CPU3D3D、视频与音频的 AI 工具

Bark:音频生成器 — 功能与运行要求

Bark — 这是 Suno 推出的开源音频生成器,解决 text-to-speech 任务:将文本转换为语音,以及根据文本描述生成其他声音。模型和代码均已开源,因此你可以自行运行并将其集成到自己的项目中。

功能

Bark 作为 text-to-speech 模型运行。据作者描述,这是一个由文本控制的生成式音频模型:它合成语音,并且如果文本提示中有所体现,还可以生成其他声音。作者在参数表中没有提供关于支持的语言、音色或生成音频时长的详细信息。

该模型可在 transformers 库中使用。模型权重占用 4.2 GB — 这既是最大的单个文件,也是所有文件的总大小。

运行要求

代码主要使用 Jupyter Notebook 编写,仓库的最后一次修改是在 2024 年 8 月 19 日。仓库创建于 2023 年 4 月 7 日。

代码许可证为 MIT,模型权重许可证为 MIT。这允许使用和修改模型,包括在商业项目中使用,前提是保留许可证条款。

据作者描述,完整版 Bark 需要约 12 GB 显存,以便将所有组件同时保留在 GPU 上。原文为:「The full version of Bark requires around 12GB of VRAM to hold everything on GPU at the same time」。

据作者描述,平台为 CUDA。Bark 已在 CPU 和 GPU 上使用 pytorch 2.0+、CUDA 11.7 和 CUDA 12.0 进行过测试。这是开发者的声明,而非独立测量结果。

适合谁

Bark 适合那些寻找采用 MIT 许可证的开源 text-to-speech 模型,并愿意在配备 CUDA 和足够显存的机器上运行它的人。该项目便于在 Jupyter Notebook 中进行实验,也便于通过 transformers 进行集成。

该模型可能不适合那些没有 12 GB 显存 GPU 的人,或者那些期望现成云解决方案而不想自行运行的人。另外需要注意的是,作者没有提供关于支持的语言和音频长度限制的详细信息。

Bark 是一个开源的生成式音频模型,在拥有合适 GPU 的情况下可以本地运行。该方案适合研究任务以及需要 text-to-speech 生成并希望根据自身需求修改代码的项目。

Bark 音频生成器流水线 文本 输入数据 提示词 分词 拆分为 词元 语义 语义 模型 声学 生成 音频 声音 语音 音频 CPU 模式 较慢 无显存 GPU 模式 CUDA 显存 资源 模型权重 开源 Text-Prompted Generative Audio Model transformers 库 · MIT 许可证
Bark 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证MIT 来源
权重许可证mit 来源
平台CUDA 据作者描述 来源
显存12 GB 据作者描述 来源
最大权重文件4.2 GB 来源
全部权重文件4.2 GB 来源
transformers 来源
语言Jupyter Notebook 来源
代码最近更新2024-08-19 来源
仓库创建时间2023-04-07 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标39239 来源
Fork 数4673 来源
月下载量38689 来源
模型更新2023-10-04 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读