Bark:音频生成器 — 功能与运行要求

Bark — 这是 Suno 推出的开源音频生成器,解决 text-to-speech 任务:将文本转换为语音,以及根据文本描述生成其他声音。模型和代码均已开源,因此你可以自行运行并将其集成到自己的项目中。
功能
Bark 作为 text-to-speech 模型运行。据作者描述,这是一个由文本控制的生成式音频模型:它合成语音,并且如果文本提示中有所体现,还可以生成其他声音。作者在参数表中没有提供关于支持的语言、音色或生成音频时长的详细信息。
该模型可在 transformers 库中使用。模型权重占用 4.2 GB — 这既是最大的单个文件,也是所有文件的总大小。
运行要求
代码主要使用 Jupyter Notebook 编写,仓库的最后一次修改是在 2024 年 8 月 19 日。仓库创建于 2023 年 4 月 7 日。
代码许可证为 MIT,模型权重许可证为 MIT。这允许使用和修改模型,包括在商业项目中使用,前提是保留许可证条款。
据作者描述,完整版 Bark 需要约 12 GB 显存,以便将所有组件同时保留在 GPU 上。原文为:「The full version of Bark requires around 12GB of VRAM to hold everything on GPU at the same time」。
据作者描述,平台为 CUDA。Bark 已在 CPU 和 GPU 上使用 pytorch 2.0+、CUDA 11.7 和 CUDA 12.0 进行过测试。这是开发者的声明,而非独立测量结果。
适合谁
Bark 适合那些寻找采用 MIT 许可证的开源 text-to-speech 模型,并愿意在配备 CUDA 和足够显存的机器上运行它的人。该项目便于在 Jupyter Notebook 中进行实验,也便于通过 transformers 进行集成。
该模型可能不适合那些没有 12 GB 显存 GPU 的人,或者那些期望现成云解决方案而不想自行运行的人。另外需要注意的是,作者没有提供关于支持的语言和音频长度限制的详细信息。
Bark 是一个开源的生成式音频模型,在拥有合适 GPU 的情况下可以本地运行。该方案适合研究任务以及需要 text-to-speech 生成并希望根据自身需求修改代码的项目。
参数表
| 任务 | text-to-speech 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 权重许可证 | mit 来源 |
| 平台 | CUDA 据作者描述 来源 |
| 显存 | 12 GB 据作者描述 来源 |
| 最大权重文件 | 4.2 GB 来源 |
| 全部权重文件 | 4.2 GB 来源 |
| 库 | transformers 来源 |
| 语言 | Jupyter Notebook 来源 |
| 代码最近更新 | 2024-08-19 来源 |
| 仓库创建时间 | 2023-04-07 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



