HuggingFace 上发布了模型
vibevoice/VibeVoice-1.5B-hf,任务为 text-to-audio。它旨在生成包含多个说话者的长对话音频——例如播客。据作者描述,可合成最长 90 分钟的语音,支持最多 4 位说话者。该模型使用 7.5 Hz 的连续语音分词器,并在 LLM 之上采用扩散方法。
根据模型参数表:许可证 MIT,27 亿参数,最大的权重文件为 1.9 GB,仓库总计 5 GB,格式为 safetensors。可通过 transformers 运行。代码已开源。
这意味着什么
在我们的音频生成指南
CPU3D 中有几个 text-to-audio 工具,VibeVoice 在多个参数上与之不同。
ChatTTS — 在 text-to-audio 任务上最接近。其权重占用 1.1 GB,权重许可证为 cc-by-nc-4.0,代码为 AGPL-3.0。VibeVoice 明显更重:权重 5 GB,但许可证 MIT — 对商业使用更自由。ChatTTS 生成 30 秒音频约需 4 GB 显存;VibeVoice 的作者未明确显存要求。
XTTS 来自 Coqui,解决的是 text-to-speech 任务,而非 text-to-audio。其权重为 1.9 GB,权重许可证为 other,代码为 MPL-2.0。XTTS 专注于声音克隆,而 VibeVoice 则侧重于多说话者的长对话。
MMAudio — 我们工具中最重的:权重 50.5 GB,权重许可证 cc-by-nc-4.0,代码 MIT。它解决 text-to-audio 和 video-to-audio,约需 6 GB 显存。VibeVoice 在权重上轻一个数量级,且仅专注于 text-to-audio。
VibeVoice 的突出之处在于其宣称的生成时长和对最多 4 位说话者的支持,这些在我们的工具参数表中没有体现。不过,该模型发布不久,实际硬件要求尚未有文档记录。
方法原理。示意图根据这篇简讯绘制。