CPU3D3D、视频与音频的 AI 工具

VibeVoice-1.5B-hf:微软在 HuggingFace 上发布的新开源 text-to-audio 模型

HuggingFace 上发布了模型 vibevoice/VibeVoice-1.5B-hf,任务为 text-to-audio。它旨在生成包含多个说话者的长对话音频——例如播客。据作者描述,可合成最长 90 分钟的语音,支持最多 4 位说话者。该模型使用 7.5 Hz 的连续语音分词器,并在 LLM 之上采用扩散方法。 根据模型参数表:许可证 MIT,27 亿参数,最大的权重文件为 1.9 GB,仓库总计 5 GB,格式为 safetensors。可通过 transformers 运行。代码已开源。

这意味着什么

在我们的音频生成指南 CPU3D 中有几个 text-to-audio 工具,VibeVoice 在多个参数上与之不同。 ChatTTS — 在 text-to-audio 任务上最接近。其权重占用 1.1 GB,权重许可证为 cc-by-nc-4.0,代码为 AGPL-3.0。VibeVoice 明显更重:权重 5 GB,但许可证 MIT — 对商业使用更自由。ChatTTS 生成 30 秒音频约需 4 GB 显存;VibeVoice 的作者未明确显存要求。 XTTS 来自 Coqui,解决的是 text-to-speech 任务,而非 text-to-audio。其权重为 1.9 GB,权重许可证为 other,代码为 MPL-2.0。XTTS 专注于声音克隆,而 VibeVoice 则侧重于多说话者的长对话。 MMAudio — 我们工具中最重的:权重 50.5 GB,权重许可证 cc-by-nc-4.0,代码 MIT。它解决 text-to-audio 和 video-to-audio,约需 6 GB 显存。VibeVoice 在权重上轻一个数量级,且仅专注于 text-to-audio。 VibeVoice 的突出之处在于其宣称的生成时长和对最多 4 位说话者的支持,这些在我们的工具参数表中没有体现。不过,该模型发布不久,实际硬件要求尚未有文档记录。
VibeVoice-1.5B-hf:微软的 text-to-audio 文本 播客脚本 最多 4 位说话人 VibeVoice-1.5B-hf LLM + 扩散 7.5 Hz 分词器 MIT · 5 GB safetensors 音频 最长 90 分钟 多角色对话 对比 ChatTTS 1.1 GB · cc-by-nc-4.0 4 GB 显存 / 30 秒 XTTS (Coqui) 1.9 GB · 声音克隆 text-to-speech MMAudio 50.5 GB · cc-by-nc-4.0 6 GB 显存 · video-to-audio VibeVoice 更轻量 MIT 自由许可证
方法原理。示意图根据这篇简讯绘制。

相关阅读