CPU3D3D、视频与音频的 AI 工具

YuE2-3B:可编辑乐谱的开源音乐生成模型

HuggingFace 上发布了模型 m-a-p/YuE2-3B,任务为 text-to-audio。作者是 m-a-p,其工具已收录在我们的指南中。模型有 36 亿参数,最大的权重文件为 safetensors 格式,占用 6.8 GB,架构基于 flow matching。许可证为 cc-by-nc-4.0,即仅允许非商业用途。 作者将 YuE2-3B 描述为一个音乐生成模型,能把歌词文本和风格描述转化为带人声和伴奏的完整曲目。另一项独立功能是通过 ABC 格式的乐谱编辑旋律与和弦。据开发者称,要在自己的硬件上运行需要 24 GB 显存的 GPU,在不量化的情况下模型输出 48 kHz 立体声。

这意味着什么

在我们的音频生成器栏目中,目前还没有用于创作音乐的工具:任务最接近的是 Coqui 的 XTTS 和 Fish Audio 的 Fish Speech,但两者解决的都是 text-to-speech,即语音合成,而非音乐。任务类型更接近的是 ChatTTS,其参数表中标注的任务为 text-to-audio,但它同样面向口语对话。 在硬件要求上,YuE2-3B 明显更重:ChatTTS 最低要求 4 GB 显存,而这里标称 24 GB。在许可证方面,YuE2-3B 与 ChatTTS 一致——两个模型均在 cc-by-nc-4.0 下分发,这将其应用限制在非商业场景。XTTS 的权重许可证更严格:Coqui Public Model License 甚至禁止间接付费以及为商业用途训练其他模型。 YuE2-3B 是我们视野中首个覆盖音乐生成任务并支持修改乐谱的模型,而在显存要求上,它面向配备现代 GPU 的工作站。
YuE2-3B:可编辑乐谱的音乐生成 模型 m-a-p/YuE2-3B · 任务 text-to-audio · flow matching 输入 歌词 风格描述 YuE2-3B 3.6 亿参数 flow matching 输出 含人声曲目 立体声 48 kHz ABC 乐谱 编辑 旋律与和弦 要求 GPU 24 GB 显存 无量化 许可证 cc-by-nc-4.0 非商业 相近模型:XTTS 和 Fish Speech — 语音合成,ChatTTS — 面向口语的 text-to-audio
方法是如何构成的。示意图依据这篇简讯绘制。

相关阅读