HuggingFace 上发布了模型
m-a-p/YuE2-3B,任务为 text-to-audio。作者是 m-a-p,其工具已收录在我们的指南中。模型有 36 亿参数,最大的权重文件为 safetensors 格式,占用 6.8 GB,架构基于 flow matching。许可证为 cc-by-nc-4.0,即仅允许非商业用途。
作者将 YuE2-3B 描述为一个音乐生成模型,能把歌词文本和风格描述转化为带人声和伴奏的完整曲目。另一项独立功能是通过 ABC 格式的乐谱编辑旋律与和弦。据开发者称,要在自己的硬件上运行需要 24 GB 显存的 GPU,在不量化的情况下模型输出 48 kHz 立体声。
这意味着什么
在我们的
音频生成器栏目中,目前还没有用于创作音乐的工具:任务最接近的是 Coqui 的
XTTS 和 Fish Audio 的
Fish Speech,但两者解决的都是 text-to-speech,即语音合成,而非音乐。任务类型更接近的是
ChatTTS,其参数表中标注的任务为 text-to-audio,但它同样面向口语对话。
在硬件要求上,YuE2-3B 明显更重:ChatTTS 最低要求 4 GB 显存,而这里标称 24 GB。在许可证方面,YuE2-3B 与 ChatTTS 一致——两个模型均在 cc-by-nc-4.0 下分发,这将其应用限制在非商业场景。XTTS 的权重许可证更严格:Coqui Public Model License 甚至禁止间接付费以及为商业用途训练其他模型。
YuE2-3B 是我们视野中首个覆盖音乐生成任务并支持修改乐谱的模型,而在显存要求上,它面向配备现代 GPU 的工作站。
方法是如何构成的。示意图依据这篇简讯绘制。