神经网络音频与语音生成器:开源模型
这里汇集了制作声音的模型:按描述生成音乐、音效、文本转语音和声音克隆。每个模型都有参数表:许可证、显存要求、平台、格式。所有可以通过机器验证的信息均来自官方来源,并标注了验证日期。
本栏目只收录开源模型——即可以安装到自己机器上的模型。关于在不同硬件上运行的问题,俄语评测通常避而不谈,而对音频来说这正是关键问题:许多模型即使没有大显存的显卡也能跑起来。
文章
15 篇文章
YuE:音频生成器 — 功能与运行要求YuE 是 M-A-P 团队推出的开源音频生成器,据作者描述,该模型用于创作完整歌曲。据开发者称,该项目旨在成为 Suno.ai 等系统的开源替代品。代码已在 GitHub 上发布,模型权重已
XTTS:音频生成器 — 功能与运行要求XTTS 是 Coqui 推出的开源语音生成器。它解决 text-to-speech 任务:将文本转换为可听的语音。该项目在 GitHub 仓库中持续开发,并以 Python 库的形式分发。功能 据作者描述,
Stable Audio Open:音频生成器 — 功能与运行要求Stable Audio Open 是 Stability AI 推出的开源音频生成器。它解决 text-to-audio 任务:将文本描述转换为音频文件。该工具适合需要根据文本生成音频、并愿意处理相关工作的用户。
OpenVoice:音频生成器 — 功能与运行要求OpenVoice 是 MyShell 团队开发的开源语音生成器。它解决 text-to-speech 任务,据作者描述,属于音频基础模型类别。主要应用场景是语音合成,支持音色迁移至
MusicGen:音频生成器 — 功能与运行要求MusicGen 是 Meta 推出的音频生成器,能将文本描述转换为音频。它属于 Audiocraft 库,解决 text-to-audio 任务:用户描述想听到的内容,模型据此生成音频片段。
MOSS-SoundEffect(复旦 MOSS-SoundEffect)无 CUDA(Mac 和 AMD):音频生成器 — 功能与运行要求MOSS-SoundEffect(复旦 MOSS-SoundEffect)无 CUDA 版是一款桌面应用,可根据文本描述生成音效。该版本面向搭载 Apple Silicon 芯片的 Mac 电脑,以及 Windows 下使用 AMD 显卡、不支持 CUDA 的机器。
MOSS-SoundEffect:音频生成器 — 功能与运行要求MOSS-SoundEffect 是一款开源的音频生成器,能将文本描述转化为音频。该模型的任务是 text-to-audio:用户用文字描述所需的声音,系统则生成相应的音频文件。此工具适合那些,
MMAudio:音频生成器 — 功能与运行要求MMAudio 是一款开源的音频生成器,可根据视频或文本描述合成音轨。据作者描述,开发者将其定位为通过多类型数据联合训练实现高质量音频合成的工具。
Fish Speech:音频生成器 — 功能与运行要求Fish Speech 是 Fish Audio 推出的开源语音生成器,解决 text-to-speech 任务:将文本转换为配音。该项目同时发布代码和现成的模型权重,因此你可以自行运行,或研究其内部结构。
F5-TTS:音频生成器 — 功能与运行要求F5-TTS 是一款开源的语音生成器,可将文本转换为声音。该项目由开发者 SWivid 创建,以代码和现成模型权重形式发布。其主要功能是 text-to-speech,即根据书面文本合成语音。阅
DiffRhythm:音频生成器 — 功能与运行要求DiffRhythm 是一款音频生成器,据作者描述,它旨在通过潜在扩散技术,从文本到完整音频,生成完整的歌曲。开发者是 ASLP Lab,项目已开源。功能
CosyVoice:音频生成器 — 功能与运行要求CosyVoice 是阿里巴巴推出的开源语音生成器。它解决 text-to-speech 任务:将文本转化为可听的语音。据作者描述,它是一个多语言语音生成模型,为推理、训练和
ChatTTS:音频生成器 — 功能与运行要求ChatTTS 是 2noise 团队开发的开源音频生成器。它解决 text-to-audio 任务:将文本转换为面向日常对话的语音。据作者描述,该模型是一款用于日常交流的生成式语音模型。
Bark:音频生成器 — 功能与运行要求Bark 是 Suno 推出的开源音频生成器,解决 text-to-speech 任务:根据文本描述将文本转换为语音及其他声音。模型和代码已开源,因此可以自行运行,也
ACE-Step:音频生成器 — 功能与运行要求ACE-Step 是一款开源音频生成器,可将文本描述转换为音频。开发者将其定位为迈向音乐生成基础模型的一步,因此该工具值得从事音频合成相关工作的人关注。