CPU3D3D、视频与音频的 AI 工具

Fish Speech:音频生成器 — 功能与运行要求

Fish Speech 是 Fish Audio 推出的开源语音生成器,解决 text-to-speech 任务:将文本转换为配音。该项目同时发布代码和现成的模型权重,因此你可以自行运行,或研究现代语音合成系统的内部结构。

功能

作者将 Fish Speech 描述为 SOTA Open Source TTS,即宣称它是领先的开源语音合成系统。其核心是 Dual-AR 架构,据开发者描述,该架构在结构上与标准大语言模型同构。得益于这一点,模型支持 SGLang 的推理加速机制:Continuous Batching、Paged KV Cache、CUDA Graph 和基于 RadixAttention 的 Prefix Caching。

仓库中标注了 llama、transformer、tts、valle、vits、vqgan 和 vqvae 等标签——这让人对技术栈有所了解:transformer 架构、向量量化,以及神经网络语音合成中常见的各种方法。

运行要求

代码使用 Python 编写。仓库创建于 2023 年 10 月,代码最后更新时间为 2026 年 8 月 3 日。最新版本为 v1.5.1。

模型权重发布在 Hugging Face 上。最大的权重文件占用 1.2 GB,所有权重文件合计 1.4 GB。权重许可证为 cc-by-nc-sa-4.0:允许在署名、非商业用途且衍生作品保持相同许可证的条件下使用。代码许可证为非标准形式——作者没有明确给出,因此使用代码前需要手动核实条款。

据作者描述,平台为 CUDA。这是开发者的声明,而非独立测试的结果:描述中指出模型通过 SGLang 机制支持 CUDA 加速。

适合谁

Fish Speech 适合那些寻找拥有公开权重、可自行运行的开源语音合成系统的人。该项目对希望了解现代 TTS 模型架构,或打算在遵守非商业权重许可证的前提下将语音生成集成到自己流程中的开发者会很有吸引力。

该项目可能不适合需要无限制商业配音的人:权重许可证 cc-by-nc-sa-4.0 禁止商业用途。另外需要注意,据作者描述,运行需要 CUDA——这限制了适用硬件的范围。非标准的代码许可证也要求你在自己的项目中使用前单独研究。

Fish Speech 是一个拥有公开权重和透明架构的开源语音合成系统。项目自 2023 年起持续发展,有当前版本 v1.5.1,并依托大语言模型中常见的方法。使用前应仔细研究许可证条款:权重许可证限制商业应用,而代码许可证作者要求手动核实。

Fish Speech — 音频与语音生成器流水线 文本 输入数据 分词 拆分为词元 Dual-AR 特征生成 声码器 音频合成 结果 — 音频文件 合成语音 导出格式:参数表未注明 输入 处理 生成 合成
Fish Speech 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证非标准(需手动核实) 来源
权重许可证cc-by-nc-sa-4.0 来源
平台CUDA 据作者描述 来源
最大权重文件1.2 GB 来源
全部权重文件1.4 GB 来源
语言Python 来源
代码最近更新2026-08-03 来源
仓库创建时间2023-10-10 来源
经常变化 — 数据截至 2026-08-19
最新版本v1.5.1 来源
发布日期2025-05-31 来源
GitHub 星标32279 来源
Fork 数2781 来源
月下载量4253 来源
模型更新2025-03-25 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读