Fish Speech:音频生成器 — 功能与运行要求

Fish Speech 是 Fish Audio 推出的开源语音生成器,解决 text-to-speech 任务:把文本转换成配音。该项目同时公开代码和现成的模型权重,因此可以自行运行,也可以研究现代语音合成系统的内部结构。
功能
作者将 Fish Speech 描述为 SOTA Open Source TTS,即宣称它是前沿的开源语音合成系统。其底层是 Dual-AR 架构,据开发者描述,该架构在结构上与标准大语言模型同构。因此该模型支持 SGLang 的推理加速机制:Continuous Batching、Paged KV Cache、CUDA Graph 和 RadixAttention-based Prefix Caching。
仓库中标注了 llama、transformer、tts、valle、vits、vqgan 和 vqvae 标签——这可以让人了解其技术栈:Transformer 架构、矢量量化以及神经网络语音合成特有的方法。
运行要求
代码使用 Python 编写。仓库创建于 2023 年 10 月,最后一次代码修改是 2026 年 8 月 3 日。最新版本为 v1.5.1。
模型权重发布在 Hugging Face 上。最大的单个权重文件为 1.2 GB,所有权重文件合计 1.4 GB。权重许可证为 cc-by-nc-sa-4.0:可以署名使用、用于非商业目的,且衍生作品需保留同一许可证。代码许可证为 Fish Audio Research License:允许为研究和非商业目的免费使用、复制、分发和创建衍生作品,而商业使用需要与 Fish Audio 另行签订书面协议。
据作者描述,平台为 CUDA。这是开发者的声明,而非独立测试的结果:描述中指出该模型通过 SGLang 机制支持 CUDA 加速。
适合谁
Fish Speech 适合那些寻找具有公开权重且可自行运行的开源语音合成系统的人。该项目会吸引希望深入了解现代 TTS 模型架构,或在遵守权重非商业许可证的前提下将语音生成集成到自己流程中的开发者。
该项目不太适合需要无限制商业配音的人:权重许可证 cc-by-nc-sa-4.0 禁止商业使用。同时也要考虑到,据作者描述,运行需要 CUDA——这限制了适用设备的范围。代码许可证 Fish Audio Research License 仅允许为研究和非商业目的免费使用,而商业使用需要与 Fish Audio 另行签订书面协议。
Fish Speech 是一个具有公开权重和透明架构的开源语音合成系统。该项目自 2023 年起持续开发,拥有最新版本 v1.5.1,并依托大语言模型特有的方法。权重许可证 cc-by-nc-sa-4.0 限制商业应用,而代码许可证 Fish Audio Research License 仅允许为研究和非商业目的免费使用,商业使用需要另行签订书面协议。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-speech 来源 |
|---|---|
| 代码许可证 | Fish Audio Research License:商用需单独许可证 来源 |
| 权重许可证 | cc-by-nc-sa-4.0 来源 |
| 平台 | CUDA 据作者描述 来源 |
| 最大权重文件 | 1.2 GB 来源 |
| 全部权重文件 | 1.4 GB 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-09-16 来源 |
| 仓库创建时间 | 2023-10-10 来源 |
| 最新版本 | v1.5.1 来源 |
|---|---|
| 发布日期 | 2025-05-31 来源 |
| GitHub 星标 | 32925 来源 |
| Fork 数 | 2845 来源 |
| 月下载量 | 3519 来源 |
| 模型更新 | 2025-03-25 来源 |
数值由程序自动从官方来源采集,并于 2026-10-03 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



