CPU3D3D、视频与音频的 AI 工具

Fish Speech:音频生成器 — 功能与运行要求

Fish Speech 是 Fish Audio 推出的开源语音生成器,解决 text-to-speech 任务:把文本转换成配音。该项目同时公开代码和现成的模型权重,因此可以自行运行,也可以研究现代语音合成系统的内部结构。

功能

作者将 Fish Speech 描述为 SOTA Open Source TTS,即宣称它是前沿的开源语音合成系统。其底层是 Dual-AR 架构,据开发者描述,该架构在结构上与标准大语言模型同构。因此该模型支持 SGLang 的推理加速机制:Continuous Batching、Paged KV Cache、CUDA Graph 和 RadixAttention-based Prefix Caching。

仓库中标注了 llama、transformer、tts、valle、vits、vqgan 和 vqvae 标签——这可以让人了解其技术栈:Transformer 架构、矢量量化以及神经网络语音合成特有的方法。

运行要求

代码使用 Python 编写。仓库创建于 2023 年 10 月,最后一次代码修改是 2026 年 8 月 3 日。最新版本为 v1.5.1。

模型权重发布在 Hugging Face 上。最大的单个权重文件为 1.2 GB,所有权重文件合计 1.4 GB。权重许可证为 cc-by-nc-sa-4.0:可以署名使用、用于非商业目的,且衍生作品需保留同一许可证。代码许可证为 Fish Audio Research License:允许为研究和非商业目的免费使用、复制、分发和创建衍生作品,而商业使用需要与 Fish Audio 另行签订书面协议。

据作者描述,平台为 CUDA。这是开发者的声明,而非独立测试的结果:描述中指出该模型通过 SGLang 机制支持 CUDA 加速。

适合谁

Fish Speech 适合那些寻找具有公开权重且可自行运行的开源语音合成系统的人。该项目会吸引希望深入了解现代 TTS 模型架构,或在遵守权重非商业许可证的前提下将语音生成集成到自己流程中的开发者。

该项目不太适合需要无限制商业配音的人:权重许可证 cc-by-nc-sa-4.0 禁止商业使用。同时也要考虑到,据作者描述,运行需要 CUDA——这限制了适用设备的范围。代码许可证 Fish Audio Research License 仅允许为研究和非商业目的免费使用,而商业使用需要与 Fish Audio 另行签订书面协议。

Fish Speech 是一个具有公开权重和透明架构的开源语音合成系统。该项目自 2023 年起持续开发,拥有最新版本 v1.5.1,并依托大语言模型特有的方法。权重许可证 cc-by-nc-sa-4.0 限制商业应用,而代码许可证 Fish Audio Research License 仅允许为研究和非商业目的免费使用,商业使用需要另行签订书面协议。

Fish Speech — 音频与语音生成器流水线 文本 输入数据 分词 拆分为词元 Dual-AR 特征生成 声码器 音频合成 结果 — 音频文件 合成语音 导出格式:参数表未注明 输入 处理 生成 合成
Fish Speech 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证Fish Audio Research License:商用需单独许可证 来源
权重许可证cc-by-nc-sa-4.0 来源
平台CUDA 据作者描述 来源
最大权重文件1.2 GB 来源
全部权重文件1.4 GB 来源
语言Python 来源
代码最近更新2026-09-16 来源
仓库创建时间2023-10-10 来源
经常变化 — 数据截至 2026-10-03
最新版本v1.5.1 来源
发布日期2025-05-31 来源
GitHub 星标32925 来源
Fork 数2845 来源
月下载量3519 来源
模型更新2025-03-25 来源

数值由程序自动从官方来源采集,并于 2026-10-03 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读