CPU3D3D、视频与音频的 AI 工具

F5-TTS:音频生成器 — 功能与运行要求

F5-TTS — 这是一个开源的语音生成器,能将文本转换为声音。项目由开发者 SWivid 创建,以代码和现成模型权重形式发布。核心功能是 text-to-speech,即根据书面文本合成语音。

功能

作者将项目描述为「F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching」的官方代码。这是开发者的声明,而非独立测量的结果。模型可在 Hugging Face 的仓库中获取,科学描述已发布在 arxiv.org 上。

参数表中未注明支持的语言、合成质量、生成速度或文本长度限制。作者未提供这些数据。

运行要求

代码以 Python 编写,采用 MIT 许可证发布。模型权重按 cc-by-nc-4.0 许可证分发——这仅允许非商业用途。

最大的权重文件占用 1.3 GB,所有文件合计 3.8 GB。运行需要 f5-tts 库。

据作者描述,平台为 ROCm。描述中明确写道:「ROCm 7.x — these architectures (gfx1151/gfx1201) are not included in ROCm 6.x」。这意味着对于所列架构需要 ROCm 7.x 版本,而非 6.x。参数表中没有其他硬件或操作系统要求。

最新版本为 1.1.22。仓库创建于 2024 年 10 月 8 日,代码最后更新于 2026 年 7 月 23 日。

适合谁

该项目适合那些寻找具有可用权重的开源语音生成器,并愿意使用 Python 代码的人。代码的 MIT 许可证允许将解决方案集成到自己的项目中,而 Hugging Face 上的仓库和模型便于快速上手。

权重的非商业许可证限制了应用范围:未经权利持有人单独许可,不得在付费产品或服务中使用该模型。此外,该项目可能不适合那些不愿处理 ROCm 和 GPU 架构的人——作者未注明对其他平台的支持。

F5-TTS 是一个带有现成权重的开源语音合成代码库。项目持续发展,拥有公开仓库和科学描述。如果环境符合 ROCm 要求,适合用于实验和非商业任务。

F5-TTS — 音频与语音生成器流水线 text-to-speech · 开源 · Python 输入文本 待配音文本 任意字符串 分词 拆分为词元 数据准备 F5-TTS 模型 flow matching 语音生成 后处理 信号清理 最终合成 音频 语音 关键特性 开发者:SWivid · 代码许可证:MIT · 权重许可证:cc-by-nc-4.0 库:f5-tts · 平台:ROCm · 语言:Python 仓库:github.com/SWivid/F5-TTS · 模型:huggingface.co/SWivid/F5-TTS 最新版本:1.1.22 · 创建:2024-10-08 · 更新:2026-07-23 最大权重文件:1.3 GB · 全部权重文件:3.8 GB
F5-TTS 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证MIT 来源
权重许可证cc-by-nc-4.0 来源
平台ROCm 据作者描述 来源
最大权重文件1.3 GB 来源
全部权重文件3.8 GB 来源
f5-tts 来源
语言Python 来源
代码最近更新2026-07-23 来源
仓库创建时间2024-10-08 来源
经常变化 — 数据截至 2026-08-19
最新版本1.1.22 来源
发布日期2026-07-23 来源
GitHub 星标15136 来源
Fork 数2198 来源
月下载量743709 来源
模型更新2025-03-21 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读