F5-TTS:音频生成器 — 功能与运行要求

F5-TTS — 这是一个开源的语音生成器,能将文本转换为声音。项目由开发者 SWivid 创建,以代码和现成模型权重形式发布。核心功能是 text-to-speech,即根据书面文本合成语音。
功能
作者将项目描述为「F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching」的官方代码。这是开发者的声明,而非独立测量的结果。模型可在 Hugging Face 的仓库中获取,科学描述已发布在 arxiv.org 上。
参数表中未注明支持的语言、合成质量、生成速度或文本长度限制。作者未提供这些数据。
运行要求
代码以 Python 编写,采用 MIT 许可证发布。模型权重按 cc-by-nc-4.0 许可证分发——这仅允许非商业用途。
最大的权重文件占用 1.3 GB,所有文件合计 3.8 GB。运行需要 f5-tts 库。
据作者描述,平台为 ROCm。描述中明确写道:「ROCm 7.x — these architectures (gfx1151/gfx1201) are not included in ROCm 6.x」。这意味着对于所列架构需要 ROCm 7.x 版本,而非 6.x。参数表中没有其他硬件或操作系统要求。
最新版本为 1.1.22。仓库创建于 2024 年 10 月 8 日,代码最后更新于 2026 年 7 月 23 日。
适合谁
该项目适合那些寻找具有可用权重的开源语音生成器,并愿意使用 Python 代码的人。代码的 MIT 许可证允许将解决方案集成到自己的项目中,而 Hugging Face 上的仓库和模型便于快速上手。
权重的非商业许可证限制了应用范围:未经权利持有人单独许可,不得在付费产品或服务中使用该模型。此外,该项目可能不适合那些不愿处理 ROCm 和 GPU 架构的人——作者未注明对其他平台的支持。
F5-TTS 是一个带有现成权重的开源语音合成代码库。项目持续发展,拥有公开仓库和科学描述。如果环境符合 ROCm 要求,适合用于实验和非商业任务。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-speech 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 权重许可证 | cc-by-nc-4.0 来源 |
| 平台 | ROCm 据作者描述 来源 |
| 最大权重文件 | 1.3 GB 来源 |
| 全部权重文件 | 3.8 GB 来源 |
| 库 | f5-tts 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-07-23 来源 |
| 仓库创建时间 | 2024-10-08 来源 |
| 最新版本 | 1.1.22 来源 |
|---|---|
| 发布日期 | 2026-07-23 来源 |
| GitHub 星标 | 15136 来源 |
| Fork 数 | 2198 来源 |
| 月下载量 | 743709 来源 |
| 模型更新 | 2025-03-21 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



