ChatTTS:音频生成器 — 功能与运行要求

ChatTTS — 这是来自 2noise 团队的开源音频生成器。它解决 text-to-audio 任务:将文本转换为面向日常对话的语音。作者将该模型描述为用于日常交流的生成式语音模型。
功能
据作者描述,ChatTTS 从文本生成语音。该模型支持中文和英文——这在仓库的标签中有注明。项目描述中提到了语义令牌的处理:对于 30 秒的音频片段,至少需要 4 GB 显存,而在 GPU 4090 上,生成速度约为每秒 7 个语义令牌。实时系数(RTF)约为 0.3——这是开发者的声明,而非独立测量结果。
仓库被标记为 agent、chat、llm、text-to-speech 等主题,这表明模型面向对话系统和代理。最新版本为 v0.2.5。
运行要求
代码用 Python 编写,并以 AGPL-3.0 许可证分发。模型权重以 cc-by-nc-4.0 许可证提供——这意味着非商业用途。最大的权重文件占用 0.8 GB,所有文件合计 1.1 GB。
运行需要 GPU。据作者描述,30 秒片段的最低显存要求为 4 GB。用于集成的库名为 chat_tts。代码和权重可在 GitHub 和 Hugging Face 上获取。
适合谁
ChatTTS 可能对构建中文或英文对话系统、聊天机器人或语音代理的人感兴趣。开源代码允许研究实现并根据自己的需求改进模型,前提是 AGPL-3.0 许可证适合项目。
该模型不适合未经单独协商的商业项目:权重以非商业许可证 cc-by-nc-4.0 分发。此外,它也不适用于没有独立 GPU 的系统——作者指出了显存要求,但未描述仅靠 CPU 运行的情况。
ChatTTS 是一个用于合成对话语音的开源工具,专注于中文和英文。它需要 GPU,适合需要实时或接近实时语音生成的非商业项目。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-audio 来源 |
|---|---|
| 代码许可证 | AGPL-3.0 来源 |
| 权重许可证 | cc-by-nc-4.0 来源 |
| 显存 | 4 GB 据作者描述 来源 |
| 最大权重文件 | 0.8 GB 来源 |
| 全部权重文件 | 1.1 GB 来源 |
| 库 | chat_tts 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-04-10 来源 |
| 仓库创建时间 | 2024-05-27 来源 |
| 最新版本 | v0.2.5 来源 |
|---|---|
| 发布日期 | 2026-04-10 来源 |
| GitHub 星标 | 39772 来源 |
| Fork 数 | 4257 来源 |
| 月下载量 | 2751 来源 |
| 模型更新 | 2024-10-22 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



