CPU3D3D、视频与音频的 AI 工具

ChatTTS:音频生成器 — 功能与运行要求

ChatTTS — 这是来自 2noise 团队的开源音频生成器。它解决 text-to-audio 任务:将文本转换为面向日常对话的语音。作者将该模型描述为用于日常交流的生成式语音模型。

功能

据作者描述,ChatTTS 从文本生成语音。该模型支持中文和英文——这在仓库的标签中有注明。项目描述中提到了语义令牌的处理:对于 30 秒的音频片段,至少需要 4 GB 显存,而在 GPU 4090 上,生成速度约为每秒 7 个语义令牌。实时系数(RTF)约为 0.3——这是开发者的声明,而非独立测量结果。

仓库被标记为 agent、chat、llm、text-to-speech 等主题,这表明模型面向对话系统和代理。最新版本为 v0.2.5。

运行要求

代码用 Python 编写,并以 AGPL-3.0 许可证分发。模型权重以 cc-by-nc-4.0 许可证提供——这意味着非商业用途。最大的权重文件占用 0.8 GB,所有文件合计 1.1 GB。

运行需要 GPU。据作者描述,30 秒片段的最低显存要求为 4 GB。用于集成的库名为 chat_tts。代码和权重可在 GitHub 和 Hugging Face 上获取。

适合谁

ChatTTS 可能对构建中文或英文对话系统、聊天机器人或语音代理的人感兴趣。开源代码允许研究实现并根据自己的需求改进模型,前提是 AGPL-3.0 许可证适合项目。

该模型不适合未经单独协商的商业项目:权重以非商业许可证 cc-by-nc-4.0 分发。此外,它也不适用于没有独立 GPU 的系统——作者指出了显存要求,但未描述仅靠 CPU 运行的情况。

ChatTTS 是一个用于合成对话语音的开源工具,专注于中文和英文。它需要 GPU,适合需要实时或接近实时语音生成的非商业项目。

ChatTTS 流水线 面向日常对话的生成式语音合成 文本 源文本 中文 或英文 分词 将文本拆分为 语义 标记 生成 用于对话的 神经网络 语音模型 声码器 将标记 转换为 音频信号 音频 生成的音频 文件 参数表 显存:30 秒片段需 4 GB 速度:4090 上每秒 7 个语义标记 实时因子:约 0.3 许可证:AGPL-3.0(代码),cc-by-nc-4.0(权重)
ChatTTS 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-audio 来源
代码许可证AGPL-3.0 来源
权重许可证cc-by-nc-4.0 来源
显存4 GB 据作者描述 来源
最大权重文件0.8 GB 来源
全部权重文件1.1 GB 来源
chat_tts 来源
语言Python 来源
代码最近更新2026-04-10 来源
仓库创建时间2024-05-27 来源
经常变化 — 数据截至 2026-08-19
最新版本v0.2.5 来源
发布日期2026-04-10 来源
GitHub 星标39772 来源
Fork 数4257 来源
月下载量2751 来源
模型更新2024-10-22 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读