XTTS:音频生成器 — 功能与运行要求

XTTS 是 Coqui 推出的开源语音生成器。它解决 text-to-speech 任务:将文本转换为可听的语音。该项目在 GitHub 仓库中持续开发,并以 Python 库的形式分发。
功能
作者将该项目的描述为用于语音合成的深度学习工具集,据他们所说,该工具集已在研究和实际工作环境中得到验证。仓库标签中列出了 multi-speaker-tts、voice-cloning 和 voice-conversion——即多说话人处理、声音克隆和声音转换。此外还提到了 glow-tts、hifigan、melgan、tacotron 等架构以及 speaker-encoder 和 vocoder 组件。
XTTS-v2 模型托管在 Hugging Face 上。权重文件总大小为 1.9 GB,最大的文件占 1.7 GB。权重按 Coqui Public Model License 1.0.0 许可证分发,该许可证仅允许非商业用途。
运行要求
代码使用 Python 编写。代码许可证为 MPL-2.0。最新版本为 v0.22.0,最后一次代码变更为 2024 年 8 月 16 日。仓库创建于 2020 年 5 月 20 日。
据作者描述,平台为 cuda。描述中引用了用户 GuyPaddock 编写的 Windows 上 CUDA 安装指南。作者未说明内存要求和具体的 CUDA 版本。
适用人群
该项目适合那些寻找基于 Python 的开源语音合成工具、并愿意自行研究安装和运行的人。带有 voice-cloning 和 voice-conversion 标签可能对处理多说话人或声音转换任务的人有吸引力。
不适合那些期待有界面的现成应用的人:这是一个库和模型,而不是开箱即用的产品。此外还需注意,权重许可证 Coqui Public Model License 1.0.0 仅允许非商业用途。作者未说明内存要求,因此很难事先评估最低配置。
XTTS 是一个用于语音合成的开源研究工具,自 2020 年以来持续开发并不断获得更新。它提供了对模型和代码的访问,但需要技术准备并注意权重许可证的条件。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-speech 来源 |
|---|---|
| 代码许可证 | MPL-2.0 来源 |
| 权重许可证 | Coqui Public Model License 1.0.0:仅限非商业使用 来源 |
| 平台 | cuda 据作者描述 来源 |
| 最大权重文件 | 1.7 GB 来源 |
| 全部权重文件 | 1.9 GB 来源 |
| 库 | coqui 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2024-08-16 来源 |
| 仓库创建时间 | 2020-05-20 来源 |
| 最新版本 | v0.22.0 来源 |
|---|---|
| 发布日期 | 2023-12-12 来源 |
| GitHub 星标 | 46100 来源 |
| Fork 数 | 6167 来源 |
| 月下载量 | 6656524 来源 |
| 模型更新 | 2023-12-11 来源 |
数值由程序自动从官方来源采集,并于 2026-10-03 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



