XTTS:音频生成器 — 功能与运行要求

XTTS — 这是 Coqui 推出的开源语音生成器。它解决的是 text-to-speech 任务:将文本转化为可听见的语音。该项目在 GitHub 仓库中持续开发,并以 Python 库的形式分发。
功能
据作者描述,该项目是一套用于语音合成的深度学习工具集,据称已在研究和实际工作环境中得到验证。仓库标签中列出了 multi-speaker-tts、voice-cloning 和 voice-conversion,即支持多说话人、声音克隆和声音转换。此外还提到了 glow-tts、hifigan、melgan、tacotron 等架构,以及 speaker-encoder 和 vocoder 组件。
XTTS-v2 模型托管在 Hugging Face 上。模型权重文件总大小为 1.9 GB,其中最大的文件占 1.7 GB。权重许可证标注为“other”,即非标准许可证;作者未在参数表中说明具体条款。
运行要求
代码使用 Python 编写。代码许可证为 MPL-2.0。最新版本为 v0.22.0,最近一次代码更新时间为 2024 年 8 月 16 日。仓库创建于 2020 年 5 月 20 日。
据作者描述,平台为 cuda。描述中引用了用户 GuyPaddock 编写的 Windows 上 CUDA 安装指南。作者未说明内存要求和具体 CUDA 版本。
适用人群
该项目适合那些在 Python 中寻找开源语音合成工具、并愿意自行处理安装和运行的人。voice-cloning 和 voice-conversion 标签可能对处理多说话人或声音迁移任务的人有吸引力。
不适合那些期待开箱即用、带界面的应用的人:这是一个库和模型,而非成品软件。另外需要注意,权重许可证为非标准许可证——在商业使用前需要单独研究其条款。作者未说明内存要求,因此很难提前评估最低配置。
XTTS 是一个开源的语音合成研究工具,自 2020 年起持续开发并不断获得更新。它提供了模型和代码的访问权限,但需要一定的技术准备,并需关注权重许可证的条款。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-speech 来源 |
|---|---|
| 代码许可证 | MPL-2.0 来源 |
| 权重许可证 | other 来源 |
| 平台 | cuda 据作者描述 来源 |
| 最大权重文件 | 1.7 GB 来源 |
| 全部权重文件 | 1.9 GB 来源 |
| 库 | coqui 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2024-08-16 来源 |
| 仓库创建时间 | 2020-05-20 来源 |
| 最新版本 | v0.22.0 来源 |
|---|---|
| 发布日期 | 2023-12-12 来源 |
| GitHub 星标 | 45918 来源 |
| Fork 数 | 6149 来源 |
| 月下载量 | 8534526 来源 |
| 模型更新 | 2023-12-11 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



