CPU3D3D、视频与音频的 AI 工具

XTTS:音频生成器 — 功能与运行要求

XTTS 是 Coqui 推出的开源语音生成器。它解决 text-to-speech 任务:将文本转换为可听的语音。该项目在 GitHub 仓库中持续开发,并以 Python 库的形式分发。

功能

作者将该项目的描述为用于语音合成的深度学习工具集,据他们所说,该工具集已在研究和实际工作环境中得到验证。仓库标签中列出了 multi-speaker-tts、voice-cloning 和 voice-conversion——即多说话人处理、声音克隆和声音转换。此外还提到了 glow-tts、hifigan、melgan、tacotron 等架构以及 speaker-encoder 和 vocoder 组件。

XTTS-v2 模型托管在 Hugging Face 上。权重文件总大小为 1.9 GB,最大的文件占 1.7 GB。权重按 Coqui Public Model License 1.0.0 许可证分发,该许可证仅允许非商业用途。

运行要求

代码使用 Python 编写。代码许可证为 MPL-2.0。最新版本为 v0.22.0,最后一次代码变更为 2024 年 8 月 16 日。仓库创建于 2020 年 5 月 20 日。

据作者描述,平台为 cuda。描述中引用了用户 GuyPaddock 编写的 Windows 上 CUDA 安装指南。作者未说明内存要求和具体的 CUDA 版本。

适用人群

该项目适合那些寻找基于 Python 的开源语音合成工具、并愿意自行研究安装和运行的人。带有 voice-cloning 和 voice-conversion 标签可能对处理多说话人或声音转换任务的人有吸引力。

不适合那些期待有界面的现成应用的人:这是一个库和模型,而不是开箱即用的产品。此外还需注意,权重许可证 Coqui Public Model License 1.0.0 仅允许非商业用途。作者未说明内存要求,因此很难事先评估最低配置。

XTTS 是一个用于语音合成的开源研究工具,自 2020 年以来持续开发并不断获得更新。它提供了对模型和代码的访问,但需要技术准备并注意权重许可证的条件。

XTTS 流水线 — 音频与语音生成器 Coqui · 开源 · text-to-speech 输入文本 输入文本 任意字符串 文本分析 分词 归一化 声学模型 神经网络 pytorch 声码器 波形合成 hifigan 音频 语音 音频 声音克隆 speaker-encoder voice-cloning 模型:XTTS-v2 · 权重:1.7 GB · 平台:cuda · 代码许可证:MPL-2.0 库:coqui · 语言:Python · 最新版本:v0.22.0
XTTS 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证MPL-2.0 来源
权重许可证Coqui Public Model License 1.0.0:仅限非商业使用 来源
平台cuda 据作者描述 来源
最大权重文件1.7 GB 来源
全部权重文件1.9 GB 来源
库coqui 来源
语言Python 来源
代码最近更新2024-08-16 来源
仓库创建时间2020-05-20 来源
经常变化 — 数据截至 2026-10-03
最新版本v0.22.0 来源
发布日期2023-12-12 来源
GitHub 星标46100 来源
Fork 数6167 来源
月下载量6656524 来源
模型更新2023-12-11 来源

数值由程序自动从官方来源采集,并于 2026-10-03 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读