CPU3D3D、视频与音频的 AI 工具

XTTS:音频生成器 — 功能与运行要求

XTTS — 这是 Coqui 推出的开源语音生成器。它解决的是 text-to-speech 任务:将文本转化为可听见的语音。该项目在 GitHub 仓库中持续开发,并以 Python 库的形式分发。

功能

据作者描述,该项目是一套用于语音合成的深度学习工具集,据称已在研究和实际工作环境中得到验证。仓库标签中列出了 multi-speaker-tts、voice-cloning 和 voice-conversion,即支持多说话人、声音克隆和声音转换。此外还提到了 glow-tts、hifigan、melgan、tacotron 等架构,以及 speaker-encoder 和 vocoder 组件。

XTTS-v2 模型托管在 Hugging Face 上。模型权重文件总大小为 1.9 GB,其中最大的文件占 1.7 GB。权重许可证标注为“other”,即非标准许可证;作者未在参数表中说明具体条款。

运行要求

代码使用 Python 编写。代码许可证为 MPL-2.0。最新版本为 v0.22.0,最近一次代码更新时间为 2024 年 8 月 16 日。仓库创建于 2020 年 5 月 20 日。

据作者描述,平台为 cuda。描述中引用了用户 GuyPaddock 编写的 Windows 上 CUDA 安装指南。作者未说明内存要求和具体 CUDA 版本。

适用人群

该项目适合那些在 Python 中寻找开源语音合成工具、并愿意自行处理安装和运行的人。voice-cloning 和 voice-conversion 标签可能对处理多说话人或声音迁移任务的人有吸引力。

不适合那些期待开箱即用、带界面的应用的人:这是一个库和模型,而非成品软件。另外需要注意,权重许可证为非标准许可证——在商业使用前需要单独研究其条款。作者未说明内存要求,因此很难提前评估最低配置。

XTTS 是一个开源的语音合成研究工具,自 2020 年起持续开发并不断获得更新。它提供了模型和代码的访问权限,但需要一定的技术准备,并需关注权重许可证的条款。

XTTS 流水线 — 音频与语音生成器 Coqui · 开源 · text-to-speech 输入文本 输入文本 任意字符串 文本分析 分词 归一化 声学模型 神经网络 pytorch 声码器 波形合成 hifigan 音频 语音 音频 声音克隆 speaker-encoder voice-cloning 模型:XTTS-v2 · 权重:1.7 GB · 平台:cuda · 代码许可证:MPL-2.0 库:coqui · 语言:Python · 最新版本:v0.22.0
XTTS 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证MPL-2.0 来源
权重许可证other 来源
平台cuda 据作者描述 来源
最大权重文件1.7 GB 来源
全部权重文件1.9 GB 来源
coqui 来源
语言Python 来源
代码最近更新2024-08-16 来源
仓库创建时间2020-05-20 来源
经常变化 — 数据截至 2026-08-19
最新版本v0.22.0 来源
发布日期2023-12-12 来源
GitHub 星标45918 来源
Fork 数6149 来源
月下载量8534526 来源
模型更新2023-12-11 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读