CPU3D3D、视频与音频的 AI 工具

CosyVoice:音频生成器 — 功能与运行要求

CosyVoice(通义 CosyVoice)是阿里巴巴推出的开源语音生成器。它解决的是 text-to-speech 任务:将文本转化为可听的语音。据作者描述,这是一个多语言语音生成模型,支持推理、训练和部署。

功能

据作者描述,CosyVoice(通义 CosyVoice)是一个多语言语音生成模型。仓库标签中列出的语言包括:中文、粤语、英语、日语、韩语。同时宣称支持跨语言生成和声音克隆。

作者指出,该模型提供完整的技术栈:推理、训练和部署。仓库标签中提到了微调和进一步训练。

运行要求

代码使用 Python 编写。仓库已开源,代码许可证为 Apache-2.0。模型权重同样以 Apache-2.0 许可证发布。

权重文件总大小为 0.9 GB,最大的权重文件为 0.9 GB。作者未说明对 GPU、内存或特定操作系统的要求。

仓库创建于 2024 年 7 月 3 日,代码最后更新于 2026 年 5 月 25 日。

适合谁

CosyVoice(通义 CosyVoice)适合那些寻找支持多语言和声音克隆的开源 text-to-speech 模型的用户。代码和权重的 Apache-2.0 许可证允许在自有项目中使用该模型。

该模型不适合需要带有支持和保障的现成商业平台的用户:这里的一切都需要自行部署。此外,作者未提供系统要求,因此在运行前应确认自己的硬件是否足够。

CosyVoice(通义 CosyVoice)是一个自 2024 年起持续发展的开源语音合成工具。它提供多语言生成和声音克隆能力,但需要自行配置和运行。

CosyVoice(通义 CosyVoice)— 音频与语音生成器管线 输入文本 不同语言的 文本 语言学 文本分析 与语音学 声学 生成 频谱图 声码器 合成声 声音 语音 完成 克隆 语音 样本 可选 开源 · Apache-2.0 · Python · 多语言语音生成
CosyVoice 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证Apache-2.0 来源
权重许可证apache-2.0 来源
最大权重文件0.9 GB 来源
全部权重文件0.9 GB 来源
语言Python 来源
代码最近更新2026-05-25 来源
仓库创建时间2024-07-03 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标22821 来源
Fork 数2629 来源
月下载量4699 来源
模型更新2026-05-31 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读