CosyVoice:音频生成器 — 功能与运行要求

CosyVoice(通义 CosyVoice)是阿里巴巴推出的开源语音生成器。它解决的是 text-to-speech 任务:将文本转化为可听的语音。据作者描述,这是一个多语言语音生成模型,支持推理、训练和部署。
功能
据作者描述,CosyVoice(通义 CosyVoice)是一个多语言语音生成模型。仓库标签中列出的语言包括:中文、粤语、英语、日语、韩语。同时宣称支持跨语言生成和声音克隆。
作者指出,该模型提供完整的技术栈:推理、训练和部署。仓库标签中提到了微调和进一步训练。
运行要求
代码使用 Python 编写。仓库已开源,代码许可证为 Apache-2.0。模型权重同样以 Apache-2.0 许可证发布。
权重文件总大小为 0.9 GB,最大的权重文件为 0.9 GB。作者未说明对 GPU、内存或特定操作系统的要求。
仓库创建于 2024 年 7 月 3 日,代码最后更新于 2026 年 5 月 25 日。
适合谁
CosyVoice(通义 CosyVoice)适合那些寻找支持多语言和声音克隆的开源 text-to-speech 模型的用户。代码和权重的 Apache-2.0 许可证允许在自有项目中使用该模型。
该模型不适合需要带有支持和保障的现成商业平台的用户:这里的一切都需要自行部署。此外,作者未提供系统要求,因此在运行前应确认自己的硬件是否足够。
CosyVoice(通义 CosyVoice)是一个自 2024 年起持续发展的开源语音合成工具。它提供多语言生成和声音克隆能力,但需要自行配置和运行。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-speech 来源 |
|---|---|
| 代码许可证 | Apache-2.0 来源 |
| 权重许可证 | apache-2.0 来源 |
| 最大权重文件 | 0.9 GB 来源 |
| 全部权重文件 | 0.9 GB 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-05-25 来源 |
| 仓库创建时间 | 2024-07-03 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



