CPU3D3D、视频与音频的 AI 工具

OpenVoice:音频生成器 — 功能与运行要求

OpenVoice — 这是来自 MyShell 团队的开源语音生成器。它解决 text-to-speech 任务,据作者描述,属于音频基础模型类别。主要场景是根据样本进行音色迁移的语音合成,无需针对特定说话人进行额外训练。

功能

作者将 OpenVoice 描述为用于语音克隆和 zero-shot text-to-speech 的模型。这意味着系统可以用文本生成语音,其音色特征由一段简短语音样本指定。在仓库中,该项目被标记为 text-to-speech、tts、voice-clone 和 zero-shot-tts。

模型发布在两个位置:代码仓库和 Hugging Face 上的 OpenVoiceV2 权重页面。权重文件总大小为 0.1 GB,最大的单个文件也是 0.1 GB。

运行要求

代码使用 Python 编写。仓库创建于 2023 年 11 月,代码最后更新时间为 2025 年 4 月。代码许可证为 MIT,权重许可证为 MIT。这允许在保留许可证条款的前提下进行使用和修改。

作者在参数表中未说明硬件要求、内存容量或特定 Python 版本要求。

适合谁

OpenVoice 可能适合从事语音合成工作、希望访问源代码和模型权重的人。MIT 开源许可证允许将模型集成到自己的项目和研究流程中。

该项目可能不适合那些寻找带界面的现成应用的人:参数表中只列出了仓库、模型页面和研究网站。另外需要注意的是,作者没有提供合成质量的实测指标或计算资源要求。

OpenVoice 是一个用于语音合成和声音迁移的开源代码库和权重集。实际适用性需要在自己的硬件上运行并针对具体任务进行验证后才能评估。

OpenVoice 管线 — 音频与语音生成器 文本 输入数据 用于配音 文本分析 解析结构 与语音学 语音模型 语音合成 zero-shot TTS 克隆 音色迁移 与语调 音频 语音 信号 语音样本 参考音频片段 流程:输入 → 分析 → 合成 → 克隆 → 输出 许可证:MIT · 权重:0.1 GB · 语言:Python 开发者:MyShell · 开源
OpenVoice 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-speech 来源
代码许可证MIT 来源
权重许可证mit 来源
最大权重文件0.1 GB 来源
全部权重文件0.1 GB 来源
语言Python 来源
代码最近更新2025-04-19 来源
仓库创建时间2023-11-29 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标37159 来源
Fork 数4147 来源
月下载量0 来源
模型更新2024-12-24 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读