OpenVoice: генератор звука — что умеет и что нужно для запуска

OpenVoice — это генератор речи с открытым кодом от команды MyShell. Он решает задачу text-to-speech и, по описанию авторов, относится к классу аудиофундаментальных моделей. Основной сценарий — синтез голоса с возможностью переноса тембра на основе образца, без дополнительного обучения под конкретного диктора.
Что умеет
Авторы описывают OpenVoice как модель для клонирования голоса и zero-shot text-to-speech. Это означает, что система может воспроизводить текст голосом, характеристики которого задаются коротким образцом речи. В репозитории проект помечен метками text-to-speech, tts, voice-clone и zero-shot-tts.
Модель опубликована в двух местах: репозиторий с кодом и страница весов OpenVoiceV2 на Hugging Face. Общий объём файлов весов — 0,1 ГБ, самый большой отдельный файл также занимает 0,1 ГБ.
Что нужно для запуска
Код написан на Python. Репозиторий создан в ноябре 2023 года, последнее изменение кода датировано апрелем 2025 года. Лицензия кода — MIT, лицензия весов — MIT. Это разрешает использование и модификацию при сохранении условий лицензии.
Требования к аппаратному обеспечению, объёму оперативной памяти или конкретной версии Python авторы в паспорте не указывают.
Кому подойдёт
OpenVoice может быть полезен тем, кто работает с синтезом речи и хочет иметь доступ к исходному коду и весам модели. Открытая лицензия MIT позволяет встраивать модель в собственные проекты и исследовательские пайплайны.
Проект вряд ли подойдёт тем, кто ищет готовое приложение с интерфейсом: в паспорте указаны только репозиторий, страница модели и исследовательский сайт. Также стоит учитывать, что авторы не приводят измеренных показателей качества синтеза или требований к вычислительным ресурсам.
OpenVoice — это открытая кодовая база и набор весов для синтеза речи с переносом голоса. Оценить практическую применимость можно после запуска на собственном оборудовании и проверки на конкретных задачах.
Паспорт
Репозиторий · Модель на HuggingFace · Сайт разработчика
| Задача | text-to-speech источник |
|---|---|
| Лицензия кода | MIT источник |
| Лицензия весов | mit источник |
| Самый большой файл весов | 0.1 ГБ источник |
| Все файлы весов | 0.1 ГБ источник |
| Язык | Python источник |
| Последнее изменение кода | 2025-04-19 источник |
| Репозиторий создан | 2023-11-29 источник |
| Звёзд на GitHub | 37159 источник |
|---|---|
| Форков | 4147 источник |
| Загрузок за месяц | 0 источник |
| Обновление модели | 2024-12-24 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



