XTTS: генератор звука — что умеет и что нужно для запуска

XTTS — это генератор речи с открытым кодом от Coqui. Он решает задачу text-to-speech: превращает текст в звучащую речь. Проект развивается в репозитории на GitHub и распространяется в виде библиотеки для Python.
Что умеет
Авторы описывают проект как набор инструментов глубокого обучения для синтеза речи, который, по их словам, проверен в исследованиях и в рабочем окружении. В метках репозитория указаны multi-speaker-tts, voice-cloning и voice-conversion — то есть работа с несколькими голосами, клонирование голоса и преобразование голоса. Также упомянуты архитектуры glow-tts, hifigan, melgan, tacotron и компоненты speaker-encoder и vocoder.
Модель XTTS-v2 размещена на Hugging Face. Общий объём файлов весов — 1,9 ГБ, самый большой файл занимает 1,7 ГБ. Лицензия весов указана как «other», то есть нестандартная; конкретные условия авторы в паспорте не раскрывают.
Что нужно для запуска
Код написан на Python. Лицензия кода — MPL-2.0. Последний выпуск — v0.22.0, последнее изменение кода — 16 августа 2024 года. Репозиторий создан 20 мая 2020 года.
По описанию автора, платформа — cuda. В описании есть отсылка к инструкции по установке с CUDA на Windows, которую написал пользователь GuyPaddock. Требования к памяти и конкретные версии CUDA авторы не указывают.
Кому подойдёт
Проект подойдёт тем, кто ищет открытый инструмент для синтеза речи на Python и готов разбираться с установкой и запуском самостоятельно. Наличие меток voice-cloning и voice-conversion может быть интересно тем, кто работает с несколькими голосами или задачами переноса голоса.
Не подойдёт тем, кто ждёт готового приложения с интерфейсом: это библиотека и модель, а не коробочный продукт. Также стоит учесть, что лицензия весов нестандартная — перед коммерческим использованием её нужно изучить отдельно. Авторы не указывают требования к памяти, поэтому оценить минимальную конфигурацию заранее сложно.
XTTS — это открытый исследовательский инструмент для синтеза речи, который развивается с 2020 года и продолжает получать обновления. Он даёт доступ к модели и коду, но требует технической подготовки и внимания к условиям лицензии на веса.
Паспорт
Репозиторий · Модель на HuggingFace · Сайт разработчика
| Задача | text-to-speech источник |
|---|---|
| Лицензия кода | MPL-2.0 источник |
| Лицензия весов | other источник |
| Платформа | cuda по описанию автора источник |
| Самый большой файл весов | 1.7 ГБ источник |
| Все файлы весов | 1.9 ГБ источник |
| Библиотека | coqui источник |
| Язык | Python источник |
| Последнее изменение кода | 2024-08-16 источник |
| Репозиторий создан | 2020-05-20 источник |
| Последний выпуск | v0.22.0 источник |
|---|---|
| Дата выпуска | 2023-12-12 источник |
| Звёзд на GitHub | 45918 источник |
| Форков | 6149 источник |
| Загрузок за месяц | 8534526 источник |
| Обновление модели | 2023-12-11 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



