CPU3DИИ-инструменты для 3D, видео и звука

XTTS: генератор звука — что умеет и что нужно для запуска

XTTS — это генератор речи с открытым кодом от Coqui. Он решает задачу text-to-speech: превращает текст в звучащую речь. Проект развивается в репозитории на GitHub и распространяется в виде библиотеки для Python.

Что умеет

Авторы описывают проект как набор инструментов глубокого обучения для синтеза речи, который, по их словам, проверен в исследованиях и в рабочем окружении. В метках репозитория указаны multi-speaker-tts, voice-cloning и voice-conversion — то есть работа с несколькими голосами, клонирование голоса и преобразование голоса. Также упомянуты архитектуры glow-tts, hifigan, melgan, tacotron и компоненты speaker-encoder и vocoder.

Модель XTTS-v2 размещена на Hugging Face. Общий объём файлов весов — 1,9 ГБ, самый большой файл занимает 1,7 ГБ. Лицензия весов указана как «other», то есть нестандартная; конкретные условия авторы в паспорте не раскрывают.

Что нужно для запуска

Код написан на Python. Лицензия кода — MPL-2.0. Последний выпуск — v0.22.0, последнее изменение кода — 16 августа 2024 года. Репозиторий создан 20 мая 2020 года.

По описанию автора, платформа — cuda. В описании есть отсылка к инструкции по установке с CUDA на Windows, которую написал пользователь GuyPaddock. Требования к памяти и конкретные версии CUDA авторы не указывают.

Кому подойдёт

Проект подойдёт тем, кто ищет открытый инструмент для синтеза речи на Python и готов разбираться с установкой и запуском самостоятельно. Наличие меток voice-cloning и voice-conversion может быть интересно тем, кто работает с несколькими голосами или задачами переноса голоса.

Не подойдёт тем, кто ждёт готового приложения с интерфейсом: это библиотека и модель, а не коробочный продукт. Также стоит учесть, что лицензия весов нестандартная — перед коммерческим использованием её нужно изучить отдельно. Авторы не указывают требования к памяти, поэтому оценить минимальную конфигурацию заранее сложно.

XTTS — это открытый исследовательский инструмент для синтеза речи, который развивается с 2020 года и продолжает получать обновления. Он даёт доступ к модели и коду, но требует технической подготовки и внимания к условиям лицензии на веса.

Конвейер XTTS — генератор звука и речи Coqui · открытый код · text-to-speech Входной текст текст на входе произвольная строка Анализ текста токенизация нормализация Акустическая модель нейросеть pytorch Вокодер синтез волны hifigan Звук речь аудио Голос клонирования speaker-encoder voice-cloning Модель: XTTS-v2 · Веса: 1.7 ГБ · Платформа: cuda · Лицензия кода: MPL-2.0 Библиотека: coqui · Язык: Python · Последний выпуск: v0.22.0
Как устроен конвейер XTTS. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-speech источник
Лицензия кодаMPL-2.0 источник
Лицензия весовother источник
Платформаcuda по описанию автора источник
Самый большой файл весов1.7 ГБ источник
Все файлы весов1.9 ГБ источник
Библиотекаcoqui источник
ЯзыкPython источник
Последнее изменение кода2024-08-16 источник
Репозиторий создан2020-05-20 источник
Меняется часто — данные на 19.08.2026
Последний выпускv0.22.0 источник
Дата выпуска2023-12-12 источник
Звёзд на GitHub45918 источник
Форков6149 источник
Загрузок за месяц8534526 источник
Обновление модели2023-12-11 источник

Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также