ChatTTS: генератор звука — что умеет и что нужно для запуска

ChatTTS — это генератор звука с открытым кодом от команды 2noise. Он решает задачу text-to-audio: превращает текст в речь, ориентированную на повседневный диалог. Авторы описывают модель как генеративную речевую модель для ежедневного общения.
Что умеет
По описанию автора, ChatTTS генерирует речь из текста. Модель поддерживает китайский и английский языки — это указано в метках репозитория. В описании проекта упоминается работа с семантическими токенами: для 30-секундного аудиоклипа требуется не менее 4 ГБ видеопамяти, а на GPU 4090 генерация идёт со скоростью примерно 7 семантических токенов в секунду. Коэффициент реального времени (RTF) составляет около 0.3 — это заявление разработчика, а не независимое измерение.
Репозиторий помечен темами agent, chat, llm, text-to-speech и другими, что указывает на направленность модели в сторону диалоговых систем и агентов. Последний выпуск — v0.2.5.
Что нужно для запуска
Код написан на Python и распространяется по лицензии AGPL-3.0. Веса модели доступны по лицензии cc-by-nc-4.0 — это означает некоммерческое использование. Самый большой файл весов занимает 0.8 ГБ, все файлы вместе — 1.1 ГБ.
Для работы нужен GPU. По описанию автора, минимальный объём видеопамяти — 4 ГБ для 30-секундного клипа. Библиотека для интеграции называется chat_tts. Код и веса доступны на GitHub и Hugging Face.
Кому подойдёт
ChatTTS может быть интересен тем, кто делает диалоговые системы, чат-ботов или голосовых агентов на китайском или английском языке. Открытый код позволяет изучать реализацию и дорабатывать модель под свои задачи, если лицензия AGPL-3.0 устраивает проект.
Модель не подойдёт для коммерческих проектов без отдельного согласования: веса распространяются по некоммерческой лицензии cc-by-nc-4.0. Также она не рассчитана на системы без дискретного GPU — авторы указывают требование к видеопамяти, но не описывают работу только на процессоре.
ChatTTS — это открытый инструмент для синтеза диалоговой речи с фокусом на китайский и английский языки. Он требует GPU и подходит для некоммерческих проектов, которым нужна генерация речи в реальном времени или близко к нему.
Паспорт
Репозиторий · Модель на HuggingFace · Сайт разработчика
| Задача | text-to-audio источник |
|---|---|
| Лицензия кода | AGPL-3.0 источник |
| Лицензия весов | cc-by-nc-4.0 источник |
| Видеопамять | 4 ГБ по описанию автора источник |
| Самый большой файл весов | 0.8 ГБ источник |
| Все файлы весов | 1.1 ГБ источник |
| Библиотека | chat_tts источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-04-10 источник |
| Репозиторий создан | 2024-05-27 источник |
| Последний выпуск | v0.2.5 источник |
|---|---|
| Дата выпуска | 2026-04-10 источник |
| Звёзд на GitHub | 39772 источник |
| Форков | 4257 источник |
| Загрузок за месяц | 2751 источник |
| Обновление модели | 2024-10-22 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



