CPU3DИИ-инструменты для 3D, видео и звука

ChatTTS: генератор звука — что умеет и что нужно для запуска

ChatTTS — это генератор звука с открытым кодом от команды 2noise. Он решает задачу text-to-audio: превращает текст в речь, ориентированную на повседневный диалог. Авторы описывают модель как генеративную речевую модель для ежедневного общения.

Что умеет

По описанию автора, ChatTTS генерирует речь из текста. Модель поддерживает китайский и английский языки — это указано в метках репозитория. В описании проекта упоминается работа с семантическими токенами: для 30-секундного аудиоклипа требуется не менее 4 ГБ видеопамяти, а на GPU 4090 генерация идёт со скоростью примерно 7 семантических токенов в секунду. Коэффициент реального времени (RTF) составляет около 0.3 — это заявление разработчика, а не независимое измерение.

Репозиторий помечен темами agent, chat, llm, text-to-speech и другими, что указывает на направленность модели в сторону диалоговых систем и агентов. Последний выпуск — v0.2.5.

Что нужно для запуска

Код написан на Python и распространяется по лицензии AGPL-3.0. Веса модели доступны по лицензии cc-by-nc-4.0 — это означает некоммерческое использование. Самый большой файл весов занимает 0.8 ГБ, все файлы вместе — 1.1 ГБ.

Для работы нужен GPU. По описанию автора, минимальный объём видеопамяти — 4 ГБ для 30-секундного клипа. Библиотека для интеграции называется chat_tts. Код и веса доступны на GitHub и Hugging Face.

Кому подойдёт

ChatTTS может быть интересен тем, кто делает диалоговые системы, чат-ботов или голосовых агентов на китайском или английском языке. Открытый код позволяет изучать реализацию и дорабатывать модель под свои задачи, если лицензия AGPL-3.0 устраивает проект.

Модель не подойдёт для коммерческих проектов без отдельного согласования: веса распространяются по некоммерческой лицензии cc-by-nc-4.0. Также она не рассчитана на системы без дискретного GPU — авторы указывают требование к видеопамяти, но не описывают работу только на процессоре.

ChatTTS — это открытый инструмент для синтеза диалоговой речи с фокусом на китайский и английский языки. Он требует GPU и подходит для некоммерческих проектов, которым нужна генерация речи в реальном времени или близко к нему.

Конвейер ChatTTS Генеративный речевой синтез для повседневного диалога Текст Исходный текст на китайском или английском Токенизация Разбивка текста на семантические токены Генерация Нейросетевая модель речи для диалога Вокодер Преобразование токенов в звуковой сигнал Аудио Готовый звуковой файл Характеристики Видеопамять: 4 ГБ для 30-секундного клипа Скорость: 7 семантических токенов в секунду на 4090 Real-Time Factor: около 0.3 Лицензии: AGPL-3.0 (код), cc-by-nc-4.0 (веса)
Как устроен конвейер ChatTTS. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-audio источник
Лицензия кодаAGPL-3.0 источник
Лицензия весовcc-by-nc-4.0 источник
Видеопамять4 ГБ по описанию автора источник
Самый большой файл весов0.8 ГБ источник
Все файлы весов1.1 ГБ источник
Библиотекаchat_tts источник
ЯзыкPython источник
Последнее изменение кода2026-04-10 источник
Репозиторий создан2024-05-27 источник
Меняется часто — данные на 19.08.2026
Последний выпускv0.2.5 источник
Дата выпуска2026-04-10 источник
Звёзд на GitHub39772 источник
Форков4257 источник
Загрузок за месяц2751 источник
Обновление модели2024-10-22 источник

Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также