CPU3DИИ-инструменты для 3D, видео и звука

Fish Speech: генератор звука — что умеет и что нужно для запуска

Fish Speech — это открытый генератор речи от Fish Audio, который решает задачу text-to-speech: превращает текст в озвучку. Проект публикует и код, и готовые веса модели, поэтому его можно запустить самостоятельно или изучить, как устроена современная система синтеза речи.

Что умеет

Авторы описывают Fish Speech как SOTA Open Source TTS, то есть заявляют его как передовую открытую систему синтеза речи. В основе лежит архитектура Dual-AR, которая, по описанию разработчика, структурно изоморфна стандартным большим языковым моделям. Благодаря этому модель поддерживает механизмы ускорения инференса SGLang: Continuous Batching, Paged KV Cache, CUDA Graph и RadixAttention-based Prefix Caching.

В репозитории указаны метки llama, transformer, tts, valle, vits, vqgan и vqvae — это даёт представление о технологическом стеке: трансформерная архитектура, векторное квантование и подходы, характерные для нейросетевого синтеза речи.

Что нужно для запуска

Код написан на Python. Репозиторий создан в октябре 2023 года, последнее изменение кода — 3 августа 2026 года. Последний выпуск — v1.5.1.

Веса модели опубликованы на Hugging Face. Самый большой файл весов занимает 1,2 ГБ, суммарно все файлы весов — 1,4 ГБ. Лицензия весов — cc-by-nc-sa-4.0: использовать можно с указанием авторства, в некоммерческих целях и с сохранением той же лицензии для производных работ. Лицензия кода нестандартная — авторы не приводят её в явном виде, поэтому перед использованием кода стоит проверить условия вручную.

Платформа по описанию автора — CUDA. Это заявление разработчика, а не результат независимого тестирования: в описании указано, что модель поддерживает ускорение на CUDA через механизмы SGLang.

Кому подойдёт

Fish Speech подойдёт тем, кто ищет открытую систему синтеза речи с публичными весами и возможностью самостоятельного запуска. Проект будет интересен разработчикам, которые хотят разобраться в архитектуре современных TTS-моделей или встроить генерацию речи в свой пайплайн при условии соблюдения некоммерческой лицензии весов.

Проект вряд ли подойдёт тем, кому нужна коммерческая озвучка без ограничений: лицензия весов cc-by-nc-sa-4.0 запрещает коммерческое использование. Также стоит учитывать, что для запуска, по описанию автора, требуется CUDA — это ограничивает круг подходящего оборудования. Нестандартная лицензия кода потребует отдельного изучения перед использованием в своих проектах.

Fish Speech — это открытая система синтеза речи с публичными весами и прозрачной архитектурой. Проект развивается с 2023 года, имеет актуальный выпуск v1.5.1 и опирается на подходы, характерные для больших языковых моделей. Перед использованием стоит внимательно изучить условия лицензий: для весов они ограничивают коммерческое применение, а лицензию кода авторы просят проверять вручную.

Fish Speech — конвейер генератора звука и речи Текст входные данные Токенизация разбиение на токены Dual-AR генерация признаков Вокодер синтез звука Результат — звуковой файл синтезированная речь форматы экспорта: не указаны в паспорте Вход Обработка Генерация Синтез
Как устроен конвейер Fish Speech. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-speech источник
Лицензия коданестандартная (проверить вручную) источник
Лицензия весовcc-by-nc-sa-4.0 источник
ПлатформаCUDA по описанию автора источник
Самый большой файл весов1.2 ГБ источник
Все файлы весов1.4 ГБ источник
ЯзыкPython источник
Последнее изменение кода2026-08-03 источник
Репозиторий создан2023-10-10 источник
Меняется часто — данные на 19.08.2026
Последний выпускv1.5.1 источник
Дата выпуска2025-05-31 источник
Звёзд на GitHub32279 источник
Форков2781 источник
Загрузок за месяц4253 источник
Обновление модели2025-03-25 источник

Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также