Fish Speech: генератор звука — что умеет и что нужно для запуска

Fish Speech — это открытый генератор речи от Fish Audio, который решает задачу text-to-speech: превращает текст в озвучку. Проект публикует и код, и готовые веса модели, поэтому его можно запустить самостоятельно или изучить, как устроена современная система синтеза речи.
Что умеет
Авторы описывают Fish Speech как SOTA Open Source TTS, то есть заявляют его как передовую открытую систему синтеза речи. В основе лежит архитектура Dual-AR, которая, по описанию разработчика, структурно изоморфна стандартным большим языковым моделям. Благодаря этому модель поддерживает механизмы ускорения инференса SGLang: Continuous Batching, Paged KV Cache, CUDA Graph и RadixAttention-based Prefix Caching.
В репозитории указаны метки llama, transformer, tts, valle, vits, vqgan и vqvae — это даёт представление о технологическом стеке: трансформерная архитектура, векторное квантование и подходы, характерные для нейросетевого синтеза речи.
Что нужно для запуска
Код написан на Python. Репозиторий создан в октябре 2023 года, последнее изменение кода — 3 августа 2026 года. Последний выпуск — v1.5.1.
Веса модели опубликованы на Hugging Face. Самый большой файл весов занимает 1,2 ГБ, суммарно все файлы весов — 1,4 ГБ. Лицензия весов — cc-by-nc-sa-4.0: использовать можно с указанием авторства, в некоммерческих целях и с сохранением той же лицензии для производных работ. Лицензия кода нестандартная — авторы не приводят её в явном виде, поэтому перед использованием кода стоит проверить условия вручную.
Платформа по описанию автора — CUDA. Это заявление разработчика, а не результат независимого тестирования: в описании указано, что модель поддерживает ускорение на CUDA через механизмы SGLang.
Кому подойдёт
Fish Speech подойдёт тем, кто ищет открытую систему синтеза речи с публичными весами и возможностью самостоятельного запуска. Проект будет интересен разработчикам, которые хотят разобраться в архитектуре современных TTS-моделей или встроить генерацию речи в свой пайплайн при условии соблюдения некоммерческой лицензии весов.
Проект вряд ли подойдёт тем, кому нужна коммерческая озвучка без ограничений: лицензия весов cc-by-nc-sa-4.0 запрещает коммерческое использование. Также стоит учитывать, что для запуска, по описанию автора, требуется CUDA — это ограничивает круг подходящего оборудования. Нестандартная лицензия кода потребует отдельного изучения перед использованием в своих проектах.
Fish Speech — это открытая система синтеза речи с публичными весами и прозрачной архитектурой. Проект развивается с 2023 года, имеет актуальный выпуск v1.5.1 и опирается на подходы, характерные для больших языковых моделей. Перед использованием стоит внимательно изучить условия лицензий: для весов они ограничивают коммерческое применение, а лицензию кода авторы просят проверять вручную.
Паспорт
Репозиторий · Модель на HuggingFace · Сайт разработчика
| Задача | text-to-speech источник |
|---|---|
| Лицензия кода | нестандартная (проверить вручную) источник |
| Лицензия весов | cc-by-nc-sa-4.0 источник |
| Платформа | CUDA по описанию автора источник |
| Самый большой файл весов | 1.2 ГБ источник |
| Все файлы весов | 1.4 ГБ источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-08-03 источник |
| Репозиторий создан | 2023-10-10 источник |
| Последний выпуск | v1.5.1 источник |
|---|---|
| Дата выпуска | 2025-05-31 источник |
| Звёзд на GitHub | 32279 источник |
| Форков | 2781 источник |
| Загрузок за месяц | 4253 источник |
| Обновление модели | 2025-03-25 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



