F5-TTS: генератор звука — что умеет и что нужно для запуска

F5-TTS — это открытый генератор речи, который превращает текст в звук. Проект создан разработчиком SWivid и распространяется в виде кода и готовых весов модели. Основная задача — text-to-speech, то есть синтез речи по написанному тексту.
Что умеет
Авторы описывают проект как официальный код для работы «F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching». Это заявление разработчика, а не результат независимых измерений. Модель доступна в репозитории на Hugging Face, а научное описание опубликовано на arxiv.org.
В паспорте не указаны поддерживаемые языки, качество синтеза, скорость генерации или ограничения по длине текста. Авторы не приводят этих данных.
Что нужно для запуска
Код написан на Python и опубликован под лицензией MIT. Веса модели распространяются по лицензии cc-by-nc-4.0 — это разрешает использование только в некоммерческих целях.
Самый большой файл весов занимает 1,3 ГБ, все файлы вместе — 3,8 ГБ. Для работы потребуется библиотека f5-tts.
По описанию автора, платформа — ROCm. В описании дословно указано: «ROCm 7.x — these architectures (gfx1151/gfx1201) are not included in ROCm 6.x». Это значит, что для указанных архитектур нужна версия ROCm 7.x, а не 6.x. Других требований к оборудованию или операционной системе в паспорте нет.
Последний выпуск — 1.1.22. Репозиторий создан 8 октября 2024 года, последнее изменение кода — 23 июля 2026 года.
Кому подойдёт
Проект будет полезен тем, кто ищет открытый генератор речи с доступными весами и готов работать с Python-кодом. Лицензия MIT на код позволяет встраивать решение в собственные проекты, а наличие репозитория и модели на Hugging Face упрощает начало работы.
Некоммерческая лицензия весов ограничивает применение: использовать модель в платных продуктах или сервисах нельзя без отдельного разрешения правообладателя. Также проект вряд ли подойдёт тем, кто не готов разбираться с ROCm и архитектурами GPU — авторы не указывают поддержку других платформ.
F5-TTS — это открытая кодовая база для синтеза речи с готовыми весами. Проект развивается, имеет публичный репозиторий и научное описание. Подойдёт для экспериментов и некоммерческих задач, если окружение соответствует требованиям ROCm.
Паспорт
Репозиторий · Модель на HuggingFace · Сайт разработчика
| Задача | text-to-speech источник |
|---|---|
| Лицензия кода | MIT источник |
| Лицензия весов | cc-by-nc-4.0 источник |
| Платформа | ROCm по описанию автора источник |
| Самый большой файл весов | 1.3 ГБ источник |
| Все файлы весов | 3.8 ГБ источник |
| Библиотека | f5-tts источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-07-23 источник |
| Репозиторий создан | 2024-10-08 источник |
| Последний выпуск | 1.1.22 источник |
|---|---|
| Дата выпуска | 2026-07-23 источник |
| Звёзд на GitHub | 15136 источник |
| Форков | 2198 источник |
| Загрузок за месяц | 743709 источник |
| Обновление модели | 2025-03-21 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



