CPU3DИИ-инструменты для 3D, видео и звука

F5-TTS: генератор звука — что умеет и что нужно для запуска

F5-TTS — это открытый генератор речи, который превращает текст в звук. Проект создан разработчиком SWivid и распространяется в виде кода и готовых весов модели. Основная задача — text-to-speech, то есть синтез речи по написанному тексту.

Что умеет

Авторы описывают проект как официальный код для работы «F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching». Это заявление разработчика, а не результат независимых измерений. Модель доступна в репозитории на Hugging Face, а научное описание опубликовано на arxiv.org.

В паспорте не указаны поддерживаемые языки, качество синтеза, скорость генерации или ограничения по длине текста. Авторы не приводят этих данных.

Что нужно для запуска

Код написан на Python и опубликован под лицензией MIT. Веса модели распространяются по лицензии cc-by-nc-4.0 — это разрешает использование только в некоммерческих целях.

Самый большой файл весов занимает 1,3 ГБ, все файлы вместе — 3,8 ГБ. Для работы потребуется библиотека f5-tts.

По описанию автора, платформа — ROCm. В описании дословно указано: «ROCm 7.x — these architectures (gfx1151/gfx1201) are not included in ROCm 6.x». Это значит, что для указанных архитектур нужна версия ROCm 7.x, а не 6.x. Других требований к оборудованию или операционной системе в паспорте нет.

Последний выпуск — 1.1.22. Репозиторий создан 8 октября 2024 года, последнее изменение кода — 23 июля 2026 года.

Кому подойдёт

Проект будет полезен тем, кто ищет открытый генератор речи с доступными весами и готов работать с Python-кодом. Лицензия MIT на код позволяет встраивать решение в собственные проекты, а наличие репозитория и модели на Hugging Face упрощает начало работы.

Некоммерческая лицензия весов ограничивает применение: использовать модель в платных продуктах или сервисах нельзя без отдельного разрешения правообладателя. Также проект вряд ли подойдёт тем, кто не готов разбираться с ROCm и архитектурами GPU — авторы не указывают поддержку других платформ.

F5-TTS — это открытая кодовая база для синтеза речи с готовыми весами. Проект развивается, имеет публичный репозиторий и научное описание. Подойдёт для экспериментов и некоммерческих задач, если окружение соответствует требованиям ROCm.

F5-TTS — конвейер генератора звука и речи text-to-speech · открытый код · Python Входной текст текст для озвучивания произвольная строка Токенизация разбиение на токены подготовка данных Модель F5-TTS flow matching генерация речи Постобработка очистка сигнала финальная сборка Звук речь Ключевые характеристики Разработчик: SWivid · Лицензия кода: MIT · Лицензия весов: cc-by-nc-4.0 Библиотека: f5-tts · Платформа: ROCm · Язык: Python Репозиторий: github.com/SWivid/F5-TTS · Модель: huggingface.co/SWivid/F5-TTS Последний выпуск: 1.1.22 · Создан: 2024-10-08 · Обновлён: 2026-07-23 Самый большой файл весов: 1.3 ГБ · Все файлы весов: 3.8 ГБ
Как устроен конвейер F5-TTS. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-speech источник
Лицензия кодаMIT источник
Лицензия весовcc-by-nc-4.0 источник
ПлатформаROCm по описанию автора источник
Самый большой файл весов1.3 ГБ источник
Все файлы весов3.8 ГБ источник
Библиотекаf5-tts источник
ЯзыкPython источник
Последнее изменение кода2026-07-23 источник
Репозиторий создан2024-10-08 источник
Меняется часто — данные на 19.08.2026
Последний выпуск1.1.22 источник
Дата выпуска2026-07-23 источник
Звёзд на GitHub15136 источник
Форков2198 источник
Загрузок за месяц743709 источник
Обновление модели2025-03-21 источник

Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также