Stable Audio Open: генератор звука — что умеет и что нужно для запуска

Stable Audio Open — это генератор звука от Stability AI с открытым кодом. Он решает задачу text-to-audio: превращает текстовое описание в звуковой файл. Инструмент подойдёт тем, кому нужна генерация аудио по тексту и кто готов работать с кодом и весами модели напрямую.
Что умеет
Авторы описывают проект как генеративные модели для условной генерации звука. Задача, которую решает модель, — text-to-audio: на вход подаётся текст, на выходе получается звук. Других режимов работы, например генерации речи или музыки по нотам, в паспорте не заявлено.
Код написан на Python. Последнее изменение в репозитории — 9 августа 2026 года, сам репозиторий создан 23 мая 2023 года.
Что нужно для запуска
Для работы нужна библиотека stable-audio-tools. Самый большой файл весов занимает 4,5 ГБ, все файлы весов вместе — 14,6 ГБ. Это стоит учитывать при планировании дискового пространства.
По описанию автора, для разработки используется Python 3.10. В описании репозитория указано: «Requires PyTorch 2.5 or later for Flash Attention and Flex Attention support. Development for the repo is done in Python 3.10». То есть для поддержки Flash Attention и Flex Attention требуется PyTorch 2.5 или новее.
Код распространяется по лицензии MIT. Лицензия весов указана как other — конкретные условия авторы в паспорте не раскрывают.
Кому подойдёт
Инструмент рассчитан на тех, кто умеет работать с Python и не боится запускать модели через код. Открытый код и доступные веса позволяют разобраться в устройстве модели и при необходимости доработать её под свои задачи.
Тем, кто ищет готовое приложение с интерфейсом, этот вариант может не подойти: в паспорте нет сведений о графическом интерфейсе или веб-сервисе. Также стоит учесть объём весов — 14,6 ГБ суммарно, что может быть заметно для слабых машин.
Stable Audio Open — это инструмент для разработчиков и исследователей, которым нужна генерация звука по тексту и которые готовы работать с кодом и весами напрямую. Код открыт, модель доступна, но запуск требует технической подготовки и свободного места на диске.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | text-to-audio источник |
|---|---|
| Лицензия кода | MIT источник |
| Лицензия весов | other источник |
| Самый большой файл весов | 4.5 ГБ источник |
| Все файлы весов | 14.6 ГБ источник |
| Python | 3.10 по описанию автора источник |
| Библиотека | stable-audio-tools источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-08-09 источник |
| Репозиторий создан | 2023-05-23 источник |
| Звёзд на GitHub | 3842 источник |
|---|---|
| Форков | 478 источник |
| Загрузок за месяц | 21491 источник |
| Обновление модели | 2025-06-19 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



