CPU3DИИ-инструменты для 3D, видео и звука

Stable Audio Open: генератор звука — что умеет и что нужно для запуска

Stable Audio Open — это генератор звука от Stability AI с открытым кодом. Он решает задачу text-to-audio: превращает текстовое описание в звуковой файл. Инструмент подойдёт тем, кому нужна генерация аудио по тексту и кто готов работать с кодом и весами модели напрямую.

Что умеет

Авторы описывают проект как генеративные модели для условной генерации звука. Задача, которую решает модель, — text-to-audio: на вход подаётся текст, на выходе получается звук. Других режимов работы, например генерации речи или музыки по нотам, в паспорте не заявлено.

Код написан на Python. Последнее изменение в репозитории — 9 августа 2026 года, сам репозиторий создан 23 мая 2023 года.

Что нужно для запуска

Для работы нужна библиотека stable-audio-tools. Самый большой файл весов занимает 4,5 ГБ, все файлы весов вместе — 14,6 ГБ. Это стоит учитывать при планировании дискового пространства.

По описанию автора, для разработки используется Python 3.10. В описании репозитория указано: «Requires PyTorch 2.5 or later for Flash Attention and Flex Attention support. Development for the repo is done in Python 3.10». То есть для поддержки Flash Attention и Flex Attention требуется PyTorch 2.5 или новее.

Код распространяется по лицензии MIT. Лицензия весов указана как other — конкретные условия авторы в паспорте не раскрывают.

Кому подойдёт

Инструмент рассчитан на тех, кто умеет работать с Python и не боится запускать модели через код. Открытый код и доступные веса позволяют разобраться в устройстве модели и при необходимости доработать её под свои задачи.

Тем, кто ищет готовое приложение с интерфейсом, этот вариант может не подойти: в паспорте нет сведений о графическом интерфейсе или веб-сервисе. Также стоит учесть объём весов — 14,6 ГБ суммарно, что может быть заметно для слабых машин.

Stable Audio Open — это инструмент для разработчиков и исследователей, которым нужна генерация звука по тексту и которые готовы работать с кодом и весами напрямую. Код открыт, модель доступна, но запуск требует технической подготовки и свободного места на диске.

Конвейер Stable Audio Open Текстовый запрос описание звука на естественном языке Токенизация преобразование в числовые токены Генерация диффузионная модель Декодирование преобразование в аудиосигнал Аудио звуковой файл Открытый код · MIT · Python · PyTorch Модель: stable-audio-open-1.0 Библиотека: stable-audio-tools Задача: text-to-audio Разработчик: Stability AI Версия Python: 3.10 Лицензия кода: MIT
Как устроен конвейер Stable Audio Open. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-audio источник
Лицензия кодаMIT источник
Лицензия весовother источник
Самый большой файл весов4.5 ГБ источник
Все файлы весов14.6 ГБ источник
Python3.10 по описанию автора источник
Библиотекаstable-audio-tools источник
ЯзыкPython источник
Последнее изменение кода2026-08-09 источник
Репозиторий создан2023-05-23 источник
Меняется часто — данные на 19.08.2026
Звёзд на GitHub3842 источник
Форков478 источник
Загрузок за месяц21491 источник
Обновление модели2025-06-19 источник

Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также