MusicGen: генератор звука — что умеет и что нужно для запуска

MusicGen — это генератор звука от Meta, который превращает текстовое описание в аудио. Он входит в библиотеку Audiocraft и решает задачу text-to-audio: пользователь описывает, что хочет услышать, а модель создаёт звуковой фрагмент на основе этого описания.
Что умеет
MusicGen работает как языковая модель для генерации музыки. По описанию авторов, она поддерживает текстовое и мелодическое обусловливание — то есть результат можно направлять не только словами, но и мелодией. В основе лежит звуковой компрессор и токенизатор EnCodec, который авторы называют современным на момент публикации.
Модель доступна в двух местах: код открыт в репозитории Audiocraft, а веса опубликованы на Hugging Face. Для работы с моделью используется библиотека transformers. Авторы не приводят детальных характеристик качества или ограничений по длительности генерируемого звука.
Что нужно для запуска
Код написан преимущественно на Jupyter Notebook и распространяется под лицензией MIT. Веса модели доступны под лицензией cc-by-nc-4.0 — это разрешает использование в некоммерческих целях с указанием авторства.
По описанию автора, для установки AudioCraft требуется Python 3.9 и PyTorch 2.1.0. Самый большой файл весов занимает 9.3 ГБ, а полный набор файлов — 19.1 ГБ. Репозиторий создан 8 июня 2023 года, последнее изменение кода датировано 3 марта 2026 года.
Кому подойдёт
MusicGen будет полезен тем, кто экспериментирует с генерацией звука по тексту и готов работать с открытым кодом. Наличие репозитория и опубликованных весов позволяет изучать архитектуру, дообучать модель или встраивать её в собственные проекты — при условии соблюдения некоммерческой лицензии на веса.
Тем, кто ищет готовый коммерческий сервис или не хочет разбираться с установкой Python-окружения и загрузкой десятков гигабайт, такой формат может не подойти. Также стоит учитывать, что авторы не указывают подробных требований к оборудованию, поэтому перед запуском имеет смысл проверить доступные ресурсы.
MusicGen — это открытый инструмент для исследователей и разработчиков, которым нужна текстовая генерация звука с возможностью контроля через мелодию. Он требует определённой технической подготовки и внимания к лицензионным условиям, но даёт доступ к полному коду и весам модели.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | text-to-audio источник |
|---|---|
| Лицензия кода | MIT источник |
| Лицензия весов | cc-by-nc-4.0 источник |
| Самый большой файл весов | 9.3 ГБ источник |
| Все файлы весов | 19.1 ГБ источник |
| Python | 3.9 по описанию автора источник |
| Библиотека | transformers источник |
| Язык | Jupyter Notebook источник |
| Последнее изменение кода | 2026-03-03 источник |
| Репозиторий создан | 2023-06-08 источник |
| Звёзд на GitHub | 23564 источник |
|---|---|
| Форков | 2687 источник |
| Загрузок за месяц | 94717 источник |
| Обновление модели | 2023-11-17 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



