MMAudio: генератор звука — что умеет и что нужно для запуска

MMAudio — открытый генератор звука, который синтезирует аудиодорожку по видео или текстовому описанию. Разработчики позиционируют его как инструмент для высококачественного синтеза звука с совместным обучением на нескольких типах данных. Код опубликован на GitHub, веса модели выложены на Hugging Face.
Что умеет
По описанию авторов, MMAudio решает две основные задачи:
- video-to-audio — генерация звуковой дорожки под готовое видео;
- text-to-audio — синтез звука по текстовому описанию.
Авторы относят проект к области глубокого обучения и компьютерного зрения. В описании репозитория указано, что работа принята на CVPR 2025. Последний выпуск — v0.1.
Что нужно для запуска
Код написан на Python. По описанию автора, требуется Python 3.9 или новее и PyTorch 2.5.1 или новее с соответствующими версиями torchvision и torchaudio. Платформа — CUDA; авторы рекомендуют подбирать версию PyTorch под свою версию CUDA на сайте pytorch.org.
Видеопамять по описанию автора — около 6 ГБ в 16-битном режиме. Дословно из описания: «In our experiments, inference only takes around 6GB of GPU memory (in 16-bit mode) which should fit in most modern GPUs». Это заявление разработчика, а не независимое измерение.
Самый большой файл весов занимает 19,2 ГБ, все файлы весов вместе — 50,5 ГБ. Лицензия кода — MIT, лицензия весов — cc-by-nc-4.0. Это означает, что веса можно использовать только в некоммерческих целях, а код — свободно, включая коммерческое применение, с сохранением уведомления о лицензии.
Кому подойдёт
Инструмент рассчитан на тех, кто работает с генерацией звука для видео или текстовых описаний и готов запускать модель локально. Открытый код позволяет изучать архитектуру и дорабатывать её под свои задачи. Наличие весов на Hugging Face упрощает загрузку готовой модели.
Не подойдёт тем, у кого нет видеокарты с поддержкой CUDA и достаточным объёмом памяти, а также тем, кто ищет коммерческое решение «из коробки»: лицензия весов cc-by-nc-4.0 ограничивает использование некоммерческими целями. Объём весов — 50,5 ГБ суммарно — тоже стоит учитывать при планировании дискового пространства.
MMAudio — исследовательский проект с открытым кодом, который даёт готовую модель для синтеза звука по видео или тексту. Для запуска нужна CUDA-совместимая видеокарта, Python 3.9+ и PyTorch 2.5.1+. Код свободен под MIT, но веса доступны только для некоммерческого использования.
Паспорт
Репозиторий · Модель на HuggingFace · Сайт разработчика
| Лицензия кода | MIT источник |
|---|---|
| Лицензия весов | cc-by-nc-4.0 источник |
| Платформа | CUDA по описанию автора источник |
| Видеопамять | 6 ГБ по описанию автора источник |
| Самый большой файл весов | 19.2 ГБ источник |
| Все файлы весов | 50.5 ГБ источник |
| Python | 3.9 по описанию автора источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-02-23 источник |
| Репозиторий создан | 2024-12-07 источник |
| Последний выпуск | v0.1 источник |
|---|---|
| Дата выпуска | 2024-12-07 источник |
| Звёзд на GitHub | 2259 источник |
| Форков | 265 источник |
| Загрузок за месяц | 0 источник |
| Обновление модели | 2026-02-19 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



