CPU3DИИ-инструменты для 3D, видео и звука

YuE2-3B: открытая модель для генерации музыки с редактируемой партитурой

На HuggingFace опубликована модель m-a-p/YuE2-3B с задачей text-to-audio. Автор — m-a-p, чьи инструменты уже описаны в нашем справочнике. Модель весит 3,6 млрд параметров, самый большой файл весов занимает 6,8 ГБ в формате safetensors, архитектура построена на flow matching. Лицензия — cc-by-nc-4.0, то есть использование разрешено только в некоммерческих целях. Автор описывает YuE2-3B как модель генерации музыки, которая превращает текст песни и описание стиля в полноценный трек с вокалом и аккомпанементом. Отдельная возможность — редактирование мелодии и аккордов через партитуру в формате ABC. По заявлению разработчика, для запуска на своём железе нужен GPU с 24 ГБ видеопамяти, без квантизации модель выдаёт стереозвук 48 кГц.

Что это значит

В нашем разделе генераторов звука пока нет инструментов для создания музыки: ближайшие по задаче — XTTS от Coqui и Fish Speech от Fish Audio, но обе решают text-to-speech, то есть синтез речи, а не музыки. Ближе по типу задачи — ChatTTS, у которого в паспорте указана задача text-to-audio, однако и он ориентирован на разговорную речь. По требованиям к железу YuE2-3B заметно тяжелее: ChatTTS просит минимум 4 ГБ видеопамяти, тогда как здесь заявлено 24 ГБ. По лицензии YuE2-3B совпадает с ChatTTS — обе модели распространяются под cc-by-nc-4.0, что ограничивает применение некоммерческими сценариями. У XTTS лицензия весов строже: Coqui Public Model License запрещает даже косвенную оплату и обучение других моделей для коммерции. YuE2-3B — первая в нашем поле зрения модель, которая закрывает задачу генерации музыки с возможностью правки партитуры, и по требованиям к видеопамяти она ориентирована на рабочие станции с современными GPU.
YuE2-3B: генерация музыки с редактируемой партитурой Модель m-a-p/YuE2-3B · задача text-to-audio · flow matching Вход Текст песни Описание стиля YuE2-3B 3,6 млрд параметров flow matching Выход Трек с вокалом Стерео 48 кГц Партитура ABC Редактирование мелодия и аккорды Требования GPU 24 ГБ видеопамяти без квантизации Лицензия cc-by-nc-4.0 некоммерческая Ближайшие модели: XTTS и Fish Speech — синтез речи, ChatTTS — text-to-audio для разговорной речи
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также