YuE2-3B: открытая модель для генерации музыки с редактируемой партитурой
На HuggingFace опубликована модель m-a-p/YuE2-3B с задачей text-to-audio. Автор — m-a-p, чьи инструменты уже описаны в нашем справочнике. Модель весит 3,6 млрд параметров, самый большой файл весов занимает 6,8 ГБ в формате safetensors, архитектура построена на flow matching. Лицензия — cc-by-nc-4.0, то есть использование разрешено только в некоммерческих целях.
Автор описывает YuE2-3B как модель генерации музыки, которая превращает текст песни и описание стиля в полноценный трек с вокалом и аккомпанементом. Отдельная возможность — редактирование мелодии и аккордов через партитуру в формате ABC. По заявлению разработчика, для запуска на своём железе нужен GPU с 24 ГБ видеопамяти, без квантизации модель выдаёт стереозвук 48 кГц.
Что это значит
В нашем разделе генераторов звука пока нет инструментов для создания музыки: ближайшие по задаче — XTTS от Coqui и Fish Speech от Fish Audio, но обе решают text-to-speech, то есть синтез речи, а не музыки. Ближе по типу задачи — ChatTTS, у которого в паспорте указана задача text-to-audio, однако и он ориентирован на разговорную речь.
По требованиям к железу YuE2-3B заметно тяжелее: ChatTTS просит минимум 4 ГБ видеопамяти, тогда как здесь заявлено 24 ГБ. По лицензии YuE2-3B совпадает с ChatTTS — обе модели распространяются под cc-by-nc-4.0, что ограничивает применение некоммерческими сценариями. У XTTS лицензия весов строже: Coqui Public Model License запрещает даже косвенную оплату и обучение других моделей для коммерции.
YuE2-3B — первая в нашем поле зрения модель, которая закрывает задачу генерации музыки с возможностью правки партитуры, и по требованиям к видеопамяти она ориентирована на рабочие станции с современными GPU.Как устроен метод. Схема нарисована по этой заметке.