VibeVoice-1.5B-hf: новая открытая модель text-to-audio от Microsoft на HuggingFace
На HuggingFace опубликована модель vibevoice/VibeVoice-1.5B-hf с задачей text-to-audio. Она предназначена для генерации длинных разговорных аудио с несколькими говорящими — например, подкастов. Автор заявляет синтез речи до 90 минут с участием до 4 спикеров. Модель использует непрерывные токенизаторы речи на частоте 7.5 Гц и диффузионный подход поверх LLM.
По паспорту модели: лицензия MIT, 2.7 млрд параметров, самый большой файл весов — 1.9 ГБ, всего в репозитории 5 ГБ в формате safetensors. Запускается через transformers. Код выложен в открытый доступ.
Что это значит
В нашем справочнике по генерации звука CPU3D есть несколько инструментов text-to-audio, и VibeVoice отличается от них по ряду параметров.
ChatTTS — ближайший по задаче text-to-audio. Его веса занимают 1.1 ГБ, лицензия весов cc-by-nc-4.0, код AGPL-3.0. VibeVoice заметно тяжелее: 5 ГБ весов, но лицензия MIT — свободнее для коммерческого использования. ChatTTS требует около 4 ГБ видеопамяти на 30 секунд аудио; для VibeVoice автор требований к видеопамяти не уточняет.
XTTS от Coqui решает задачу text-to-speech, а не text-to-audio. Его веса — 1.9 ГБ, лицензия весов other, код MPL-2.0. XTTS ориентирован на клонирование голоса, тогда как VibeVoice делает акцент на длинных диалогах с несколькими говорящими.
MMAudio — самый тяжёлый из наших инструментов: 50.5 ГБ весов, лицензия весов cc-by-nc-4.0, код MIT. Он решает text-to-audio и video-to-audio, требует около 6 ГБ видеопамяти. VibeVoice на порядок легче по весам и сфокусирован только на text-to-audio.
VibeVoice выделяется заявленной длительностью генерации и поддержкой до 4 говорящих, что в паспортах наших инструментов не отражено. Однако модель опубликована недавно, и практические требования к железу пока не задокументированы.Как устроен метод. Схема нарисована по этой заметке.