CPU3DИИ-инструменты для 3D, видео и звука

VibeVoice-1.5B-hf: новая открытая модель text-to-audio от Microsoft на HuggingFace

На HuggingFace опубликована модель vibevoice/VibeVoice-1.5B-hf с задачей text-to-audio. Она предназначена для генерации длинных разговорных аудио с несколькими говорящими — например, подкастов. Автор заявляет синтез речи до 90 минут с участием до 4 спикеров. Модель использует непрерывные токенизаторы речи на частоте 7.5 Гц и диффузионный подход поверх LLM. По паспорту модели: лицензия MIT, 2.7 млрд параметров, самый большой файл весов — 1.9 ГБ, всего в репозитории 5 ГБ в формате safetensors. Запускается через transformers. Код выложен в открытый доступ.

Что это значит

В нашем справочнике по генерации звука CPU3D есть несколько инструментов text-to-audio, и VibeVoice отличается от них по ряду параметров. ChatTTS — ближайший по задаче text-to-audio. Его веса занимают 1.1 ГБ, лицензия весов cc-by-nc-4.0, код AGPL-3.0. VibeVoice заметно тяжелее: 5 ГБ весов, но лицензия MIT — свободнее для коммерческого использования. ChatTTS требует около 4 ГБ видеопамяти на 30 секунд аудио; для VibeVoice автор требований к видеопамяти не уточняет. XTTS от Coqui решает задачу text-to-speech, а не text-to-audio. Его веса — 1.9 ГБ, лицензия весов other, код MPL-2.0. XTTS ориентирован на клонирование голоса, тогда как VibeVoice делает акцент на длинных диалогах с несколькими говорящими. MMAudio — самый тяжёлый из наших инструментов: 50.5 ГБ весов, лицензия весов cc-by-nc-4.0, код MIT. Он решает text-to-audio и video-to-audio, требует около 6 ГБ видеопамяти. VibeVoice на порядок легче по весам и сфокусирован только на text-to-audio. VibeVoice выделяется заявленной длительностью генерации и поддержкой до 4 говорящих, что в паспортах наших инструментов не отражено. Однако модель опубликована недавно, и практические требования к железу пока не задокументированы.
VibeVoice-1.5B-hf: text-to-audio от Microsoft Текст сценарий подкаста до 4 говорящих VibeVoice-1.5B-hf LLM + диффузия токенизатор 7.5 Гц MIT · 5 ГБ safetensors Аудио до 90 минут многоголосый диалог Сравнение ChatTTS 1.1 ГБ · cc-by-nc-4.0 4 ГБ VRAM / 30 сек XTTS (Coqui) 1.9 ГБ · клон голоса text-to-speech MMAudio 50.5 ГБ · cc-by-nc-4.0 6 ГБ VRAM · video-to-audio VibeVoice легче свободная лицензия MIT
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также