CPU3DИИ-инструменты для 3D, видео и звука

Cloudflare выложила мультимодальную модель clef-omni с задачей text-to-audio

На HuggingFace опубликована модель Cloudflare/clef-omni. Это mixture-of-experts модель на 35,3 млрд параметров, которая принимает состояние в виде текста, JSON, изображений, аудио или видео и возвращает вероятности для вариантов ответов на типизированные вопросы. Свободной генерации текста у модели нет — только оценки вариантов. Веса выложены в формате safetensors, самый большой файл занимает 4,7 ГБ, весь репозиторий — 65,9 ГБ. Лицензия — apache-2.0, запуск через transformers.

Что это значит

Задача text-to-audio в карточке модели не означает генерацию речи или звука в привычном смысле. Clef-Omni не создаёт аудиофайлы: она читает состояние, в том числе аудио, и выдаёт вероятности для заранее заданных вариантов ответа. Это инструмент принятия решений, а не синтезатор. В нашем разделе генераторов звука собраны модели с другой механикой. ChatTTS — это text-to-audio генератор речи, который создаёт аудиоклипы и требует от 4 ГБ видеопамяти на 30 секунд звука. XTTS и Fish Speech решают задачу text-to-speech: синтезируют речь по тексту, поддерживают клонирование голоса и работают на CUDA. Все три выдают аудио на выходе, тогда как clef-omni возвращает только логиты для вариантов ответа. Для тех, кто ищет инструмент генерации звука или речи, clef-omni не заменяет существующие модели из справочника. Она относится к другому классу систем — мультимодальных классификаторов, и её практическое применение лежит в области автоматизации решений, а не синтеза аудио.
Clef-Omni: мультимодальный классификатор 35,3 млрд параметров, mixture-of-experts Вход: состояние текст, JSON, изображение, аудио или видео Clef-Omni mixture-of-experts 35,3 млрд параметров Выход: логиты вероятности для вариантов ответа Сравнение с генераторами звука ChatTTS text-to-audio генератор создаёт аудиоклипы от 4 ГБ на 30 секунд выход: аудиофайл XTTS text-to-speech синтез речи по тексту клонирование голоса выход: аудиофайл Fish Speech text-to-speech синтез речи по тексту клонирование голоса выход: аудиофайл Clef-Omni — классификатор, а не синтезатор: только логиты, без аудио на выходе
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также