Cloudflare выложила мультимодальную модель clef-omni с задачей text-to-audio
На HuggingFace опубликована модель Cloudflare/clef-omni. Это mixture-of-experts модель на 35,3 млрд параметров, которая принимает состояние в виде текста, JSON, изображений, аудио или видео и возвращает вероятности для вариантов ответов на типизированные вопросы. Свободной генерации текста у модели нет — только оценки вариантов. Веса выложены в формате safetensors, самый большой файл занимает 4,7 ГБ, весь репозиторий — 65,9 ГБ. Лицензия — apache-2.0, запуск через transformers.
Что это значит
Задача text-to-audio в карточке модели не означает генерацию речи или звука в привычном смысле. Clef-Omni не создаёт аудиофайлы: она читает состояние, в том числе аудио, и выдаёт вероятности для заранее заданных вариантов ответа. Это инструмент принятия решений, а не синтезатор.
В нашем разделе генераторов звука собраны модели с другой механикой. ChatTTS — это text-to-audio генератор речи, который создаёт аудиоклипы и требует от 4 ГБ видеопамяти на 30 секунд звука. XTTS и Fish Speech решают задачу text-to-speech: синтезируют речь по тексту, поддерживают клонирование голоса и работают на CUDA. Все три выдают аудио на выходе, тогда как clef-omni возвращает только логиты для вариантов ответа.
Для тех, кто ищет инструмент генерации звука или речи, clef-omni не заменяет существующие модели из справочника. Она относится к другому классу систем — мультимодальных классификаторов, и её практическое применение лежит в области автоматизации решений, а не синтеза аудио.Как устроен метод. Схема нарисована по этой заметке.