CPU3DИИ-инструменты для 3D, видео и звука

Cloudflare выложила модель clef для принятия решений по схемам вопросов

На HuggingFace 30 сентября 2026 года появилась модель Cloudflare/clef с задачей image-text-to-text. Модель принимает состояние в виде текста, JSON, изображений или видео и возвращает вероятности для каждого допустимого варианта каждого вопроса из схемы — без свободной генерации текста и без парсинга вывода. За первые дни модель набрала 5416 загрузок и 1528 отметок «нравится».

Что это значит

Модель содержит 27,4 млрд параметров, веса в репозитории занимают 51,2 ГБ в формате safetensors, самый большой файл — 4,6 ГБ. Лицензия — apache-2.0. Запускается через transformers. На площадке есть 17 квантованных сборок: GGUF, NVFP4, FP8, MLX, EXL, AWQ, GPTQ. Самая маленькая рабочая сборка — IQ4_XS от bartowski, она весит 14,2 ГБ. Автор уточняет, что clef постобучена из Qwen/Qwen3.8-27B с его визуальным энкодером, а поверх backbone добавлена небольшая transformer-голова, которая маршрутизирует признаки из состояния к каждому вопросу и оценивает все варианты совместно. В те же дни вышла и уменьшенная версия clef-flash. Для локального запуска полной модели потребуется заметный объём видеопамяти, но квантованные сборки снижают порог входа. Следить за новостями об инструментах для 3D и видео можно в ленте CPU3D.
Cloudflare clef — принятие решений по схемам вопросов Вход текст, JSON, изображения, видео Backbone Qwen3.8-27B 27,4 млрд параметров Transformer-голова маршрутизация признаков к вопросам Выход вероятности по вариантам Ключевые характеристики 51,2 ГБ safetensors веса в репозитории 17 квантованных сборок GGUF, NVFP4, FP8, MLX 14,2 ГБ IQ4_XS минимальная сборка apache-2.0 лицензия Популярность на HuggingFace 5416 загрузок 1528 отметок «нравится» image-text-to-text
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также