Cloudflare выложила модель clef для принятия решений по схемам вопросов
На HuggingFace 30 сентября 2026 года появилась модель Cloudflare/clef с задачей image-text-to-text. Модель принимает состояние в виде текста, JSON, изображений или видео и возвращает вероятности для каждого допустимого варианта каждого вопроса из схемы — без свободной генерации текста и без парсинга вывода. За первые дни модель набрала 5416 загрузок и 1528 отметок «нравится».
Что это значит
Модель содержит 27,4 млрд параметров, веса в репозитории занимают 51,2 ГБ в формате safetensors, самый большой файл — 4,6 ГБ. Лицензия — apache-2.0. Запускается через transformers. На площадке есть 17 квантованных сборок: GGUF, NVFP4, FP8, MLX, EXL, AWQ, GPTQ. Самая маленькая рабочая сборка — IQ4_XS от bartowski, она весит 14,2 ГБ.
Автор уточняет, что clef постобучена из Qwen/Qwen3.8-27B с его визуальным энкодером, а поверх backbone добавлена небольшая transformer-голова, которая маршрутизирует признаки из состояния к каждому вопросу и оценивает все варианты совместно. В те же дни вышла и уменьшенная версия clef-flash.
Для локального запуска полной модели потребуется заметный объём видеопамяти, но квантованные сборки снижают порог входа. Следить за новостями об инструментах для 3D и видео можно в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.