CPU3DИИ-инструменты для 3D, видео и звука

K2-Horizon-MoVA-36B-A4B: открытая MoE-модель на 36B параметров с 4B активных

На HuggingFace опубликована модель IFM/K2-Horizon-MoVA-36B-A4B с задачей text-generation. Это разреженная модель семейства K2-Horizon: архитектура Mixture-of-Experts с Mixture-of-Values attention, хранит 36 млрд параметров, а на каждый токен активирует 4 млрд. Автор заявляет нативную поддержку контекста 512K токенов и обещает выложить промежуточные чекпоинты, данные и код обучения.

Что это значит

Полные веса в репозитории занимают 69.7 ГБ в формате safetensors, самый большой файл — 3.9 ГБ. Лицензия apache-2.0, запуск через transformers. Для локального использования на площадке уже есть 15 квантованных сборок: GGUF, FP8, MLX, NVFP4, GPTQ. Самая компактная рабочая сборка — IQ4_XS на 18.7 ГБ от NANI-Nithin. Модель с 4 млрд активных параметров на токен — это умеренная нагрузка для локального запуска, особенно в квантованном виде. Полные веса потребуют заметного объёма видеопамяти, но квантованные варианты позволяют уместить модель на одной потребительской GPU. Разработчик не уточняет минимальные требования к памяти для разных форматов. Следить за новыми моделями и квантованными сборками можно в ленте новостей CPU3D.
K2-Horizon-MoVA-36B-A4B: разреженная MoE-модель Модель K2-Horizon 36 млрд параметров 4 млрд активных Архитектура Mixture-of-Experts MoVA attention Контекст 512K токенов нативная поддержка Полные веса 69.7 ГБ safetensors файл до 3.9 ГБ Квантованные сборки 15 сборок: GGUF, FP8, MLX, NVFP4, GPTQ Локальный запуск IQ4_XS — 18.7 ГБ одна потребительская GPU Лицензия apache-2.0 · запуск через transformers · следить в ленте CPU3D
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также