K2-Horizon-MoVA-36B-A4B: открытая MoE-модель на 36B параметров с 4B активных
На HuggingFace опубликована модель IFM/K2-Horizon-MoVA-36B-A4B с задачей text-generation. Это разреженная модель семейства K2-Horizon: архитектура Mixture-of-Experts с Mixture-of-Values attention, хранит 36 млрд параметров, а на каждый токен активирует 4 млрд. Автор заявляет нативную поддержку контекста 512K токенов и обещает выложить промежуточные чекпоинты, данные и код обучения.
Что это значит
Полные веса в репозитории занимают 69.7 ГБ в формате safetensors, самый большой файл — 3.9 ГБ. Лицензия apache-2.0, запуск через transformers. Для локального использования на площадке уже есть 15 квантованных сборок: GGUF, FP8, MLX, NVFP4, GPTQ. Самая компактная рабочая сборка — IQ4_XS на 18.7 ГБ от NANI-Nithin.
Модель с 4 млрд активных параметров на токен — это умеренная нагрузка для локального запуска, особенно в квантованном виде. Полные веса потребуют заметного объёма видеопамяти, но квантованные варианты позволяют уместить модель на одной потребительской GPU. Разработчик не уточняет минимальные требования к памяти для разных форматов.
Следить за новыми моделями и квантованными сборками можно в ленте новостей CPU3D.Как устроен метод. Схема нарисована по этой заметке.