llama.cpp v0.4.1: поддержка Maple 20B-A1B, Tencent Hy 4 и Spark2.5
Выпуск llama.cpp v0.4.1 вышел 14 сентября 2026 года. В обновлении добавлена поддержка трёх новых архитектур: Maple 20B-A1B — ternary MoE для CPU, Tencent Hy 4 в статусе preview и Spark2.5. Кроме того, обновлён ggml до v0.24.0, улучшена обработка JSON-схем, парсинг чатов, логирование и управление дочерними процессами сервера.
Что это значит
Для тех, кто запускает модели локально, главное — новые архитектуры. Maple 20B-A1B заявлена как ternary MoE-модель с поддержкой CPU, что означает возможность работы без дискретного GPU. Tencent Hy 4 добавлена в режиме preview: разработчик предупреждает, что поддержка может быть неполной и изменится в следующих выпусках. Spark2.5 — ещё одна новая архитектура, детали которой в описании выпуска не раскрыты.
Изменения в API затрагивают разработчиков: llama_sampler_chain_n() теперь возвращает int32_t вместо int, а в server-common.h добавлены server_subproc и waiter для мониторинга дочерних процессов роутера. Для конвертации моделей появился флаг --fuse-qkv, позволяющий объединять Q/K/V тензоры при преобразовании HF в GGUF.
Обновление также исправляет ошибки в работе с Kimi-K3, DeepSeek2, GLM-MoE, Qwen и Granite. Удалены устаревшие аргументы --mmap, --mlock и --direct-io — вместо них используется --load-mode. Добавлено структурированное JSONL-логирование через --log-jsonl.
Тем, кто использует llama.cpp для инференса на своей машине, обновление стоит рассмотреть прежде всего ради исправлений в существующих моделях и новой архитектуры Maple для CPU. Подробнее о новостях нейросетей и инструментов для локального запуска — в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.