CPU3DИИ-инструменты для 3D, видео и звука

llama.cpp v0.4.1: поддержка Maple 20B-A1B, Tencent Hy 4 и Spark2.5

Выпуск llama.cpp v0.4.1 вышел 14 сентября 2026 года. В обновлении добавлена поддержка трёх новых архитектур: Maple 20B-A1B — ternary MoE для CPU, Tencent Hy 4 в статусе preview и Spark2.5. Кроме того, обновлён ggml до v0.24.0, улучшена обработка JSON-схем, парсинг чатов, логирование и управление дочерними процессами сервера.

Что это значит

Для тех, кто запускает модели локально, главное — новые архитектуры. Maple 20B-A1B заявлена как ternary MoE-модель с поддержкой CPU, что означает возможность работы без дискретного GPU. Tencent Hy 4 добавлена в режиме preview: разработчик предупреждает, что поддержка может быть неполной и изменится в следующих выпусках. Spark2.5 — ещё одна новая архитектура, детали которой в описании выпуска не раскрыты. Изменения в API затрагивают разработчиков: llama_sampler_chain_n() теперь возвращает int32_t вместо int, а в server-common.h добавлены server_subproc и waiter для мониторинга дочерних процессов роутера. Для конвертации моделей появился флаг --fuse-qkv, позволяющий объединять Q/K/V тензоры при преобразовании HF в GGUF. Обновление также исправляет ошибки в работе с Kimi-K3, DeepSeek2, GLM-MoE, Qwen и Granite. Удалены устаревшие аргументы --mmap, --mlock и --direct-io — вместо них используется --load-mode. Добавлено структурированное JSONL-логирование через --log-jsonl. Тем, кто использует llama.cpp для инференса на своей машине, обновление стоит рассмотреть прежде всего ради исправлений в существующих моделях и новой архитектуры Maple для CPU. Подробнее о новостях нейросетей и инструментов для локального запуска — в ленте CPU3D.
llama.cpp v0.4.1 — выпуск от 14 сентября 2026 Новые архитектуры Maple 20B-A1B ternary MoE для CPU Tencent Hy 4 режим preview Spark2.5 детали не раскрыты Ядро и API ggml v0.24.0 обновление ядра llama_sampler_chain_n() возвращает int32_t server_subproc, waiter мониторинг процессов Конвертация и логи --fuse-qkv объединение Q/K/V --log-jsonl структурированное логирование --load-mode вместо устаревших флагов Исправления ошибок Kimi-K3, DeepSeek2, GLM-MoE, Qwen, Granite исправления в существующих моделях Стоит обновиться ради исправлений и Maple для CPU
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также