CPU3DИИ-инструменты для 3D, видео и звука

llama.cpp v0.6.0: расширенный batch API, новые модели и ускорение на Metal и Vulkan

Вышел llama.cpp v0.6.0. Релиз добавляет расширенный batch API llama_batch_ext с функцией llama_process() для смешанных токен/эмбеддинг-батчей и per-token state-эмбеддингов для MTP и deepstack-моделей, поддержку гибридной модели GLM-5.3-Flash (GLM5-Next) на 320B параметров с текстом и зрением, decision-модели Clef, MTP speculative decoding для Qwen4Exp, новый серверный API /v1/systemone для пяти decision-моделей, а также обновление ggml до v0.26.0.

Что это значит

Для тех, кто запускает модели локально, выпуск приносит несколько практических изменений. Новый batch API позволяет смешивать токены и эмбеддинги в одном батче — это важно для MTP и deepstack-моделей, которым нужно передавать состояние между шагами генерации. Поддержка GLM-5.3-Flash открывает доступ к 320-миллиардной гибридной модели с текстом и зрением, хотя разработчик не уточняет требования к видеопамяти для её запуска. На Apple-устройствах новый flash attention kernel для F16 KV и few-row MMA mat-mul ядра ускоряют матричные умножения до трёх раз в сценариях speculative и batched decoding. На Vulkan добавлен sparse flash attention для квантованных K/V. MTP speculative decoding для Qwen4Exp даёт примерно полуторакратное ускорение декодирования на DGX Spark. Серверный API /v1/systemone поддерживает пять decision-моделей: laya, julia-1, lev, openjev (с поддержкой зрения) и kev. Лицензии новых моделей в описании выпуска не указаны. Обновление затрагивает сразу несколько направлений — от API для разработчиков до ускорения инференса на конкретном железе. Следить за новостями о локальном запуске нейросетей можно в ленте CPU3D.
llama.cpp v0.6.0 — основные изменения Batch API llama_batch_ext смешанные батчи токены + эмбеддинги GLM-5.3-Flash гибридная модель 320B параметров текст + зрение MTP decoding Qwen4Exp speculative decoding ускорение x1.5 Metal flash attention F16 KV ускорение до x3 Vulkan sparse flash attention квантованные K/V /v1/systemone 5 decision-моделей laya, julia-1, lev openjev, kev Clef decision-модель поддержка в API ggml обновление до v0.26.0 Обновление затрагивает API, модели и ускорение инференса на конкретном железе Лицензии новых моделей в описании выпуска не указаны
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также