llama.cpp v0.6.0: расширенный batch API, новые модели и ускорение на Metal и Vulkan
Вышел llama.cpp v0.6.0. Релиз добавляет расширенный batch API llama_batch_ext с функцией llama_process() для смешанных токен/эмбеддинг-батчей и per-token state-эмбеддингов для MTP и deepstack-моделей, поддержку гибридной модели GLM-5.3-Flash (GLM5-Next) на 320B параметров с текстом и зрением, decision-модели Clef, MTP speculative decoding для Qwen4Exp, новый серверный API /v1/systemone для пяти decision-моделей, а также обновление ggml до v0.26.0.
Что это значит
Для тех, кто запускает модели локально, выпуск приносит несколько практических изменений. Новый batch API позволяет смешивать токены и эмбеддинги в одном батче — это важно для MTP и deepstack-моделей, которым нужно передавать состояние между шагами генерации. Поддержка GLM-5.3-Flash открывает доступ к 320-миллиардной гибридной модели с текстом и зрением, хотя разработчик не уточняет требования к видеопамяти для её запуска.
На Apple-устройствах новый flash attention kernel для F16 KV и few-row MMA mat-mul ядра ускоряют матричные умножения до трёх раз в сценариях speculative и batched decoding. На Vulkan добавлен sparse flash attention для квантованных K/V. MTP speculative decoding для Qwen4Exp даёт примерно полуторакратное ускорение декодирования на DGX Spark.
Серверный API /v1/systemone поддерживает пять decision-моделей: laya, julia-1, lev, openjev (с поддержкой зрения) и kev. Лицензии новых моделей в описании выпуска не указаны.
Обновление затрагивает сразу несколько направлений — от API для разработчиков до ускорения инференса на конкретном железе. Следить за новостями о локальном запуске нейросетей можно в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.