SGLang v0.5.19: поддержка Qwen3.8, beam search и DeepEP v2
5 сентября 2026 года вышел SGLang v0.5.19. В выпуск вошли 786 пул-реквестов от 214 участников. Среди новых моделей — Qwen3.8 (2.4T-A95B), Qwen3.8-27B, Ling-3.0-flash, Ling-3.0-tiny, Spark2.5, MiniCPM-SALA и Granite 4.2, а также диффузионные LongCat-Image-Edit и Edit-Turbo.
Из системных изменений: появился beam search — параметр beam_width в запросе возвращает n лучших последовательностей вместо одной. Он работает параллельно с обычными запросами, но пока не совместим со speculative decoding, disaggregation, DP attention и HiCache. Также добавлен движок DeepEP v2 с ElasticBuffer для DeepSeek-V3/V4 и Qwen3-MoE в FP8: буферы фиксированного размера позволяют decode работать под CUDA graphs даже между узлами.
Что это значит
Для тех, кто запускает модели на своей машине, выпуск приносит три практических изменения. Во-первых, расширился список поддерживаемых моделей: Qwen3.8-27B протестирован на RTX 5090, RTX PRO 6000 и DGX Spark, а MiniMax-H3 — на GPU с 24 ГБ видеопамяти, с отдельным руководством по настройке под потребительские карты. Во-вторых, beam search даёт несколько вариантов ответа на один запрос — это полезно для задач, где нужно сравнивать генерации, а не брать первую. В-третьих, DeepEP v2 с фиксированными буферами упрощает запуск MoE-моделей в FP8 на нескольких узлах: decode стабильнее работает под CUDA graphs, что снижает накладные расходы на синхронизацию.
Ограничения beam search стоит учитывать при планировании: он не сочетается с рядом оптимизаций, которые часто включают для ускорения инференса. Подробнее о поддерживаемых моделях и новых руководствах по развёртыванию — в ленте новостей CPU3D.



