CPU3DИИ-инструменты для 3D, видео и звука

SGLang v0.5.19: поддержка Qwen3.8, beam search и DeepEP v2

5 сентября 2026 года вышел SGLang v0.5.19. В выпуск вошли 786 пул-реквестов от 214 участников. Среди новых моделей — Qwen3.8 (2.4T-A95B), Qwen3.8-27B, Ling-3.0-flash, Ling-3.0-tiny, Spark2.5, MiniCPM-SALA и Granite 4.2, а также диффузионные LongCat-Image-Edit и Edit-Turbo.

Из системных изменений: появился beam search — параметр beam_width в запросе возвращает n лучших последовательностей вместо одной. Он работает параллельно с обычными запросами, но пока не совместим со speculative decoding, disaggregation, DP attention и HiCache. Также добавлен движок DeepEP v2 с ElasticBuffer для DeepSeek-V3/V4 и Qwen3-MoE в FP8: буферы фиксированного размера позволяют decode работать под CUDA graphs даже между узлами.

Что это значит

Для тех, кто запускает модели на своей машине, выпуск приносит три практических изменения. Во-первых, расширился список поддерживаемых моделей: Qwen3.8-27B протестирован на RTX 5090, RTX PRO 6000 и DGX Spark, а MiniMax-H3 — на GPU с 24 ГБ видеопамяти, с отдельным руководством по настройке под потребительские карты. Во-вторых, beam search даёт несколько вариантов ответа на один запрос — это полезно для задач, где нужно сравнивать генерации, а не брать первую. В-третьих, DeepEP v2 с фиксированными буферами упрощает запуск MoE-моделей в FP8 на нескольких узлах: decode стабильнее работает под CUDA graphs, что снижает накладные расходы на синхронизацию.

SGLang v0.5.19 Новые модели Qwen3.8, Ling-3.0 Spark2.5, MiniCPM-SALA Granite 4.2, диффузионные расширенный список Beam search параметр beam_width возвращает n лучших последовательностей несколько вариантов ответа DeepEP v2 ElasticBuffer для MoE фиксированные буферы decode под CUDA graphs стабильность на узлах Практические изменения запуск на своей машине Ограничения beam search не совместим с speculative decoding, disaggregation, DP attention, HiCache
Как устроен метод. Схема нарисована по этой заметке.

Ограничения beam search стоит учитывать при планировании: он не сочетается с рядом оптимизаций, которые часто включают для ускорения инференса. Подробнее о поддерживаемых моделях и новых руководствах по развёртыванию — в ленте новостей CPU3D.

Смотрите также