SGLang v0.5.19:支持 Qwen3.8、beam search 与 DeepEP v2
2026年9月5日发布了 SGLang v0.5.19。本次发布包含来自214位贡献者的786个拉取请求。新增模型包括 Qwen3.8(2.4T-A95B)、Qwen3.8-27B、Ling-3.0-flash、Ling-3.0-tiny、Spark2.5、MiniCPM-SALA 和 Granite 4.2,以及扩散模型 LongCat-Image-Edit 和 Edit-Turbo。
系统变更方面:新增了 beam search——请求中的 beam_width 参数返回 n 个最佳序列而不是一个。它与普通请求并行工作,但目前与 speculative decoding、disaggregation、DP attention 和 HiCache 不兼容。此外,还添加了 DeepEP v2 引擎,带有用于 DeepSeek-V3/V4 和 Qwen3-MoE 的 ElasticBuffer(FP8):固定大小的缓冲区使 decode 即使在节点之间也能在 CUDA graphs 下工作。
这意味着什么
对于在自己的硬件上运行模型的人来说,本次发布带来了三个实际变化。首先,支持的模型列表扩大了:Qwen3.8-27B 已在 RTX 5090、RTX PRO 6000 和 DGX Spark 上测试,而 MiniMax-H3 在具有24 GB显存的 GPU 上测试,并附有面向消费级显卡的单独调优指南。其次,beam search 为单个请求提供多个回答选项——这对于需要比较生成结果而不是取第一个的任务很有用。第三,带有固定缓冲区的 DeepEP v2 简化了在多个节点上以 FP8 运行 MoE 模型:decode 在 CUDA graphs 下更稳定地工作,从而降低了同步开销。
在规划时应考虑 beam search 的限制:它与许多通常为加速推理而启用的优化不兼容。有关支持的模型和新的部署指南的更多信息,请参阅 CPU3D 动态。



