SGLang v0.5.21 版本发布。本次发布包含来自 227 位贡献者的 779 个拉取请求。新增模型包括 DeepSeek-V4.1、GigaChat 3.5、IQuest-Q1、MiMo-V2.6 和 MiMo-V2.6-Pro、Ling-3.0-flash-VL,以及扩散模型 DiffusionGemma、Qwen-Image 2.1、Anima Base v1.0、Ming-Image 0.1 和 FLUX 3 Action。详情见
GitHub 上的发布说明。
这意味着什么
对于在自己的硬件上运行模型的人来说,本次发布带来了几项实用变化。PD 实例现在可以在 prefill 和 decode 之间即时切换,无需重启。前缀缓存默认运行在 Rust 内核上。对于 DeepSeek-V4.1,据称在长提示词下首个 token 加速 22%,对于 Kimi K3,PD 服务中的 prefill 吞吐量提升 20.6%。
新的 Decisions API(/v1/decisions)可将 LLM 或 VLM 变为低延迟分类器和评分器,而 Score API(/v1/score)可在单个请求中评估所有候选。此外还宣称可在 ComfyUI 内使用 SGLang Diffusion 运行 MiniMax-H3。更新可使用命令 uv pip install --prerelease=allow sglang==0.5.21。Docker 镜像适用于 NVIDIA(CUDA 13)、AMD MI35x、AMD MI30x、Intel GPU 和 Intel CPU。
关注本地运行神经网络工具的相关新闻,请见
CPU3D 动态。