开源SGLang Releases·2026年9月5日

SGLang v0.5.19发布:新增束搜索、DeepEP v2与多款模型支持

SGLang发布v0.5.19,包含 786 个PR,新增束搜索、DeepEP v2后端、LayerNorm序列并行等特性,并支持Qwen3.8、Spark2.5、Ling-3.0等新模型。

AI解读:SGLang这次更新解决了两类人的问题:一是跑长上下文或大批量推理的部署者,二是想在新硬件或新模型上快速落地的团队。它把束搜索(beam search)加进了服务端,以前你要自己写逻辑拿多个候选序列,现在直接传个beam_width参数就能拿到n个最优结果,这对需要多候选再排序的应用(比如代码生成、翻译重排)是实打实省事。性能方面,新加的DeepEP v2让MoE模型在跨节点时也能用CUDA graph,decode不再被通信卡住;LayerNorm序列并行在H100上给Qwen3-8B prefill省了 3.5% 时间,B200上省 5.6%,TP度越高越明显。对AMD用户,新的Lean attention内核在MI355X上最多能把吞吐提 1.52 倍,首token延迟降 3.62 倍。模型支持上,Qwen3.8(2.4T-A95B)、Spark2.5、Ling-3.0、Granite 4.2这些都能直接跑了,还给了对应的cookbook部署指南。不过要注意,束搜索目前不能和投机解码、PD分离这些功能混用;LayerNorm并行只支持dense Qwen3模型;W4A8需要FlashInfer 0.6.18。如果你是普通用户,这次不用急着升级;如果你在跑生产服务,可以先在小流量环境测一下这些新内核有没有回归,再决定要不要切。

SGLang项目发布v0.5.19,累计合并 786 个PR,来自 214 位贡献者。该版本新增束搜索(beam search)、DeepEP v2后端、LayerNorm序列并行等特性,并扩展了对新模型的支持。

新增模型与部署指南

版本新增支持以下自回归模型:Qwen3.8(2.4T-A95B)、Qwen3.8-27B、RedNote的dots3.note、InclusionAI的Ling-3.0-flash与Ling-3.0-tiny、Spark2.5(出自iFlytek,PR #35963 标注为亮点)、MiniCPM-SALA、IBM Granite 4.2,以及扩散模型LongCat-Image-Edit与Edit-Turbo。

部署指南(cookbook)新增了GLM-5.3、PaddleOCR-VL、Kimi-K3 on Ascend A3(PR #35508)、Kimi-K2.7-Code-MXFP4 on MI355X(#36246)、Qwen3.5 MXFP4 on MI355X(支持FP8 KV cache或HiCache主机内存层,#35445 和 #36245)、MiniMax-H3 on 24GB GPU或DGX Spark(含消费级GPU调优指南,#36169 和 #35816)、Ling-3.0-flash on DGX Spark(#36364),以及Qwen3.8-27B on RTX 5090/RTX PRO 6000/DGX Spark的重测数据(#35825)。

新增CUDA 13.4预览镜像(面向NVIDIA Rubin架构,#36233),以及面向AMD gfx942、gfx950、gfx1250的ROCm 10镜像(#36434、#36871)。

核心新特性:束搜索与推理性能优化

SGLang现在支持束搜索:请求中传入beam_width参数即可返回n个最优序列,而非单个采样结果。它可和常规请求一起直接使用,但目前不能与投机解码(speculative decoding)、PD分离(disaggregation)、DP attention或HiCache组合使用(PR #31626)。

DeepEP v2的ElasticBuffer引擎可通过 --moe-a2a-backend deepep_v2启用,适用于DeepSeek-V3/V4和Qwen3-MoE的FP8模式。其缓冲区大小固定,因此decode阶段在跨节点场景下也能运行于CUDA graphs;据称性能与经典后端持平(#35634、#34923)。

新增LayerNorm序列并行开关 --enable-layernorm-sp。启用后,每个张量并行(TP)秩只对其负责的prefill令牌做归一化,而非全部令牌。官方给出的数据:Qwen3-8B prefill在H100上节省 3.5% 时间、B200上节省 5.6%,节省幅度随TP度增加而增大。该特性目前仅适用于dense结构的Qwen3模型(PR #30915)。

针对MoE模型的W4A8量化:在Hopper架构上服务MXFP4 experts的场合,可通过 --flashinfer-mxfp4-moe-precision fp8将激活值也量化到FP8。官方声称DeepSeek-V4-Flash因此获得约 12% 的输出吞吐提升,GSM8K准确率不变;需要FlashInfer 0.6.18(PR #34967)。

DCP(解码上下文并行)现已默认支持Blackwell MLA后端trtllm_mla,此前仅限CuTe DSL和Tokenspeed。官方测试:128K输入下,8 张B200的普通TP在并发增长时吞吐停滞在约 680 tokens/s,而DCP可持续扩展(PR #33926)。

投机解码内核有所加速:DSA prefill top-k迁移至v2内核,在B200上快 1.3 到 1.8 倍(#35175);KDA模型新增可选融合接受路径SGLANG_OPT_KDA_FUSED_ACCEPT_STATE=1,在Kimi-Linear形状下可将MTP验证与提交时间减少 45% 至 63%,输出比特级一致(#33722)。

统一radix tree现成为所有模型的默认缓存(原仅混合模型,PR #35081)。本周期为其新增三项能力:PD decode工作节点可复用SWA混合模型(如gpt-oss)的缓存前缀(#27770);运行中的服务器可动态挂载/卸载L3存储(#35269);流水线并行与HiCache L3在各rank间保持一致(#27010)。

AMD平台获得新持久化Lean attention内核:用于MI300X和MI355X,通过将工作负载分散到所有计算单元,官方称MI355X上吞吐最高提升 1.52 倍、token间延迟最高降低 3.62 倍。该内核在适用场景自动启用,可通过环境变量SGLANG_DISABLE_LEAN_ATTENTION=1 关闭(PR #33576)。

  • DSA模型在ROCm上的改进:GLM-5.2分离式部署的decode TPOT从 23ms降至 8ms(8 张MI355X,#36714);DeepSeek-V4的v2 top-k内核速度提升最多三倍(#36684);GLM-5.2共享专家门控修复带来最多 16% TPOT改善(#36124)。

依赖更新与兼容性说明

依赖项更新:FlashInfer升至 0.6.18(#36954),sgl-deep-ep升至 0.1.2(#35450),sgl-deep-gemm升至 0.1.7(#37279),mooncake升至 0.3.13(#36493)。

完整发布说明按类别列出,破坏性变更(Breaking Changes)与已知问题(Known Issues)位于文档末尾。

信息来源

SGLang Releases原始来源