开源SGLang Releases·2026年9月5日

SGLang发布v0.5.18:新增多模态与扩散模型支持,启动速度提升最高 2.38 倍

该版本整合了来自 212 名贡献者的 710 个PR,新增Muse Glimmer等模型,并引入重叠检查点暂存、TP LMHead All-to-All等性能优化。

AI解读:SGLang v0.5.18的发布,核心是解决大模型推理中的两个痛点:启动慢和部分硬件上的效率瓶颈。通过将检查点加载与CUDA图捕获重叠,Qwen3-32B在H100上的启动时间从约 85 秒缩短到约 36 秒,意味着你对模型进行热更新的停机时间能减少一半以上;而TP LMHead的all-to-all优化则让DeepSeek-V4-Pro在解码时的单token延迟降低了约 1.3 毫秒,这对高并发实时交互场景(如AI助手)的响应速度有直接帮助。此外,NVFP4权重在AMD上的支持,使得持有NVIDIA量化模型的团队可以更灵活地部署到AMD硬件而不损失过多精度。这些改进主要影响的是自建推理服务的开发者和平台运维者,因为他们可以更快地加载模型、降低每个token的成本;而普通的API调用用户可能感受不到细微变化,除非服务商应用了这些优化来提升吞吐量,从而可能降低单位价格。需要注意的是,这些性能数据是官方在特定环境(如H100、B200或MI355X)下给出的,实际效果取决于你的硬件和模型。

SGLang项目于 2025 年 5 月 4 日发布v0.5.18版本,该版本整合了来自 212 名贡献者的 710 个PR。新增了对Muse Glimmer(自回归多模态)、Intern-S2-Mobius(自回归)、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image(扩散模型)等模型的支持,并增加了Qwen3.8系列、Ling-3.0、Nemotron 3.5 Lightning、Dots3-Note和DeepSeek-V4-Pro-0813的cookbook配方。

性能与架构优化

启动时支持重叠检查点暂存(`--startup-weight-load-mode overlap`):检查点页面在CUDA图捕获期间从存储暂存。官方称,Qwen3-32B在H100上的启动速度比串行预取快 8.6-11.7%,比普通默认设置快 2.38 倍(从 84.8 秒降至 35.6 秒)。

TP LMHead现在使用All-to-All通信(PR #32313),在纯DP注意力下,将聚合和分散合并为单一操作。在DeepSeek-V4-Pro B200解码中,LMHead时间从 320 微秒降至 169 微秒,TPOT(每个token的处理时间)从 36.97 毫秒改善到 35.67 毫秒。

新增FlashInfer MNNVL后端用于纯allreduce(PR #30700),在DeepSeek-V4-Flash TP4解码于Blackwell上,小批次吞吐量最高提升 6.9%。该功能为DeepSeek-V3/V3.2/V4自动启用,其他场景需通过 `--enable-flashinfer-pure-allreduce` 开启。

新增TP LMHead All-to-All优化,在DeepSeek-V4-Pro B200上,LMHead时间从 320us降至 169us,TPOT从 36.97ms降至 35.67ms。此功能针对纯DP注意力,可将allgather+scatter合并为单一的all-to-all操作。

统一了编译内核缓存目录,所有缓存(Triton、FlashInfer、Inductor、DeepGEMM和CUDA driver caches)现在位于 `SGLANG_CACHE_DIR` 下,升级后首次启动需重新编译一次(PR #32434)。

  • 新增 `SGLANG_CACHE_DIR` 环境变量,用于统一内核缓存位置。

AMD支持与专项优化

NVFP4检查点现可在AMD GPU上运行。通过 `--quantization quark_mxfp4`,可将ModelOpt和Quark NVFP4权重反量化并重新量化为MXFP4,无需持有全精度副本。在MiniMax-M2.7、GLM-5.1、Kimi-K2.6、Qwen3.5-397B和DeepSeek-R1上,GSM8K恢复率达到 97.5-100.2%。

针对Kimi K3在MI355X上进行了优化,包括分组头MLA verify内核(吞吐量提升 1.37-1.77 倍,ITL提升 1.45-2.42 倍)、AITER MLA prefill内核支持 12 头形状(TTFT降低最多 14.9%),以及通过 `SGLANG_MLA_DECODE_TUNE=1` 开启的gfx950-tuned解码阶段几何(68k输入时ITL提升 46-73%)。GSM8K得分保持在 0.951-0.957。

依赖项更新与破坏性变更

依赖项更新:torch 2.13.0搭配triton 3.7.1,flashinfer 0.6.17,CuTeDSL 4.6.2(修复Blackwell上的FA4启动回归),DeepEP现已从发布的 `sgl-deep-ep` wheels安装,sgl-kernel 0.4.6.post1。

移除torchao集成(`--torchao-config`)。这是一个破坏性变更。

其他破坏性变更包括:`SGLANG_CACHE_DIR` 的引入导致首次启动重新编译。官方在文末的“Breaking Changes”部分列出了更多细节,但来源未具体展开。

信息来源

SGLang Releases原始来源