开源SGLang Releases·2026年9月5日

SGLang v0.5.17发布:day-0支持Kimi K3与MiniMax-H3,启动Rust服务端

新版本合并了来自 194 名贡献者的 582 个PR,新增对 2.8T参数多模态模型Kimi K3和视频生成模型MiniMax-H3的首日支持,并迁移部分服务端到Rust。

AI解读:SGLang此次发布的重点是与模型发布同日的适配能力:Kimi K3是一个 2.8T参数、1M token上下文的混合注意力多模态模型,SGLang在NVIDIA GB300和AMD MI35x上验证了从推理、投机解码到工具调用的全套支持;MiniMax-H3则意味着同一个视频生成模型框架统一了文生视频、首尾帧生视频和视频编辑三类任务。对部署方而言,这意味着新模型发布当天就能用上较完整的serving功能,而不必等待社区适配。值得注意的另一点是v0.5.17将服务器前半段——从网络入口到把token化请求交给GPU调度器——从Python迁移到多线程Rust实现,这是SGLang降低host开销、提升吞吐的底层改动,但目前只是初始支持,普通用户无需立即行动,生产环境是否切换还需要观察稳定性。

SGLang发布v0.5.17,包含来自 194 名贡献者的 582 个PR,核心内容是day-0支持Moonshot AI的Kimi K3和MiniMax的MiniMax-H3,并首次引入Rust实现的服务端前端。

Kimi K3是一个 2.8T参数的multimodal LatentMoE模型,拥有 896 个专家(top-16),在 3584 维潜空间路由,上下文长度 1M token,结构上包含 69 层KDA线性注意力层与 24 层MLA层交错,并带MoonViT3d视觉塔,以原生MXFP4 checkpoint发布。SGLang声称从发布当天即支持该模型,功能覆盖DCP、DSpark投机解码、chunked-prefill PP与TP decode、KDA-aware前缀缓存、DCP上的HiCache L2、量化权重上的LoRA,以及推理、工具调用和OpenAI兼容服务,并在NVIDIA GB300和AMD MI35x上完成验证。

MiniMax-H3视频生成模型支持

MiniMax-H3是MiniMax的视频生成模型,可在一次请求中生成视频和同步的立体声音轨。SGLang-Diffusion原生支持其三个公开任务配置:text-to-video-and-audio(t2va)、first/last-frame conditioning(fl2va)以及image/video/audio reference conditioning(ref2va,也涵盖video-to-video)。验证硬件包括B200(TP2 + Ulysses4)、H100(TP2 + Ulysses2)、AMD MI300X和MI355X(Ulysses1/2/4/8),以及 2x RTX 5090(支持layerwise offload)。

Rust服务端与其他模型

v0.5.17引入Rust服务端的初始支持:将服务器前半部分——从网络入口到token化请求交给GPU调度器——从Python迁移到多线程Rust实现,以预编译artifact形式发布,包含tokenizer manager、OpenAI兼容API server和PD解耦支持。

新增模型包括EmbeddingGemma和LFM2.5 embedding模型、nvidia/MiniMax-M3-NVFP4,并为Poolside的Laguna-S-2.1系列和ThinkingMachines的Inkling-Small增加了cookbook配方。

性能与内存优化

新的DWDP(Data Weighted Data Parallel)预填充策略通过NVLink P2P预取peer expert权重并在本地计算所有专家,省去EP的all-to-all token分发。在 4x B200上运行gpt-oss-120b预填充时,DWDP4在MNT 32K / ISL 32K下达到DEP4的 1.92 倍,在饱合状态(CONC=128, ISL=8K)下达到 506K vs 329K tok/s(1.54 倍)。该功能通过 `--dwdp-size` 启用,作者标注为早期开发阶段。

针对大MoE模型加载,修复了非连续CPU权重视图导致的病态H2D传输:DeepSeek-V4-Pro TP8部分rank的H2D耗时 27 至 32 分钟,优化后全模型加载从约 35 分钟降至 6 分 20 秒(5.6 倍);GPT-OSS-20B BF16从 545 秒降至 70 秒(7.8 倍);Qwen3.5-397B测得 1.93 至 2.3 倍。该优化需通过 `SGLANG_MOE_COPY_WEIGHT_VIEWS_BEFORE_H2D` 开启,默认关闭。

AMD上的DeepSeek-V4显存占用降低:去除无必要专家padding后,MI355X FP4 MoE模型权重从 159.07 GB降至 112.36 GB;将HIP compress-state池移入memory_saver KV_CACHE区域后,训练阶段每GPU占用从约 143 GiB降至 87 GiB。

为加速引擎恢复,引入weight-cache daemon按GPU缓存权重,使重启引擎可从缓存恢复,避免重新从存储加载和CUDA graph重建(Qwen3-235B FP8在 4 GPU上原需约 6.5 分钟)。该PR编号 #27139。

信息来源

SGLang Releases原始来源