开源vLLM Releases·2026年9月5日

vLLM v0.28.0发布:重点优化Kimi-K3与DeepSeek V4,新增Rust前端功能

vLLM v0.28.0带来 584 个提交,主要针对Kimi-K3的性能提升(含Decode Context Parallel支持和显存优化)以及DeepSeek V4的稀疏MLA端到端支持,同时新增多模态gRPC推理等Rust前端能力。

AI解读:vLLM v0.28.0是一次大规模版本更新,重点服务于两类模型的部署优化:Kimi-K3和DeepSeek V4。对于Kimi-K3,新版本通过Decode Context Parallel、融合kernel和显存节省(每GPU约 17 GiB)等手段,直接降低了推理时的显存占用并提升吞吐,适合需要高并发或长上下文服务的场景。对于DeepSeek V4,稀疏MLA现在支持普通解码、MTP和DSpark投机解码,意味着在保持模型稀疏性优势的同时,推理效率显著提升。此外,Rust前端新增了gRPC多模态图像推理和独立的渲染器,为生产环境的API服务提供了更稳定的基础。这些新特性对GPU资源有限或需要多模态应用的开发者尤其有用,但注意Transformers升级到 5.15.0 等破坏性变更可能需要适配。

vLLM项目发布v0.28.0版本,声称包含 584 个提交、来自 270 位贡献者,其中 76 位是首次贡献。该版本的重点是优化Kimi-K3和DeepSeek V4的推理性能,并扩展Rust前端功能。

Kimi-K3性能提升

vLLM v0.28.0对Kimi-K3进行了大规模优化,官方称其主要亮点包括:Decode Context Parallel(DCP)支持、用于解码和预填充的融合FlashKDA kernel、MegaMoE的SiTU激活支持、序列并行的GEMM-RS、组合all-gathers(内核级提速 1.5~3 倍)、自适应投机token预算(使DSpark首token延迟改善约 60%),以及可选的共享专家分片(每GPU节省约 17 GiB内存)。Kimi-K3现在还支持在ROCm上使用V2 model runner。

DeepSeek V4支持

DeepSeek V4的稀疏MLA现已支持纯解码、MTP和DSpark投机解码的端到端工作流,同时加入了AMD Quark NVFP4支持、推理effort提示和映射,以及稀疏top-k元数据内核优化。ROCm在gfx11和gfx950上启用。

投机解码与Model Runner V2

投机解码方面新增了DFlash2(带局部卷积和候选选择器)、DSpark置信度调度验证,并为草稿模型自动启用异步调度。Model Runner V2新增了E/P/D分离、权重卸载、多层MTP KV缓存支持、编码器CUDA graph、decoder token级池化以及thinking_token_budget支持。

Rust前端与API

Rust前端新增了独立渲染器、gRPC多模态图像推理、显式数据并行rank路由和RL生命周期控制,并将protobuf schema发布到Buf。API方面新增了从HTTP头部解析请求优先级、会话ID传递以及 /inference/v1/generate的content_parts支持。

新模型和硬件支持

新增了Muse Glimmer、Ling 3.0 Flash(含FP8变体)、Dots3 NOTE多模态和Interns2mobius等模型支持。硬件方面,NVIDIA新增FlashInfer XQA解码(SM12x)和CuTeDSL融合query kernel(SM100);AMD ROCm升级了torch 2.12 / triton 3.7栈,并为gfx950优化了Triton稀疏MLA解码。

破坏性变更

bitsandbytes支持迁移为树外插件;Transformers升级至 5.15.0;移除了已弃用的calculate_kv_scales运行时KV尺度计算和override_attention_dtype。

信息来源

vLLM Releases原始来源