开源vLLM Releases·2026年9月5日

vLLM v0.26.0发布:新增Inkling模型支持,并针对DeepSeek-V4及多硬件进行性能优化

新版本包含 411 个提交,来自 212 位贡献者,其中 61 位是首次贡献者。重点包括对Inkling模型家族的完整支持、针对DeepSeek-V4的专项优化、fp32 lm_head精度改进,以及KV卸载和分层二级存储的成熟。

AI解读:vLLM v0.26.0的发布意味着运行大型语言模型的开发者现在可以更高效地部署新一代模型。本次更新重点支持了Inkling模型家族,覆盖了从基础建模到量化、投机解码和LoRA微调的全栈能力,这意味着使用该模型的企业无需额外开发适配层。同时,针对DeepSeek-V4的优化(如专用路由内核和fused_topk_bias)能降低端到端延迟,对在高并发场景下提供服务的团队而言,每token生成时间的改善直接降低了用户等待成本和GPU利用率。此外,fp32 lm_head的引入提升了生成模型的精度,适合对输出质量要求较高的应用。需要注意的是,部分优化(如ROCm和XPU上的DSpark)仅适用于特定硬件,实际效果取决于你的部署环境,普通用户无需立即行动,但服务提供商应评估升级收益。

vLLM项目发布v0.26.0版本,包含 411 个提交,由 212 位贡献者完成,其中 61 位是首次贡献者。该版本的主要亮点是新增了对Inkling模型家族的完整支持,并针对DeepSeek-V4进行了跨厂商的性能优化。

新模型与功能支持

v0.26.0引入Inkling模型家族,提供完整支持栈,包括基础建模、分段CUDA图支持、Hopper FA4相对注意力、MTP=1 投机解码、LoRA以及标准ModelOpt NVFP4量化。

新增模型包括BertForMaskedLM、RobertaForTokenClassification / XLMRobertaForTokenClassification、LongCat-Flash-Lite n-gram嵌入、Cosmos3 Edge Reasoner和Cosmos3-Super注册、TranslateGemma-12b-it。此外,Olmo/Olmo2、MistralLarge3和HunyuanVL迁移至Transformers建模后端,升级至Transformers 5.13.0。

DeepSeek-V4性能优化

针对DeepSeek-V4,v0.26.0引入了专用路由内核(端到端TPOT降低 2.94%)、fused_topk_bias(内核提速 1.5–2 倍)以及冗余重复/复制移除(端到端TPOT降低 1.8%)。此外,还对ROCm平台提供了HCA预填充的两阶段压缩器、稀疏解码/预填充优化,以及AMD和XPU上的DSpark投机解码支持。

精度与灵活性改进

版本通过head_dtype参数为生成模型启用fp32 lm_head,扩展至LoRA路径,并提供ROCm torch.mm快速路径,以提高生成头的精度。

注意力后端现在可以按KV-cache组选择,滑窗支持成为显式后端能力,提升了对混合模型的支持。

KV卸载与分层存储成熟

KV卸载和分层二级存储功能大幅成熟:新增卸载指标、分层事件处理、带工作负载身份的对象存储二级层、DP副本感知分层,以及包括CPU卸载在内的编码器缓存(EC)连接器。

前端与硬件支持

Rust前端增加了多模态视频和音频支持、Seed-OSS工具解析器以及原生vllm-bench端口。

硬件支持方面,新增了s390x NUMA拓扑、macOS arm64 CPU wheel构建、IBM Power docker构建以及arm64 Blackwell SM10x/SM110镜像。

其他更新

移除了TeleChat、Persimmon和Fuyu模型。

安全修复包括替换diskcache以消除pickle反序列化问题,以及修复并发稀疏不变量竞争,该竞争曾绕过CVE修复。

信息来源

vLLM Releases原始来源