vLLM v0.27.0发布:支持Kimi K3全栈推理、新模型及PyTorch 2.13升级
vLLM v0.27.0带来 561 项提交,首次实现Kimi K3的完整推理栈支持,新增多款模型,并升级至PyTorch 2.13.0(破坏性变更)。
AI解读:vLLM作为主流的大模型推理框架,本次v0.27.0更新的核心是集成新硬件和新模型,同时提升推理性能与大规模部署的稳定性。对开发者而言,最大的变化是支持了Kimi K3模型的全栈推理,意味着从模型文件、内核到前后端接口都已完成适配,可直接在vLLM中运行;新增的Qwen3.5、K-EXAONE-2.0等模型也降低了使用新模型时的移植成本。性能方面,针对DeepSeek-V4的优化(如跳过冗余内核、工作空间复用)带来了端到端首token延迟最多降低 3.9%,这能直接提升交互式应用(如聊天、实时生成)的响应速度。不过,PyTorch升级到 2.13.0 属于破坏性环境变更,现有部署或依赖旧版PyTorch的项目需测试兼容性再升级;同时,新增的容错框架和弹性扩展功能简化了DP+EP大规模部署,适合计划扩展现有服务的团队参考。普通使用vLLM单机部署的用户无需立即升级,可等待稳定验证。
vLLM项目发布v0.27.0版本,包含 561 个提交,来自 242 位贡献者(其中 64 位新贡献者)。本版本首个完整支持Kimi K3模型,涵盖核心模型文件与内核、Python和Rust前端、AttnRes内核、DeepGEMM支持、压缩张量量化检查点、DSpark AR融合以及可选共享专家分片。
同时新增Qwen3.5纯文本稠密和MoE模型、K-EXAONE-2.0-750B-A37B、通过Transformers后端支持的VaultGemma,以及jina-embeddings-v5-text-nano嵌入模型。
环境依赖升级至PyTorch 2.13.0、torchvision 0.28.0和Triton 3.7.1,属于破坏性环境变更;XPU和CPU后端也同步跟进至torch 2.13。
其他重点包括:FlashAttention 4在SM100上增加FP8 KV缓存和headdim-256支持、面向DeepSeek-V4的多项性能优化、非生成任务的Model Runner V2扩展、以及大规模服务容错框架。
Kimi K3与新增模型支持
Kimi K3的完整支持是本版本核心,一次性落地了全部推理栈:核心模型文件和内核、Python与Rust前端、AttnRes内核(专注注意力内核)、DeepGEMM支持、compressed-tensors量化检查点、DSpark AR融合,以及将共享专家分片而非复制的选项。
新增模型包括:Qwen3.5纯文本稠密与MoE模型,并配合EVS(视频token剪枝)功能;K-EXAONE-2.0-750B-A37B(MoE模型);通过Transformers建模后端支持的VaultGemma;以及基于EuroBERT编码器骨干的jina-embeddings-v5-text-nano嵌入模型。
其他模型相关更新:Inkling模型支持llm-compressor NVFP4权重和compressed-tensors动态FP8;多模态部分新增视频token剪枝(VidCom2)、Gemma-4的ViT CUDA图、MiniMax-M3的投机解码验证和默认视频处理器、DeepSeek-OCR-2的TTFT优化等。扩散模型DiffusionGemma增加top_k和top_p采样。
移除模型:Plamo2和Ouro不再支持。
DeepSeek-V4性能优化与内核改进
本版本针对DeepSeek-V4进行了专项性能优化:实现序列并行;跳过空c128启动带来约 2 倍内核改进;跳过解码时不必要的topk/router使端到端TTFT降低 3.4%;工作空间复用带来 3.9% 的TTFT改善;移除冗余完整内核带来 1.88 倍内核加速;自适应topk宽度提升 1.0% 端到端性能;PP缓冲区节省 448 MiB GPU内存;以及FlashInfer 0.6.14以上版本移除稀疏-MLA q-head padding。
内核层改进:RMSNorm支持非连续输入,带来 1.2–3.1 倍内核提升;修复MoE reduce_scatter回归,恢复 5% 端到端吞吐;非分组无偏置topk路由调度到融合路径;LL BF16路由器GEMM调优;通过 `VLLM_TRITON_USE_TD` 启用Triton张量描述符路径。
引擎核心与大规模部署能力
引擎核心方面,新增JIT预热基础设施,由运行时拥有的Triton内核在首个请求前完成预热,消除首次请求的编译停顿;FlashAttention 4在SM100上支持FP8 KV缓存和headdim-256。
Model Runner V2扩展至非生成任务,包括编码器-only注意力、序列池化(用于嵌入/分类)、编码器token分类和嵌入、BGE-M3池化、CPU多模态支持,以及多层MTP投机器;PCP现在默认选择MRV2。
大规模服务方面,引入一个简化的容错框架,用于DP+EP外部负载均衡部署;弹性EP扩展支持异步准备;针对混合模型的P/D分离(prefill/decode)支持,包括MLA+SSM混合模型的NIXL P/D、异构P/D块大小,以及MoRIIO的异构TP DP预填充/解码读取路由。
KV卸载功能增强,包括通用P2P次级层、按请求的层级过滤、插件式逐出策略、以及多种CPU offload配置优化。
Rust前端新增gRPC控制平面,支持引擎感知的健康报告、中止控制、服务器和模型发现、KV事件源发现;`vllm-bench` 集成到 `vllm` CLI(可选启用Rust委托)。
硬件支持、依赖变更与移除
硬件支持方面,针对NVIDIA Rubin的 `sm_107` 目标、SM107上的NVLink all-reduce路径;ROCm启用gfx1250架构;XPU后端同步至torch 2.13;CPU支持新增INT8融合MoE内核(用于Arm CPU)、s390x oneDNN INT8 GEMM优化等。
依赖升级:PyTorch 2.13.0、Transformers 5.14.1、FlashInfer 0.6.16.post3(最初 0.6.15)、AITER 0.1.19、NCCL 2.30.7(启用DeepEPv2)等。PyTorch升级为破坏性变更,需注意环境适配。
API更新:新增Cohere chat v2 API支持、Anthropic Messages API的 `cache_salt`、GPT-OSS Harmony的严格工具调用和约束解码,以及 `stream_interval` 作为请求级采样参数。
移除已不再支持的 `max_num_partial_prefills` 和 `max_long_partial_prefills` 参数。