ONNX Runtime WebGPU Plugin EP 0.3.0发布:新增PagedAttention与量化KV缓存支持
微软发布ONNX Runtime WebGPU Plugin EP 0.3.0,扩展模型与数据类型覆盖,改进生成式模型性能,并加强配置与可靠性选项。
AI解读:这次发布的核心是把浏览器端的大模型推理往前推了一步。ONNX Runtime的WebGPU插件新增了PagedAttention和量化KV缓存支持,这两项都是大语言模型推理的关键技术:PagedAttention能更高效地管理显存中的键值缓存,量化KV缓存则把缓存从fp16压到更低位,直接降低显存占用。对开发者来说,这意味着在浏览器里跑Gemma这类生成模型时,可以处理更长的上下文或更大的批次,而不容易撑爆显存。同时新增了int64、uint8等整数类型对多个常用算子的支持,拓宽了能跑的模型范围。冷启动时着色器编译改为延迟分发、加入Intel子组矩阵乘内核,是为了缩短首次加载时间和提升推理速度。整体来看,这是一次底层能力升级,普通用户不会直接感知,但如果你在用WebGPU跑ONNX模型或做浏览器端AI应用,0.3.0 意味着可以尝试更复杂的生成式模型,并需要根据新选项(如可配置的pending-dispatch限制)来调优稳定性。需要留意的是,这些功能目前只在该插件内生效,且部分优化(如FlashAttention图捕获)仅针对特定模型,实际效果取决于硬件和模型兼容性。
微软于 1 月 13 日发布ONNX Runtime WebGPU Plugin EP 0.3.0。该版本扩展模型与算子覆盖,引入PagedAttention的初步支持与量化KV缓存,并针对生成式模型场景优化性能与稳定性。
新版本新增了MRotaryEmbedding、GRU、DFT、PRelu、HardSwish、Trilu、Max、Min及MatMulBnb4等算子的支持,并首次加入PagedAttention的初步实现。
整数数据类型支持得到扩展:int64现已用于Add、Cast、Clip、Concat、Equal、Gather、Min、Max、ReduceSum、Reshape、Sub、Tile和Where;uint8新增支持Cast、Expand、Gather和Reshape;int32/uint32新增用于CumSum和Tile。
生成式模型方面,新增量化KV缓存支持,扩大了GQA在滑动窗口缓存、批量右侧填充提示词等方面的覆盖,并为Gemma 4加入FlashAttention图捕获。
性能上引入deferred dispatch以并行化冷启动时的着色器编译,并为Intel平台加入subgroup-matrix MatMul与FP16 Gemm内核。