研究:KV缓存逐出中时间聚合比评分的排序保持更关键,新方法InertiaKV提速1.34-1.46倍
arXiv论文发现,在激进压缩下,EMA时间聚合使约排序保持的评分器修改难以区分;基于此提出InertiaKV及周期刷新变体,解码吞吐提升 1.34-1.46 倍,并发现“免评分”解码平均质量变化仅 +0.03。
AI解读:这项研究挑战了KV缓存压缩领域的默认前提:大家一直在反复打磨token评分函数,却把跨解码步骤聚合分数的时间规则当作无关紧要的细节。作者发现,在激进压缩下,只要评分器修改大致保持原有排序,采用指数移动平均(EMA)聚合后,最终被逐出的token集合几乎不变——这意味着,许多论文中“更优的评分器”改进可能并没有真正改变缓存保留的结果。基于这个观察,他们设计了InertiaKV,用EMA做解码时逐出,并提供一个周期刷新版本InertiaKV-Lazy,相比每次完整刷新,解码吞吐提升 1.34-1.46 倍;还实验了“免评分”解码:只在第一步对整个上下文评分一次然后冻结排序,之后不再评分,平均质量变化仅 +0.03。对开发者来说,如果正在做长上下文推理优化,与其继续堆砌新的评分函数,不如先审视聚合策略和排序稳定性,这可能直接用更简单的方案获得吞吐收益;但需注意所有实验基于LongBench、LongBench-v2、RULER等基准,实际效果仍需在自身负载上验证,且作者明确说明该结果不意味着评分质量总体无关。
一项被EMNLP 2026主会议接收的研究指出,解码时KV缓存压缩中用于跨解码步骤聚合分数的时间规则(如EMA)比通常认为的更重要,并基于此提出InertiaKV方法,其周期刷新变体InertiaKV-Lazy在解码吞吐上比全刷新InertiaKV提升 1.34-1.46 倍。该论文发布于arXiv(编号 2609.03515),作者来自Bo Zeng、Yu Zhao、Yefeng Liu、Zhihong Lu、Xuanfan Ni、Xintong Wang。
研究在六个开源权重骨干模型及LongBench、LongBench-v2、RULER基准上进行测试,识别出时间聚合和排序保持是独立且有影响力的设计因素,并明确表示结果不意味着评分质量在总体上无关紧要。