无需训练的新缓存压缩法:利用RoPE退化分支信号,Kimi Linear长上下文检索保持1.00

面向NoPE MLA模型设计的VestigeKV方法,通过读取每行11%的缓存数据,将非关键行迁至GPU驻留归档区而非删除,在8x至32x压缩率下实现与全行选择无差距的检索性能,且不需要任何模型改动。

AI解读:长上下文推理中,KV缓存会随文本增长而迅速膨胀,但现有压缩方法(如H2O、SnapKV)依赖已经观察到的注意力权重来决定保留哪些token,面对尚未出现查询的长期缓存时表现极差(针检索成绩仅0.00-0.33)。VestigeKV的独特之处在于,它发现NoPE训练下的MLA模型,其64维解耦分支(原本为RoPE设计的残余结构)被模型重新利用为一种与查询无关的重要性信号。该方法通过读取每行11%的数据,将最关键的少数行保留在快速层,其余行原封不动迁至GPU驻留的归档区(而非删除),并允许后续按认证触发条件逐步骤取回。在Kimi Linear模型上的测试中,8k至65k上下文长度下,8x压缩时检索精度保持1.00,32x压缩时仍有0.92,与理论上全行选择无差距;特定配置下甚至可支撑128x压缩。这项技术对需要极长上下文但VRAM有限的部署场景尤其有意义,它能在不改变模型权重、不量化、不改内核的情况下大幅降低缓存开销。需要注意的是,论文仅以Kimi Linear为验证对象,作者明确表示不将结论扩展到其他模型(尽管猜测Kimi K3可能适用);且该方法仅适用于NoPE模型,对RoPE模型,相同操作会使检索成绩崩溃至0.08。读者若使用RoPE模型,目前该技术不适用;若使用NoPE MLA架构且面临长上下文缓存压力,可关注论文附带的数据与路由细节以评估是否值得尝试。

arXiv预印本论文(arXiv:2609.03949,2026年9月3日提交)提出VestigeKV,一种针对NoPE MLA模型的KV缓存压缩方法,利用缓存内部携带的与查询无关信号进行逐出,无需训练或模型改动。作者WenJie Fan在论文摘要中报告,该方法在Kimi Linear模型上,8k到65k上下文下,8x压缩时针检索精度保持1.00,32x压缩时降至0.92,与全行选择相比零差距;标准配置(recall tier)在128x压缩下仍保持1.00。

方法:利用NoPE训练中RoPE残余分支的显著性通道

VestigeKV的核心观察是,NoPE(无位置编码)训练的MLA模型中,64维解耦分支——原本是RoPE(旋转位置编码)的残余结构——被模型重新用作显著性通道,承载与查询无关的token重要性信号。论文指出,这种信号仅在没有旋转的情况下存在:在有RoPE的模型中,top-1目标覆盖2.3-6.7%的token(相比之下,NoPE模型为10.2-46.8%),且查询无关的精确合并被证明在RoPE下不可能实现。

操作上,VestigeKV读取每行11%的缓存数据,将缓存划分为两部分:得分最高的m行保留在快速层(attended tier),其余行移动——而非删除——到GPU驻留的归档区,该归档区可在每个步骤通过认证触发器访问。这种方法不需要训练、量化或改变权重/内核。

  • 作者报告,Kimi Linear模型在32x压缩下,attended tier仅占每token 8.1 KB缓存中的0.25 KB;归档区保持位精确且GPU驻留,另提供主机卸载版本以回收VRAM。
  • 论文附带20个已归档的验证结果和8条封闭路由;所有阈值在数据观察前已固定。

局限性与适用范围

作者明确将结论局限于Kimi Linear模型。他们提到Kimi K3据报使用NoPE Gated-MLA变体,但表示若其缓存布局匹配,该方法可能扩展至Kimi K3,然而他们不对测量模型之外的情况做任何声明。此外,该方法仅在NoPE模型上有效:在RoPE MLA模型上执行相同操作,针检索性能下降至0.08(普通逐出为0.42)。

信息来源