研究:随机丢弃KV缓存即可媲美最优选择策略,推理吞吐量提升32–43%
Salesforce研究团队发现,KV缓存驱逐中的评分机制几乎没有贡献,随机保留即可匹配最强基线,同时大幅提升吞吐量。
AI解读:大模型做长链推理时,每生成一个token都要存下之前所有的注意力键值对,这些KV缓存会迅速占满显存,成为推理速度的瓶颈。现有压缩方法都要给每个缓存token打分,预测它以后重不重要,只留下分数最高的。Salesforce这项研究直接用实验推翻了这个前提——他们让模型在每个注意力头里随机丢弃缓存token,不做任何评分,结果在四个模型和六个推理任务上,效果和最强的选择型驱逐器持平,在vLLM部署下吞吐量还高了32%到43%。为什么随机就够了?作者的对照实验给出两个解释:一是真正脆弱的是提示词(prompt)本身,只要保住了它,后面推理痕迹怎么丢影响不大;二是模型在推理时会不断重复自己还需要的信息,而且不同的注意力头各自都留着一份副本,形成了天然冗余,所以随机丢掉一部分后,仍然有足够的副本留下来供模型使用。这意味着对做推理服务的人来说,KV缓存压缩里最耗算力、最复杂的评分和选择逻辑可能是多余的,直接用随机驱逐能省下这部分开销、提高吞吐。但它不等于缓存完全不需要管理,提示词仍然必须完整保留。普通用户不需要为此做任何事,这项研究目前还是论文阶段,真正的收益要等它落进vLLM这类推理框架之后才能体现。
Salesforce研究团队9月3日向arXiv提交论文(编号2609.03430),提出一种名为Random Attention的KV缓存驱逐方法:不再给缓存token计算重要性分数,而是在每个注意力头内均匀随机驱逐,仅保留提示词。论文称,在四个模型和六个推理任务上,该方法与最强现有驱逐器效果持平,在vLLM部署中吞吐量高出32–43%。