新框架SGD-KV按注意力头分配缓存预算,KV缓存内存占用最高降75%
arXiv论文提出SGD-KV,通过分块摘要诊断任务识别层级信息聚合的注意力头,在Qwen2.5-7B-1M和Qwen3-32B上实现最长100万token上下文的最优性能。
AI解读:长上下文大模型推理时,KV缓存随token数线性增长,很快撑爆显存,这是模型难以处理百万token输入的瓶颈。SGD-KV的核心思路是:不同注意力头分工不同,有些专门负责跨层汇总信息,以往的压缩方法对所有头一视同仁,浪费了预算。它用一个“分块摘要”诊断任务给每个头打分,把更多KV缓存预算分配给摘要能力强的头,其余头则多用压缩。在Qwen2.5-7B-1M和Qwen3-32B上,该方法在100万token上下文中达到最先进性能,同时内存占用最高降75%。对开发者而言,这意味着在同样显存下能跑更长的上下文或更大的batch,或把长上下文模型部署到消费级GPU上;但注意结果基于特定模型和基准,实际收益需自行验证。普通用户无需行动,先观望即可。
arXiv上发布的一项研究提出SGD-KV(Summarization-Guided KV Cache Compression),一种面向大语言模型长上下文推理的KV缓存压缩框架,通过识别并优先保留负责层级信息聚合的注意力头,在Qwen2.5-7B-1M和Qwen3-32B上的多种长上下文基准中达到最先进性能,KV缓存内存占用最高减少75%,支持最长100万token的上下文。论文已收录于NeurIPS 2026 Efficient Reasoning Workshop。
方法
SGD-KV采用分块摘要诊断任务,系统性地识别哪些注意力头专长于层级信息聚合,并据此分配KV缓存预算。现有压缩技术通常依赖简单启发式规则,忽略了不同注意力头的功能差异。
实验与结果
研究团队在Qwen2.5-7B-1M和Qwen3-32B模型上进行了实验,覆盖多样化的长上下文基准。结果显示,SGD-KV在上下文长度高达100万token的场景中实现了最先进的性能,同时将KV缓存内存使用量最高降低75%。基于注意力头摘要得分分布的战略性预算分配,在长上下文推理中获得了更优的效率-准确性权衡。