GrowPage:按需KV预算框架提升LLM长输出推理服务的吞吐与性能平衡
GrowPage通过动态分配KV缓存资源,在压缩或增加物理页之间自适应,提升推理服务效率。
AI解读:GrowPage的核心创新在于将KV缓存容量从静态限制变为运行时资源。传统压缩方法在请求开始时设定固定预算,只决定保留哪些KV状态,而GrowPage通过双时间尺度的查询摘要实时估算注意力需求变化,在容量边界处选择压缩现有分配或获取额外物理页。这直接解决了长输出推理中不同请求及同一请求不同阶段对缓存需求差异大的问题,使得服务商能在有限内存下处理更多并发请求,同时维持模型性能。实验显示其在推理基准上取得更优的吞吐-性能权衡。对于使用PagedAttention的推理服务,这意味着无需修改内核即可获得动态缓存管理能力,但实际效果仍需查看具体实验数据。
arXiv论文提出GrowPage,一种用于高效LLM推理服务的按需KV(键值)预算框架。该方法将KV容量视为运行时资源,通过动态分配内存来适应长输出推理中不断变化的注意力需求,从而改善性能与吞吐量之间的权衡。该论文于 2026 年 9 月 3 日提交至arXiv(编号:2609.03494)。
GrowPage由Qiankun Ma、Yanjiang Zhou、Zinan Xiong、Haofei Wang、Zhen Song、Yang Xiang、Ziyao Zhang和Hairong Zheng撰写,利用双时间尺度查询摘要来估计需求的演变,并与PagedAttention的页级内存抽象集成,以保持连续批处理和前缀缓存。