LatentPress:把对话历史与长文档压缩成连续记忆令牌,4–16 倍压缩供冻结解码器直接读取

arXiv论文提出LatentPress:对话历史与长文档被压缩为连续记忆令牌,冻结解码器以 7.7 倍压缩在LongMemEval上达 0.504 准确率,超过未压缩证据的 0.490。

AI解读:这条新闻的核心是:大模型处理长对话或长文档时,通常需要把上下文压缩成文本摘要或图像再喂给模型,但LatentPress直接把这些内容变成一种模型才能读懂的连续令牌,让冻结的模型直接读取,省掉了推理时的重建步骤。论文数据显示,在LongMemEval测试中,7.7 倍压缩下准确率反而达到 0.504,略高于未压缩的 0.490,也远好于文本摘要的 0.184 和OCR压缩的 0.312–0.426;写作每个对话只需 43 毫秒,比文本摘要或OCR重建快约一个数量级。真正相关的人是做对话记忆、长文档问答的开发者,他们可能用更少显存处理更长历史,同时保持甚至略升准确率。但要注意:16 倍压缩时性能落后于原始上下文,跨领域时效果也不稳定,所以它不是万能替代,只适合把模型上下文压缩到可用范围。普通读者不需要立刻做什么,但可以预期未来聊天机器人或文档工具能记住更多内容而成本不暴涨。

arXiv论文LatentPress提出一种新的上下文压缩表示:把会话历史和长文档写入连续记忆令牌,冻结的解码器通过输入嵌入接口直接读取,推断时无需文本重建。论文称该方法在 4–16 倍压缩下仅训练一个适配器(420 万–2620 万参数,约为解码器的 0.1%),写作每个会话耗时 43 毫秒,比文本摘要或OCR重建快约一个数量级,读取速度比原始上下文或缓存OCR快 5–9 倍。

信息来源