无需训练的检索方法ViSAR能将文档视觉问答RAG延迟降低58.7%
ViSAR在嵌入空间中动态决定检索页数,在多个编码器和LVLM上保持或提升答案准确率。
AI解读:文档视觉问答(DocVQA)系统通常先检索相关页面,再交给视觉语言模型生成答案。传统做法无论问题难易都固定取前k页,简单问题浪费计算,复杂问题又可能漏掉关键页。ViSAR的独特之处在于不用微调或训练,直接在嵌入空间里按问题动态决定要检索多少页——每页跟问题有多相关,矩阵结构会给出信号。论文数据显示,在多个编码器和LVLM组合下,RAG延迟最高降低58.7%,答案准确率不降或更好。对开发DocVQA产品的团队来说,这意味着可以不换模型、不加训练成本,只替换检索层就能明显减少每次查询的等待时间和算力开销。需要注意的是,这些结果来自论文中的受控实验,具体收益取决于你的编码器、文档集和查询分布。目前没有公开的端到端服务数据,生产环境是否同样有效还需要实测。
arXiv论文(编号 2609.02486)介绍了一种名为ViSAR(Visual Semantic Activation Retrieval)的训练免费自适k检索方法,用于基于视觉文档的问答(DocVQA)。论文称,在多个编码器和大型视觉语言模型(LVLM)上,ViSAR将RAG延迟降低最多 58.7%,同时保持或提升答案准确率。
方法原理
ViSAR在嵌入空间内构建一个以查询为条件的页面级相似矩阵,突出与查询相关的语义,并据此动态确定要检索的页面数量。这与现有固定top-k方法形成对比。
该方法无需训练,直接操作于嵌入空间,适合即插即用。
实验结果
论文报告,ViSAR检索出更紧凑且适应查询的页面集,与固定top-k及自适应检索启发式方法相比,RAG延迟最高降低 58.7%,同时保持或提升答案准确率。
此外,研究显示相似矩阵结构与答案准确率相关,提示未来可开展面向检索质量的文档理解工作。