新检索系统STAIR利用目录结构降低RAG幻觉,Recall@1达82.6%

研究团队提出STAIR,让大模型利用书籍的目录(ToC)等全局结构进行信息检索,在自建基准SearchTome上显著优于传统检索器,幻觉率低于0.05%。

AI解读:大模型做问答时经常需要外挂知识库(RAG),但传统做法是先把文档硬切成固定长度的小块,这会把书里的目录、章节逻辑这些整体脉络丢掉,导致检索不准、容易答错。这篇论文提出让模型先看目录再去找内容,等于先知道书的结构再翻页。在自建的18本书测试集上,它的首个命中率(Recall@1)达到82.6%,远高于BM25的59.5%,也比增强检索的DSI高约6个百分点,而且幻觉率低于0.05%。不过这个数字只在作者发布的SearchTome基准上测过,真实场景效果还要看模型对整本目录和全文的编码能力是否够用。这套方法最直接的价值是让AI替人查书、做综述时更靠谱;但对于只用搜索引擎、不依赖文档检索的普通用户,没什么影响,不用急着关注。

arXiv上的一篇新论文(编号2609.03874)提出了一种名为STAIR(结构感知信息检索器)的检索系统,让大语言模型利用语料库的全局结构(如书籍目录ToC)来存储和检索信息,以减少检索增强生成(RAG)中的幻觉现象。论文报告,STAIR在自建基准SearchTome上的Recall@1得分达82.6%,高于对比的DSI(76.9%),差异具有统计显著性。

方法要点

论文指出,当前检索器通常将长文本按长度切分为块,这一过程会丢失语料中丰富的全局语义结构。STAIR让LLM利用目录等全局结构,在模型参数中高效存储和检索信息,以降低“lost in the middle”问题的影响。

基准与对比数据

作者构建了SearchTome基准,由6个领域的18本书组成,用于评估基于目录的检索。在该基准上,STAIR表现优于DSI(76.9%)、BM25(59.5%)、DPR(68.7%)和开箱即用的Mistral(13.8%)。

研究显示,配合微调的微分搜索索引(DSI)系统,利用目录能构建幻觉率低于0.05%的生成式信息检索系统,并且在训练样本极少的情况下也能泛化。作者还公布了数据集的发布信息。

信息来源