新基准数据集FinRAG-QA针对跨机构银行财报问答,多阶段RAG检索准确率从 0.322 提升至 0.710
研究团队构建了包含 999 个问题、覆盖 24 家欧美大行 2019-2023 年报的金融问答基准,并评估了多阶段RAG各组件的实际贡献。
AI解读:银行财报对比分析对自动问答系统一直是个难题:文件动辄几十万字,术语密集,不同国家和机构的格式还不统一。这篇论文的贡献是先造了一把尺子——FinRAG-QA基准,包含 999 个由从业者编写的问题,对应 10 个标准化指标,答案要从 24 家欧美大行 2019-2023 年的年报和Pillar 3报告中检索,平均每份文档 19.8 万词,比现有金融问答基准都长,而且专门要求跨机构对比,而不是只查单家银行。有了这把尺子,作者拆解了一条多阶段RAG流水线:把上下文分块做语义增强、再用专门优化的嵌入模型,检索质量(NDCG@10)从 0.322 提高到 0.710,几乎翻倍;在检索结果正确的前提下,换用推理优化的生成模型,答案准确率从 44.6% 升到 79.0%,代价是生成延迟大约是原来的 20 倍。另外两个发现是:当首轮排序已经很强时,再加交叉编码器重排反而会降低检索效果;生成阶段用排名第一的单个文本块,比喂更多上下文效果更好。对做金融NLP的工程师来说,这套基准可以直接用来对比不同RAG方案的跨机构检索能力;对普通读者,它更多意味着银行财报这类长文档问答的评测和优化有了更贴近真实任务的参照。需要提醒的是,实验基于 2024 年底到 2025 年初的模型,数字会随模型换代而变化,目前没有公开的端到端系统可以直接使用。
意大利研究团队发布面向银行财报跨机构问答的新基准数据集FinRAG-QA,包含 999 个由从业者编写的问题,覆盖 10 个标准化指标,答案基于 24 家主要欧洲和美国银行在 2019-2023 年间的 209 份年报及Pillar 3报告。
该基准的文档平均长度为 19.8 万词,作者称其长于现有任何金融问答资源,且与以往集中于美国申报文件和单机构分析的基准不同,FinRAG-QA专门针对跨机构检索。
基准构成与设计目标
研究团队介绍,FinRAG-QA旨在解决银行财务报告对比分析中的自动问答难题,这类文档涉及复杂结构、篇幅巨大、专业术语密集,且不同司法管辖区和机构之间的文本与数字内容不一致。
论文指出,已有的金融QA基准多基于美国申报文件和单一机构分析,FinRAG-QA则要求系统在多家银行文件中进行跨机构检索。
RAG流水线各组件贡献实测
作者在多阶段RAG流水线上评测基准,并逐一分离各组件的贡献。上下文分块增强结合检索优化的嵌入模型,将NDCG@10 从 0.322 提高到 0.710。
在检索到正确答案的条件下,使用推理优化的生成模型,答案准确率从 44.6% 提升到 79.0%(提高 34.4 个百分点),但生成延迟大约是原来的 20 倍。
论文还报告,当第一阶段排序已较强时,交叉编码器重排反而降低检索效果;在生成阶段,单个排名最高的文本块比包含更多上下文的方案表现更好。
实验时间与范围
论文注明实验于 2024 年底至 2025 年初进行,使用的是当时可用的模型。论文以预印本形式发布在arXiv,编号 2609.03654,作者包括Arianna Miola、Bruno Spaccavento、Lorenzo Silotto、Marco Bianchetti和Luca Cagliero。