新框架TabScope按问题类型自适应选择表格局部或全表推理,提升长表格问答准确率
arXiv预印本论文提出基于问题自适应机制,在长表格问答中按问题类型动态切换局部子表推理与全表推理,较单一策略取得更优整体性能。
AI解读:表格越长,大模型回答问题的出错率越高,但论文指出不同问题对表格内容的敏感度并不相同:像“查某个值”这类定位型问题,无关行会严重干扰模型;而需要跨表综合证据的问题,保留全表反而有助推理。TabScope的思路是先按问题涉及的操作把长表拆出对应的子表,再预测问题类型,决定走“只看局部”还是“看完整张表”的路线。实验基于WikiTQ和作者自建的SLQA长表基准,结果表明定位策略对lookup和局部推理问题尤其有效,而自适应切换两种模式的整体表现最好。对做表格问答或长文档检索的开发者,这意味着无需再默认全表喂给模型,可以先用问题类型判断推理范围,从而在长表场景中减少无关内容的干扰;论文代码和数据集将在正式发表后公开,目前尚无可直接使用的模型或接口。
arXiv预印本论文(编号2609.03395)提出TabScope框架,根据问题类型动态选择局部子表推理或全表推理,以应对大语言模型在长表格问答中准确率随表长增加而下降的问题。实验显示,对lookup和局部推理类问题,局部化策略尤为有效;而在局部与全表推理之间自适应选择,整体性能最佳。
论文作者为Yuxiang Wang、Junhao Gan和Jianzhong Qi。
研究观察到一个现象:LLM在表格问答中随表长增大出现的精度下降,在不同问题类型上并不一致——对定位敏感的问题更容易被无关表格内容干扰,而需要更广证据的问题仍可能受益于全表推理。
框架设计与基准构建
TabScope通过操作感知的表格分解(operation-aware table decomposition)构建针对具体问题的子表,并利用预测的问题类型(question type)决定采用局部推理还是全表推理。
论文还引入silver reference sub-tables用于评估证据选择效果,并构建了基于真实世界长表的基准SLQA。
实验设置与结果
实验在WikiTQ和SLQA两个基准上进行。结果显示,对于lookup和局部推理问题,局部化策略特别有效;而自适应地在局部推理与全表推理之间选择,取得了最好的整体性能。
这些结果说明,长表格问答不仅需要决定如何定位(how to localize),还需要决定何时定位(when to localize)。
论文标注为会议论文预印本,属计算与语言(cs.CL)和人工智能(cs.AI)方向。根据摘要,代码和数据集将在论文正式发表后公开。