研究发现大语言模型存在偏向早期证据的系统性偏差,提出无训练激活引导方法改善上下文冲突处理

一项发表于EMNLP 2026的研究构建了含 5,781 个样本的ContextConflict数据集,揭示LLM在处理上下文内部知识冲突时仍存在不足。

AI解读:这项研究把焦点从“模型自身知识与外部信息的冲突”转到“外部上下文内部互相矛盾”的场景,比如两段资料说法不一致。作者发现,九个大模型在处理这类冲突时普遍偏向先出现的证据——哪怕后出现的才是对的,这跟人类常被“首因效应”影响有点像。他们据此提出一个不需要训练、也不需要标注的激活引导方法:在模型推理时调节内部表示,让模型更均衡地考虑前后证据。实验显示,在推理任务上准确率稳定提升,在摘要任务上生成的摘要更平衡、质量更高。真正会受到影响的,是那些用检索增强生成(RAG)搭应用的人,因为检索结果里经常混着观点或时效不同的内容。当前方法还停留在论文数据集上,没有在真实场景公开评测,所以确实需要的开发团队可以把它当做一个轻量方案来测试,普通用户则不必为此改变现有使用习惯。

一篇被EMNLP 2026接收的论文提出,现有大语言模型(LLM)在解决上下文内部知识冲突时表现不足,并存在偏向较早证据的一致性偏差。该研究由Xinye Yang、Zhenyang Liu、Ruisi Li、Yuanyuan Lei完成,预印本于 2026 年 9 月 2 日发布在arXiv(编号 2609.03148)。

数据集与实验设置

作者将上下文内部冲突划分为六种类型:事实冲突、推理冲突、时间冲突、粒度冲突、视角冲突和模糊性冲突。基于此,他们构建了ContextConflict数据集,共含 5,781 个样本,覆盖推理和摘要两类任务,并包含显式矛盾以及需要多步推理才能识别的隐式冲突。

主要发现与提出的方法

在九个LLM上的实验显示,当前模型仍难以有效解决此类冲突。机制可解释性分析表明,模型在表征层面对冲突存在潜在感知,但分析同时揭示了一个一致的模型偏向:模型倾向于采信较早出现的证据,这种位置偏好是妨碍冲突解决的关键障碍。

基于这一发现,作者提出了一种无需训练、无需标签的激活引导方法,通过调整模型内部激活,鼓励更全面地整合不同位置的证据。在ContextConflict数据集上,该方法在推理任务上持续提升了准确率,并在摘要任务中生成了更高质量、更平衡的摘要。

信息来源