研究:语言模型幻觉与“关系线性”高度相关,为可预测幻觉提供新线索
来自慕尼黑大学等机构的研究团队提出假设并验证:模型对未知主体的线性关系更容易编造答案,而非线性关系则更容易拒绝回答。
AI解读:语言模型为什么会一本正经地虚构事实?这篇论文给出了一个可操作的预测线索:模型处理的关系是“线性”还是“非线性”。研究者发现,当问题涉及线性关系(比如“格伦·古尔德演奏什么乐器”这种一问一答的对应关系)时,模型更容易对不存在的实体编出貌似合理的答案;而当关系更复杂、非线性的模式无法被简单套用时,模型反而更容易承认自己不知道并拒绝回答。这个规律的发现,意味着未来可以通过分析问题内部的关系结构来预判模型可能在哪些地方“胡说”,从而在部署问答系统时针对这些高风险问题提前设置拒绝或核查机制。论文也明确说了,这只是相关性证据,不是直接证明因果机制,但为理解和控制幻觉提供了新方向。普通用户暂时不需要改变使用习惯,但开发者团队可以关注后续如何利用这类结构特征设计幻觉预警工具。
一篇2026年9月3日更新于arXiv的论文提出并验证了一种预测语言模型幻觉的新方法:模型是否会在面对未知实体时编造答案,与其内部处理的关系类型是否具有“线性”高度相关。该论文由Yuetian Lu、Yihong Liu、Sebastian Gerstner等人撰写,来自慕尼黑大学等机构,论文标题为《Relational Linearity is a Predictor of Hallucinations》(arXiv:2601.11429v3)。
研究设计与核心发现
研究者首先观察到,像Gemma-7B-IT这样的指令微调模型,在被问到例如“格伦·古尔德演奏什么乐器?”时,只要把问题中的主体换成模型从未见过的虚构实体,模型就会频频产生幻觉,即生成看似合理但并非其知识库中真实存在的答案,同时难以意识到该事实不在其知识范围内。
- 基于“线性关系嵌入”这一理论,研究团队提出假设:(i) 由于模型用来表示抽象关系的方案,对于不存在的实体,模型很容易为线性关系生成一个貌似合理的对象,从而导致幻觉;(ii) 对于非线性关系,生成对象的机制不可用,因此更容易避免幻觉。
- 为验证假设,团队创建了SynthHal基准,一个包含15种关系、针对未知实体的合成测试集。
- 在四个指令微调模型上测试后发现,对于未知主体,关系线性度是模型是否编造对象答案(而非拒绝回答)的强预测因子,相关系数r在0.58到0.84之间。
- 论文同时指出,这一结果仅构成相关性证据,并非对假设的因果机制的“直接证据”,但具有启发性,为理解LM幻觉开辟了一条新的研究途径。