研究:用因果干预证明开源大模型内部确实编码材料科学物理机制
MIT科学家Markus J. Buehler在预印本中报告,Gemma 4系列开源模型能区分材料物理机制方向,39/40方向定律判定正确,但静态表征中的物理组织可能是数字比较的假象。
AI解读:这项研究要解决的问题是:大模型答对科学题时,到底是真在脑子里用了物理规律,还是纯粹靠语言模式蒙对的。Buehler用Gemma 4的三款开源模型做实验,故意把物理输入的方向反过来(比如把应力方向颠倒),然后看模型内部隐藏状态是否跟着物理定律走。结果在40条方向性本构定律里,模型判对了39条,说明它确实在内部状态层面区分物理方向。但对普通读者来说,这暂时不改变任何使用方式——模型还不会因为这篇论文变得更强或更准。它真正影响的是AI对齐和安全研究:以前我们没法知道模型有没有理解物理,现在有了一个可操作的检验方法(反向输入加隐藏状态干预),可以用到更广的科学推理场景。需要留意的是,目前证据只在材料科学的特定任务上成立,论文也承认静态状态里的物理组织可能是数字比较的假象,物理知识更多体现在状态变化过程而不是静态布局中。
麻省理工学院教授Markus J. Buehler在预印本平台arXiv发布研究,使用三款Gemma 4开源模型(google/gemma-4-E4B-it、google/gemma-4-12B-it、google/gemma-4-31B-it),检验大语言模型是否在内部真正编码和运用材料科学机制信息,而不仅仅是输出正确文本。论文于2026年7月22日首次提交,9月3日更新(v2),DOI为10.48550/arXiv.2607.20058。
三种实验可分离的信号与主要结果
Buehler提出,材料科学机制信息在模型中可以通过三种实验上可分离的信号来识别:选择性概念可读性、定性本构取向的关系编码,以及受约束工程答案的因果上下文控制。方法上综合了直接词汇与Jacobian词汇读出的配对比较、无选项状态几何、60条定律的反事实基准,以及因果干预。
在50条留出的材料描述中,三个独立拟合的Jacobian透镜复现了概念排序,两种读出方式生成的无目标词集能在盲测中识别10个机制家族中的9个。另一个由72个提示组成的基准产生了机制特异的隐藏状态邻域,但精确图审计显示,这种看似物理组织的结构同样可以用模型内部的数值比较来解释。
为此,研究者采用了方向反转的提示对比:在除物理输入方向外完全相同的提示中,观察隐藏状态移动是否遵循提供的本构定律。结果显示,在60条冻结关系上,直接、物理中立和反向定律得到了正确排序;40条方向性定律中39条被正确取向,而词汇对照接近随机水平。双向干预在全部12个匹配案例中,将答案概率推离或拉向物理上合理的结果;反事实状态修补则在不同机制和答案格式间传递对立的决策信号。
结论与限制
作者认为,物理关系在受控状态变化中比在绝对状态中更可观测。论文指出,较大的物理机制信息体现在模型处理干扰时产生的状态偏转上,而不是静态的内部布局里。
该研究发布在arXiv预印本上,尚未经过正式同行评审。