研究:语言模型电路在组件层面高度重叠,可能难以支持针对性干预

arXiv一项横跨六任务、五模型的分析显示,组件级电路在不同任务间共享大部分组件,去除某一任务的电路对另一任务性能的损害与其自身电路相当。

AI解读:机制可解释性研究常用“电路”来描述模型完成某个任务时真正用到的组件子集,但这项研究指出,按现有标准找出的电路可能既不够“专属”也不够“稳定”。作者在六个任务、五个模型上提取电路,发现注意力头和MLP块层面的电路在不同任务间高度重叠——即使任务毫不相关,去掉一个任务的电路也会同样严重地损害另一个任务的表现;只有细化到单个MLP神经元时,电路才表现出任务特异性,但这时同一任务内部的稳定性又明显下降。这意味着,如果你打算用电路来定位并干预模型的某个具体行为(比如消除偏见或修改某个技能),组件级电路可能无法精确指向你想要的那个功能,因为它的组件被太多任务共用。对Llama-3.2-3B的个案分析显示,任务间共用的组件主要是MLP块,少数注意力头则是通用的attention-sink头,并不承担具体任务功能。普通读者不需要为此改变任何使用习惯;真正相关的是做模型对齐、安全审计或可解释性研究的工程师——他们的结论是,在利用电路做定向干预前,需要更谨慎地验证电路的任务专属性和稳定性。

机制可解释性研究中的电路框架试图找到模型组件中因果负责某一行为的稀疏子图,通常通过必要性和充分性来评估。但一项新研究指出,这些标准很少说明电路是否一致地捕捉模型执行任务的方式,或它是否对该任务具有特异性。

方法与主要发现

该研究在六个任务和五个模型上提取电路,分别在组件层面(注意力头和MLP块)和单个MLP神经元层面进行分析。结果发现,组件级电路在大多数任务上高度一致且在因果上重要,但它们不具备特异性:移除一个任务的电路对另一个任务性能的损害,与该任务自身电路被移除时几乎相当。

相比之下,神经元级电路表现出更高的任务特异性,但在任务内部的一致性要低得多。研究者将此归因于电路重叠:组件级电路在所有任务对之间共享大部分组件,无论任务是否相关;而神经元级电路仅在紧密相关的任务之间存在重叠。

在对Llama-3.2-3B任务电路共享组件的个案研究中,作者发现共享部分主要由MLP块组成,少数注意力头被证明是通用的注意力汇聚头。

研究结论

总体而言,这些发现对电路能在多大程度上支持对模型行为进行有针对性的理解和干预提出了疑问。该论文已提交至arXiv(编号 2605.08348),并于 2026 年 9 月 2 日发布了第二版(v2)。

信息来源