新研究:MoE模型事实回忆未必定位于单个专家,Qwen3层 44 与Mixtral结果相反
arXiv预印本通过激活修补发现,Qwen3-30B-A3B-Base的L44E069专家表现出事实特异性,而Mixtral-8x7B-v0.1的特异性来自路由top-2专家集合,提示块级恢复不等于单专家定位。
AI解读:这篇预印本解决的是一个可解释性难题:当我们用激活修补恢复大模型被破坏的事实预测时,只能定位到某个MoE块,但块内有多个专家,到底是哪个专家起作用?研究者用新方法在Qwen3-30B-A3B-Base上找到了单个专家L44E069,它专门负责某些事实回忆;但在Mixtral-8x7B-v0.1上,单个专家不具特异性,真正起作用的是路由选中的top-2专家集合。这意味着模型架构不同,知识存储方式也不同。对做模型调试或安全分析的人,这提醒他们不能假设块级修补成功就等同于找到了关键专家。对普通读者,这属于前沿研究,无需立即行动,但它帮助理解大模型内部运作的复杂性。
一项针对稀疏混合专家(MoE)语言模型的因果追踪研究显示,通过激活修补恢复被破坏的事实预测,未必意味着该恢复定位到单个专家。预印本作者Lu Yuetian、Ali Modarressi、Yihong Liu和Hinrich Schütze(慕尼黑大学)在arXiv提交论文“Expert-Aware Causal Tracing of Factual Recall in Sparse MoE Language Models”(编号 2606.03780),于 2026 年 6 月 2 日首次提交,9 月 3 日更新第二版。研究基于论文摘要。
方法与实验模型
研究者使用单token的COUNTERFACT对比:破坏主体token的嵌入,恢复干净块输出,再在固定路由下恢复“干净减去噪声”的专家更新,从而观察恢复效果是否依赖于单个专家或路由专家集。
在Qwen3-30B-A3B-Base上,发现扫描定位到第 44 层;留出分析识别出L44E069是一个反复被路由的贡献者,在同一层激活专家中具有正特异性。该效果与事实匹配,能提升真实token的概率和排名,部分解释了该层的恢复。
在Mixtral-8x7B-v0.1上,选出的反复单例专家不具备特异性;相反,匹配大小的对照组显示干净路由的top-2专家集合才具有特异性。