研究:路由分离不足以阻止MoE+LoRA多领域微调中的负迁移,SpawnLoRA在专家内部动态新增门控子适配器

arXiv新论文发现,MoE路由的token级分离并不能防止跨领域干扰,并提出在检测到适配器竞争时动态添加门控子适配器的SpawnLoRA方法。

AI解读:当模型要同时学会写代码、读医学文本和做数学推理时,常见的做法是用MoE路由把不同领域的任务分给不同专家,再在专家里加LoRA适配器微调,以为这样就能互不干扰。但这篇论文用实验推翻了这一假设:即便不同领域的token确实被路由到了基本不重叠的专家,混合训练时代码任务的困惑度还是会明显上升,说明路由的"分工"并没挡住负迁移。作者通过Jaccard路由重叠度和适配器梯度余弦相似度两个诊断指标定位问题,发现真正的干扰来自低秩适配器内部:两个领域的梯度方向近似正交,却挤在同一个低维子空间里互相打架。他们于是提出SpawnLoRA——不重新训练固定的路由器,而是在检测到竞争时,于专家内部动态增加带门控的子适配器,给冲突的领域开辟各自独立的更新通道。实验在Phi-tiny-MoE-instruct和OLMoE-1B-7B两个小模型上进行,结果显示它比标准LoRA和自适应秩LoRA更能降低负迁移。这篇论文入选EMNLP 2026 Findings,目前是摘要阶段,13页正文含1张图和16张表。对做多领域指令微调或参数高效微调的研究者,这意味着排查负迁移时除了看路由重叠,更值得检查适配器子空间内的梯度竞争;SpawnLoRA为这类问题提供了一个不增加路由训练成本的解决思路。诊断指标和模型代码尚未公开,想复现的应用者需要等待作者放出代码。

一篇被EMNLP 2026 Findings接收的arXiv论文(编号2609.03150)提出:在MoE+LoRA组合中,即使token级路由将不同领域的输入分配到近乎不相交的专家,领域间仍会发生负迁移;问题根源不是路由选择,而是低秩适配器子空间内近似正交的梯度互相竞争。论文据此提出SpawnLoRA方法,在检测到适配器级竞争时于MoE专家内部动态添加门控子适配器,同时保持路由器不变。依据为论文摘要。

实验设计与诊断方法

研究者在MoE+LoRA设置下,用Python代码、生物医学文本和数学推理三类数据进行多领域微调,检验“token级路由能分离领域特定更新”这一常见假设。结果显示,尽管各领域对应的专家路由近乎不相交,加入生物医学数据后代码任务的困惑度仍显著上升,说明仅靠路由分离并不足以防止负迁移。

为定位干扰源,作者提出两个诊断指标:Jaccard路由重叠度(用于量化专家共享程度)和适配器梯度余弦相似度(用于衡量不同领域更新是否兼容)。分析表明,干扰主要来自不同领域近似正交的梯度在同一低秩适配器子空间内竞争,而非路由层面的专家重叠。

SpawnLoRA方法与评估

针对上述干扰机制,作者提出SpawnLoRA:当检测到适配器级竞争时,动态在MoE专家内部添加带门控的子适配器,为冲突领域提供结构上分离的更新路径;路由器权重在过程中保持固定,不参与调整。

方法在Phi-tiny-MoE-instruct和OLMoE-1B-7B两个模型、多种数据混合比例下进行评测,与标准LoRA和自适应秩LoRA对比。结果表明SpawnLoRA能有效降低负迁移,论文据此认为专家内部的“结构分离”比单纯扩展路由或增加秩带来更多收益。

信息来源