新框架Hard-Routed MoR-LoRA:以硬路由组合冻结的推理LoRA专家,减少可训练参数

arXiv论文提出两阶段方法:先用可验证反馈的强化学习独立训练领域LoRA,再冻结专家、仅训练轻量路由器与小型注意力LoRA,通过top-1硬选择在每个token上调用单一专家。

AI解读:这篇arXiv论文解决的是一个实际部署问题:当多个团队各自用私有数据训练了不同的LoRA适配器,又想把它们组合进同一个大模型时,常见的软路由(soft routing)会按权重混合多个专家的输出,这可能破坏每个LoRA原本基于的“单位尺度加法更新”假设,导致行为偏移。作者提出的Hard-Routed MoR-LoRA改用硬路由:每个token只激活一个专家,配合直通估计器让路由器仍能梯度训练。关键步骤是先冻结所有专家,用它们的推理轨迹训练一个轻量共享路由器和一个小注意力LoRA,因此可训练参数远少于软路由基线。对研究者或工程团队而言,这意味着组合多个领域专家时,可能不需要重新训练或微调原有LoRA,只需训练一个小型路由模块即可;但该方法针对的是“推理型”LoRA(用可验证反馈的强化学习训练),且实验基于五个基准和多个模型规模,尚未覆盖所有任务类型。普通用户无需立即行动,这更多是给做多领域模型融合的团队提供一个降低参数成本的备选方案。

arXiv上一项新研究提出Hard-Routed MoR-LoRA,一种通过单位尺度硬选择组合冻结推理LoRA专家的两阶段框架。论文由Seyed Alireza Molavi、Zhan Su、Yan Hu、Peyman Sheikholharam Mashhadi、Stefan Byttner和Prayag Tiwari撰写,于 2026 年 9 月 3 日更新至v3版本(arXiv:2606.31413v3)。

方法:两阶段训练与硬top-1路由

该方法分为两个阶段。第一阶段,使用可验证反馈的强化学习(reinforcement learning from verifiable feedback)独立训练各领域特定的LoRA适配器,以得到推理专家。第二阶段,所有专家被冻结,从中蒸馏推理轨迹,仅训练一个轻量级共享路由器和一个小的注意力LoRA用于集成。路由器采用硬top-1路由,每个token仅选择一个专家,并通过直通估计器实现基于梯度的训练。

实验结果与发现

在五个基准测试、多种模型规模和其他模型家族的实验中,作者报告Hard-Routed MoR-LoRA在保持专家行为的同时,所需可训练参数显著少于软路由混合基线。分析还显示,归一化的软混合通常将大部分路由权重集中到单个专家上,这表明硬单位尺度路由为冻结LoRA专家的组合提供了一种简单高效的抽象。

信息来源