研究:分阶段进行在线策略蒸馏与RLVR训练,推理模型表现优于联合方案
新论文提出OPD-then-RL两阶段训练法,在逻辑与数学推理基准上超越纯OPD、纯RLVR及联合基线,并以OPD验证分数作为切换信号。
AI解读:这篇论文解决的是推理大模型后训练中两种主流方法如何组合的问题。过去研究把在线策略蒸馏(OPD)的密集词级监督和可验证奖励强化学习(RLVR)的稀疏奖励放在同一步里联合优化,但作者发现这两种信号会互相干扰。他们提出的简单方案是先做OPD、再做RLVR:OPD先扩大模型对老师支持解法的覆盖,RLVR再在这一支持范围内sharpen选择,分阶段避免了冲突。对实际训练者来说,最有用的结论是可以用OPD验证分数决定何时切换到RL,并且OPD比SFT更适合作为RL的冷启动。该方法在逻辑和数学推理基准上一致超过纯OPD、纯RLVR和所有联合基线,但论文只报告了基准测试表现,没有给出具体数字或部署成本,实际收益仍需在自有任务上验证。
arXiv上发布的一篇论文(编号2609.04108,2026年9月3日提交)提出,在后训练推理大语言模型时,将在线策略蒸馏(OPD)与可验证奖励强化学习(RLVR)按顺序分两阶段进行,能一致优于纯OPD、纯RLVR以及把两者在同一训练步骤中联合优化的多种基线方案。作者为Boyan Li、Bingsen Chen、Chenghao Yang、Ping Nie、Chen Zhao和Xi Ye。
两阶段方案与主要发现
论文指出,过往工作用OPD的密集词级监督来补充RLVR稀疏的奖励信号,融合方式要么是加权相加,要么是对RL优势做教师调制缩放,两者都在单步内同时优化两个信号。本文展示的简单两阶段方案——先OPD后RL(OPD-then-RL)——在逻辑与数学推理基准上稳定超过纯OPD、纯RLVR以及上述所有联合基线。
研究者通过pass@k行为、学习动态和参数更新给出了系统性解释:OPD扩大学生模型对教师支持解法的覆盖范围,RL则在覆盖范围内进一步锐化选择;若在同一优化步骤中联合处理两个信号,它们会相互干扰。
- 作者给出实用配方:OPD验证分数是决定何时切换到RL训练的关键信号。
- 相比SFT,OPD是RL训练更好的冷启动方式。