新共训练方法WDL-OPD稳定在线策略蒸馏,提升Qwen3数学与代码性能
研究人员提出WDL-OPD,通过双策略共训练稳定在线策略蒸馏过程,在Qwen3 1.7B和4B模型上提升了数学推理与代码生成基准分数。
AI解读:WDL-OPD的核心问题在于,在线策略蒸馏(OPD)虽然让模型在自己的轨迹上学习以减少状态偏差,但每次更新都会同时改变策略和评估的状态,导致训练不稳定。该方法引入一个锚定策略生成所有轨迹,一个辅助策略评估相同状态,并将两者token分布的几何混合与冻结的教师模型对齐,从而在联合训练中增加了自由度,抑制了单策略方法常见的熵增或轨迹退化。在Qwen3实验中,4B模型的MATH500准确率从0.630提高到0.685,1.7B从0.521提高到0.585;代码生成任务中,单策略配置出现退化,而共训练达到了独立复评的开发分数。不过,由于部分对比在课程或初始化上存在差异,论文仅将其视为支持稳定性假说的证据,而非普遍因果结论。对从业者而言,这意味着如果他们在小规模模型上做知识蒸馏时遇到训练不稳定或发散,可参考此方法设计双策略机制,但直接迁移到不同模型或任务前,需要先在自己的数据集上验证,因为公开结果并未覆盖所有场景。
arXiv论文(编号2608.09447)介绍了一种名为WDL-OPD(Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training的在线策略蒸馏稳定化方法,旨在解决在线策略蒸馏(OPD)中因策略与状态同步更新导致的训练不稳定问题。该方法使用两个可训练策略:锚定策略生成每次rollout,辅助策略评估同一状态,并将两者token分布的几何混合与冻结的教师模型通过反向KL散度对齐,两个策略均接收梯度。论文报告,在Qwen3 1.7B和4B规模的实验中,WDL-OPD在四种规模-领域组合中均产生最强的学生检查点,其中4B模型的MATH500准确率从0.630提升至0.685,1.7B模型从0.521提升至0.585。
方法机制与实验限制
论文指出,单策略在线策略蒸馏的反馈循环可能不稳定,因为每次更新都会同时改变下一次计算所依赖的策略和状态。WDL-OPD通过联合训练两个策略,在分支层面引入静态delta无法表达的自由度,从而稳定优化过程。作者证明,冻结辅助策略会恢复一个与OPD²和W2S-OPD密切相关的锚定加对比代理目标,而联合训练则提供了额外灵活性。
在代码生成任务中,论文记录了七个单策略OPD配置出现熵增长或轨迹退化,而共训练达到了独立复评的开发分数0.637和0.375(分别对应论文中的具体设置,但摘要未明确区分)。由于若干对比在课程学习或初始化上存在差异,论文作者明确表示,这些结果支持一种稳定化假说,而非普适因果结论。