清华等机构研究:单条查询即可恢复在线蒸馏大部分收益,训练瓶颈转向算法步骤效率

arXiv新论文显示,单条查询驱动的在线蒸馏(OPD)在数百步内持续提升,覆盖全量数据训练 71.5% 的状态空间;16 条语义多样的查询可达到 98.9% 的覆盖率并匹配全量训练效果,但学生模型的吸收速度同样缓慢。

AI解读:这篇论文揭示了一个反直觉的现象:大语言模型的在线蒸馏(OPD)可能并不缺数据,而是卡在算法效率上。研究人员用单条查询训练,模型性能竟能在数百步内持续提升,并恢复全量数据训练的大部分收益——单条查询的rollout已能覆盖全量训练所访问状态的 71.5%。这意味着当前OPD的训练数据实际上是过量的,真正的瓶颈在于学生模型吸收教师监督的速度太慢,即使固定状态也需要数百步才能消化。对普通用户而言,这项研究不直接改变任何产品体验,但为AI开发者提供了一个明确信号:与其堆砌更多训练数据,不如优化蒸馏算法的步进效率。对于正在做大模型后训练或知识蒸馏的工程师和研究者,可能需要重新审视数据采样的性价比——当 16 条语义不同的查询就能匹配全量数据效果时,大规模数据收集的成本可能被高估了。

清华等机构的研究人员在arXiv发表论文《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》,首次在数据最少的极限条件下检验在线蒸馏(OPD)中训练数据的作用:仅用单条查询即可在数百个训练步内持续提升学生模型性能,并恢复全量数据OPD的大部分收益。

OPD结合学生生成的采样轨迹(rollouts)和教师模型的密集token级监督,此前研究多聚焦算法行为,数据的作用尚不清晰。论文将训练数据降至单条查询后发现,该设置下OPD在数百步内持续改进,并在多种任务领域和模型家族中恢复全量数据训练的大部分增益。

信息来源