新方法SAGE按梯度效用筛选训练样本,提升离线推理对齐效率
arXiv论文提出SAGE方法,仅对高效用样本计算梯度,在数学推理基准上超越全量数据基线,并产生更平滑的优化轨迹。
AI解读:离线偏好优化通常从固定的“ chosen-rejected ”样本对中训练推理模型,但现有方法对每个样本对都做梯度更新,没有考虑它们在当前策略下的训练价值。arXiv上的一篇新论文指出,这种均匀处理既浪费计算,还可能引入噪声。作者提出SAGE方法,在训练中维护按难度分层、且持续刷新的候选池,并依据“信号-曲率”评分只对当前效用高的样本计算梯度,其余样本不参与反向传播。在多个模型规模的数学推理基准上,SAGE优于全量数据和同等数据量的基线,同时优化轨迹更平滑。这意味着团队在微调推理模型时,可以减少无效样本带来的计算开销和训练不稳定;但该结论目前仅基于数学推理任务的公开基准,尚未提供代码或其他模态的验证,效果是否适用于更广泛场景仍属未知。
arXiv 2026年2月1日首次提交、9月3日更新的一篇论文提出SAGE(Stability-Aware Gradient Efficiency,稳定性感知的梯度效率)方法,用于离线推理对齐。研究称,标准方法对所有chosen–rejected样本对都进行梯度更新,而不考虑其在当前策略下的训练价值,这种均匀处理既浪费又可能有害。
方法细节
论文从梯度效用的角度论证,一个样本对的贡献同时取决于信息量和稳定性。随着策略演化,样本对的效用会发生漂移;高梯度样本可能落在高曲率区域,导致更新带噪声和不稳定。作者认为,最有效的监督来自“稳定但自信的错误”——即模型确实判错但曲率较低的样本。
据此,SAGE在训练期间维护按难度分层、并随时间刷新的候选池,池内依据前向传播得出的“信号-曲率”分数挑选样本。只有当前效用高的样本对才参与梯度计算,其余样本从反向传播中排除。
实验结果
论文在数学推理基准上、多个模型规模下测试SAGE,结果显示它优于使用全量数据的基线和数据量匹配的基线,同时优化轨迹明显更平滑。