F-GRPO:面向RLVR的困难感知缩放系数,提升罕见正确轨迹学习
arXiv研究提出F-GRPO,通过困难感知缩放系数修正RLVR中有限组采样导致的罕见正确轨迹被忽略问题,在Qwen2.5-7B上提升数学推理pass@256 最多 6.2 个百分点。
AI解读:RLVR训练中,由于计算限制,采样组通常较小,模型只会看到有限的候选答案。如果正确答案很罕见,这些正确答案常常根本没被采样到,模型就无法学习它们,反而把概率集中在常见但错误的答案上。F-GRPO借鉴Focal loss的思路,给那些已经表现很好的采样组降低更新权重,让模型把学习资源留给更难、更少见的正确轨迹。在Qwen2.5-7B数学任务上,N=8 时,该方法让GRPO的pass@256 从 64.1 提升到 70.3,DAPO从 69.3 到 72.5,CISPO从 73.2 到 76.8,且无需增加组大小或计算成本。对使用RLVR训练推理模型的团队,这意味着能更高效地利用有限采样预算;但论文只给出数学和迷宫任务结果,未覆盖更广的真实场景,实际效果仍需更多验证。
arXiv论文《F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare》提出一种名为F-GRPO的困难感知缩放系数,用于改善强化学习在有限组采样下对罕见正确轨迹的学习。实验显示,该方法在不增加组大小或计算成本的情况下,提升了多种RLVR算法在数学推理任务上的pass@256。
方法动机:有限采样导致罕见正确轨迹被忽略
论文指出,基于可验证奖励的强化学习(RLVR)通常依赖组采样来估计优势函数并稳定策略更新。在实际训练中,计算限制往往不允许使用非常大的组,因此模型只能从有限rollout集合中学习,这些集合可能只包含部分正确行为。在常见组大小下,更新可能遗漏罕见的正确轨迹,同时仍包含混合奖励,导致概率集中在更常见的采样解上。
- 作者推导了此类prompt局部尾事件(prompt-local tail-miss events)作为组大小的函数发生概率,表明该概率呈非单调行为。
- 在类别抽象(categorical abstraction)中,论文描述了未采样的正确质量(unsampled-correct mass)如何在总正确质量增长时反而缩小。
提出的方法:困难感知缩放系数
基于上述分析,作者提出了一种受Focal loss启发的困难感知缩放系数,用于对高成功率采样组上的更新进行降权。该方法旨在让策略更新更关注那些难以采样的正确轨迹,而非过度强化常见解。
- 在类别模拟中,该方法在类别设置中复现了相同效应。
- 迷宫(Maze)任务提供了单解测试。
- LLM实验包含代表性的GRPO组大小扫描,以及固定N下在GRPO、DAPO和CISPO之间的迁移。
实验结果
在Qwen2.5-7B模型上,组大小N=8 时,应用该方法后平均数学pass@256 指标变化如下:GRPO从 64.1 提升至 70.3,DAPO从 69.3 提升至 72.5,CISPO从 73.2 提升至 76.8。其中GRPO提升幅度最大,达到 6.2 个百分点,DAPO和CISPO分别提升 3.2 和 3.6 个百分点。
论文还报告,在所有这些情况下,分布外(OOD)pass@256 也均有所改善,且未增加组大小或计算成本。
- 论文注明这些提升是在数学任务上测得的,未提供其他领域或更大模型的公开结果。