FlowBalance:用验证器校准的轨迹平衡提升推理模型自举训练稳定性
arXiv论文提出FlowBalance,将策略自身token级引导分数与验证器群体优势对齐,在Qwen3-4B/8B数学推理上平均性能超过FlowRL,并缓解响应长度坍缩。
AI解读:推理模型用自身输出迭代改进时,验证器只在最终结果上给奖励,信号稀疏但可靠;而让模型自己提供密集引导又容易强化错误自信或把学习压到单一解题模式上。FlowBalance的思路是把两者校准起来:它不单独模仿token,而是为每条完整响应算一个自引导分数,再拿验证器给出的群体优势去调这个分数——优势为正的轨迹保留引导,为负的轨迹反转引导,群体没有明确偏好时干脆关掉引导。这样既保留了目标函数的单调性,也避免了错误正样本污染。实验里,FlowBalance在Qwen3-4B和Qwen3-8B的数学推理平均分都超过FlowRL,训练更快更稳,还避免了OPSD那种响应长度越练越短的问题。对做推理模型训练的研究者而言,这套方法提供了一种不依赖额外模仿损失、直接用验证器约束自引导的替代方案;对普通用户没有直接影响,属于训练算法层面的改进。
arXiv预印本论文提出FlowBalance,一种面向推理模型的验证器锚定自改进方法,在不引入独立token级模仿损失的前提下,用验证器派生的群体优势校准策略自身的token级引导分数。
论文称,在Qwen3-4B和Qwen3-8B的数学推理任务上,FlowBalance的平均性能均超过基线FlowRL,同时训练速度更快、稳定性更高,并避免了直接OPSD方法中出现的响应长度坍缩。
依据来源为arXiv摘要(论文编号arXiv:2609.03241v1,2026 年 9 月 3 日提交),全文内容未在来源中提供,以下信息均出自摘要。
方法核心:按群体优势校准自引导分数
FlowBalance为每条on-policy轨迹计算一个轨迹级自引导分数:训练时冻结的同一策略视图利用特权上下文产生token级对数概率增益,再聚合成总分。该分数随后与验证器派生的群体优势对齐——正优势轨迹保留引导,负优势轨迹反转引导,rollout组无结果偏好时引导被禁用。
实现上,目标能量对参考策略做指数级重加权,profile轨迹平衡以每组rollout一个log-partition估计拟合归一化目标。论文分析建立了几项性质:组内对比保持、最小变化反向KL特征、验证器对目标奖励的单调控制,以及对被拒绝响应上假阳性自引导的精确校正。
- 自引导分数来自冻结训练时策略对完整响应的token级对数概率增益。
- 验证器群体优势决定引导的保留、反转或禁用。
- 无需单独token级模仿损失,直接通过轨迹平衡实现结果校准的自引导。
- 分析保证对假阳性自引导的精确校正。
实验:数学推理上的性能与稳定性
论文报告了在数学推理上的实验结果:FlowBalance在Qwen3-4B与Qwen3-8B上的平均性能均超过FlowRL,并改善了训练速度和稳定性。
诊断实验中,FlowBalance避免了直接OPSD的响应长度坍缩,并在受控的AIME24诊断中展现出更高的正确策略多样性。
- 平均性能:FlowBalance在Qwen3-4B与Qwen3-8B上均优于FlowRL。
- 训练特性:速度与稳定性提升。
- 策略多样性:在AIME24诊断中正确策略多样性更高。
- 篇幅说明:论文共 28 页,7 图,10 表,代码与博客已发布。