LeanGRPO:消除扩散强化学习中的冗余重计算,提速最高1.83倍

新方法LeanGRPO通过重构数据并行布局并引入两种免重计算训练调度,在FlowGRPO/DanceGRPO中实现最高1.83倍端到端加速,同时保持原始优化目标。

AI解读:扩散强化学习在训练图像和视频生成模型时,通常在rollout后需要重新计算部分时间步,这既耗时又浪费算力。LeanGRPO的解决思路是:在rollout过程中直接开启梯度跟踪,并复用已保存的计算图和激活值,从而跳过重复的前向传播。它设计了两种调度方案,分别适用于不同规模的模型和输入尺寸。在实际测试中,搭配FLUX.1-dev和Wan模型时,LeanGRPO相比FlowGRPO/DanceGRPO能做到最高1.83倍的端到端加速,且不改变原有的优化目标。对研究者和工程师来说,这意味着在不影响模型质量的前提下,可以显著缩短训练周期或降低计算成本。不过,该方法的验证范围集中在论文列出的模型和场景,实际部署时仍需针对自身模型规模与软硬件环境进行测试。

一篇发表于arXiv的论文(编号:2609.03528)提出LeanGRPO方法,用于消除扩散强化学习(RL)中的冗余重计算,在保持原始优化目标的同时,可将端到端训练速度提升最高1.83倍。研究由Sijie Wang、Zhiqiang Tan、Xinrui Yang和Shaohuai Shi共同完成。

方法与效果

论文指出,大多数扩散强化学习方法(如DanceGRPO和FlowGRPO)在rollout后会启用梯度跟踪重新计算选定的时间步,但在使用相同后端进行on-policy训练时,这种重计算在数学上是冗余的。LeanGRPO通过重构数据并行布局规避了rollout阶段的大内存开销,并引入两种免重计算训练调度:LeanGRPO-Retain在rollout期间启用梯度跟踪,直接复用计算图和保存的激活值用于更新阶段的反向传播;LeanGRPO-Reweight则在rollout中即时用临时优势估计进行反传,并延迟梯度同步,轨迹完成后用真实优势修正临时梯度。

这两种调度方案分别针对不同的模型规模和输入尺寸设计。实验基于FlowGRPO/DanceGRPO,搭配FLUX.1-dev和Wan模型,LeanGRPO实现了最高1.83倍的端到端加速,且原始优化目标保持不变。所有描述均依据论文摘要,未阅读完整论文。

论文以预印本形式发布于2026年9月3日,属于机器学习、人工智能和硬件架构交叉领域,尚待DataCite DOI注册。

依据仅为论文摘要,摘要未提供实验的具体数据集、硬件配置或加速幅度范围等细节,也未说明LeanGRPO-Retain与LeanGRPO-Reweight在不同模型规模下的具体适用条件。

信息来源