新强化学习算法TailRL:直接优化策略在高奖励尾部的覆盖概率

来自卡内基梅隆大学等机构的研究者提出Tail-Likelihood Reinforcement Learning(TailRL),通过修改优势函数,让强化学习不再只看平均奖励,而是优化策略超过随机奖励阈值的对数概率,在物体定位、迷宫导航等任务中避免次优解,并让模型在推理时从更多采样中获益。

卡内基梅隆大学、微软研究院等机构的研究者在预印本平台arXiv发布论文,提出Tail-Likelihood Reinforcement Learning(TailRL)算法。该方法不再只优化平均奖励,而是直接优化策略在所有奖励阈值上超过阈值的概率(即所谓“上尾”覆盖),让梯度更侧重稀有但高奖励的样本,并兼容现有强化学习训练框架。论文称,在物体定位、迷宫导航、GUI grounding和代码优化等任务中,TailRL能利用稀有高奖励训练样本避免次优解,并使模型在推理阶段从更多采样中获益更多。

论文由Shrinivas Ramasubramanian、Daman Arora、Fahim Tajwar等多位来自卡内基梅隆大学、微软研究院(Ruslan Salakhutdinov、Jeff Schneider)等机构的研究者合作完成,于2026年9月2日提交至arXiv,编号2609.02987。

根据论文摘要,TailRL的核心是将连续奖励转化为一族二值成功事件——对每一个奖励阈值,评估策略超过该阈值的可能性,然后最大化超过一个随机选择的奖励阈值的对数概率。这一梯度的效果可以解释为一系列Best-of-(k)梯度的混合。

信息来源