IBM提出DRACO:用动态评分细则给长程智能体训练做细粒度奖励分配
在无程序化检查器的长程任务中,DRACO每轮轨迹只评分一次、闭式分配到步骤级,在AppWorld上比基线高15.9分,且不依赖验证器。
AI解读:长程智能体任务大多没有程序化检查器,无法自动判断成功与否,强化学习因此缺少可靠的奖励信号。DRACO的思路是让rubrics在训练中动态生成、每完成一条轨迹只评分一次,再把这一总体分数闭式分配到真正相关的步骤上。这样做的好处是:既避免了逐一标注每个步骤的成本,又能让每一步获得更精细的奖励差异。在AppWorld上比GRPO基线高5.3分,且它自己完全不使用验证器,意味着可以用于那些无法写代码检查结果的真实任务。不过,论文只公开了摘要,没有训练成本、收敛时间或更多任务上的数据,能否在更长策略或更多领域保持优势仍需验证。
IBM研究院的研究者提出DRACO(Distributing Rubric-based Advantage for Credit Optimization),一种面向无结果验证的长程智能体训练方法,论文以预印本形式发布于arXiv,代码托管在GitHub。
该方法针对的是rewards from verifiable rewards的局限:当任务缺少程序化检查器(即无法验证最终结果是否正确)时,通常的做法是用rubrics(多准则评分细则)在每条轨迹结束后给出一个总体分数。DRACO的作者指出,这种单一标量分数用于数十步长的轨迹区分度不足,因此DRACO在训练期间动态生成rubrics以跟踪策略能力,每完成一条轨迹评分一次,再以闭式方式将该分数分配至各步骤,在GRPO中生成差异化的步骤级优势。
该分配过程为闭式解,不引入任何可训练的归因模块。
在基准测试AppWorld上,DRACO相比基座模型提升15.9个百分点,相比使用稀疏真实奖励的GRPO提升5.3个百分点,且DRACO自身不使用任何验证器。
在域外基准Tau-Bench上,即便不借助前沿判断模型,DRACO也比基座模型高5.3个百分点,表现优于基于真实奖励的训练和其他基于rubrics的训练设置。
本报道依据的是论文摘要,未获取完整论文内容。