模型量子位·原文 2026年9月4日本站收录 2026年9月5日

星尘智能发布SmoothRL:让在线强化学习适配机器人异步推理

SmoothRL框架将action chunk按执行状态分区,只对真正执行的部分做强化学习,并在训练时同步运行异步推理,在真实投掷、开箱、戴笔帽任务中显著提升成功率。

AI解读:SmoothRL要解决的是机器人部署中一个具体矛盾:模型越来越大、推理越来越慢,但机器人不能停下来等待。实际运行中,模型在后台计算下一段动作,机器人同时继续执行,这导致模型计划的动作和机器人实际执行的动作不一致。如果在线强化学习把整段动作一起用于优化,那些实际没被执行的“计划动作”也可能被记功或背锅。SmoothRL的做法很直接——只让模型从真正执行的动作部分学习,并在训练时就模拟异步推理的节奏,让学习和部署处于同一时间体系。对研究者和机器人开发者而言,这意味着在线强化学习不仅能用于高精度修正,也能适配高速、连续、不能停顿的动态操作场景,比如投掷和开箱。但它的效果取决于基础策略的通用能力,如果基础策略与目标行为差距过大,局部修正并不能补救,且当前实现要求推理在预设延迟内完成。

星尘智能基座模型团队发布SmoothRL框架,一种支持异步执行的在线强化学习方案。它解决的是大模型异步推理成为真实部署常态后,在线强化学习应从哪些动作中学习的问题。SmoothRL首次将这类异步在线RL放在真实高动态投掷任务中验证。

异步执行下的动作分区与只强化执行部分

传统在线RL的节奏是模型先算动作,机器人执行,再更新策略,模型生成什么机器人就执行什么。异步执行打破了这个对应关系:新动作算出来时,机器人已经执行了一部分上轮指令;新动作还没全执行完,下轮推理结果又可能覆盖后半段。如果RL把整段动作一起优化,机器没来得及改或没做的动作也会因任务成败被错误归因。

SmoothRL将action chunk按执行状态分为三部分:已提交区域(committed region),上一轮推理已提交、不能改变的动作;执行区域(execution region),当前轮生成且机器人实际会执行的动作;丢弃区域(discarded region),模型生成但不会执行、会被下一轮替换的动作。训练时只让梯度穿过执行区域。团队将这一原则概括为“Reinforce in Deployment”,即在训练rollout中直接运行异步推理,让模型计算和机器人执行并行发生,replay buffer记录真实时间关系下的轨迹。

论文实现中,团队采用针对各任务微调后的π0.5作为基础策略,沿用RLT骨架,用轻量TD3-style actor-critic在原始动作空间预测residual correction。S1以30 Hz执行动作,推理请求频率为5 Hz,即每200 ms得到一个新的action chunk。基础策略每次预测32帧动作;在固定延迟预算下,Committed与Execution共占12帧,其中6帧属于本轮真正执行的Execution Region,其余20帧在执行前会被后续chunk覆盖。

三项目真机任务成功率提升

SmoothRL在星尘智能S1绳驱本体上测试了动态投掷、给笔戴帽、快递开箱三项目真机任务。

动态投掷:机器人从随机位置抓取物体投进不同位置的目标箱。累计250个rollout episodes后,成功率从基础策略的39%提升至94%。投掷对异步执行尤其敏感,因为一旦在action chunk边界停顿,手臂可能几乎降到静止,难以恢复所需释放速度。

给笔戴帽:双臂需将笔和笔帽精确对齐,允许相对位姿误差约5 mm。最终成功率从8%提升至83%。

快递开箱:机器人用约1 mm宽的刀片插入2—3 mm宽的箱盖接缝再切开胶带。学习曲线并非一路上升:150个rollout episodes时成功率一度从30%降到20%,随后回升至40%,最终达到90%。

纠正系统偏差与平滑性提升

RL之前,三项任务都有明显系统性偏差:投掷时不能根据目标距离调节释放速度,开箱时刀片持续左偏,戴笔帽时对不同位置产生过于相似的动作。在线RL利用真实执行结果逐步修正这些固定偏差。到最终checkpoint,开箱失败样本中刀片相对接缝的左右偏差约为1—2 mm,给笔戴帽失败样本主要为正确位置附近的小幅错位。

通过加入平滑性约束,在一次真实自主投掷rollout中,在线RL后右侧末端执行器的加速度均方根下降52%,Jerk下降47%。

当前边界与下一步计划

论文当前使用稀疏的任务成功/失败奖励,训练中操作员可在必要时介入,介入动作属于raw action space并可直接用于后续模型训练。因此这不是完全无人参与的自主进化,而是一套面向真实部署的在线后训练机制。

当前实现要求每次chunk-level inference在预设latency budget内完成;轻量residual policy的表达能力受冻结基础策略限制。如果基础策略与目标行为差距过大,局部residual correction不能补救。团队计划下一步探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化的结合。

SmoothRL团队与项目页面

SmoothRL由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究。技术报告见www.astribot.com/en/research/SmoothRL。本文由星尘智能提供,量子位获授权转载。

信息来源

量子位原始来源