新型训练正则化EGR让机器人多模态策略在传感器失效时成功率最高提升120%

arXiv论文提出证据门控正则化(EGR),在不增加推理开销的前提下,通过区分信息性传感器与无关传感器来缓解视-语-动(VLA)策略的模态纠缠问题。

AI解读:机器人操控策略常要融合摄像头、触觉、语言等多种传感器,但训练数据少且场景单一,模型容易学会依赖无意义的传感器相关性,而不是真正任务相关的信号。例如某个传感器失效被噪声覆盖时,策略性能大幅下降。这篇论文提出的EGR方法,在训练时为每一帧、每个传感器计算一个任务相关性信号,并用这个信号分别施加两种约束:对低相关性的传感器保持输出不变(避免被干扰带偏),对高相关性的传感器训练单靠它也够用(一个传感器坏了不至于全瘫)。这相当于给模型加了个注意力机制,告诉它哪些传感器值得信。论文在模拟和两套真实机器人上验证,EGR使单传感器回退下成功率从2.8%提升到6.1%,对无信息传感器加噪时从9.4%提升到16.5%;在真实双臂机器人上,物理物体干扰下成功率从30%提升到85%。关键点是EGR不增加推理时的任何计算量,处理器或传感器并未改变,只是改变训练方式,因此现有策略可以直接受益。不过,这些结果是在特定机器人平台和47项技能上测试的,真实车间或家庭的遮挡、触感反馈仍可能比论文场景更复杂,效果会打折扣。对机器人开发者的直接意义是:如果你遇到某个传感器被遮挡或失灵后整个系统失灵,EGR是低成本改进方向,但需要算力重新训练模型。普通读者不需要任何行动。

9月2日提交至arXiv的一项研究提出证据门控正则化(EGR)训练目标,用于缓解视觉-语言-动作(VLA)策略中的“模态纠缠”问题——即训练数据有限且同质时,模型学会利用传感器间虚假相关性而非任务相关信息。EGR不增加推理开销,在模拟基准和两套不同形态的真实机器人上提升了成功率。

模态纠缠与EGR机制

论文由Yue Yang、Diego Romeres、Chiori Hori、Gedas Bertasius、Daniel Szafir、Siddarth Jain撰写。他们指出,VLA策略融合多种感官输入,在真实遮挡和干扰物下,会出现两类失效:对无关传感器损坏的过度敏感(nuisance sensitivity),以及仅剩单一有效传感器时的单模态不足(single-modality insufficiency)。

EGR是一种与模态无关的训练目标,推理时无额外开销。它从输入的上下文token中为每一帧、每个传感器推导任务相关性信号,并用该信号门控两个状态条件一致性目标:对低证据(low-evidence)的传感器施加不变性约束,对高证据(high-evidence)的传感器施加单传感器充分性约束。

BEHAVIOR-1K基准与模拟结果

研究团队引入了一个基于BEHAVIOR-1K的基准,包含一组快速诊断套件和针对模态纠缠的47项基于卷展(rollout)的技能。

在模拟中,EGR将全模态下的成功率从12.5%提升至16.4%(相对提升约31%);在无效传感器损坏情况下,从9.4%提升至16.5%(相对提升约75%);在单传感器回退情况下,从2.8%提升至6.1%(相对提升约120%)。

真实机器人验证

作者在两个实体平台上验证了EGR:一个双臂设置,采用两台Kinova机械臂和三台RGB相机;另一个单臂设置,采用三菱MELFA ASSISTA机械臂,结合视觉与GelSight触觉传感器。

在物理物体干扰下,EGR将双臂平台的成功率从30%提升至85%(相对提升约183%),将触觉平台的成功率从55%提升至70%(相对提升约27%)。

信息来源