FailBench基准发布:最强VLM机器人任务成功率判断准确率仅 0.77

新基准涵盖 2197 次操作尝试,发现专用微调模型普遍不如通用VLM,且在接触密集型装配任务上接近随机猜测。

AI解读:机器人操作任务是否成功,正越来越多地交给视觉语言模型(VLM)来判断,但这类判断到底有多可靠一直缺乏跨场景的检验。FailBench用 2197 次操作尝试(其中 75% 是自然发生的失败)测试了 13 个VLM检测器,结果最好的模型平均平衡准确率也只有 0.77,而在接触密集的装配任务上,准确率掉到 0.60 以下,接近随机猜测。这意味着依赖VLM做自动化评估的机器人研发团队,目前并不能放心地用单一模型判断装配这类高精度任务是否成功,尤其是模型在证据模糊时倾向于误判为成功,即使增加推理努力也改不掉这个偏差。好消息是,论文发现一个无需额外训练的输入干预——把结果相关的空间区域裁剪出来再喂给模型,能让最好的检测器提升 2.4 个百分点,这对想立刻改进评估流程的团队是个低成本选项。不过需注意,这些结论来自论文摘要,具体裁剪方法和适用模型细节还没在摘要中展开。

来自arXiv的预印本论文(arXiv:2609.03611,作者Zaruhi Navasardyan、Tatul Danielyan、Hrant Davtyan)提出FailBench,一个用于机器人失败检测的基准,包含来自 14 个公开来源(12 个真实世界、2 个模拟)的 2197 次操作尝试。据论文摘要,FailBench中 75% 的失败是自然发生的,其中 6 个真实世界来源来自非失败检测数据集。

13 个检测器评估结果

摘要报告,在FailBench上评估了 13 个基于VLM的检测器,表现最好的模型平均平衡准确率仅为 0.77。值得注意的是,专门为失败检测微调的模型持续表现不如通用VLM以及它们自己的预训练基线。

按视觉证据类型区分表现

性能高度依赖任务所需的视觉证据类型。当结果取决于可观察的物体运动时,模型接近饱和;但在接触密集型装配任务上,性能下降到接近随机水平(平衡准确率低于 0.60)。错误分析显示,模型在证据模糊时系统性偏向预测成功,这种偏差即使增加推理努力仍然存在。

输入级干预提升检测

论文还展示了输入级干预——空间定位并裁剪结果相关区域——使最佳检测器提升了 2.4 个百分点,且无需额外训练。该论文以arXiv预印本形式于 2026 年 9 月 3 日提交,归类于机器人学(cs.RO)和人工智能(cs.AI)。以上内容基于论文摘要整理。

信息来源