AnyBox:零样本9自由度纸箱位姿估计框架,检测精度最高提升36点
该框架无需CAD模型即可从单张RGB-D图像恢复货箱的6D位姿和3D尺寸,在机器人上架任务中成功率提升28%。
AI解读:仓库自动化中,机器人抓取堆叠纸箱的前提是准确知道每个箱子的位置、朝向和大小,但传统方法要么依赖每种箱子的CAD模型,库存一变就得重新建模,成本很高;要么在箱子对称、纹理弱、相互遮挡的场景下精度骤降。AnyBox利用纸箱本身是规则长方体的先验,从一张RGB-D图像同时估计位姿和尺寸,通过深度一致性过滤剔除对称性造成的错误假设,并用提前停止规则把剩余搜索简化为一次闭式更新,从而做到零样本且高效。在公开基准和内部仓库数据上,它的检测精度最高比此前最好结果提升36个百分点,接近使用真实CAD模型的实例级方法,并将堆叠纸箱上架任务的成功率提高28%。对仓库和物流自动化开发商来说,这意味着一套方案可以适配不断变化的纸箱规格而无需为每款新品建模,降低了维护成本;但当前数据来自论文作者的仓库测试,实际部署仍需在自身场景验证。普通读者无需立刻行动,这项技术主要影响的是机器人拣选系统的设计选择。
一篇发表于arXiv的论文提出AnyBox,一个零样本9自由度(6D位姿加3D尺寸)纸箱位姿估计框架,仅凭单张RGB-D图像即可从堆叠、遮挡场景中恢复货箱的位姿和尺寸,无需针对每个物体建立CAD模型。论文已被ECCV 2026 R6D Workshop接收。
在公开基准和作者自有的仓库数据集上,AnyBox的检测平均精度(AP)最高提升36个百分点,较此前最佳结果提高一倍以上,性能接近使用真实CAD模型的实例级方法。
方法:利用箱体几何规律交替估计位姿与尺寸
AnyBox从一个标准类别的模板出发,在姿态估计与尺度估计之间交替进行。它将重投影模板与观测掩码之间的差异作为依据,对箱体尺寸执行二分搜索。
框架包含两个轻量组件:深度一致性过滤器用于剔除由箱体对称性导致的不合理假设;提前停止规则将剩余搜索替换为一次闭式更新,从而降低计算开销。
模型驱动方法虽然准确,但假设每个物体都有实例专属的CAD模型,在库存变化时维护成本高昂。无模型和类别级方法放宽了这一假设,但在对称、弱纹理和严重遮挡的堆叠货箱场景中仍易出错,且忽略了此类场景提供的强结构先验。AnyBox正是利用箱体的几何规律来应对这些问题。
下游任务效果:机器人货箱上架成功率提升28%
位姿估计的改进能传导至下游操作任务。论文报告,在杂乱的机器人货箱上架任务中,AnyBox将操作成功率提升了28%。
研究作者包括Yintao Ma、Sajjad Pakdamansavoji、Charles Eret、Rui Heng Yang、Xuan Zhao、Yingxue Zhang、Tongtong Cao和Amir Rasouli。论文于2025年11月19日首次提交,2026年9月3日更新第二版。