无需训练的空间推理框架GraFT:通过 3D场景图提升多模态大模型空间推理能力
GraFT不依赖微调,利用 3D场景图为多模态大语言模型提供确定性几何、鸟瞰布局和视觉属性锚定能力,在ScanQA上CIDEr提升 27%,在VSI-Bench上最高提升 65%。
AI解读:多模态大语言模型(MLLM)在处理空间推理时常常力不从心,比如难以测量物体间的精确距离、无法在自我中心和外部视角之间切换,也搞不清细微的外观差异。现有解决方案要么需要在大规模数据集上微调模型,要么需要专门的 3D编码器,成本高而且受限于特定的模型架构。GraFT提出了一种绕过训练的办法:它为模型提供一个结构化的 3D场景图(3DSG),这个图可以是现成的或易于维护的。模型借助这个图,可以获得确定性的几何计算(类似尺子的作用)、鸟瞰图(便于理解整体布局)以及目标导向的第一人称视角画面(用于识别物体外观)。在ScanQA和VSI-Bench两个基准测试中,GraFT在冻结(不更新权重)的模型上显著提升了空间问答和视觉描述的性能,甚至超过了多个经过微调的专业空间模型。这意味着,未来在机器人导航、VR/AR或自动驾驶等需要理解三维空间的场景里,无需为每个新模型重新训练空间能力,只需在外部补上一个 3D场景图就能增强现有模型,成本更低且更灵活。
一项名为GraFT(Graph-based Framework for Training-free spatial reasoning)的方法提出,无需对多模态大语言模型(MLLM)进行训练或引入专用编码器,仅通过构建紧凑的 3D场景图(3DSG)即可增强其三维空间推理能力。研究者来自Junqing Du、Fernando Ropero、Erkin Turkoz、Yanfeng Zhang和Lu Liu(论文arXiv:2609.03892,2026 年 9 月 3 日提交)。该方法在ScanQA基准上对同骨干基线的每个指标均有提升,CIDEr提高 27%;在VSI-Bench上将冻结参数的MLLM性能最高提升 65%,超过当时所有专有和通用开源基线,并优于多个知名微调空间模型。
GraFT的三大增强能力
论文摘要指出,当前MLLM在三维空间推理上存在明显短板:难以进行精确的几何测量、难以在自我中心视角和外部视角之间转换,也难以锚定细粒度外观。常见解决方案依赖大规模空间推理数据集的微调或专用 3D编码器,这些方法通常与昂贵的监督信号和特定骨干模型绑定。
GraFT通过提供紧凑、易于维护的 3D场景图来补充缺失的 3D结构信息,由此获得三种能力:确定性几何(借助符号工具完成精确计算)、外部视角布局(通过鸟瞰图渲染)、视觉属性锚定(通过任务相关的自我中心帧)。
- 确定性几何(deterministic geometry):通过符号工具实现精确的几何度量。
- 外部视角布局(allocentric layout):通过鸟瞰图(BEV)渲染提供全局空间关系。
- 视觉属性锚定(visual-attribute grounding):利用任务相关的自我中心帧,关联外观属性。
基准测试结果
论文报告了GraFT在两个公开基准上的表现:在ScanQA(3D视觉问答数据集)上,与同骨干的基线相比,GraFT在所有指标上均有提升,CIDEr得分提高 27%。
在VSI-Bench(视觉空间智能基准)上,GraFT对冻结参数的MLLM提升最高达 65%,超过了所有专有和通用开源基线,并优于多个知名的微调空间模型。
- ScanQA:CIDEr相对提升 27%(同骨干基线对比)。
- VSI-Bench:冻结MLLM性能最高提升 65%,超越专有模型和通用开源模型。
- 论文发表于arXiv(arXiv:2609.03892),归类于计算机视觉(cs.CV)、人工智能(cs.AI)和机器人学(cs.RO)。