研究人员提出首个无训练空地协作视觉语言导航基线,成功率77%

新方法AGC-VLN通过共享鸟瞰图实现无人机与地面车辆的导航协作,在CARLA-Air仿真中比最强单智能体基线高出24个百分点。

AI解读:这项研究解决的是空地协同视觉语言导航没有现成协作机制的问题。过去无训练方法只解决单智能体任务,而最新CARLA-Air评测显示,五种先进视觉-语言-动作模型都无法稳定协作,甚至双向耦合还会降低性能。研究者提出AGC-VLN,让具备全局鸟瞰视角的无人机和仅有第一人称视角的地面车辆共享地图:无人机把地面车辆的位置和语言目标渲染成带距离标签的标记,地面车辆据此规划沿路路径并用冻结的视觉语言模型执行,无人机则用升级的3D-SPF算法在俯视图中搜索目标。在CARLA-Air的100次闭环测试中,联合成功率77%,比单独使用无人机(50%)提升27个百分点,比最强单智能体基线Travel UAV(53%)高出24个百分点。这说明直接把两个智能体的信息叠在一起不如通过共享几何地图来分工:无人机提供全局环境,地面车辆负责实际的沿路行驶。对研究者的意义是,搭建了首个无需训练的空地协作基线,未来做更复杂的协作方法时有了可对比的起点。不过文章只给出CARLA-Air仿真结果,尚未涉及真实环境,实际部署时的感知误差和控制延迟可能影响协作增益。

一项新研究提出AGC-VLN(Air-Ground Collaborative VLN),据称是首个针对空地协同视觉语言导航(VLN)的无训练基线。该系统配对一架具全局鸟瞰视角的无人机(UAV)与一辆具局部第一人称视角的地面无人车(UGV),在CARLA-Air仿真环境的100次闭环任务中达到77.0%的联合成功率,相比表现较弱的单智能体无人机(50.0%)协作增益为+27.0%,并比最强的已发布单智能体基线Travel UAV(53.0%)高出24.0个百分点。

论文作者为Zhang Shuning、Li Liang、Wang Yunheng、Wang Tao、Kang Yihang和Xu Renjing,2026年9月3日提交至arXiv(编号2609.03483),归类于机器人学(cs.RO)和人工智能(cs.AI)。研究指出,空地协作VLN此前基本未被探索:现有无训练方法只能解决单智能体任务,没有协作机制;一项近期在CARLA-Air上的评测发现,五种最先进的视觉-语言-动作(VLA)模型均未展现稳定的协作行为,而朴素的语义通信或双向耦合甚至会让性能下降。

协作机制:共享鸟瞰图

AGC-VLN的核心思路是:无训练方法将导航分解为基于视觉语言模型(VLM)的语义推理和确定性的几何执行,这暴露了一个协作接口。无人机在其全局视野中将地面车辆报告的位置和VLM锚定的目标渲染为带有距离标签的CAR/GOAL标记,从而形成一张共享的鸟瞰图。

地面车辆从这张图中获取第一人称视角无法提供的全局空间上下文,利用冻结的VLM规划沿路行驶路径,并在闭环控制下执行;与此同时,无人机运行3D-SPF——SPF(空间搜索)算法的升级版,在向下的视野中定位目标并朝其飞行。

  • 100次闭环任务在CARLA-Air的Town10HD场景中完成。
  • 协作增益归因于无人机全局视野与地面车辆沿路执行能力的互补性。
  • 项目页面已发布,论文共8页、5张图。

信息来源