产品NVIDIA Technical Blog·原文 2026年8月27日本站收录 2026年9月6日

英伟达发布智能体驱动工作流,训练跨形态机器人导航策略

该工作流基于COMPASS框架,利用AI智能体自动化训练流程,减少为每种机器人-场景组合重复开发的开销。

AI解读:跨形态机器人导航策略的训练一直昂贵且难以复现,因为每换一个机器人或环境,开发者都要重新收集数据、准备仿真资产、训练并调试。英伟达这篇技术博客提出的智能体驱动工作流,把COMPASS框架的训练流程打包成编码智能体(如Codex或Claude Code)可调用的仓库技能:智能体负责验证依赖、准备场景、运行冒烟测试、启动训练、诊断失败和比较检查点,而开发者在场景验收、冒烟测试和检查点晋升等关键节点保留人工审批。对实际从事机器人开发的团队来说,这意味着不再需要为每个机器人-场景组合从头写训练脚本,而是用自然语言提示智能体执行标准化流程,再把精力集中在审批和异常处理上。文章提供了明确的硬件参考(Ubuntu 22.04/24.04、32GB内存、RTX GPU至少16GB显存、Linux驱动580.95.05)和软件栈(Isaac Lab 3.0、Isaac Sim 6.0),并说明训练时间随硬件和场景复杂度变化,没有给出具体性能数据。需要强调的是,这套流程目前以波士顿动力Spot为参考机器人,并依赖Hugging Face上的受限仓库(nvidia/COMPASS和nvidia/X-Mobility),访问前需先接受条款并获得读取令牌。

英伟达发布了一篇技术教程,介绍如何用智能体驱动的工作流训练跨形态机器人导航策略,该方法基于COMPASS(Cross-Embodiment Mobility Policy via Residual RL and Skill Synthesis)框架,用AI编码智能体(如OpenAI Codex或Anthropic Claude Code)自动化数据准备、训练、诊断和评估流程,以减少为每种机器人-场景组合重复开发的开销。

工作流核心:智能体自动化训练,人工保留审批

COMPASS是一种统一框架,利用来自单一形态的专家演示实现可扩展的跨形态移动。它复用预训练的NVIDIA X-Mobility策略,训练一个残差专家,即强化学习(RL)策略,针对选定机器人和环境修正基础动作,而不是从头重新学习导航。多个专家的数据之后可以蒸馏成一个共享的跨形态策略。

在智能体驱动的工作流中,开发者定义机器人、场景来源和导航目标;编码智能体使用仓库技能验证依赖、准备资产、运行冒烟测试、启动训练、诊断失败并比较检查点。人工审批门控制场景验收、单环境冒烟测试和检查点晋升。文章特别指出,智能体在运行时不会控制机器人,开发完成后,训练策略和机器人控制器在运行时无需编码智能体参与。

  • 工作流中的每个阶段都会在进入下一阶段前产生可审查的证据:验证环节生成软件和资产清单、环境报告和冒烟测试日志;场景准备环节产生注册的场景配置、占用地图和视觉检查证据;训练环节记录命令、遥测数据和周期性检查点;评估环节提供标准指标、视频和晋升建议;打包环节包含已批准的检查点、配置和工件清单。
  • 若运行失败,compass-doctor技能会执行只读健康检查并报告可能原因,不会静默更改环境。认证错误应路由到Hugging Face访问检查,场景加载或碰撞错误对应场景准备,相机或动作接口错误对应冒烟测试阶段,内存错误对应环境数量或分布式配置。

三种场景路径:内置仓库、SAGE-10K和NuRec重建

教程提供了三种导航场景来源:内置的COMPASS仓库(combined_multi_rack)作为最快可复现的基线路径,SAGE-10K数据集(包含50种房间类型共10,000个生成室内场景)用于生成场景,NVIDIA Omniverse NuRec用于捕捉环境的重建。SAGE-10K是一个场景数据集而非策略或模拟器,每个场景提供几何、材质、布局元数据和预览。

SAGE-10K路径包含两个人工审批门:首先在Isaac Sim中检查转换的USD文件,确认几何、材质、比例和碰撞网格后再注册;注册并生成占用地图后,需批准单环境预览才能进行完整训练。NuRec路径是可选的,用于在预期部署环境的重建中微调和评估COMPASS,教程的主体训练流程继续使用SAGE-10K场景。

  • 内置仓库路径:机器人、场景和占用地图都已注册,适合在引入新场景前验证安装。
  • SAGE-10K路径:起居室和仓库场景遵循相同准备流程,只需选择一个候选场景,无需下载整个数据集。
  • NuRec路径:将立体RGB捕获转换为Isaac Sim就绪的重建,包含对齐的视觉几何、碰撞网格和可选的场景增强。

训练与评估:残差训练和标准指标

冒烟测试批准后,开发者可以启动标准残差强化学习工作流。教程给出的示例命令使用Spot和内置仓库,并指定预训练检查点路径、启用相机和场景键。训练是长期运行的过程,编码智能体应在持久会话或托管调度器中运行,将日志和检查点写入配置的输出目录。

训练期间需监控奖励组件、目标进度、接触和跌落、回合终止、吞吐量和GPU内存。应保存周期性检查点,并在匹配条件下评估,而不是假设最终迭代最优。COMPASS标准评估报告目标达成率、跌倒率和行进时间,额外的证据(如目标进度、接触行为、超时或命令稳定性)应标记为衍生分析或自定义仪表。检查点只有在匹配证据满足项目的导航和安全门且人工批准打包后才可晋升。

  • 训练时间因硬件、场景复杂度、环境数量和停止标准而异。
  • 环境数量(--num_envs)应根据可用GPU内存设置,冒烟测试仅使用一个环境。
  • COMPASS支持分布式多GPU训练以应对更大规模的运行。
  • 在改变环境或训练配置前,应使用诊断工作流调查失败原因。

运行时集成:策略输入输出和cuVSLAM

在参考的ROS 2集成中,compass_inference组件将前视相机图像、导航目标或路线以及从里程计导出的机器人速度转换为导出的策略输入,并发布正向线速度和角速度命令到 /cmd_vel。循环状态和先前动作是推理实现的内部部分,不是外部ROS集成输入。开发者需验证坐标框架、更新率、归一化、命令限制、停止行为和物理机器人控制器的目标部署。

当部署机器人需要基于相机的状态估计(如GPS拒绝或间歇环境),且未提供兼容且已验证的里程计和变换时,可使用NVIDIA cuVSLAM库。cuVSLAM的里程计可以支持COMPASS导航器,但其地图不是导航策略的输入。cuVSLAM不参与策略训练,也不需智能体技能,应作为独立的、版本匹配的ROS 2组件运行,连接到 /chassis/odom并验证校准、时间戳、主题名称和框架约定。

  • 导出和部署打包训练策略用于推理,不将基础和残差暴露为两个ROS 2组件。
  • 对于未注册的新机器人,教程提及需要‘新形态工作流’(compass-newembodiment技能),但未展开细节。
  • 教程参考机器人是Boston Dynamics Spot四足机器人。

信息来源