研究Google DeepMind·2026年9月5日

Google DeepMind发布Gemini Robotics 2,实现机器人全身控制与多机协作

新模型系列Gemini Robotics 2支持人形机器人全身协调操作、精细灵巧操作以及多机器人协作,其中推理模型已上线AI Studio。

AI解读:Google DeepMind发布的Gemini Robotics 2是一套机器人AI模型,核心是把Gemini多模态能力转化为电机控制。以往机器人只能完成预设的重复任务,换一种机身就要重新训练很长时间。这次新版的突破在于:一是能控制整个人形机器人(从脚到手指),不只是上半身,比如让Apollo 2机器人走过去把水壶放进货架底层的绿箱;二是手部精细操作更强,能用22自由度的五指手打结或封拉链袋;三是多个机器人可以协作完成单个机器人做不了的复杂流程。对机器人开发商来说,最实际的改变是Gemini Robotics On-Device 2可在本地运行,换到新机器人上只需几小时和不到200个示例就能适配,大幅缩短部署时间。但目前只有Gemini Robotics ER 2推理模型公开开放,在Google AI Studio可用,企业级私有预览通过Gemini Enterprise Agent Platform申请;控制动作的VLA和On-Device模型仍只提供给早期合作伙伴,外部开发者暂时用不到。关于安全性,DeepMind推出了ASIMOV-Agentic基准来衡量代理安全,ER 2据称在安全约束遵循和人体接近基准上是该公司最安全的机器人模型,但文章没有提供具体评测数据。

Google DeepMind于2026年7月30日发布Gemini Robotics 2模型系列,宣称能实现人形机器人全身控制、精细手部(或夹爪)操作以及多机器人协作。

系列包含三个模型:Gemini Robotics 2是最先进的视觉-语言-动作模型(VLA),能将视觉与语言输入转换为电机控制,支持全身人形及双臂机器人;Gemini Robotics ER 2是体现推理模型(VLM),用于理解环境、规划长任务并与人交互;Gemini Robotics On-Device 2是面向机器人本地运行的VLA模型,针对快速适配新机体的需求优化。

模型通过搭载于Apptronik的Apollo 2人形机器人、Franka Duo双臂平台以及Dexmate、SO101、Trossen等新机体展示能力。DeepMind表示,这是其首次实现对整个类人机器人的控制。

可用性方面:Gemini Robotics ER 2现已在Google AI Studio开放,并在Gemini Enterprise Agent Platform提供私有预览;VLA和On-Device模型向早期合作伙伴提供。

全身控制与精细操作

在演示中,通过Gemini Robotics 2控制Apollo 2,研究者得以要求"把水壶放进下层货架的绿色垃圾桶",机器人即能走到桌前拿起水壶、走到货架前放好。DeepMind称这次进展是迈向复杂真实世界任务所需的全身协调技能的一步。

在灵巧性方面,Gemini Robotics 2能控制Apollo 2上22个自由度、五指的SharpaWave手,完成打结或密封拉链袋等精细动作,也能控制Franka Duo平台上标准双指平行夹爪完成紧凑打包等任务。

长任务推理与多机器人协作

Gemini Robotics ER 2处理用户指令,在房间内观察、规划执行步骤,并与VLA协调进行动作,跟踪进度直到任务完成,可执行复杂多步任务,支持自我纠正。

据介绍,相比前代,ER 2能更可靠地执行持续数分钟且涉及数百个决策的长序列任务,并且理解任务何时开始与结束,能确定关键事件发生的时刻。

本次还引入多机器人协作,允许不同类型的机器人相互通信、协作以完成单个机器人无法完成的复杂工作流程。

本地运行与安全机制

Gemini Robotics On-Device 2针对无网络或低延迟场景设计,能本地运行。据称可以适用于不同形状、传感器和自由度差异巨大的机体,通常不到200个示例即可适配,时间为几小时。

在安全方面,DeepMind引入新基准“ASIMOV-Agentic”,用以评估代理安全编排与不确定性解析:衡量体现推理代理拒绝执行VLA不安全工具调用的能力,以及预测任务是否可能完成并在不确定时主动请求人工介入的能力。

DeepMind声称,得益于增强的体现推理,Gemini Robotics ER 2是该机构在安全约束遵循和人体接近基准上表现最安全的机器人模型,能更好地检测到人靠近、触发安全工具调用,必要时使机器人安全停止。

信息来源

Google DeepMind原始来源