Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人
Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
Gemini Robotics ER 2 代表着在为机器人赋予视频理解、任务编排和多机器人协作能力方面的一次跨越式进步——让机器人能够在物理世界中发挥更大的作用。

我们正式推出 Gemini Robotics ER 2,这是一款旨在充当机器人高级大脑的全新模型。它能够实现实时空间推理、多步骤任务规划,以及不同机器人之间的协作。你现在可以通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 访问该模型,开始构建属于你自己的物理 AI 智能体。
Google 刚刚发布了 Gemini Robotics ER 2,它就像机器人的智能大脑。它能帮助机器人快速思考、规划多步骤任务,甚至与其他机器人协同工作。该模型让机器人能够观看视频流,实时追踪自身进度并纠正错误。它的设计目标是让机器人在现实世界中更安全、更有用。
要让机器人在日常环境中协助人类,仅有准确的空间推理是不够的。机器人还必须快速思考,使其决策和推理的时机与物理世界的实时速度相匹配。
正因如此,我们今天推出 Gemini Robotics ER 2,这是我们面向机器人领域能力最强的“具身推理”模型。可以把 Gemini Robotics ER 2 看作机器人的高层大脑。它让机器人能够与人类对话、理解物理世界,并规划多步骤任务。随后,它把运动执行交给任意给定的底层视觉-语言-动作(VLA)模型。Gemini Robotics ER 2 还能原生调用 Google Search 等工具来查找信息,或调用任何其他用户自定义函数。Gemini Robotics ER 2 的设计让机器人能够在执行动作的同时“思考”下一步该做什么。
Gemini Robotics ER 2 相比 Gemini Robotics ER 1.6 是一次重大升级。通过观看连续视频流,机器人现在能够跟踪自身进度、在出现问题时进行调整,并准确知道何时进入下一步。我们还引入了多机器人协作,使机器人能够在共享空间中协同工作,完成单个机器人无法独立完成的复杂工作流。
Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 向开发者公开提供,并在 Gemini Enterprise Agent Platform 上开放私密预览。为帮助你快速上手,我们分享了示例,展示如何配置该模型并编写提示词,以驱动更实用的物理 AI 任务。
推进物理智能体能力
物理世界中的大多数任务都很复杂,需要多个步骤才能完成。Gemini Robotics ER 2 是一个物理智能体,它为机器人编排各个步骤,使其能够自我纠正,并泛化到更新颖的情境中。要构建智能体式设置,开发者可以将底层控制接口——例如视觉-语言-动作(VLA)模型或导航 API——声明为工具,并将多模态视频、音频或文本直接流式传入模型。
Gemini Robotics ER 2 改进了这一工具编排工作流。我们可以通过仿真中的机器人、使用真实世界的机器人控制,甚至将其与远程操控机器人的人类配对,来评估其性能。

在三种控制模式下——真实 VLA、仿真 VLA 和人类远程操控——Gemini Robotics ER 2 在工具编排方面始终优于 ER 1.6。
在机器人领域,高层推理取决于执行速度。Gemini Robotics ER 2 集成到 Gemini Live API 中,使用针对延迟敏感任务优化的双向流式端点。其结果是流畅的编排:Gemini Robotics ER 2 指挥动作模型和机器人 API 完成多步骤任务,而不会出现令人不适的“停下来思考”式停顿。
为了说明这一点,我们构建了一个演示,Spot来自我们的合作伙伴Boston Dynamics。我们使用 Gemini Robotics ER 2 来编排Spot API,例如导航和机械臂运动,打造出一个能为你取物的交互式机器人。
搭载 Gemini Robotics ER 2 的 Boston Dynamic Spot 在收到自然语言指令后取来了一份爆米花零食。
代码已在 Github 上提供,并附有其他示例。
解锁时间智能,实现稳健的任务完成
机器人技术最艰巨的挑战之一,是判断任务何时完成。Gemini Robotics ER 2 在视频理解和进度追踪方面带来了跨越式提升,能够在切换到下一项任务之前,验证复杂任务——例如拧紧灯泡或扎紧垃圾袋——是否已按规格完成。
在本次更新中,我们在任务进度理解的两项基础能力上取得了进展:进度分类和关键时刻定位。
连续进度分类
进度分类是指机器人追踪任务完成进度的能力。在我们的评估中,我们将视频流中的每一帧划分为五个进度等级(0-20%、20-40%、40-60%、60-80%、80-100%)。通过量化任务进度,Gemini Robotics ER 2 为机器人提供了实时的态势感知,使其能够即时调整动作,或重试失败的步骤,而无需重新启动整个工作流程。

Gemini Robotics ER 2 在进度分类任务上达到了 57.4% 的准确率,超越了前代模型和竞争的前沿模型。
精准的时刻定位
时刻定位衡量的是模型识别关键事件发生的确切视频帧的能力(即何时停止往杯子里倒咖啡)。Gemini Robotics ER 2 在时刻定位方面取得了显著的性能提升,使机器人能够精确地在任务之间切换、验证成功并给出纠正建议。

在时刻定位任务中,Gemini Robotics ER 2 达到了 91.3% 的准确率和 0.96s 的平均绝对距离。它与规模大得多的模型类别不相上下,但以极低的计算成本和 4 倍的执行速度实现了这一精度——这种亚秒级延迟正是现实世界中安全操作物理机器人所真正需要的。
多机器人协作
没有哪一台机器人能胜任所有任务——轮式漫游车在室内表现出色,而人形机器人则可能擅长应对崎岖地形。Gemini Robotics 2 支持多机器人协作,让不同类型的机器通过共享的语义理解进行通信,从而交接并完成复杂任务。看看 Gemini Robotics ER 2 如何让 Apptronik 的 Apollo 2 和 Franka F3 Duo 在此处协作。
提升通用空间智能
Gemini Robotics ER 2 推进了我们的核心空间推理能力,这通过三项基准测试来衡量:
- 成功/失败检测: 现在基于原始视频流而非静态快照运行,以捕捉执行过程中的失败,如溢出、滑落或错位。
- 通用仪表读数: 从圆形表盘和视镜扩展到数字显示屏、线性刻度、直尺和液体温度计。我们在 10 种不同类型的仪表上进行了测试。
- 增强空间 VQA: 通过 Gemini 在多模态理解方面的进展改进视觉问答。

Gemini Robotics ER 2 在所有核心能力上始终取得最高准确率,亮点包括成功检测(图像/视频)、问答(ERQA)和通用仪表读数。
推进具身智能的安全性
Gemini Robotics ER 2 是我们最安全的模型,在安全指令遵循和人类接近度基准测试上取得了显著提升,这两项基准分别评估模型在推理任务中遵守物理约束的能力,以及检测人类的空间感知能力。我们发现,Gemini Robotics ER 2 能在有人靠近时成功让人形机器人停下,并且只有在周围区域清空后才会自主恢复工作。为了推进物理智能体的安全性,我们推出了一项基准测试,通过检验基础模型执行安全约束、监控环境、评估物理可行性以及寻求人类澄清的能力,来评估其作为安全 VLA 编排器的能力。详情请参阅我们的安全技术报告。

Gemini Robotics ER 2 在安全指令遵循和人类接近度基准测试上优于 ER 1.6 及其他前沿模型。
展望未来,我们的计划是推动这些模型迈向更复杂的任务,以加速实用机器人的开发,并支持机器人社区。
来源:Google DeepMind:Blog(RSS) · deepmind.google