Gemini Robotics ER 2:利用视频理解、任务编排和多机器人协作,驱动机器人技术
摘要
Google DeepMind 发布 Gemini Robotics ER 2,这是一个具身推理模型,使机器人能够理解视频、编排任务并与多机器人协作,现通过 Gemini API 公开提供。
Gemini Robotics ER 2 帮助机器人进行推理、协作并解决现实世界的任务。它代表了机器人应用中视频理解、工具编排和多机器人协作的阶跃式变革。
查看缓存全文
缓存时间:
2026/07/30 16:52
# 介绍 Gemini Robotics ER 2
来源:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=
Gemini Robotics ER 2 代表了机器人技术在视频理解、任务编排和多机器人协作方面的重大突破——让机器人在物理世界中发挥更大的作用。
---
彭旭
高级软件工程师
---
两台机器人:Duo 和 Apollo
要让机器人在日常环境中协助人类,仅靠精确的空间推理是不够的。机器人还必须快速思考,将决策和推理与物理世界的实时速度同步。
正因如此,我们今天发布了 **Gemini Robotics ER 2**(https://deepmind.google/models/model-cards/gemini-robotics-er-2/),这是我们在机器人领域能力最强的“具身推理”模型。可以把 Gemini Robotics ER 2 当作机器人的高级大脑。它能让机器人与人类对话、理解物理世界并规划多步骤任务。随后,它会将电机执行指令交给任何低层级的视觉-语言-动作(VLA)模型。Gemini Robotics ER 2 还可以原生调用 Google 搜索等工具来查找信息,或调用任何用户自定义的函数。Gemini Robotics ER 2 的设计使得机器人能够在执行动作的同时“思考”下一步该做什么。
Gemini Robotics ER 2 相比 **Gemini Robotics ER 1.6**(https://deepmind.google/blog/gemini-robotics-er-1-6/)是一次重大升级。通过持续观看视频流,机器人现在可以跟踪自己的进度,在出现问题时及时调整,并确切知道何时进入下一步。我们还引入了多机器人协作,使机器人能够在共享空间中协同工作,完成单个机器人无法独立完成的复杂工作流程。
Gemini Robotics ER 2 现已通过 **Gemini API**(https://ai.google.dev/gemini-api/docs/robotics-overview)、**Google AI Studio**(https://ai.dev/prompts/new_chat?model=gemini-robotics-er-2-preview)向开发者公开,并在 **Gemini Enterprise Agent Platform**(https://console.cloud.google.com/agent-platform/publishers/google/model-garden/gemini-robotics-er-2-preview-info)上提供私有预览。为帮助您快速上手,我们分享了一些**示例**(https://github.com/google-gemini/robotics-samples/blob/main/Getting%20Started/gemini_robotics_er.ipynb),展示如何配置模型并提示它执行更有用的物理 AI 任务。
## 推进物理智能体的能力
物理世界中的大多数任务都很复杂,需要多个步骤才能完成。Gemini Robotics ER 2 是一个物理智能体,它可以为机器人编排步骤,使其能够自我纠正,并泛化到更多新场景。要构建智能体设置,开发者可以将低层控制接口(如视觉-语言-动作(VLA)模型或导航 API)声明为工具,并将多模态视频、音频或文本直接流式传输到模型中。
Gemini Robotics ER 2 改进了这种工具编排工作流。我们可以通过模拟器中的机器人、真实世界的机器人控制,甚至与远程操控机器人的人类配对,来评估其性能。
Gemini Robotics ER 2 在三种控制模式(真实 VLA、模拟 VLA 和人类远程操作)下的工具编排性能始终优于 ER 1.6。
图表:Gemini Robotics ER 1.6 和 Gemini Robotics ER 2 的物理智能体性能对比
在机器人技术中,高层级推理依赖于执行速度。Gemini Robotics ER 2 集成到 **Gemini Live API**(https://ai.google.dev/gemini-api/docs/live-api)中,使用针对延迟敏感任务优化的双向流式端点。结果是流畅的编排:Gemini Robotics ER 2 指挥动作模型和机器人 API 完成多步骤任务,而不会出现突兀的“停下思考”停顿。
为了说明这一点,我们与合作伙伴 **Boston Dynamics**(https://bostondynamics.com/)的 **Spot**(https://bostondynamics.com/products/spot/)一起构建了一个演示。我们使用 Gemini Robotics ER 2 来编排 **Spot APIs**(https://dev.bostondynamics.com/python/readme)(例如导航和机械臂移动),从而创建了一个可以为你取物的交互式机器人。
Gemini Robotics ER 2 驱动的 Boston Dynamic Spot 在自然语言指令下取出一份爆米花零食。
代码可在 **Github**(https://github.com/google-gemini/robotics-samples/tree/main/live-api)上与其他示例一起获取。
## 释放时间智能,实现稳健的任务完成
机器人技术最棘手的挑战之一是知道任务何时完成。Gemini Robotics ER 2 在视频理解和进度跟踪方面带来了突破性进展,能够验证复杂任务(如拧紧灯泡或系紧垃圾袋)是否按规范完成,然后再切换到下一个任务。
在此次更新中,我们在任务进度理解的两个基础能力上取得了进展:进度分类和时刻定位。
### 连续进度分类
进度分类是指机器人跟踪任务完成进度的能力。在我们的评估中,我们将视频流中的每一帧分为五个进度级别(0-20%、20-40%、40-60%、60-80%、80-100%)。通过量化任务进度,Gemini Robotics ER 2 为机器人提供实时的态势感知,使其能够即时调整动作或重试失败的步骤,而无需重新开始整个工作流程。
Gemini Robotics ER 2 在进度分类任务上达到了 57.4% 的准确率,优于前代模型和竞争前沿模型。
图表:不同机器人的进度分类对比
### 精确时刻定位
时刻定位衡量模型识别关键事件发生的精确视频帧的能力(例如何时停止往杯子里倒咖啡)。Gemini Robotics ER 2 在时刻定位上取得了显著的性能提升,使机器人能够精确地在任务间切换、验证成功并建议修正。
对于时刻定位任务,Gemini Robotics ER 2 达到了 91.3% 的准确率和 0.96 秒的平均绝对距离。它与规模大得多的模型类别竞争激烈,但以极低的计算成本和 4 倍的执行速度实现了这一精度——这是在现实世界中安全操作物理机器人所必需的亚秒级延迟。
图表:时刻定位:准确率与距离
### 多机器人协作
没有一种机器人适合所有任务——轮式机器人擅长室内环境,而人形机器人可能在崎岖地形上表现出色。Gemini Robotics 2 支持多机器人协作,使不同机器能够通过共享语义理解进行通信,以交接并完成复杂任务。了解 Gemini Robotics ER 2 如何实现 **Apptronik**(https://apptronik.com/)的 **Apollo 2**(https://apptronik.com/apollo/apollo-2)和 **Franka F3 Duo**(https://franka.de/mobile-fr3-duo)在此**协作**(https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots)。
## 提升通用空间智能
Gemini Robotics ER 2 提升了我们的核心空间推理能力,通过三个基准测试衡量:
- **成功/失败检测:**现在基于原始视频流而非静态快照,以捕捉执行过程中的错误,如溢出、滑动或错位。
- **通用仪器读数:**扩展至数字显示屏、线性刻度尺、直尺和液体温度计,而不仅仅是圆形表盘和视镜。我们在 10 种不同类型的仪器上进行了测试。
- **增强的空间 VQA:**通过 Gemini 在多模态理解方面的进步,改进了视觉问答能力。
Gemini Robotics ER 2 在所有核心能力上始终达到最高准确率,亮点包括成功检测(图像/视频)、问答(ERQA)和通用仪器读数。
图表:不同机器人的 ER 指标对比
## 推进具身智能的安全性
Gemini Robotics ER 2 是我们最安全的模型,在安全指令遵循和人类接近基准测试上取得了显著进步,这些测试评估模型在推理任务中遵守物理约束的能力以及检测人类的空间意识。我们发现,当有人靠近时,Gemini Robotics ER 2 成功使人形机器人停止动作,并在区域清空后自动恢复工作。为推进物理智能体的安全性,我们引入了一个基准测试,评估基础模型作为安全 VLA 编排器的能力,测试其执行安全约束、监控环境、评估物理可行性以及寻求人类澄清的能力。详情见我们的**安全技术报告**(https://storage.googleapis.com/deepmind-media/gemini-robotics/Gemini-Robotics-2-Safety.pdf)。
Gemini Robotics ER 2 在安全指令遵循和人类接近基准测试上优于 ER 1.6 和其他前沿模型。
图表:不同机器人的安全性能对比
展望未来,我们的计划是将这些模型推向更复杂的任务,以加速开发有用的机器人并支持机器人社区。
## 在收件箱中获取来自 Google 的最新消息
订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等。
您的信息将根据 Google 的**隐私政策**(https://policies.google.com/privacy)使用。您可以随时退订。
相似文章
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics-ER 1.6,这是一款专注于提升机器人具身推理能力的 AI 模型,通过改进空间感知、任务规划和仪器读数能力来实现这一目标。
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics,这是一个基于 Gemini 2.0 的视觉-语言-动作模型,可以控制物理机器人,具有更强的通用性、交互性和灵巧性。该公司还推出了用于空间推理的 Gemini Robotics-ER,并与 Apptronik 合作开发人形机器人。
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5,推进了物理 AI 智能体的发展,这些智能体能够感知、规划、思考和行动来完成复杂的多步骤任务。Gemini Robotics-ER 1.5 现已通过 Gemini API 向开发者提供。
Ars Technica
Google 发布了 Gemini Robotics 2.0,这是一组用于机器人的 AI 子模型,可提升灵巧性、实时视频理解和机器人协作能力,其中具身推理模型已向开发者公开。
Hacker News Top
DeepMind 推出 Gemini Robotics 2,这是一组 AI 模型(VLA、ER、On-Device),使机器人能够进行全身控制、精细操作和多机器人协作,支持本地设备端执行,并能快速适应新的机器人本体。