Gemini Robotics-ER 1.6: 通过增强具身推理赋能真实世界机器人任务
摘要
Google DeepMind 推出 Gemini Robotics-ER 1.6,这是一款专注于提升机器人具身推理能力的 AI 模型,通过改进空间感知、任务规划和仪器读数能力来实现这一目标。
Gemini Robotics ER 1.6: 增强空间推理与多视角理解,助力自主机器人技术。
查看缓存全文
缓存时间:
2026/05/08 09:08
# Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务
来源:https://deepmind.google/blog/gemini-robotics-er-1-6/
要让机器人在日常生活和工业场景中真正发挥作用,它们必须超越单纯执行指令,而是能够对物理世界进行推理。从在复杂设施中导航,到解读压力表上的指针,机器人的"具身推理"能力正是连接数字智能与物理行动的桥梁。
今天,我们推出 Gemini Robotics-ER 1.6(https://deepmind.google/models/gemini-robotics/),这是我们在推理优先模型上的重大升级,使机器人能够以空前的精度理解环境。通过增强空间推理和多视角理解能力,我们为下一代物理智能体带来了更高水平的自主性。
该模型专注于机器人领域的关键推理能力,包括视觉与空间理解、任务规划和成功检测。它作为机器人的高层推理模型,能够通过原生调用工具来执行任务,例如使用 Google Search 查找信息、调用视觉-语言-动作模型(VLA)或任何其他第三方用户自定义功能。
Gemini Robotics-ER 1.6 相比 Gemini Robotics-ER 1.5(https://developers.googleblog.com/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-15/)和 Gemini 3.0 Flash(https://blog.google/products-and-platforms/products/gemini/gemini-3-flash/)均有显著提升,特别是在空间和物理推理能力方面,如指向、计数和成功检测。我们还解锁了一项全新能力:仪表读数,使机器人能够读取复杂的压力表和视镜——这一用例是我们与合作伙伴 Boston Dynamics 紧密协作中发现的。
即日起,Gemini Robotics-ER 1.6 面向开发者通过 Gemini API(https://ai.google.dev/gemini-api/docs/robotics-overview)和 Google AI Studio(https://aistudio.google.com/prompts/new_chat?model=gemini-robotics-er-1.6-preview)开放。为帮助开发者快速上手,我们分享了一个开发者 Colab(https://github.com/google-gemini/robotics-samples/blob/main/Getting%20Started/gemini_robotics_er.ipynb),其中包含如何配置模型并对其进行具身推理任务提示的示例。
图 1:Gemini Robotics-ER 1.6 与 Gemini Robotics-ER 1.5 及 Gemini 3.0 Flash 模型的基准测试结果对比。仪表读数评估在启用 agentic vision 的情况下运行(Gemini Robotics-ER 1.5 不支持该功能除外)。其余所有评估均在禁用 agentic vision 的情况下运行。单视角和多视角成功检测评估包含不同的示例,因此不可直接比较。
## 指向:空间推理的基础
指向是具身推理模型的一项基础能力,随着每一代模型的演进而不断增强。点可以用于表达多种概念,包括:
- **空间推理:** 精确的目标检测与计数
- **关系逻辑:** 进行比较,例如识别一组物品中最小的那个;定义"从-到"关系(例如将 X 移动到位置 Y)
- **运动推理:** 映射轨迹并识别最佳抓取点
- **约束合规:** 处理复杂指令的推理,如"指出所有小到能放进蓝色杯子里的物体"
Gemini Robotics-ER 1.6 可以将点作为中间步骤来推理更复杂的任务。例如,它可以利用点来统计图像中的物品数量,或识别图像中的关键点,以帮助模型执行数学运算来提升其度量估计的准确性。
下面的示例展示了 Gemini Robotics-ER 1.6 在指向多个元素方面的优势,以及它知道何时该指向、何时不该指向。
Gemini Robotics-ER 1.6 正确识别了锤子(2 把)、剪刀(1 把)、画笔(1 支)、钳子(6 把)以及一组可视为单个群组或多个点的园艺工具。对于图像中不存在的请求物品——手推车和 Ryobi 电钻——它不会指向。相比之下,Gemini Robotics-ER 1.5 未能正确识别锤子或画笔的数量,完全遗漏了剪刀,幻觉出手推车,且在钳子指向方面缺乏精度。Gemini 3.0 Flash 接近 Gemini Robotics-ER 1.6 的表现,但在处理钳子方面稍逊。
## 成功检测:自主性的引擎
在机器人领域,知道任务何时完成与知道如何开始同等重要。成功检测是自主性的基石,作为关键的决策引擎,使智能体能够智能地选择重试失败的操作,还是进入计划的下一阶段。
在机器人领域实现视觉理解颇具挑战性,这需要将复杂的感知和推理能力与广泛的世界知识相结合,以应对遮挡、光线不佳和指令模糊等复杂因素。此外,大多数现代机器人设置包含多个摄像头视角,如俯视和腕部安装视角。这意味着系统需要理解不同视角如何结合,在每个时刻以及跨时间形成连贯的画面。
Gemini Robotics-ER 1.6 推进了多视角推理能力,使系统能够更好地理解多个摄像头流及其之间的关系,即使在动态或遮挡环境中也是如此,如下面的典型多视角场景所示。
Gemini Robotics-ER 1.6 从多个摄像头视角获取线索,以判断"将蓝色笔放入黑色笔筒"任务何时完成。
## 仪表读数:真实世界的视觉推理
要理解 Gemini Robotics-ER 1.6 的一项关键优势,我们需要看它如何结合空间推理和世界知识等能力来解决复杂的真实世界问题。仪表读数就是一个绝佳的例子。
这一任务源于设施巡检需求,是我们与 Boston Dynamics 合作伙伴的重点关注领域。工业设施中有大量仪表——温度计、压力表、化学视镜等——需要持续监测。Spot 是 Boston Dynamics 的一款机器人产品(https://bostondynamics.com/blog/aivi-learning-now-powered-google-gemini-robotics/),能够巡视设施中的仪表并拍摄图像。
Gemini Robotics-ER 1.6 使机器人能够解读多种仪表,包括圆形压力表、垂直液位指示器和现代数字显示屏。
仪表读数需要复杂的视觉推理。必须精确感知多种输入——包括指针、液位、容器边界、刻度标记等——并理解它们之间的相互关系。对于视镜而言,这涉及估算液体填充视镜的程度,同时考虑摄像头视角带来的畸变。压力表通常有描述单位的文字需要读取和解读,有些表具有多个指向不同小数位的指针需要综合判断。
> 仪表读数和更可靠的任务推理等能力将使 Spot 能够完全自主地观察、理解和应对真实世界的挑战。
Marco da Silva
Boston Dynamics Spot 副总裁兼总经理
Gemini Robotics-ER 1.6 通过使用 agentic vision(https://blog.google/innovation-and-ai/technology/developers-tools/agentic-vision-gemini-3-flash/)实现高精度的仪表读数,该技术将视觉推理与代码执行相结合。模型采取中间步骤:首先放大图像以更好地读取仪表上的小细节,然后利用指向和代码执行来估算比例和间隔以获得准确读数,最终应用其世界知识来解读含义。
图 2:Gemini Robotics-ER 1.6 的不同元素如何共同作用,在仪表读数任务上达到高水平表现。
### 精确读取模拟压力表
此示例展示了模型如何利用指向和代码执行进行放大,以推导压力表读数至亚刻度精度。
## 我们迄今为止最安全的机器人模型
安全性融入了我们具身推理模型的每一个层面。Gemini Robotics-ER 1.6 是我们迄今为止最安全的机器人模型,在对抗性空间推理任务中,相比所有前代模型,对 Gemini 安全政策(https://gemini.google/policy-guidelines/)的遵守表现更优。
该模型在遵守物理安全约束方面也展现出大幅提升的能力。例如,它通过空间输出(如指向)做出更安全的决策,判断在夹爪或材料约束下哪些物体可以安全操作(例如"不要处理液体"、"不要拿起超过 20kg 的物体")。
我们还测试了模型在基于真实工伤报告的文本和视频场景(https://asimov-benchmark.github.io/v2/)中识别安全隐患的能力。在这些任务上,我们的 Gemini Robotics-ER 模型相比基线 Gemini 3.0 Flash 表现有所提升(文本 +6%,视频 +10%),能够更准确地感知伤害风险。
图 3:Gemini Robotics-ER 1.6 在安全指令遵循方面相比 Gemini Robotics-ER 1.5 有大幅提升,该测试评估遵守物理安全约束的能力。在指向任务上相比 Gemini 3.0 Flash 有所提升,两个模型在文本方面都具有很高的准确率。Gemini 3.0 Flash 在边界框方面表现更好。
## 与我们合作,共同提升机器人具身推理能力
我们致力于确保 Gemini Robotics-ER 为机器人社区提供最大价值。如果当前能力对您的专业应用存在局限,我们邀请您提交此表单(https://forms.gle/a5jRuga5VmnCeQCk9),附上 10-50 张标注图像,说明具体的失败模式,以帮助我们构建更强大的推理功能。我们期待与您合作,在即将发布的版本中增强这些能力。
立即在 Google AI Studio 上试用 Gemini Robotics-ER 1.6(https://aistudio.google.com/prompts/new_chat?model=gemini-robotics-er-1.6-preview)
### Gemini Robotics
### Gemini Robotics-ER
### 负责任地推进 AI 与机器人技术
相似文章
Google DeepMind Blog
Google DeepMind 发布 Gemini Robotics ER 2,这是一个具身推理模型,使机器人能够理解视频、编排任务并与多机器人协作,现通过 Gemini API 公开提供。
X AI KOLs
Google DeepMind 发布了 Gemini Robotics-ER 1.6,这是一个升级的模型,具有增强的视觉和空间理解能力,使机器人能够更好地推理和与物理世界互动。
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5,推进了物理 AI 智能体的发展,这些智能体能够感知、规划、思考和行动来完成复杂的多步骤任务。Gemini Robotics-ER 1.5 现已通过 Gemini API 向开发者提供。
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics,这是一个基于 Gemini 2.0 的视觉-语言-动作模型,可以控制物理机器人,具有更强的通用性、交互性和灵巧性。该公司还推出了用于空间推理的 Gemini Robotics-ER,并与 Apptronik 合作开发人形机器人。
Hacker News Top
DeepMind 推出 Gemini Robotics 2,这是一组 AI 模型(VLA、ER、On-Device),使机器人能够进行全身控制、精细操作和多机器人协作,支持本地设备端执行,并能快速适应新的机器人本体。