Google 发布 Gemini Robotics 2.0,承诺提升灵巧性与安全性
摘要
Google 发布了 Gemini Robotics 2.0,这是一组用于机器人的 AI 子模型,可提升灵巧性、实时视频理解和机器人协作能力,其中具身推理模型已向开发者公开。
<p>由 Google Gemini AI 模型驱动的机器人现在能力更强了。随着 <a href="https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/">Gemini Robotics 2</a> 的推出,这些实体机器人现在可以完成更复杂的任务,持续分析不断变化的环境,并与其他机器人协作。这要归功于三个新的子模型,其中一个从今天起向开发者<a href="https://ai.google.dev/gemini-api/docs/robotics-overview">公开可用</a>。</p>
<p>机器人跑步、跳舞和后空翻的视频多年来一直是互联网上的常见内容,但这些机器是被编程来执行这些非常狭窄的任务的。Gemini Robotics 的目标是创造一个通用型机器人,一个能做人类能做的任何事情的机器人。Google DeepMind 科学家有时称之为“物理 AGI”。本质上,你告诉机器人该做什么,它就会去做。随着 2.0 版本的发布,Google 表示其机器人 AI 可以控制整个类人机器人,并且具有更高的灵巧性,即使是拥有复杂类人手的机器也能做到。</p>
<div class="ars-video ars-video--horizontal"><div><div class="relative" allow="fullscreen" loading="lazy" src="https://www.youtube.com/embed/4lSQnrMC6nY?start=0&wmode=transparent"></div><div class="caption font-impact dusk:text-gray-300 mb-4 mt-2 inline-flex flex-row items-stretch gap-1 text-base leading-tight text-gray-400 dark:text-gray-300">
<div class="caption-icon bg-[left_top_5px] w-[10px] shrink-0"></div>
<div class="caption-content">
Gemini Robotics 2 为机器人带来全身智能。
</div>
</div>
</div></div>
<p>这一切始于 Gemini Robotics ER 2,这是 DeepMind 声称较<a href="https://arstechnica.com/ai/2026/04/robot-dogs-now-read-gauges-and-thermometers-using-google-gemini/">1.6 版本</a>有重大飞跃的升级版“具身推理”模型。它与 Gemini Live API 集成,让开发者有机会体验这一所谓的飞跃。</p><p><a href="https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/">阅读全文</a></p>
<p><a href="https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/#comments">评论</a></p>
查看缓存全文
缓存时间:
2026/07/31 17:00
# 谷歌发布 Gemini Robotics 2.0,承诺更强的灵巧性与安全性
来源:https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/
跳转到内容 (https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/#main)
停下,协作,倾听
Gemini Robotics 2 包含三个模型,但目前只有一个公开可用。
由谷歌 Gemini AI 模型驱动的机器人现在变得更加强大。随着 Gemini Robotics 2 的首次亮相 (https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/),这些实体机器人现在可以完成更复杂的任务,持续分析不断变化的环境,并与其他机器人协作。这要归功于三个新的子模型,其中一个从今天起向开发者公开可用 (https://ai.google.dev/gemini-api/docs/robotics-overview)。
机器人奔跑、跳舞和后空翻的视频多年来一直是互联网的标配内容,但这些机器只是被编程来执行这些非常狭窄的任务。Gemini Robotics 的目标是打造一个通用型机器人,一个能完成人类能做的任何事情的机器。谷歌 DeepMind 的科学家有时称之为“物理 AGI”。本质上,你告诉机器人要做什么,它就去做。随着 2.0 版本的发布,谷歌表示其机器人 AI 可以控制整个仿人机器人,拥有更强的灵巧性,即使是配备复杂仿人手的机器也不在话下。
Gemini Robotics 2 为机器人带来了全身智能。
这一切始于 Gemini Robotics ER 2,一个升级版的“具身推理”模型,DeepMind 声称这是相比之前的 1.6 版本 (https://arstechnica.com/ai/2026/04/robot-dogs-now-read-gauges-and-thermometers-using-google-gemini/) 的一大飞跃。它与 Gemini Live API 集成,让开发者有机会体验这一所谓的飞跃。
Gemini Robotics ER 2 是一种所谓的视觉语言模型(VLM)。它旨在理解指令和周围的世界。这次升级的重点在于,ER 2 可以处理来自机器人摄像头的实时视频流,使系统能够在机器人一步步执行任务时跟踪进度。谷歌指出,Gemini Robotics ER 2 对视频帧完整性的分类准确率接近 60%。这虽然还远远不够完美,但已经比 1.6 版本或竞争 AI 模型的视觉理解能力好得多。
[](https://cdn.arstechnica.net/wp-content/uploads/2026/07/ER_metrics_comparison_Chart.width-1200.format-webp.png)
Gemini Robotics ER 2 在理解世界方面优于其他模型,但差距并不大。
图片来源:Google
Gemini Robotics ER 2 在理解世界方面优于其他模型,但差距并不大。图片来源:Google
在视频流中定位特定时刻也是正确完成任务的关键。当你让机器人倒一杯咖啡时,你肯定希望它知道何时停止倒水。ER 2 显然在这方面做得更好,识别关键时刻的准确率接近 90%。当机器人执行多步骤任务时,具身推理模型能让它们实时理解失败。系统可以只重试失败的那一步,而不是从头再来。例如,如果机器人试图捡起的球滚走了,或者有人移动了容器,机器人只需重新调整手的位置和动作即可。
新的具身推理版本还赋予了谷歌 DeepMind 升级版机器人 AI 协作能力。视频演示中,Apptronik 的 Apollo 2 和更简单的 Franka F3 Duo 在不互相妨碍的情况下共同完成一项任务。虽然测试机器人仍然无法匹敌人类的速度或优雅,但视频演示中包含大量机器人实时运行的镜头,它们看起来确实比过去的测试中少了很多犹豫。
Gemini Robotics 2 的多机器人协作。
理解只是第一步——让机器人在物理世界中移动是另一个模型的职责。在规划好任务之后,视觉语言模型会将工作交给一个升级版的视觉-语言-行动模型,简称为 Gemini Robotics 2。这个 AI 模型以生成其他生成式系统创建文本或图像的方式,从指令中生成机器人动作。还有一个低延迟的离线版本,名为 Gemini Robotics On-Device 2。这些模型目前仅限于一小部分测试者使用。
谷歌还在波士顿动力的硬件上测试 Gemini Robotics 2。
谷歌还在波士顿动力的硬件上测试 Gemini Robotics 2。
谷歌表示,新的动作模型在准确性和效率上都有大幅提升。即使是较小的设备端版本,也能仅凭几小时的移动数据(约 200 个示例)就适应新的机器人设计。
## 防范机器人末日
AI 幻觉的问题目前已经广为人知,但当 AI 以物理形态与人类共享空间时,犯错可能造成的伤害要大得多。随着每次 Gemini Robotics 的发布,谷歌 DeepMind 都强调它认真对待这一风险。据 DeepMind 称,Gemini Robotics 的每一层都融合了“传统的物理安全措施与强大的 AI 安全框架”。
随着 Gemini Robotics 2 的发布,一个新的安全基准测试也一同问世,名为 ASIMOV-Agentic。该测试从多种安全因素角度评估模型。它可以评估具身推理代理是否会拒绝来自 VLA 的不安全工具调用。它还可以判断给定任务是否能在安全的前提下完成,以及模型在不确定安全性时是否能够请求人工协助。
谷歌 DeepMind 指出,Gemini Robotics ER 2 是该团队迄今为止最安全的模型,展现出对安全问题的强大理解能力,并能在人类离机器人太近时停止动作。谷歌的新安全基准测试已在 Hugging Face 上完整公开 (https://huggingface.co/datasets/google/asimov_agentic/blob/main/README.md)。
Ryan Whitwam 的照片 (https://arstechnica.com/author/ryanwhitwam/)
Ryan Whitwam 是 Ars Technica 的高级科技记者,负责报道谷歌、AI 和移动技术如何持续改变世界。在他 20 年的职业生涯中,他曾为 Android Police、ExtremeTech、Wirecutter、纽约时报等媒体撰稿。他评测过的手机比大多数人一辈子拥有的还要多。你可以在 Bluesky 上关注他 (https://bsky.app/profile/rwhitwam.bsky.social),在那里你会看到他几十把机械键盘的照片。
38 条评论 (https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/#comments)
1. 热门阅读中第一篇文章的列表图片:太空部队支持的任务在轨道上上演了最佳《壮志凌云》模仿秀 (https://arstechnica.com/space/2026/07/space-force-backed-mission-does-its-best-impression-of-top-gun-in-orbit/)
相似文章
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics,这是一个基于 Gemini 2.0 的视觉-语言-动作模型,可以控制物理机器人,具有更强的通用性、交互性和灵巧性。该公司还推出了用于空间推理的 Gemini Robotics-ER,并与 Apptronik 合作开发人形机器人。
Wired
谷歌DeepMind发布了Gemini Robotics 2,这是一个结合了视觉语言和视觉语言动作模型的AI模型,用于控制人形机器人完成复杂的物理任务,如拧灯泡和整理货架。
Google DeepMind Blog
Google DeepMind 发布 Gemini Robotics ER 2,这是一个具身推理模型,使机器人能够理解视频、编排任务并与多机器人协作,现通过 Gemini API 公开提供。
Hacker News Top
DeepMind 推出 Gemini Robotics 2,这是一组 AI 模型(VLA、ER、On-Device),使机器人能够进行全身控制、精细操作和多机器人协作,支持本地设备端执行,并能快速适应新的机器人本体。
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5,推进了物理 AI 智能体的发展,这些智能体能够感知、规划、思考和行动来完成复杂的多步骤任务。Gemini Robotics-ER 1.5 现已通过 Gemini API 向开发者提供。