Google 发布 Gemini Robotics 2.0,承诺提升灵巧性与安全性

Ars Technica 模型

摘要

Google 发布了 Gemini Robotics 2.0,这是一组用于机器人的 AI 子模型,可提升灵巧性、实时视频理解和机器人协作能力,其中具身推理模型已向开发者公开。

<p>由 Google Gemini AI 模型驱动的机器人现在能力更强了。随着 <a href="https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/">Gemini Robotics 2</a> 的推出,这些实体机器人现在可以完成更复杂的任务,持续分析不断变化的环境,并与其他机器人协作。这要归功于三个新的子模型,其中一个从今天起向开发者<a href="https://ai.google.dev/gemini-api/docs/robotics-overview">公开可用</a>。</p> <p>机器人跑步、跳舞和后空翻的视频多年来一直是互联网上的常见内容,但这些机器是被编程来执行这些非常狭窄的任务的。Gemini Robotics 的目标是创造一个通用型机器人,一个能做人类能做的任何事情的机器人。Google DeepMind 科学家有时称之为“物理 AGI”。本质上,你告诉机器人该做什么,它就会去做。随着 2.0 版本的发布,Google 表示其机器人 AI 可以控制整个类人机器人,并且具有更高的灵巧性,即使是拥有复杂类人手的机器也能做到。</p> <div class="ars-video ars-video--horizontal"><div><div class="relative" allow="fullscreen" loading="lazy" src="https://www.youtube.com/embed/4lSQnrMC6nY?start=0&amp;wmode=transparent"></div><div class="caption font-impact dusk:text-gray-300 mb-4 mt-2 inline-flex flex-row items-stretch gap-1 text-base leading-tight text-gray-400 dark:text-gray-300"> <div class="caption-icon bg-[left_top_5px] w-[10px] shrink-0"></div> <div class="caption-content"> Gemini Robotics 2 为机器人带来全身智能。 </div> </div> </div></div> <p>这一切始于 Gemini Robotics ER 2,这是 DeepMind 声称较<a href="https://arstechnica.com/ai/2026/04/robot-dogs-now-read-gauges-and-thermometers-using-google-gemini/">1.6 版本</a>有重大飞跃的升级版“具身推理”模型。它与 Gemini Live API 集成,让开发者有机会体验这一所谓的飞跃。</p><p><a href="https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/">阅读全文</a></p> <p><a href="https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/#comments">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/07/31 17:00

# 谷歌发布 Gemini Robotics 2.0,承诺更强的灵巧性与安全性 来源:https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/ 跳转到内容 (https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/#main) 停下,协作,倾听 Gemini Robotics 2 包含三个模型,但目前只有一个公开可用。 由谷歌 Gemini AI 模型驱动的机器人现在变得更加强大。随着 Gemini Robotics 2 的首次亮相 (https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/),这些实体机器人现在可以完成更复杂的任务,持续分析不断变化的环境,并与其他机器人协作。这要归功于三个新的子模型,其中一个从今天起向开发者公开可用 (https://ai.google.dev/gemini-api/docs/robotics-overview)。 机器人奔跑、跳舞和后空翻的视频多年来一直是互联网的标配内容,但这些机器只是被编程来执行这些非常狭窄的任务。Gemini Robotics 的目标是打造一个通用型机器人,一个能完成人类能做的任何事情的机器。谷歌 DeepMind 的科学家有时称之为“物理 AGI”。本质上,你告诉机器人要做什么,它就去做。随着 2.0 版本的发布,谷歌表示其机器人 AI 可以控制整个仿人机器人,拥有更强的灵巧性,即使是配备复杂仿人手的机器也不在话下。 Gemini Robotics 2 为机器人带来了全身智能。 这一切始于 Gemini Robotics ER 2,一个升级版的“具身推理”模型,DeepMind 声称这是相比之前的 1.6 版本 (https://arstechnica.com/ai/2026/04/robot-dogs-now-read-gauges-and-thermometers-using-google-gemini/) 的一大飞跃。它与 Gemini Live API 集成,让开发者有机会体验这一所谓的飞跃。 Gemini Robotics ER 2 是一种所谓的视觉语言模型(VLM)。它旨在理解指令和周围的世界。这次升级的重点在于,ER 2 可以处理来自机器人摄像头的实时视频流,使系统能够在机器人一步步执行任务时跟踪进度。谷歌指出,Gemini Robotics ER 2 对视频帧完整性的分类准确率接近 60%。这虽然还远远不够完美,但已经比 1.6 版本或竞争 AI 模型的视觉理解能力好得多。 [](https://cdn.arstechnica.net/wp-content/uploads/2026/07/ER_metrics_comparison_Chart.width-1200.format-webp.png) Gemini Robotics ER 2 在理解世界方面优于其他模型,但差距并不大。 图片来源:Google Gemini Robotics ER 2 在理解世界方面优于其他模型,但差距并不大。图片来源:Google 在视频流中定位特定时刻也是正确完成任务的关键。当你让机器人倒一杯咖啡时,你肯定希望它知道何时停止倒水。ER 2 显然在这方面做得更好,识别关键时刻的准确率接近 90%。当机器人执行多步骤任务时,具身推理模型能让它们实时理解失败。系统可以只重试失败的那一步,而不是从头再来。例如,如果机器人试图捡起的球滚走了,或者有人移动了容器,机器人只需重新调整手的位置和动作即可。 新的具身推理版本还赋予了谷歌 DeepMind 升级版机器人 AI 协作能力。视频演示中,Apptronik 的 Apollo 2 和更简单的 Franka F3 Duo 在不互相妨碍的情况下共同完成一项任务。虽然测试机器人仍然无法匹敌人类的速度或优雅,但视频演示中包含大量机器人实时运行的镜头,它们看起来确实比过去的测试中少了很多犹豫。 Gemini Robotics 2 的多机器人协作。 理解只是第一步——让机器人在物理世界中移动是另一个模型的职责。在规划好任务之后,视觉语言模型会将工作交给一个升级版的视觉-语言-行动模型,简称为 Gemini Robotics 2。这个 AI 模型以生成其他生成式系统创建文本或图像的方式,从指令中生成机器人动作。还有一个低延迟的离线版本,名为 Gemini Robotics On-Device 2。这些模型目前仅限于一小部分测试者使用。 谷歌还在波士顿动力的硬件上测试 Gemini Robotics 2。 谷歌还在波士顿动力的硬件上测试 Gemini Robotics 2。 谷歌表示,新的动作模型在准确性和效率上都有大幅提升。即使是较小的设备端版本,也能仅凭几小时的移动数据(约 200 个示例)就适应新的机器人设计。 ## 防范机器人末日 AI 幻觉的问题目前已经广为人知,但当 AI 以物理形态与人类共享空间时,犯错可能造成的伤害要大得多。随着每次 Gemini Robotics 的发布,谷歌 DeepMind 都强调它认真对待这一风险。据 DeepMind 称,Gemini Robotics 的每一层都融合了“传统的物理安全措施与强大的 AI 安全框架”。 随着 Gemini Robotics 2 的发布,一个新的安全基准测试也一同问世,名为 ASIMOV-Agentic。该测试从多种安全因素角度评估模型。它可以评估具身推理代理是否会拒绝来自 VLA 的不安全工具调用。它还可以判断给定任务是否能在安全的前提下完成,以及模型在不确定安全性时是否能够请求人工协助。 谷歌 DeepMind 指出,Gemini Robotics ER 2 是该团队迄今为止最安全的模型,展现出对安全问题的强大理解能力,并能在人类离机器人太近时停止动作。谷歌的新安全基准测试已在 Hugging Face 上完整公开 (https://huggingface.co/datasets/google/asimov_agentic/blob/main/README.md)。 Ryan Whitwam 的照片 (https://arstechnica.com/author/ryanwhitwam/) Ryan Whitwam 是 Ars Technica 的高级科技记者,负责报道谷歌、AI 和移动技术如何持续改变世界。在他 20 年的职业生涯中,他曾为 Android Police、ExtremeTech、Wirecutter、纽约时报等媒体撰稿。他评测过的手机比大多数人一辈子拥有的还要多。你可以在 Bluesky 上关注他 (https://bsky.app/profile/rwhitwam.bsky.social),在那里你会看到他几十把机械键盘的照片。 38 条评论 (https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety/#comments) 1. 热门阅读中第一篇文章的列表图片:太空部队支持的任务在轨道上上演了最佳《壮志凌云》模仿秀 (https://arstechnica.com/space/2026/07/space-force-backed-mission-does-its-best-impression-of-top-gun-in-orbit/)

相似文章

Gemini Robotics 将 AI 引入物理世界

Google DeepMind Blog

Google DeepMind 推出 Gemini Robotics,这是一个基于 Gemini 2.0 的视觉-语言-动作模型,可以控制物理机器人,具有更强的通用性、交互性和灵巧性。该公司还推出了用于空间推理的 Gemini Robotics-ER,并与 Apptronik 合作开发人形机器人。

Gemini Robotics 2 将谷歌AI带入物理世界

Wired

谷歌DeepMind发布了Gemini Robotics 2,这是一个结合了视觉语言和视觉语言动作模型的AI模型,用于控制人形机器人完成复杂的物理任务,如拧灯泡和整理货架。

Gemini Robotics 2 为机器人带来全身智能

Hacker News Top

DeepMind 推出 Gemini Robotics 2,这是一组 AI 模型(VLA、ER、On-Device),使机器人能够进行全身控制、精细操作和多机器人协作,支持本地设备端执行,并能快速适应新的机器人本体。

Gemini Robotics 1.5 将 AI 智能体带入物理世界

Google DeepMind Blog

Google DeepMind 推出 Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5,推进了物理 AI 智能体的发展,这些智能体能够感知、规划、思考和行动来完成复杂的多步骤任务。Gemini Robotics-ER 1.5 现已通过 Gemini API 向开发者提供。