Gemini Robotics 2 将谷歌AI带入物理世界
摘要
谷歌DeepMind发布了Gemini Robotics 2,这是一个结合了视觉语言和视觉语言动作模型的AI模型,用于控制人形机器人完成复杂的物理任务,如拧灯泡和整理货架。
谷歌DeepMind最新版本的AI模型在“物理AGI”方面取得了重大突破。但将AI投入现实世界也伴随着风险。
查看缓存全文
缓存时间:
2026/07/30 15:57
# Gemini Robotics 2 将谷歌人工智能带入物理世界
来源:https://www.wired.com/story/google-gemini-can-control-humanoid-robots/
谷歌 DeepMind 刚刚发布了其人工智能模型 Gemini(https://www.wired.com/tag/google-gemini/)的新版本,它可以控制一系列不同的机器人,包括能够执行拧灯泡、系垃圾袋等灵巧任务的人形机器人(https://www.wired.com/story/nvidia-unitree-humanoid-robot-h2-plus/)。
Gemini Robotics 2 将多个不同的人工智能模型整合到一个系统中。这些模型共同让机器人能够理解自身环境并知道如何在其中行动。一个视觉语言模型(VLM)能理解图像和视频,可以与人类交流并推理如何执行不同的任务。两个视觉语言动作模型(VLA)经过训练,能够理解如何在物理空间中移动,从而控制机器人的全身动作以及夹爪或手部的运动。
在发布前分享的视频演示中,该公司(https://www.wired.com/tag/deepmind/)展示了多个不同的机器人使用这个整合模型自主完成复杂任务。在一个演示中,Apptronik 的 Apollo 2 机器人使用来自 Sharpa 公司的手部装置整理货架。谷歌 DeepMind 通过结合人类远程操作、视频示例和模拟来训练模型执行这些任务——目前人工智能模型还无法在未经特定训练的情况下执行广泛的复杂任务。
尽管 Anthropic(https://www.wired.com/tag/anthropic/)和 OpenAI(https://www.wired.com/tag/openai/)在聊天机器人和 AI 编程工具方面处于领先地位,但谷歌在机器人研究领域拥有更强劲的业绩记录,并且已经发表了使用 AI 训练机器人完成有用任务的重要工作(https://say-can.github.io/)(https://sites.research.google/palm-saycan)。此次发布再次表明,这家搜索巨头正押注于人工智能需要突破数字领域才能实现其全部潜力。(它此前曾与腿足机器人领域的领导者波士顿动力公司(https://www.wired.com/story/google-boston-dynamics-gemini-powered-robot-atlas/)合作,为那些机器提供“大脑”。)
“这标志着我们向着真正实现所谓物理 AGI 迈出了又一步,物理 AGI 意味着让机器人能完成任何人类能做的事情,”谷歌 DeepMind 机器人部门负责人 Carolina Parada 告诉 WIRED。
然而,让前沿 AI 模型接入机器人,使其能够在工作场所或家庭中自由移动并操作物体,也伴随着风险。此前的研究表明,使用前沿 AI 控制机器人可能会产生意外甚至危险的行为(https://www.wired.com/story/researchers-llm-ai-robot-violence/)。最近,OpenAI 开发的一个未发布 AI 代理入侵了多个系统(https://www.wired.com/story/openais-rogue-ai-agent-hacked-nore-than-just-hugging-face/)(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/),这使人们认识到这些模型在数字领域可能突然采取意外或不当行为。
“安全问题变得更加紧迫,因为你把它们放到了更多不同的场景中,”Parada 说。“会出现很多不确定性,所以你需要更深入地理解安全问题。”
Parada 表示,谷歌采用多层安全方法,在每个模型层都设置了护栏。它还引入了 ASIMOV-Agentic,这是一个新的基准测试,用于衡量多个 AI 系统协同控制机器人时的安全性。该基准测试可以检测一个指令是否会导致有害或不确定的结果。
该公司首席执行官 Demis Hassabis 此前告诉 WIRED(https://www.wired.com/story/google-hires-cto-boston-dynamics-demis-hassabis-android/),他希望开发一个适用于多种不同机器人的 AI 操作系统,类似于适用于智能手机的 Android 操作系统。
相似文章
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics,这是一个基于 Gemini 2.0 的视觉-语言-动作模型,可以控制物理机器人,具有更强的通用性、交互性和灵巧性。该公司还推出了用于空间推理的 Gemini Robotics-ER,并与 Apptronik 合作开发人形机器人。
Google DeepMind Blog
Google DeepMind 推出 Gemini Robotics 1.5 和 Gemini Robotics-ER 1.5,推进了物理 AI 智能体的发展,这些智能体能够感知、规划、思考和行动来完成复杂的多步骤任务。Gemini Robotics-ER 1.5 现已通过 Gemini API 向开发者提供。
Ars Technica
Google 发布了 Gemini Robotics 2.0,这是一组用于机器人的 AI 子模型,可提升灵巧性、实时视频理解和机器人协作能力,其中具身推理模型已向开发者公开。
Hacker News Top
DeepMind 推出 Gemini Robotics 2,这是一组 AI 模型(VLA、ER、On-Device),使机器人能够进行全身控制、精细操作和多机器人协作,支持本地设备端执行,并能快速适应新的机器人本体。
The Verge
Google DeepMind 发布了 Gemini Robotics 2,这是一种能控制整个类人机器人做出全身动作、提升灵活度的 AI 模型。同时,该更新还引入了具身推理能力、端侧模型,以支持多机器人协同与安全保障。