2026年7月9日 Frontier Red Team Claude 操作机器人

Anthropic Research 论文

摘要

Anthropic 在各种机器人任务上测试了 Claude 模型,发现性能在很大程度上取决于控制接口——模型在监督预训练策略时成功,但在直接控制关节时失败——这表明语言模型能力向物理领域的迁移在不断增长但不均衡。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/13 16:53

# Claude 在机器人任务中的表现如何 来源:https://www.anthropic.com/research/claude-plays-robotics 语言模型的优势能否迁移到机器人领域——一个需要综合逻辑技能和精确三维理解的领域?模型能否感知场景、理解特定机器人的状态,并发出能在物理世界中可靠产生效果的动作? 我们进行了一系列测试来寻找答案。我们让多个语言模型控制多种机器人形态——包括经典控制玩具、模拟的四足和双足机器人、机械臂,以及真实的 Unitree Go2(即 Project Fetch 的四足机器人)。我们为模型提供了多种控制方式,这些方式在抽象程度上各不相同(即指令的"高层"程度),从直接指令电机扭矩(最不抽象的一端),到编写控制器代码,再到通过强化学习从头训练控制器,以及向预训练的机器人策略(一个将高层指令转化为协调关节运动的独立神经网络)提供高层引导指令。我们测试了模型在三个方面的表现:经典控制问题(如平衡摆锤)、运动与导航(让腿式机器人保持平衡、行走和移动),以及操控(使用机械臂抓取和移动物体)。 模型在机器人领域的能力进步迅速,但我们发现其能力水平很大程度上取决于它们如何连接到机器人——即使用了哪种控制方式。当模型必须自己驱动关节时,它们大多失败。但当它们监督预训练控制器或使用简单的定向工具时,它们可以完成真实的导航和操控任务。某些形态仍然笨拙且难以控制,但较新的模型,特别是在跨领域调整策略以及将图像和感官理解转化为适当动作方面,表现出了显著增强的能力。 这对于语言模型的安全开发和部署具有重要意义。当今的前沿模型无法在没有预训练策略的情况下控制人形机器人,但较新的模型在我们测试的人形和四足形态上,在直接操控和高级策略控制方面取得了实质性进展。我们预计未来模型会做得更好。具体来说:一个没有经过机器人训练的通用聊天模型,在运行顺利时,已经可以编写并下载自己的工具,让四足机器人缓慢地穿过迷宫,或者从台面上拿起盘子放到炉子上,而可靠性的差距正在随着每一代模型的更新而缩小。 条形图显示每个模型在不同接口下的形态得分。Mythos Preview 得分最高,为 0.389;Opus 4 得分最低,为 0.115。Embody 基准套件的综合得分按模型和接口堆叠显示。综合得分是套件中所有机器人形态和任务归一化后的平均值(高层运动任务除外);条柱越高表示物理能力越广泛。 ## 主要发现总结 - **模型的机器人得分与机器人体和控制接口的相关程度,不亚于与模型本身的相关程度。**同一个模型看起来是弱还是强,取决于它是在直接设置电机扭矩、编写 Python 控制器、监督预训练策略,还是使用强化学习训练自己的策略——这些都是模型完成同一任务的不同方式。对于最难控制的形态(特别是人形),当今的模型只有在使用高层抽象接口(预训练策略处理底层物理)时才能取得进展。 - **模型在机器人领域的能力正在提升,但提升不均衡。**模型代际之间最稳定的性能提升出现在高层接口上。直接的底层控制也在提升,但提升非常不均衡:一些新模型明显优于其前代,但另一些则没有。 - **在运动任务上,前沿模型现在能够实现有限但有意义的全身控制。**较新的模型在四足站立、平衡和行走的底层控制上取得了进展——在人形平衡方面也有较弱但可测量的提升。结合预训练策略和感知工具,它们甚至可以导航简单的环境。然而,模型在需要稳定空间记忆、自我定位或长时间开环规划的任务上仍然失败。 - **在使用低级操控方法时,模型开始产生有用的局部物理行为,尽管完整任务的成功率仍然很低。**较新的模型在接近物体、建立接触和抓取方面表现更好。然而,它们只在很小比例的情况下能完成完整任务(0% 到 5.5%)。 - **在使用高级操控方法时,结合预训练策略的较新模型更加成功。**视觉-语言-动作(VLA)框架——将摄像头图像和指令直接映射到机械臂运动的预训练策略——将模型的操控性能提升到远高于直接控制的水平。较新的模型也日益成为这些策略的更好监督者:它们能更好地识别提议的动作何时会失败,不那么倾向于不加区分地听从 VLA,因此在操控任务上取得了进一步进展。监督策略仍然会牺牲一些性能——组合系统比单独运行的 VLA 表现差——但最好的监督者现在几乎弥补了大部分差距。这并不意味着监督无用:早期模型会破坏策略的大部分价值,当前最好的模型能恢复大部分价值,而在 VLA 无法独立完成的任务上,最强的模型已经能提供净提升。 ## 简单场景 我们首先在一组简单的控制任务上评估与机器人相关的能力,包括经典的强化学习问题,例如平衡倒立摆和控制一个跳跃器。 尽管这些是简化环境,但我们认为它们要求模型推理动力学、随时间变化的因果效应以及基础物理——这些能力是更通用的物理理解的重要前兆。在这些低维环境中,传感器数据提供了几乎所有必要信息,因此几乎不需要视觉输入就能解决。这类低维控制也出现在一些现实场景中,例如相机稳定。 我们通过四种控制接口在 Mujoco 模拟引擎中进行评估。(在整个报告中,"经典控制"命名了这一系列玩具任务;"直接控制"命名了以下四种接口之一——它们是独立的维度。)在我们称之为**直接控制**的方式中,模型在每一步选择底层动作,如扭矩或力。在**程序化控制**中,模型编写一个 Python 控制器,在执行期间将观测映射到动作。在**策略控制**中,模型可以访问预训练策略并发出高层命令,通常是自然语言。在**强化学习监督**中,模型训练一个策略,然后在测试时部署学到的策略。 为了近似直接控制性能的上限,我们在 LLM 调用之间暂停模拟器,这样实时延迟就不会主导结果。如果不这样做,许多直接测试会因为一个琐碎的原因而失败:模型的反应速度太慢,无法控制环境。我们预计推理速度会持续提升,这种设置可以清晰地展示最优情况下的能力。 我们还设计了评估方法,以考虑到许多经典 RL 任务频繁出现在预训练语料中这一事实,这可能会限制我们的结论对新颖环境的泛化能力。为了解决这个问题,我们保留倒立摆和跳跃器任务作为控制任务,但引入了一个基于弹球街机游戏的新任务。在 TwinFlipper 中,智能体控制一组挡板,并试图最大化球的总滞空时间——在球掉到挡板下方之前,球保持在指定高度阈值以上且不触碰任何物体的累计时间。虽然一个天真的解决方案是直接把球向上猛击,但通过小心地以受控方式上下弹球,可以获得更长的滞空时间。这个任务被设计为具有少量自由度的混沌动态系统的代表性例子,并且所有模型之前都未见过。 显示 AI 智能体控制一组挡板的游戏可视化,旨在最大化球的滞空时间。Opus 4.6 的最佳经典控制运行。 六个条形图显示不同 AI 模型在各种任务上的经典控制性能,包括直接控制和代码控制:摆锤平衡(直接和代码)、跳跃器速度(直接和代码)以及 TwinFlipper 滞空时间(直接和代码)。模型在经典控制上的性能。 虽然单个任务的性能有噪音,但纵观所有经典控制基准,可以看到一致性的代际改进。Claude Opus 4.6 和 Opus 4.5 在几乎所有任务上都优于两个早期版本,除了 TwinFlipper 直接控制(所有模型表现都差)和跳跃器速度(这是我们噪音最大的任务)。尽管如此,后两个模型在代码控制、强化学习以及较小程度上的直接控制方面都显示出显著改进。 我们的结果表明,大部分改进来自于在看到先前结果后更好地调整和相应修改策略的能力。在具有自然终止点的任务上(最明显的是 TwinFlipper 和 Pendulum),各模型的首次尝试平均性能相当,Claude Opus 4 和 Opus 4.1 在此指标上略优于后来的模型。更大的收益出现在后续尝试中,后来的模型改进幅度大得多。Claude Mythos Preview 是一个显著的例外;它在 Pendulum 上的许多首次尝试更加稳健。 三个条形图显示模型在训练 RL 策略以执行三项任务时的经典控制性能:摆锤平衡、跳跃器速度和 TwinFlipper 滞空时间。模型从头训练 RL 策略时的性能。 几乎所有模型在训练 RL 策略时的表现都比创建 Pythonic 控制器时差。TwinFlipper 是个例外,GPT-5.4 是唯一能持续学到合格策略的模型。考虑到它在其他控制接口下的表现相对较差,这一点引人注目。在 Pendulum 和 Hopper 上情况不同:Mythos Preview 领先,GPT-5.4 紧随其后,模型间的差距要小得多。在所有三个任务上,较新的 Claude 模型相比旧模型有显著改进。 在目标难以指定的任务上,如 Hopper 和 TwinFlipper,RL 性能正在提升但仍落后于代码控制。这并不意外:让模型训练自己的 RL 策略需要解决复杂的设置问题,从定义环境和奖励,到管理更长的迭代周期以及做出多个相互依赖的设计选择。虽然不是每一代 Claude 都显示出同样的改进程度,但更广泛的趋势是明确的:RL 能力随着时间的推移而进步。 ## 直接控制效果差,但正在改进 ### 底层运动 下一个问题是,在简单控制中看到的收益是否会延续到具有更多自由度的机器人上。为了测试这一点,我们在两个代表性平台上评估了底层运动:29 自由度的 Unitree G1 人形机器人和 12 自由度的 Unitree Go2 四足机器人。我们注意到,与玩具任务相比,这个领域既有更高的贡献上限,也有更大的风险。训练稳健的人形和四足机器人策略是困难的,但一旦训练完成,它们就会被部署在错误对齐的行为可能导致严重身体伤害的环境中。 这些是复杂的机器人,对它们进行数值控制具有挑战性。与在简单任务中控制几个耦合变量不同,模型必须协调许多关节,同时持续补偿重力、惯性和接触力。这是**非常**不宽容的:即使是最小的错误,如果不立即纠正,也可能破坏整个底盘。 考虑到这种难度,我们在两项核心任务上评估模型:从倒塌状态站起来,以及从直立状态开始尽可能长时间地保持平衡。我们最初探索了更复杂的任务和起始条件,但这些设置通常超出了即使是前沿模型的能力范围。然而,我们的四足试验结果令人鼓舞,因此我们还评估了通过程序化方式让 Go2 机器人向前行走的能力。 我们使用三种控制接口:直接控制、程序化控制和强化学习。与经典任务一样,在直接设置中,我们在 LLM 调用之间暂停模拟器,这样实时延迟就不会成为限制因素。实时控制大约需要 83Hz;当前的非推理推理以约 0.2-0.4 Hz 运行,因此缩小这一差距需要大约两个数量级的延迟改进。 三个带有性能区间的条形图显示各种 AI 模型在直接控制四足机器人时的性能。Go2 四足机器人的直接底层控制。 四个条形图显示各种 AI 模型在利用代码控制控制四足机器人运动时的性能。程序化运动控制。 虽然对四足机器人的直接底层运动控制对所有模型来说都很难,但许多模型擅长程序化控制。Opus 4.6、4.7 和 Claude Mythos Preview 成功让 Go2 机器人保持平衡近两秒钟,足以展示稳定平衡且足够快以便迭代,这使用了扭矩力控制和 Pythonic 控制器。Gemini 3.1 和 GPT-5.4 也有类似强大的控制器,尽管它们在直接控制电机时落后甚远。在直接控制下,Opus 4.6 能让机器人保持平衡,但无法成功让它站起来。 两张 AI 控制人形机器人的计算机渲染图。第一张标记为"Opus 4.6 (Python controller)",机器人站立但开始向一侧扭转躯干。第二张标记为"zero commands (passive)",机器人倒塌在地。模型控制下的人形机器人。 G1 人形机器人是我们研究中最难的平台,结果较弱但正在改进。在我们的试验中,没有模型成功让机器人从倒塌姿势站起来哪怕一次。尽管如此,从 Opus 4 到 4.7,在让已经处于站立姿势的机器人保持平衡方面,我们观察到可测量的进步。 两个条形图显示各种 AI 模型在控制人形机器人时的性能。更先进的模型在"Go2 Stand"任务上表现尚可,但所有模型在"G1 Stand"任务上都失败。Go2 和 G1 上的程序化 vs. 训练策略控制。 我们还评估了模型训练运动策略的能力。为此,我们给模型提供了一个可以访问 GPU 和可视化环境的训练框架,并让它控制奖励函数、训练环境和模型架构。在四小时内,GPT-5.4 和 Claude Mythos Preview 持续训练出最有能力的 RL 策略,证实了我们之前在经典 RL 任务上的结果。我们在 Claude 系列内部也观察到了进展,性能从 Opus 4 提升到 Opus 4.6,并在 Mythos Preview 上进一步提升。 所有这些结果都应该被恰当地解读。例如,如果我们将四足机器人的初始位置随机化(包括使其仰面朝天),Opus 4.6 就连一次也无法让它站起来。此外,当

相似文章

2026年6月18日 Frontier Red Team Project Fetch: 第二阶段

Anthropic Research

Anthropic 重新启动 Project Fetch,以比较 Claude 在机器人任务中的自主表现。Claude Opus 4.7 完成任务的速度比最快的人类团队快 20 倍,展现了人工智能在物理世界交互方面的快速进步。

2026年4月9日政策:实践中的可信智能体

Anthropic Research

Anthropic 发布了一篇研究文章,详细阐述如何在实践中构建可信的 AI 智能体,概述了核心安全原则以及 Claude Code 和 Claude Cowork 等产品实现。