机器人操作中的Agent as Policy

arXiv cs.CL 论文

摘要

本文介绍了Agent as Policy (AGP),这是一个框架,使通用智能体无需针对特定任务训练,即可直接控制物理机器人执行操作任务,在各种现实场景中实现高成功率。

arXiv:2609.12541v1 公告类型:新 摘要:我们展示了一个通用智能体可以在没有任何特定任务或环境训练的情况下,直接驱动物理机器人完成整个任务执行过程。我们引入了Agent as Policy (AGP),将任务规划和执行置于智能体的控制之下。给定一个任务和一个机器人接口,智能体解释视觉证据,编写可执行程序,发出运动命令,并根据物理结果修正其动作。这使智能体的推理和编程能力与物理世界进行持续交互。我们在多个现实世界的操作任务上研究AGP,涵盖精确操作、动态运动和可变形物体。这些任务包括从人类视频中组装、从目标图像构建积木、骰子重定向、定向投掷和双臂毛巾折叠。AGP在三种积木构建配置上分别实现了100%、100%和80%的成功率。这些发现为通用智能体作为机器人策略开辟了道路,通过运行时推理、编程和交互,扩展其自主性到物理操作。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:37

# 用于机器人操控的智能体即策略
来源:https://arxiv.org/html/2609.12541

杨林 (Yang Lin)、Xixin 张 (Xixin Zhang)
所属机构:圣母大学、加州大学圣地亚哥分校、圣地亚哥州立大学
\*核心贡献者:张志涵 (Zhihan Zhang)
所属机构:[mjia2@nd\.edu](mailto:[email protected])

刘晓白 (Xiaobai Liu)、蒋孟 (Meng Jiang)
所属机构:圣母大学、加州大学圣地亚哥分校、圣地亚哥州立大学
\*核心贡献者
所属机构:[mjia2@nd\.edu](mailto:[email protected])

###### 摘要
我们证明了一个通用智能体可以在无需任何任务特定或环境特定训练的情况下,直接在任务执行过程中驱动物理机器人。我们引入了**智能体即策略**(Agent as Policy, AGP),将任务规划和执行置于智能体的控制之下。给定一个任务和一个机器人接口,该智能体能够解读视觉证据、编写可执行程序、发出运动命令,并根据物理结果修正其动作。这使得智能体的推理和编程能力能够与物理世界进行持续交互。我们在多个跨越精密操作、动态运动和可变形物体的真实世界操控任务中研究了AGP。这些任务包括从人类视频进行组装、从目标图像进行积木构建、骰子重定向、定向投掷以及双臂毛巾折叠。AGP在三种积木构建配置上分别达到了100%、100%和80%的成功率。这些发现为通用智能体充当机器人策略建立了一条路径,通过运行时推理、编程和交互,将其自主性扩展到物理操控领域。

## 1 引言

参见图注
图1:AGP概述。(a) 评估的任务包括视频引导的组装、图像引导的构建、骰子重定向、定向投掷和双臂毛巾折叠。(b) 准备智能体创建一个可重用的任务定义。在运行时,执行智能体编写并选择程序来解读观测结果、计算运动目标,并通过机器人接口请求机器人动作。每次动作后,智能体利用运动反馈和新的观测结果来细化其估计并调整后续动作。

多模态大型语言模型(MLLMs)展现出强大的通用能力(Li等,2026b)。基于这些模型构建的智能体可以处理诸如软件开发和计算机操作等数字任务(Yang等,2024;Wang等,2024;Xie等,2024)。最近的研究将这些智能体扩展到了机器人操控领域,将其任务执行能力从数字环境带入了物理世界(Li等,2026a;Zhang等,2026;Galanti等,2026)。

这些智能体机器人系统大致遵循两种方法。第一种方法使用智能体提前生成可执行程序,表现为代码或计算图,由机器人在任务执行期间运行(Liang等,2022;Chen等,2026)。第二种方法使用智能体作为现有学习策略的协调者,根据任务目标和执行反馈来选择和排序这些策略(Li等,2026a;Zhang等,2026;Galanti等,2026)。然而,这两种方法都有局限性。生成的程序必须通过明确的规则来表达运行时决策,这使得难以预测不确定的观测和意外结果应如何影响执行。策略协调赋予了智能体控制下一个运行哪个策略的能力,而运动生成仍然受限于所选策略能执行的操作。然而,物理任务通常需要灵活性来适应证据的解读方式以及动作的生成方式。例如,在一次插入失败后,机器人可能需要更近的视图、修正的对准估计或不同的接近方向。选择并执行适当的响应需要结合当前场景、尝试的动作及其结果进行联合推理。

为此,我们引入了**智能体即策略**(AGP),它在整个任务执行过程中使用智能体本身作为策略。我们赋予智能体在运行时任务决策上的完全自主权:它决定观察什么、如何解释证据、以及请求哪个动作,并能根据需要编写和修改本地程序。每次结果都会为下一个决策提供信息,包括是收集更多证据还是改变执行策略。这使得智能体能够在新的物理证据可用的层面上控制感知、运动生成和恢复。

我们通过将一个通用编码智能体通过一个桥接器连接到机器人来实现AGP,该桥接器暴露了标定的观测、几何查询和运动命令(图1)。编码智能体提供了用于创建脚本、检查数据和保留执行证据的编程工具和持久化工作区。通过这些工具,它可以计算物体几何形状、评估候选动作,并利用机器人的反馈修改动作序列。该桥接器将这些计算基于相机标定和机器人坐标进行具身化,验证请求的运动,并返回测量状态和执行报告。它还支持协调的关节和夹爪运动,适用于依赖时序的动作。运动执行和监控独立于智能体推理运行,允许机器人执行提交的运动,同时智能体在工具调用之间进行推理。适应性通过会话内的更新测量、程序和决策实现,而模型参数在整个执行过程中保持固定。

我们直接在真实机器人上评估了AGP,任务包括从人类视频进行组装、从目标图像进行积木构建、骰子重定向、定向投掷和双臂毛巾折叠。在主要评估中,每次试验都在一个全新的会话中开始,模型权重固定,没有先验的任务执行经验或模拟演练。AGP在八个任务配置中的七个取得了至少80%的成功率,包括在三种积木构建配置中15次试验成功14次,以及在骰子重定向中5次试验成功5次。在不同配置下,成功试验的平均完成时间从20.6分钟到54.3分钟不等,每次成功试验的平均推理成本从7.46美元到27.41美元不等。我们还探索了在两个组装任务中重用经验,并观察到其对任务执行时间的益处因任务而异。

这项工作提供了证据,表明通用基础MLLM可以通过机器人接口作为直接控制机器人手臂的策略。它们的视觉感知和推理能力支持在零样本操控中解读任务目标、生成动作并适应物理反馈。大量的执行时间和推理成本仍然是实际部署的障碍。我们希望这项研究能为未来利用基础MLLM的强大能力实现更强大、更高效的机器人操控的研究提供见解。

## 2 相关工作

### 2.1 智能体机器人系统

智能体机器人系统使用语言模型进行推理、工具使用和通过执行反馈进行适应,智能体在其中扮演两个主要角色。

**程序合成与精炼。**
一条研究路线生成将观测映射到动作的程序,通过感知和控制接口实现,并通过验证支持在模拟和物理机器人上的执行(Singh等,2022;Liang等,2022;Chen等,2024;Mu等,2024)。最近的研究使用执行证据来迭代地精炼程序或计算图,并保留可重用的解决方案(Lu等,2026)。AGP在部署期间将一个运行时智能体保持在决策循环中,允许其根据观测和执行反馈选择新方法、编写新程序并修改工作流。

**运行时策略协调。**
第二条研究路线根据任务目标、可供性和环境反馈来选择和排序学习到的技能(Ahn等,2022;Huang等,2022)。最近的系统将这种方法扩展到了视觉-语言-动作策略,并增加了进度监控和恢复机制(Li等,2026a;Zhang等,2026;Galanti等,2026)。这些系统将技能选择与被调用策略或原语内的运动生成分离开来。AGP使用运行时智能体本身作为策略,而无需单独训练的动作策略,从而在以前未见过的环境中实现零样本任务执行。

### 2.2 机器人操控

经典机器人操控结合了几何建模、任务和运动规划以及反馈控制(Garrett等,2021)。学习到的视觉运动策略从机器人轨迹数据中预测动作,其中扩散模型可以捕获动作序列(Chi等,2023)。视觉-语言-动作模型通过图像和语言条件将这种方法扩展到各种任务(Brohan等,2023;Kim等,2024;Black等,2024)。视频和世界动作模型进一步将动作与未来的视觉状态相结合,以指导动作生成和评估(Li等,2025;Ye等,2026)。AGP提出了一种替代专门训练的动作生成策略的方法,直接使用通用基础多模态大型语言模型(MLLM)作为机器人策略。

### 2.3 超越机器人领域的智能体工作流

语言智能体结合了推理、工具使用以及对交互反馈的反思(Yao等,2022;Schick等,2023;Shinn等,2023)。编码智能体将这些机制应用于软件的编辑和测试(Yang等,2024;Wang等,2024),而计算机使用智能体则通过浏览器和桌面界面进行操作,并适应界面变化(Zhou等,2023;Xie等,2024)。多智能体框架在专门的角色之间分配工作流,这些角色进行通信并共享中间结果(Wu等,2023;Hong等,2023)。这些工作流为工具使用、记忆、反馈和协调建立了机制。AGP研究它们如何塑造机器人策略的边界,智能体通过感知、几何、规划和控制接口来管理物理任务的执行。

## 3 作为机器人策略的通用智能体

### 3.1 问题表述

**任务目标。** 我们考虑通过视频指令、图像指令、语言指令或这些组合来指定的物理操控任务。一个机器人在一个持久化的场景中运行,目标是在固定的时间预算以及观测和动作请求预算内,将该场景带入满足任务标准的状态。

**任务准备。** 当一种任务类型首次引入系统时,一个单独的编码智能体会根据用户的请求准备一个可重用的任务定义。此智能体仅在任务准备阶段运行。另一个智能体,即执行智能体,在运行时执行任务。此定义指定了目标、参考资料、约束、允许的变体和完成标准,以及接口访问规则、预算和报告要求。对于现有任务类型的后续实例,启动程序会使用保存的定义和当前实例的详细信息直接启动执行智能体。执行智能体读取提供的材料并执行请求的实例。

**智能体作为机器人策略。** 我们使用一个通用智能体作为机器人策略。该智能体接收任务规范 \( g \),包括提示和参考资料,以及文档化的机器人接口 \( I \)。它维护一个本地工作区 \( W \),包含在执行期间收集的脚本、注释和观测结果。智能体解读任务、规划动作并通过工具与机器人交互。我们将其工具选择过程描述为 \( u_{k} \sim \pi_{\theta}(\, \cdot \mid g, I, H_{k}, W_{k}) \)(公式1),其中 \( u_{k} \) 是在步骤 \( k \) 选择的工具调用,\( H_{k} \) 包含在该步骤可用的对话和工具结果,\( W_{k} \) 包含当前工作区文件。工具调用可以获取信息或执行一个将动作目标提交给机器人控制器的程序。模型参数 \( \theta \) 在整个执行过程中保持固定。

### 3.2 智能体到机器人的桥接

机器人接口 \( I \) 支持两个方向的信息交换。机器人向智能体提供相机观测和本体感受状态。智能体通过此接口发送观测或动作请求。这些交换共同使得智能体能够观察场景、指导物理动作并评估结果状态。

**机器人到智能体。** 接口提供两个信息源。相机提供俯视图像以查看场景,以及带有对齐深度的腕部图像用于近距离检查和空间测量。相机标定和位姿将这些观测关联到一个共享的机器人坐标系。机器人的状态接口提供来自电机反馈的关节位置,以及通过正向运动学计算的相应末端执行器位姿。这种本体感受状态描述了机器人的当前构型,并支持与命令目标进行比较。运动后,接口返回可用的更新状态以及基于此状态计算的目标误差。观测结果保存在智能体的工作区中,用于视觉检查和程序处理。

**智能体到机器人。** 智能体通过接口发送请求。这些包括观测请求(要求机器人系统捕获图像或报告其状态)和动作请求(指定手臂运动或夹爪开合)。对于手臂运动,智能体可以选择指定目标关节角度或指定目标末端执行器位置和方向。后者描述了将夹爪放置在何处以及如何定向。夹爪请求则单独指定手指应张开或闭合的程度。为了执行这些请求,机器人使用控制器将智能体的目标转化为驱动其关节和夹爪的命令。对于末端执行器目标,它使用Mink(Zakka,2026)进行逆向运动学计算以求得关节目标。然后它生成满足工作空间和运动限制的关节轨迹。

相似文章

机器人操作中的Agent策略

Hugging Face Daily Papers

一个通用代理通过解读视觉证据、编写可执行程序,并基于物理反馈在多样化的操作任务中调整动作,直接控制物理机器人,无需针对特定任务的训练,便能实现高成功率。

从动作引导中学习智能体策略

arXiv cs.CL

本文提出了 ActGuide-RL,这是一种利用人类动作数据作为指导来训练大语言模型(LLM)智能体策略的方法,旨在无需大量监督微调的情况下克服强化学习中的探索障碍。

AgentOS

Product Hunt

AgentOS 提供了一个统一控制层,用于管理 AI 代理、任务和工作空间。