GaP:一种面向变体自动化任务的图即策略多智能体自学习框架

Hugging Face Daily Papers 论文

摘要

引入图即策略(GaP),一种多智能体编码框架,通过模块化机器人技能库生成有向计算图,并利用并行模拟迭代优化任务执行,在变体自动化任务上成功率显著高于基准方法。

为了让机器人在商业和工业应用中可靠运行,近期具身编码系统的进展能否将可解释的机器人编程与无模型策略的开放世界适应性相结合?我们聚焦于“变体自动化”(VA)任务——这类任务在物体几何和姿态上的变化超过固定自动化任务。无模型策略往往难以弥合VA任务在商业和工业应用中必须持久且可靠执行时的可靠性差距。受任务与运动规划(TAMP)及机器人操作系统(ROS)先前工作的启发,我们提出图即策略(GaP),一种多智能体编码框架,可从模块化开放机器人技能库(MORSL)生成包含感知、规划和控制节点的有向计算图。GaP随后生成内部仿真环境,并行排练不同图的任务实例,迭代优化图结构与参数,以提高成功率和吞吐量。我们在8个新的开放VA任务基准(4个仿真、4个真实世界)上的评估表明,GaP的成功率显著优于基准方法。详情、代码及数据见:https://graph-robots.github.io/gap
查看原文
查看缓存全文

缓存时间: 2026/07/07 22:45

论文页面 - GaP:面向变分自动化任务的图即策略多智能体自学习框架

来源:https://huggingface.co/papers/2607.05369 作者:

摘要

图即策略(Graph-as-Policy)系统将模块化机器人技能与多智能体编码相结合,通过并行仿真优化提高变分自动化任务的可靠性。

要使机器人在商业和工业应用中可靠运行,近期智能体编码系统(https://huggingface.co/papers?q=agentic%20coding%20systems)的进展能否将可解释的机器人编程与无模型策略(https://huggingface.co/papers?q=model-free%20policies)的开放世界适应性相结合?我们聚焦于“变分自动化”(https://huggingface.co/papers?q=Variational%20Automation)(VA),这是一类比固定自动化在物体几何和姿态上变化更大的任务。无模型策略(https://huggingface.co/papers?q=Model-free%20policies)通常难以弥合VA任务所需的高可靠性差距,这些任务必须在商业和工业应用中持续且可靠地执行。受任务与运动规划(https://huggingface.co/papers?q=Task%20and%20Motion%20Planning)(TAMP)以及机器人操作系统(https://huggingface.co/papers?q=Robot%20Operating%20System)(ROS)的启发,我们引入了图即策略(GaP),这是一个多智能体编码框架,能够从模块化开放机器人技能库(MORSL)生成包含感知、规划和控制节点的有向计算图(https://huggingface.co/papers?q=directed%20computation%20graphs)。GaP随后生成一个内部仿真环境(https://huggingface.co/papers?q=internal%20simulation%20environment),并行排练具有不同图结构的任务实例,以迭代优化图结构和参数,从而提高成功率和吞吐量。在8个新的开放VA任务基准(4个仿真、4个真实世界)上的评估表明,GaP能够取得显著优于基线的成功率。详细信息、代码和数据请访问:https://graph-robots.github.io/gap

查看 arXiv 页面 (https://arxiv.org/abs/2607.05369) 查看 PDF (https://arxiv.org/pdf/2607.05369) 项目页面 (https://graph-robots.github.io/gap/) GitHub13 (https://github.com/graph-robots/graph-as-policy) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05369)

在您的智能体中获取此论文:

hf papers read 2607.05369

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用 arxiv.org/abs/2607.05369 以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2607.05369 以从本页面链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用 arxiv.org/abs/2607.05369 以从本页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

Geometric Action Model 用于机器人策略学习

Hugging Face Daily Papers

Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。

ReGRPO:面向工具使用智能体的反思增强策略优化

arXiv cs.AI

ReGRPO 提出了一种反思增强的策略优化框架,用于工具使用的视觉语言智能体,通过利用结构化的失败观测以及反思令牌与动作的联合优化,来改善从工具故障中的恢复能力,在 GTA 和 GAIA 基准测试上取得了最先进的结果。

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。