GaP:一种面向变体自动化任务的图即策略多智能体自学习框架
摘要
引入图即策略(GaP),一种多智能体编码框架,通过模块化机器人技能库生成有向计算图,并利用并行模拟迭代优化任务执行,在变体自动化任务上成功率显著高于基准方法。
查看缓存全文
缓存时间: 2026/07/07 22:45
论文页面 - GaP:面向变分自动化任务的图即策略多智能体自学习框架
来源:https://huggingface.co/papers/2607.05369 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
图即策略(Graph-as-Policy)系统将模块化机器人技能与多智能体编码相结合,通过并行仿真优化提高变分自动化任务的可靠性。
要使机器人在商业和工业应用中可靠运行,近期智能体编码系统(https://huggingface.co/papers?q=agentic%20coding%20systems)的进展能否将可解释的机器人编程与无模型策略(https://huggingface.co/papers?q=model-free%20policies)的开放世界适应性相结合?我们聚焦于“变分自动化”(https://huggingface.co/papers?q=Variational%20Automation)(VA),这是一类比固定自动化在物体几何和姿态上变化更大的任务。无模型策略(https://huggingface.co/papers?q=Model-free%20policies)通常难以弥合VA任务所需的高可靠性差距,这些任务必须在商业和工业应用中持续且可靠地执行。受任务与运动规划(https://huggingface.co/papers?q=Task%20and%20Motion%20Planning)(TAMP)以及机器人操作系统(https://huggingface.co/papers?q=Robot%20Operating%20System)(ROS)的启发,我们引入了图即策略(GaP),这是一个多智能体编码框架,能够从模块化开放机器人技能库(MORSL)生成包含感知、规划和控制节点的有向计算图(https://huggingface.co/papers?q=directed%20computation%20graphs)。GaP随后生成一个内部仿真环境(https://huggingface.co/papers?q=internal%20simulation%20environment),并行排练具有不同图结构的任务实例,以迭代优化图结构和参数,从而提高成功率和吞吐量。在8个新的开放VA任务基准(4个仿真、4个真实世界)上的评估表明,GaP能够取得显著优于基线的成功率。详细信息、代码和数据请访问:https://graph-robots.github.io/gap
查看 arXiv 页面 (https://arxiv.org/abs/2607.05369) 查看 PDF (https://arxiv.org/pdf/2607.05369) 项目页面 (https://graph-robots.github.io/gap/) GitHub13 (https://github.com/graph-robots/graph-as-policy) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05369)
在您的智能体中获取此论文:
hf papers read 2607.05369
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用 arxiv.org/abs/2607.05369 以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2607.05369 以从本页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用 arxiv.org/abs/2607.05369 以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
Geometric Action Model 用于机器人策略学习
Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。
RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略
RoboTALES引入了一个两阶段框架,结合基于LLM的规划和基于VLM的批评,以改进任务对齐的视频生成和机器人策略训练,在长时域操作任务上显著优于现有方法。
ReGRPO:面向工具使用智能体的反思增强策略优化
ReGRPO 提出了一种反思增强的策略优化框架,用于工具使用的视觉语言智能体,通过利用结构化的失败观测以及反思令牌与动作的联合优化,来改善从工具故障中的恢复能力,在 GTA 和 GAIA 基准测试上取得了最先进的结果。
基于大语言模型智能体进行分层广义规划时的策略分解学习与复用
本文介绍了 HCL-GP,这是一种动态策略学习框架,将广义规划与分层任务分解相结合,使基于大语言模型(LLM)的智能体能够学习和复用可执行的策略组件,从而在 AppWorld 基准测试上显著提升性能。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。