ENPIRE: 现实世界中自主机器人策略自我改进

Hugging Face Daily Papers 论文

摘要

ENPIRE是一个框架,通过环境反馈、策略优化和进化代码优化的闭环系统,使机器人能够在现实世界中自主实现策略自我改进,在灵巧操作任务上达到99%的成功率。

在现实世界中实现灵巧的机器人操作严重依赖人类监督和算法工程,这成为追求通用物理智能的核心瓶颈。尽管新兴的编码智能体可以生成代码来自动化算法搜索,但其成功主要局限于数字环境。我们推测,自动化机器人研究缺失的抽象是一个可重复的现实世界策略改进反馈循环:重置场景、执行策略、验证结果、优化下一次迭代。为弥补这一空白,我们提出了ENPIRE,一个为编码智能体设计的框架,它实例化了这一物理反馈流程,包含四个核心模块:环境模块(EN)用于自动重置和验证,策略改进模块(PI)启动策略优化, rollout模块(R)使用一个或多个并行运行的物理机器人评估策略,以及进化模块(E),其中编码智能体分析日志、查阅文献、改进训练基础设施和算法代码以解决失败模式。这个闭环系统将现实世界操作学习转化为可控的优化过程,最小化人工干预,同时允许对训练方案和智能体变体进行公平的消融实验。在ENPIRE的支持下,前沿编码智能体可以自主训练策略,在挑战性的灵巧操作任务上实现99%的成功率,例如整理针盒、系紧扎带和工具使用,当我们在机器人集群中部署智能体团队时,这一过程进一步加速。我们的结果展示了将编码智能体部署到现实世界中自主推进机器人技术的实用且可扩展的路径。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:29

Paper page - ENPIRE:现实世界中基于智能体的机器人策略自我改进

来源: https://huggingface.co/papers/2606.19980 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

ENPIRE 框架通过一个闭环系统实现自主机器人研究,该系统通过环境反馈、策略改进和进化代码优化来自动化策略改进。

在现实世界中实现灵巧的机器人操作在很大程度上依赖于人工监督和算法工程,这成为追求通用物理智能的核心瓶颈。尽管新兴的编码智能体(https://huggingface.co/papers?q=coding%20agents)能够生成代码来自动化算法搜索(https://huggingface.co/papers?q=algorithm%20search),但其成功在很大程度上仍局限于数字环境。我们推测,自动化机器人研究所缺失的抽象是一个用于现实世界策略改进(https://huggingface.co/papers?q=policy%20improvement)的可重复反馈循环:重置场景、执行策略、验证结果、完善下一次迭代。为弥合这一差距,我们引入了 ENPIRE,这是一个为编码智能体(https://huggingface.co/papers?q=coding%20agents)设计的框架,它实例化了这一物理反馈例程(https://huggingface.co/papers?q=physical%20feedback%20routine),包含四个核心模块:环境模块(https://huggingface.co/papers?q=Environment%20module)(EN)用于自动重置和验证,策略改进模块(https://huggingface.co/papers?q=Policy%20Improvement)(PI)负责启动策略优化,评估模块(https://huggingface.co/papers?q=Rollout%20module)(R)用于评估一台或多台并行运行的物理机器人的策略,以及进化模块(https://huggingface.co/papers?q=Evolution%20module)(E),其中编码智能体(https://huggingface.co/papers?q=coding%20agents)分析日志、查阅文献、改进训练基础设施和算法代码以解决故障模式。这个闭环系统将现实世界的操作学习转化为可控的优化过程,最大限度地减少人工干预,同时允许对训练方案和智能体变体进行公平的消融实验。在 ENPIRE 的支持下,前沿编码智能体(https://huggingface.co/papers?q=coding%20agents)能够自主训练策略,在具有挑战性的灵巧操作(https://huggingface.co/papers?q=dexterous%20manipulation)任务(如整理针盒、系紧扎带和使用工具)上实现 99% 的成功率,当我们在机器人车队(https://huggingface.co/papers?q=robot%20fleet)上部署智能体团队时,这一过程会进一步加速。我们的结果展示了一条实际且可扩展的路径,即在物理世界中自主推进机器人技术时部署编码智能体(https://huggingface.co/papers?q=coding%20agents)。

查看 arXiv 页面 (https://arxiv.org/abs/2606.19980) 查看 PDF (https://arxiv.org/pdf/2606.19980) 项目页面 (https://research.nvidia.com/labs/gear/enpire/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19980)

在你的智能体中获取此论文:

hf papers read 2606.19980

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.19980 即可从此页面链接。

引用本文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.19980 即可从此页面链接。

引用本文的 Spaces 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.19980 即可从此页面链接。

包含此论文的收藏 1

相似文章

@FinanceYF5: ENPIRE 已能独立完成扎束线带、整理细针、安装 GPU 等高精度操作,并展现出“物理扩展”现象:多机器人并行探索,进步速度明显更快。 NVIDIA GEAR 实验室的一部分如今已能通宵自我改进,人类早上只需查看报告。项目也将开源。 项…

X AI KOLs Following

NVIDIA GEAR lab introduces ENPIRE, a framework for autonomous real-world robot policy self-improvement that achieves 99% success on dexterous manipulation tasks like GPU insertion and zip-tying, with multi-robot parallel learning and open-source release.

ASPIRE:面向机器人的自主技能发现

Hugging Face Daily Papers

ASPIRE 是一个持续学习系统,通过迭代探索自主开发和优化机器人控制程序,在操作任务和家务任务中取得显著提升,并实现了从仿真到现实的迁移。