ENPIRE: 现实世界中自主机器人策略自我改进
摘要
ENPIRE是一个框架,通过环境反馈、策略优化和进化代码优化的闭环系统,使机器人能够在现实世界中自主实现策略自我改进,在灵巧操作任务上达到99%的成功率。
查看缓存全文
缓存时间: 2026/06/20 14:29
Paper page - ENPIRE:现实世界中基于智能体的机器人策略自我改进
来源: https://huggingface.co/papers/2606.19980 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
ENPIRE 框架通过一个闭环系统实现自主机器人研究,该系统通过环境反馈、策略改进和进化代码优化来自动化策略改进。
在现实世界中实现灵巧的机器人操作在很大程度上依赖于人工监督和算法工程,这成为追求通用物理智能的核心瓶颈。尽管新兴的编码智能体(https://huggingface.co/papers?q=coding%20agents)能够生成代码来自动化算法搜索(https://huggingface.co/papers?q=algorithm%20search),但其成功在很大程度上仍局限于数字环境。我们推测,自动化机器人研究所缺失的抽象是一个用于现实世界策略改进(https://huggingface.co/papers?q=policy%20improvement)的可重复反馈循环:重置场景、执行策略、验证结果、完善下一次迭代。为弥合这一差距,我们引入了 ENPIRE,这是一个为编码智能体(https://huggingface.co/papers?q=coding%20agents)设计的框架,它实例化了这一物理反馈例程(https://huggingface.co/papers?q=physical%20feedback%20routine),包含四个核心模块:环境模块(https://huggingface.co/papers?q=Environment%20module)(EN)用于自动重置和验证,策略改进模块(https://huggingface.co/papers?q=Policy%20Improvement)(PI)负责启动策略优化,评估模块(https://huggingface.co/papers?q=Rollout%20module)(R)用于评估一台或多台并行运行的物理机器人的策略,以及进化模块(https://huggingface.co/papers?q=Evolution%20module)(E),其中编码智能体(https://huggingface.co/papers?q=coding%20agents)分析日志、查阅文献、改进训练基础设施和算法代码以解决故障模式。这个闭环系统将现实世界的操作学习转化为可控的优化过程,最大限度地减少人工干预,同时允许对训练方案和智能体变体进行公平的消融实验。在 ENPIRE 的支持下,前沿编码智能体(https://huggingface.co/papers?q=coding%20agents)能够自主训练策略,在具有挑战性的灵巧操作(https://huggingface.co/papers?q=dexterous%20manipulation)任务(如整理针盒、系紧扎带和使用工具)上实现 99% 的成功率,当我们在机器人车队(https://huggingface.co/papers?q=robot%20fleet)上部署智能体团队时,这一过程会进一步加速。我们的结果展示了一条实际且可扩展的路径,即在物理世界中自主推进机器人技术时部署编码智能体(https://huggingface.co/papers?q=coding%20agents)。
查看 arXiv 页面 (https://arxiv.org/abs/2606.19980) 查看 PDF (https://arxiv.org/pdf/2606.19980) 项目页面 (https://research.nvidia.com/labs/gear/enpire/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19980)
在你的智能体中获取此论文:
hf papers read 2606.19980
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.19980 即可从此页面链接。
引用本文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.19980 即可从此页面链接。
引用本文的 Spaces 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.19980 即可从此页面链接。
包含此论文的收藏 1
相似文章
Nvidia的自主机器人研究(6分钟阅读)
ENPIRE是一个框架,使编码代理能够通过真实世界的反馈循环自主改进机器人操作策略,在插针和剪扎带等灵巧任务上实现了99%的成功率。
@FinanceYF5: ENPIRE 已能独立完成扎束线带、整理细针、安装 GPU 等高精度操作,并展现出“物理扩展”现象:多机器人并行探索,进步速度明显更快。 NVIDIA GEAR 实验室的一部分如今已能通宵自我改进,人类早上只需查看报告。项目也将开源。 项…
NVIDIA GEAR lab introduces ENPIRE, a framework for autonomous real-world robot policy self-improvement that achieves 99% success on dexterous manipulation tasks like GPU insertion and zip-tying, with multi-robot parallel learning and open-source release.
AI编程代理可自主指导机器人训练
使用开源ENPIRE框架的AI编码代理能够自主训练机器人执行如安装GPU和切割扎带等任务,系统可在一夜之间自我改进。
ASPIRE:面向机器人的自主技能发现
ASPIRE 是一个持续学习系统,通过迭代探索自主开发和优化机器人控制程序,在操作任务和家务任务中取得显著提升,并实现了从仿真到现实的迁移。
@DrJimFan:今天,我们首次在物理世界中启用自动研究!介绍ENPIRE:我们给8个Codex智能体一个机器人舰队……
NVIDIA GEAR实验室推出了ENPIRE,这是一个使用8个Codex智能体自主控制机器人舰队执行物理任务(如扎扎带、安装GPU)的系统,展示了自我改进的机器人研究以及一种新的'physical scaling'现象。