趣味性自主机器人学习

Hugging Face Daily Papers 论文

摘要

介绍趣味性自主机器人学习(Playful Agentic Robot Learning),其中具身编码智能体通过自主探索游戏(self-directed play)学习可复用技能,无需额外训练即可提升下游任务表现。提出的RATs系统在仿真和现实世界迁移中相比基线取得了显著提升。

当前的自主机器人系统可以编写可执行的Code-as-Policy程序,观察反馈,并在多次尝试中修正行为,但它们大多仍然是任务驱动的:只有在明确指令之后才获得可复用技能。我们研究趣味性自主机器人学习,其中具身编码智能体在下游任务到来之前,将自主探索游戏作为持续的技能学习阶段。我们引入了RATs(Robotics Agent Teams,机器人智能体团队),专为游戏时间技能获取而设计。在游戏过程中,RATs提出新穎且可学习的探索性任务,规划并执行机器人代码策略,验证中间进度,诊断失败,通过密集的步骤级反馈进行重试,并将成功执行蒸馏为持久化的代码技能库。在测试时,智能体从该冻结库中检索相关技能,以帮助解决新任务。在LIBERO-PRO和MolmoSpaces上的实验表明,经过游戏学习的技能相比无游戏和随机游戏基线在保留的下游任务上表现更好,在LIBERO-PRO和MolmoSpaces上分别比CaP-Agent0高出20.6和17.0个百分点。此外,学习到的技能可以通过简单地检索到上下文中接入其他推理时的Code-as-Policy智能体,在无需微调底层模型的情况下,将RoboSuite和现实世界迁移性能分别提升8.9和8.8个百分点。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:28

论文页面 - 游戏化具身智能体学习

来源:https://huggingface.co/papers/2606.19419 发布时间:6月17日

#3 当日论文 (https://huggingface.co/papers/date/2026-06-19) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

具身机器人通过自主游戏和探索学习可复用的技能,然后将这些技能应用于下游任务,无需额外训练即可提升表现。

当前的具身智能体系统能够编写可执行的Code-as-Policy (https://huggingface.co/papers?q=Code-as-Policy)程序,观察反馈,并在多次尝试中修正行为,但它们仍然主要基于任务驱动:可复用技能只有在明确指令下达后才能获得。我们研究了游戏化具身智能体学习,其中具身编程代理 (https://huggingface.co/papers?q=embodied%20coding%20agent) 在下游任务 (https://huggingface.co/papers?q=downstream%20tasks) 到来之前,将自主游戏 (https://huggingface.co/papers?q=self-directed%20play) 作为持续的技能学习阶段。我们引入了RATs,即专为游戏时间技能习得设计的机器人代理团队。在游戏过程中,RATs提出新颖且可学习的探索性任务 (https://huggingface.co/papers?q=exploratory%20tasks),规划并执行机器人代码策略 (https://huggingface.co/papers?q=robot-code%20policies),验证中间进度,诊断失败,通过密集的步骤级反馈进行重试,并将成功执行提炼到持久的代码技能库 (https://huggingface.co/papers?q=skill%20library) 中。在测试时,代理从该冻结的技能库中重用相关技能来帮助解决新任务。在LIBERO-PRO (https://huggingface.co/papers?q=LIBERO-PRO) 和MolmoSpaces (https://huggingface.co/papers?q=MolmoSpaces) 上的实验表明,通过游戏学习的技能在未见过的下游任务 (https://huggingface.co/papers?q=downstream%20tasks) 上优于无游戏和随机游戏基线,在LIBERO-PRO (https://huggingface.co/papers?q=LIBERO-PRO) 和MolmoSpaces (https://huggingface.co/papers?q=MolmoSpaces) 上分别比CaP-Agent0提高了20.6和17.0个百分点。此外,学习到的技能可以简单地检索到上下文中,插入到其他推理时的Code-as-Policy (https://huggingface.co/papers?q=Code-as-Policy) 代理中,无需微调底层模型即可在RoboSuite (https://huggingface.co/papers?q=RoboSuite) 和真实世界迁移中分别提升8.9和8.8个点。

查看arXiv页面 (https://arxiv.org/abs/2606.19419)查看PDF (https://arxiv.org/pdf/2606.19419)项目页面 (https://playful-rats.github.io/)GitHub38 (https://github.com/Playful-RATs/rats)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19419)

在您的代理中获取此论文:

hf papers read 2606.19419

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2606.19419以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2606.19419以从此页面链接。

引用此论文的Spaces0

没有Space链接此论文

请在Space README.md中引用arxiv.org/abs/2606.19419以从此页面链接。

包含此论文的收藏集1

相似文章

学习灵巧性

OpenAI Blog

OpenAI 宣布推出 Dactyl,这是一个通过模拟和强化学习来学习机器人手灵巧性的系统,使用 LSTM 来在不同物理环境中泛化,并通过 Rapid PPO 实现来训练能够迁移到现实世界操纵任务的策略。

竞争性自我对弈

OpenAI Blog

OpenAI 证明在模拟 3D 机器人环境中进行竞争性自我对弈,能够使 AI 智能体在没有明确指导的情况下发现复杂的物理行为,如铲球、躲闪和虚晃等,表明自我对弈将成为未来强大 AI 系统的基础。

从动作引导中学习智能体策略

arXiv cs.CL

本文提出了 ActGuide-RL,这是一种利用人类动作数据作为指导来训练大语言模型(LLM)智能体策略的方法,旨在无需大量监督微调的情况下克服强化学习中的探索障碍。

LectūraAgents: 自适应个性化AI辅助学习与具身教学的多智能体框架

Hugging Face Daily Papers

LectūraAgents是一个用于自适应个性化学习的多智能体框架,它模拟教授与学生的互动,并生成与学习者画像对齐的具身教学动作。它引入了层级架构、自适应具身教学机制以及教学动作-语音对齐算法,在现有方法上表现出一致的改进。