Play2Perfect: 灵巧游戏预训练中影响精确组装的关键因素

Hugging Face Daily Papers 论文

摘要

Play2Perfect是一个强化学习框架,通过与多样化物体的游戏式交互学习通用操作技能,然后微调以执行精确组装任务,在紧密插入中实现了33倍的样本效率和零样本模拟到现实的迁移。

多指机器人有望实现人类双手的速度和灵巧性,但诸如精确组装等挑战性问题仍然遥不可及。这些任务接触密集,使得模仿学习的数据收集困难,且奖励稀疏,使得直接使用强化学习(RL)进行探索变得棘手。因此,先前的工作通过使用专用夹爪、工具附件和环境固定装置来结构化问题,取得了进展。在这项工作中,我们提出,在机器人能够完美执行精确组装之前,它必须首先学会玩耍。我们进一步提出一个问题:在玩耍学习过程中,哪些因素对精确组装至关重要?我们提出Play2Perfect,这是一个RL框架,通过在多样化物体和目标上的玩耍进行任务无关的预训练,然后在精确组装上进行微调。玩耍的目标是获得可重复使用的操作先验,例如抓取、手内重新定向和姿态达到。然后,微调将这个通用先验适应到组装任务,将探索集中在最终成功所需的接触密集、高精度交互上。我们系统地研究了玩耍预训练中的关键设计选择,包括物体多样性、训练目标、轨迹多样性和目标精度。我们表明,即使提供了密集的多阶段奖励,我们的先验也比从零开始的RL训练具有33倍的样本效率。我们演示了零样本模拟到现实的迁移,在仅0.5毫米接触间隙的紧密插入中实现了60%的成功率,并在长时多部件组装和拧螺丝中实现了超过50%的成功率。
查看原文
查看缓存全文

缓存时间: 2026/07/01 19:44

论文页面 - Play2Perfect:灵巧操作预训练对精密装配的关键因素是什么?

来源:https://huggingface.co/papers/2606.26428

摘要

一种名为 Play2Perfect 的强化学习框架,通过先与多样化物体进行互动式玩耍学习通用操作技能,再通过微调将这些技能适配到精密装配任务,实现了样本高效的机器人装配。

多指机器人有望拥有与人类手部相同的速度与灵巧度,然而精密装配(https://huggingface.co/papers?q=assembly)等极具挑战的问题仍无法攻克。这类任务接触丰富,使得用于模仿学习(https://huggingface.co/papers?q=imitation%20learning)的数据收集十分困难,同时奖励稀疏(https://huggingface.co/papers?q=sparse-reward),导致直接使用强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL)进行探索难以实现。因此,先前的工作通过使用专用夹具、工具附件和环境固件来结构化问题,取得了一定进展。在本文中,我们认为,在机器人能够完美完成精密装配(https://huggingface.co/papers?q=assembly)之前,它必须首先学会玩耍。我们进一步提问:玩耍学习过程中的哪些因素对精密装配(https://huggingface.co/papers?q=assembly)至关重要?我们提出了 Play2Perfect,这是一种通过在不同物体和目标上进行玩耍来实现任务无关预训练(https://huggingface.co/papers?q=task-agnostic%20pretraining)的 RL 框架,随后在精密装配(https://huggingface.co/papers?q=assembly)上精化(fine-tuning)。玩耍的目标是获得可重用的操作先验(https://huggingface.co/papers?q=manipulation%20priors),例如抓取(https://huggingface.co/papers?q=grasping)、手内重定向(https://huggingface.co/papers?q=in-hand%20reorientation)和位姿到达(https://huggingface.co/papers?q=pose%20reaching)。微调则将这一通用先验适配到装配(https://huggingface.co/papers?q=assembly),将探索重点集中在最终成功所需的接触丰富、高精度的交互上。我们系统研究了玩耍预训练中的关键设计选择,包括物体多样性、训练目标、轨迹多样性和目标精度。我们证明,即使提供了密集的多阶段奖励,我们的先验也比从头开始的 RL 训练样本效率高 33 倍。我们展示了零样本仿真到现实迁移(https://huggingface.co/papers?q=sim-to-real%20transfer),在仅 0.5 mm 接触间隙的紧密插入任务中成功率达到 60%,在长序列多部件装配(https://huggingface.co/papers?q=assembly)和拧螺丝任务中成功率超过 50%。

查看 arXiv 页面(https://arxiv.org/abs/2606.26428)查看 PDF(https://arxiv.org/pdf/2606.26428)项目页面(https://play2perfect.github.io/)GitHub13(https://github.com/kushal2000/play2perfect)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.26428)

在您的智能体中获取此论文:

hf papers read 2606.26428

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

尚无模型关联此论文。

在模型的 README.md 中引用 arxiv.org/abs/2606.26428 即可从此页面关联。

引用此论文的数据集 0

尚无数据集关联此论文。

在数据集的 README.md 中引用 arxiv.org/abs/2606.26428 即可从此页面关联。

引用此论文的 Spaces 0

尚无 Space 关联此论文。

在 Space 的 README.md 中引用 arxiv.org/abs/2606.26428 即可从此页面关联。

包含此论文的收藏集 0

尚无包含此论文的收藏集。

将此论文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面关联。

相似文章

学习灵巧性

OpenAI Blog

OpenAI 宣布推出 Dactyl,这是一个通过模拟和强化学习来学习机器人手灵巧性的系统,使用 LSTM 来在不同物理环境中泛化,并通过 Rapid PPO 实现来训练能够迁移到现实世界操纵任务的策略。

用于LEGO空间物理推理的高效样本后训练

arXiv cs.LG

本文发现了一种基于LLM的LEGO组装生成中的失败模式PhysHack,并提出PVPO,一种结合基于模型的数据选择的高效样本强化学习方法,仅使用一小部分训练数据即可改善物理和语义对齐。