Play2Perfect: 灵巧游戏预训练中影响精确组装的关键因素
摘要
Play2Perfect是一个强化学习框架,通过与多样化物体的游戏式交互学习通用操作技能,然后微调以执行精确组装任务,在紧密插入中实现了33倍的样本效率和零样本模拟到现实的迁移。
查看缓存全文
缓存时间: 2026/07/01 19:44
论文页面 - Play2Perfect:灵巧操作预训练对精密装配的关键因素是什么?
来源:https://huggingface.co/papers/2606.26428
摘要
一种名为 Play2Perfect 的强化学习框架,通过先与多样化物体进行互动式玩耍学习通用操作技能,再通过微调将这些技能适配到精密装配任务,实现了样本高效的机器人装配。
多指机器人有望拥有与人类手部相同的速度与灵巧度,然而精密装配(https://huggingface.co/papers?q=assembly)等极具挑战的问题仍无法攻克。这类任务接触丰富,使得用于模仿学习(https://huggingface.co/papers?q=imitation%20learning)的数据收集十分困难,同时奖励稀疏(https://huggingface.co/papers?q=sparse-reward),导致直接使用强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL)进行探索难以实现。因此,先前的工作通过使用专用夹具、工具附件和环境固件来结构化问题,取得了一定进展。在本文中,我们认为,在机器人能够完美完成精密装配(https://huggingface.co/papers?q=assembly)之前,它必须首先学会玩耍。我们进一步提问:玩耍学习过程中的哪些因素对精密装配(https://huggingface.co/papers?q=assembly)至关重要?我们提出了 Play2Perfect,这是一种通过在不同物体和目标上进行玩耍来实现任务无关预训练(https://huggingface.co/papers?q=task-agnostic%20pretraining)的 RL 框架,随后在精密装配(https://huggingface.co/papers?q=assembly)上精化(fine-tuning)。玩耍的目标是获得可重用的操作先验(https://huggingface.co/papers?q=manipulation%20priors),例如抓取(https://huggingface.co/papers?q=grasping)、手内重定向(https://huggingface.co/papers?q=in-hand%20reorientation)和位姿到达(https://huggingface.co/papers?q=pose%20reaching)。微调则将这一通用先验适配到装配(https://huggingface.co/papers?q=assembly),将探索重点集中在最终成功所需的接触丰富、高精度的交互上。我们系统研究了玩耍预训练中的关键设计选择,包括物体多样性、训练目标、轨迹多样性和目标精度。我们证明,即使提供了密集的多阶段奖励,我们的先验也比从头开始的 RL 训练样本效率高 33 倍。我们展示了零样本仿真到现实迁移(https://huggingface.co/papers?q=sim-to-real%20transfer),在仅 0.5 mm 接触间隙的紧密插入任务中成功率达到 60%,在长序列多部件装配(https://huggingface.co/papers?q=assembly)和拧螺丝任务中成功率超过 50%。
查看 arXiv 页面(https://arxiv.org/abs/2606.26428)查看 PDF(https://arxiv.org/pdf/2606.26428)项目页面(https://play2perfect.github.io/)GitHub13(https://github.com/kushal2000/play2perfect)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.26428)
在您的智能体中获取此论文:
hf papers read 2606.26428
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
尚无模型关联此论文。
在模型的 README.md 中引用 arxiv.org/abs/2606.26428 即可从此页面关联。
引用此论文的数据集 0
尚无数据集关联此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2606.26428 即可从此页面关联。
引用此论文的 Spaces 0
尚无 Space 关联此论文。
在 Space 的 README.md 中引用 arxiv.org/abs/2606.26428 即可从此页面关联。
包含此论文的收藏集 0
尚无包含此论文的收藏集。
将此论文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面关联。
相似文章
学习灵巧性
OpenAI 宣布推出 Dactyl,这是一个通过模拟和强化学习来学习机器人手灵巧性的系统,使用 LSTM 来在不同物理环境中泛化,并通过 Rapid PPO 实现来训练能够迁移到现实世界操纵任务的策略。
零样本仿真到现实机器人学习:关于反应性抓取的灵巧操作研究
本文介绍了域随机化实例集(DRIS),一种同时表示多个随机化实例的方法,以改善灵巧操作的仿真到现实迁移。该方法在具有平板末端执行器且要求无真实世界微调的反应性抓取任务上展示了零样本迁移。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
DragMesh-2:与铰接物体的物理合理灵巧手-物体交互
本文介绍了DragMesh-2和PICA方法,用于通过模拟中的接触感知强化学习来学习与铰接物体的物理合理灵巧手-物体交互,在没有明确触觉反馈的情况下实现有效操作。
用于LEGO空间物理推理的高效样本后训练
本文发现了一种基于LLM的LEGO组装生成中的失败模式PhysHack,并提出PVPO,一种结合基于模型的数据选择的高效样本强化学习方法,仅使用一小部分训练数据即可改善物理和语义对齐。