模仿学习是否在灵巧操作中保持时间鲁棒性?跨任务执行速度的专家与学习者比较
摘要
本文比较了灵巧操作任务中专家和模仿学习策略的时间鲁棒性,发现模仿学习策略随执行速度增加而显著下降,主要原因是插入错位。
查看缓存全文
缓存时间: 2026/09/02 23:48
论文页面 - 模仿学习能否在灵巧操作中保持时间鲁棒性?不同任务执行速度下的专家-学习者对比
来源:https://huggingface.co/papers/2609.01453
摘要
当执行速度增加时,通过模仿学习获得的灵巧操作策略比专家策略衰退得更为显著,其中插入对齐失误是主要的失败模式。
通过模仿学习获得的灵巧操作策略通常在场景、物体或指令的变化鲁棒性方面进行评估,但它们在不同任务执行速度下的表现却较少被考察。这使得我们不清楚学习者相对于其模仿的专家能保留多少时间鲁棒性。我们在相同的任务条件、初始条件抽样和加速因子下比较了专家和学习者。我们在ParcelStow中实例化了评估,这是一个接触丰富的任务,机器人在其中获取、重新定向并插入一个包裹。演示涵盖了包裹获取后操作阶段的加速范围。一个脚本化的专家和一个从专家演示中训练的基于Transformer的动作分块策略在标准速度下都达到了100%的任务成功率。它们的成功率在演示的加速范围内开始分化:在最大演示速度下,专家成功率为84%,而ACT成功率为53%。两个具有不同参数初始化的ACT策略显示出相似的衰退,从标准速度到最大演示速度分别下降了34和48个百分点,而专家策略下降了16个百分点。阶段级分析表明,在最大演示速度下,ACT的47次失败中有35次是插入对齐失误。在相对运动交接下,每一个ACT获取都能在重新定向和自由空间转移中保留包裹,但只有64%完成了整体任务,相比之下,专家获取后为95%。在所有评估的策略和速度下,414次没有获得力闭合的获取无一完成任务。因此,标准速度下的等同任务成功率并不意味着专家性能在执行速度上的保持。代码、数据和评估脚本可在 https://github.com/coenwerem/parcelstow 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2609.01453) 查看 PDF (https://arxiv.org/pdf/2609.01453) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01453)
引用本文的模型0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.01453 以从此页面链接到它。
引用本文的数据集1
cenwerem/parcelstow 查看器• 约1小时前更新 • 971k • 2 (https://huggingface.co/datasets/cenwerem/parcelstow)
引用本文的空间0
无空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2609.01453 以从此页面链接到它。
包含本文的收藏0
无收藏包含此论文
将本文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
零样本仿真到现实机器人学习:关于反应性抓取的灵巧操作研究
本文介绍了域随机化实例集(DRIS),一种同时表示多个随机化实例的方法,以改善灵巧操作的仿真到现实迁移。该方法在具有平板末端执行器且要求无真实世界微调的反应性抓取任务上展示了零样本迁移。
行为克隆并非所需全部:噪声专家反馈下在线策略蒸馏的最优性
本文提出一个噪声专家模型来解释离线与在线模仿学习之间的差距,表明从噪声轨迹中离线学习需要指数级样本复杂度,而在线策略蒸馏可实现多项式依赖。该分析引出一种替代损失函数,实验证实了理论发现。
学习灵巧性
OpenAI 宣布推出 Dactyl,这是一个通过模拟和强化学习来学习机器人手灵巧性的系统,使用 LSTM 来在不同物理环境中泛化,并通过 Rapid PPO 实现来训练能够迁移到现实世界操纵任务的策略。
Play2Perfect: 灵巧游戏预训练中影响精确组装的关键因素
Play2Perfect是一个强化学习框架,通过与多样化物体的游戏式交互学习通用操作技能,然后微调以执行精确组装任务,在紧密插入中实现了33倍的样本效率和零样本模拟到现实的迁移。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。