模仿学习是否在灵巧操作中保持时间鲁棒性?跨任务执行速度的专家与学习者比较

Hugging Face Daily Papers 论文

摘要

本文比较了灵巧操作任务中专家和模仿学习策略的时间鲁棒性,发现模仿学习策略随执行速度增加而显著下降,主要原因是插入错位。

通过模仿学习的灵巧操作策略通常评估其对场景、物体或指令变化的鲁棒性,但较少考察它们在不同任务执行速度下的性能。这留下了一个问题:学习者相对于它所模仿的专家保留了多少时间鲁棒性。我们在相同的任务条件、初始条件抽取和加速因子下比较了专家和学习者。我们在ParcelStow中实例化评估,这是一个接触密集的任务,机器人在其中获取、重新定位并插入一个包裹。演示涵盖了包裹获取后操作阶段的加速范围。一个脚本化专家和一个基于专家演示训练的Action Chunking with Transformers (ACT)策略在名义速度下都达到了100%的任务成功率。它们的成功率在演示范围内出现分歧:在最大加速下,专家成功率为84%,ACT成功率为53%。两个具有不同参数初始化的ACT策略显示出相似的退化,从名义速度到最大演示速度分别下降了34和48个百分点,而专家仅下降了16个百分点。阶段级分析显示,在最大演示速度下,ACT的47次失败中有35次是插入错位。在相对运动交接下,每次ACT获取都能在自由空间中通过重新定位和转移保持包裹,但只有64%完成了整个任务,而专家获取后为95%。在所有评估的策略和速度下,没有力闭合的414次获取中没有任何一次完成任务。因此,相同的名义任务成功率并不意味着在执行速度下保持了专家性能。代码、数据和评估脚本可在 https://github.com/coenwerem/parcelstow 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 23:48

论文页面 - 模仿学习能否在灵巧操作中保持时间鲁棒性?不同任务执行速度下的专家-学习者对比

来源:https://huggingface.co/papers/2609.01453

摘要

当执行速度增加时,通过模仿学习获得的灵巧操作策略比专家策略衰退得更为显著,其中插入对齐失误是主要的失败模式。

通过模仿学习获得的灵巧操作策略通常在场景、物体或指令的变化鲁棒性方面进行评估,但它们在不同任务执行速度下的表现却较少被考察。这使得我们不清楚学习者相对于其模仿的专家能保留多少时间鲁棒性。我们在相同的任务条件、初始条件抽样和加速因子下比较了专家和学习者。我们在ParcelStow中实例化了评估,这是一个接触丰富的任务,机器人在其中获取、重新定向并插入一个包裹。演示涵盖了包裹获取后操作阶段的加速范围。一个脚本化的专家和一个从专家演示中训练的基于Transformer的动作分块策略在标准速度下都达到了100%的任务成功率。它们的成功率在演示的加速范围内开始分化:在最大演示速度下,专家成功率为84%,而ACT成功率为53%。两个具有不同参数初始化的ACT策略显示出相似的衰退,从标准速度到最大演示速度分别下降了34和48个百分点,而专家策略下降了16个百分点。阶段级分析表明,在最大演示速度下,ACT的47次失败中有35次是插入对齐失误。在相对运动交接下,每一个ACT获取都能在重新定向和自由空间转移中保留包裹,但只有64%完成了整体任务,相比之下,专家获取后为95%。在所有评估的策略和速度下,414次没有获得力闭合的获取无一完成任务。因此,标准速度下的等同任务成功率并不意味着专家性能在执行速度上的保持。代码、数据和评估脚本可在 https://github.com/coenwerem/parcelstow 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2609.01453) 查看 PDF (https://arxiv.org/pdf/2609.01453) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01453)

引用本文的模型0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.01453 以从此页面链接到它。

引用本文的数据集1

cenwerem/parcelstow 查看器• 约1小时前更新 • 971k • 2 (https://huggingface.co/datasets/cenwerem/parcelstow)

引用本文的空间0

无空间链接此论文

在空间的 README.md 中引用 arxiv.org/abs/2609.01453 以从此页面链接到它。

包含本文的收藏0

无收藏包含此论文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到它。

相似文章

学习灵巧性

OpenAI Blog

OpenAI 宣布推出 Dactyl,这是一个通过模拟和强化学习来学习机器人手灵巧性的系统,使用 LSTM 来在不同物理环境中泛化,并通过 Rapid PPO 实现来训练能够迁移到现实世界操纵任务的策略。