翻译作为桥梁动作:将人类操作技能迁移至机器人
摘要
本文提出了一种基于头戴相机坐标系中相对手腕平移的桥梁动作表征,利用带有交错动作令牌和注意力掩码的视觉-语言-动作模型来处理具身差异,从而将人类操作技能迁移至双臂机器人。
查看缓存全文
缓存时间: 2026/06/29 06:01
论文页面 - 翻译作为桥接动作:将操作技能从人类迁移至机器人
来源:https://huggingface.co/papers/2606.28133
摘要
通过使用基于初始头部-相机坐标系中相对手腕平移的桥接动作表示,并结合能够通过交错动作令牌和注意力掩码处理本体差异的视觉-语言-动作模型,人类操作技能可更有效地迁移至机器人。
我们研究能否从人类动作中学习到新颖的操作技能,并将其迁移至配备平行夹爪的双臂机器人(https://huggingface.co/papers?q=parallel%20grippers)。人类动作数据廉价、丰富且多样,是扩展机器人学习最有前景的资源之一。然而,从人类向机器人迁移技能仍然困难重重:大部分现有工作将人类视为另一种双臂6DoF本体,其中手部姿态估计存在噪声,且人类手指的接触模式与平行夹爪存在根本差异。因此,我们认为从人类数据中学习包含旋转的动作信号是次优的,并转而提出一种桥接动作表示:以初始头部-相机坐标系(https://huggingface.co/papers?q=head-camera%20frame)中的相对手腕平移(https://huggingface.co/papers?q=relative%20wrist%20translation)作为人类和机器人共享的动作空间。为了处理不同本体中某些动作组件可能缺失的问题,我们构建了一个类似π₀的视觉-语言-动作模型(https://huggingface.co/papers?q=vision-language-action%20model),其中包含交错动作令牌(https://huggingface.co/papers?q=interleaved%20action%20tokens)和注意力掩码(https://huggingface.co/papers?q=attention%20masking)。在一系列新颖的双臂操作(https://huggingface.co/papers?q=bi-manual%20manipulation)任务中,我们的桥接动作将人类操作知识迁移至机器人的效果远优于带噪声的6DoF人类动作,并且随人类数据量增加而扩展。
查看arXiv页面(https://arxiv.org/abs/2606.28133)查看PDF(https://arxiv.org/pdf/2606.28133)项目页面(https://translation-as-a-bridging-action.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.28133)
在你的代理中获取本文:
hf papers read 2606\.28133
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
无模型链接该论文
在模型README.md中引用 arxiv.org/abs/2606.28133 以从本页链接。
引用该论文的数据集0
无数据集链接该论文
在数据集README.md中引用 arxiv.org/abs/2606.28133 以从本页链接。
引用该论文的Space0
无Space链接该论文
在Space README.md中引用 arxiv.org/abs/2606.28133 以从本页链接。
包含该论文的合集0
无合集包含该论文
将该论文添加到合集(https://huggingface.co/new-collection)以从本页链接。
相似文章
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
从世界到手腕:面向精细机器人操作的任务条件未来手腕建模
介绍了W2-VLA,一种用于精细机器人操作的视觉-语言-动作模型,该模型对任务条件下的未来手腕观测进行建模,在基准测试和真实世界任务中实现了改进的操作性能。
测量机器人策略中的语言迁移:将希腊语添加到Cosmos3视觉-语言-动作策略
本研究探讨将希腊语添加到Cosmos3视觉-语言-动作机器人策略中,揭示了测量方面的挑战,并表明双语训练能提升性能但会过拟合到翻译者的措辞。结果强调了在低资源本地化中建立空基线和种子复制的必要性。
iMaC:将动作转化为运动与接触图像,用于具身世界模型
iMaC提出了一种统一控制范式,将原始视觉图像作为具身世界模型的原生动作表示,通过基于图像的动作令牌实现更具表现力和泛化能力的机器人控制。
像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图
本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。