Morphometric Imitation: 从形态与接触感知的手部重定向到仿真到现实的视觉运动策略

Hugging Face Daily Papers 论文

摘要

Morphometric Immitation 提出了一种三阶段框架,该框架将重建的人类手物交互转化为零样本仿真到现实的视觉运动策略,从而增强灵巧操作任务中的接触保持和成功率。

人类手物交互(HOIs)为灵巧操作提供了丰富的示范来源,但直接从中学习在弥合形态差距、确保动力学可行性和仿真到现实部署方面存在挑战。我们提出 Morphometric Imitation,一个三阶段框架,它将重建的 HOIs 转化为零样本仿真到现实的视觉运动策略。首先,形态计量优化(MMO)在跨手部形态重定向人类运动时,通过运动学方法保持示范的接触。其次,残差强化学习(RL)使用来自人类运动的物体姿态和接触信息来细化运动学参考,以产生动力学可行的机器人示范。第三,这些示范被蒸馏成视觉运动策略。在三个机器人手和十个 HOIs 上,MMO 在每个手上将接触 F1 提高了至少 8 个点,相比五个基线中最强的一个,同时还将下游动态重定向的成功率提高了多达 35 个点。对残差 RL 的消融研究表明,使用物体姿态和接触信息具有互补优势。最后,视觉运动策略在 30 个物体的 300 次现实世界试验中实现了 89.3% 的零样本成功率。项目页面:https://morphometricimitation.github.io{this https URL}
查看原文
查看缓存全文

缓存时间: 2026/09/28 04:03

论文页面 - 形态计量模仿:从形态与接触感知的手部重定向到跨实体视觉运动策略

来源:https://huggingface.co/papers/2609.28660

摘要

人手-物体交互(HOI)为灵巧操作提供了丰富的演示数据源,但直接从中学习面临形态差异弥合、动力学可行性保证以及跨实体迁移部署等多重挑战。本文提出形态计量模仿——一个三阶段框架,可将重建的HOI转化为零样本跨实体视觉运动策略。首先,形态计量优化(MMO)在保持演示接触状态的同时,跨不同手部形态进行运动学重定向。其次,残差强化学习(RL)利用人类运动中的物体位姿与接触信息优化运动学参考轨迹,生成动力学可行的机器人演示。最后,这些演示被蒸馏为视觉运动策略。在三种机械手与十个HOI场景的实验中,MMO在接触F1分数上相比五个基线中最强的基线均提升至少8个百分点,同时使下游动态重定向的成功率提升最高达35个百分点。残差RL的消融实验显示,融合物体位姿与接触信息具有互补效益。最终,视觉运动策略在300次真实世界试验(涵盖30个物体)中实现89.3%的零样本成功率。项目主页:https://morphometricimitation.github.io

查看arXiv页面 (https://arxiv.org/abs/2609.28660) 查看PDF (https://arxiv.org/pdf/2609.28660) 项目主页 (https://morphometricimitation.github.io/) GitHub仓库 (https://github.com/tsadja/morphometric) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.28660)

在代理中获取此论文:

hf papers read 2609.28660

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.28660 即可从本页面链接。

引用此论文的数据集 0

暂无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.28660 即可从本页面链接。

引用此论文的空间 0

暂无空间链接此论文

在空间README.md中引用 arxiv.org/abs/2609.28660 即可从本页面链接。

包含此论文的收藏 0

暂无收藏包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页面链接。

相似文章

ActiveMimic: 基于主动感知的自我中心视频预训练

Hugging Face Daily Papers

ActiveMimic 是一个预训练框架,它从自我中心人体视频中恢复相机和手腕轨迹,将主动感知建模为视角动作,从而使机器人预训练能够达到与直接在机器人数据上训练的模型相当的性能。

Mirror Learning

arXiv cs.LG

This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.