DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
摘要
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
查看缓存全文
缓存时间: 2026/04/23 11:54
论文页面 - DeVI:基于物理的灵巧人-物交互合成视频模仿
来源:https://huggingface.co/papers/2604.20841
摘要
DeVI 通过融合 3D 与 2D 追踪的混合追踪奖励,利用文本条件合成视频,实现物理可信的灵巧机器人控制,显著提升手-物交互建模效果。
近期视频生成模型(https://huggingface.co/papers?q=video%20generative%20models)的进展,可在广泛场景与物体类别中合成逼真的人-物交互视频,涵盖动作捕捉系统难以记录的复杂灵巧操作。尽管这些合成视频蕴含丰富的交互知识,对运动规划(https://huggingface.co/papers?q=motion%20planning)与灵巧机器人操控(https://huggingface.co/papers?q=dexterous%20robotic%20manipulation)极具潜力,但其物理保真度有限且纯 2D 特性,难以直接作为基于物理的角色模仿目标。我们提出 DeVI(Dexterous Video Imitation),一种新颖框架,利用文本条件合成视频(https://huggingface.co/papers?q=text-conditioned%20synthetic%20videos)实现与未见目标物体交互的物理可信灵巧智能体控制。为克服生成式 2D 线索不精确的问题,我们引入混合追踪奖励(https://huggingface.co/papers?q=hybrid%20tracking%20reward),将 3D 人体追踪(https://huggingface.co/papers?q=3D%20human%20tracking)与鲁棒 2D 物体追踪(https://huggingface.co/papers?q=2D%20object%20tracking)相结合。与依赖高质量 3D 运动学演示的方法不同,DeVI 仅需生成视频,即可在多样物体与交互类型上实现零样本泛化(https://huggingface.co/papers?q=zero-shot%20generalization)。大量实验表明,DeVI 在模仿 3D 人-物交互演示方面优于现有方法,尤其在灵巧手-物交互(https://huggingface.co/papers?q=hand-object%20interactions)建模上表现突出。我们进一步验证了 DeVI 在多物体场景与文本驱动动作多样性中的有效性,彰显其作为 HOI 感知运动规划器(https://huggingface.co/papers?q=HOI-aware%20motion%20planner)的视频优势。
查看 arXiv 页面(https://arxiv.org/abs/2604.20841)
查看 PDF(https://arxiv.org/pdf/2604.20841)
项目主页(https://snuvclab.github.io/devi/)
GitHub15(https://github.com/snuvclab/devi)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.20841)
在智能体中获取本文:
hf papers read 2604.20841
未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型引用该论文
在模型 README.md 中引用 arxiv.org/abs/2604.20841 即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集引用该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.20841 即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 引用该论文
在 Space README.md 中引用 arxiv.org/abs/2604.20841 即可在此页面显示链接。
包含该论文的收藏 0
暂无收藏包含该论文
将本论文添加到收藏(https://huggingface.co/new-collection)即可在此页面显示链接。
相似文章
零样本仿真到现实机器人学习:关于反应性抓取的灵巧操作研究
本文介绍了域随机化实例集(DRIS),一种同时表示多个随机化实例的方法,以改善灵巧操作的仿真到现实迁移。该方法在具有平板末端执行器且要求无真实世界微调的反应性抓取任务上展示了零样本迁移。
DragMesh-2:与铰接物体的物理合理灵巧手-物体交互
本文介绍了DragMesh-2和PICA方法,用于通过模拟中的接触感知强化学习来学习与铰接物体的物理合理灵巧手-物体交互,在没有明确触觉反馈的情况下实现有效操作。
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
EgoSteer: 从第一人称视频实现可引导灵巧操作的全栈系统
EgoSteer提出一个全栈系统,从第一人称人类视频预训练视觉-语言-动作模型,实现可引导的灵巧操作,在40多个多样化任务上展现鲁棒泛化能力,复杂长时任务成功率超过75%。
CoInteract:通过空间结构化协同生成实现物理一致的人-物交互视频合成
CoInteract 提出端到端 Diffusion Transformer 框架,联合建模 RGB 外观与 HOI 几何,在零推理开销下生成物理合理、手脸稳定的人-物交互视频。