DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现

Hugging Face Daily Papers 论文

摘要

DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。

最新的视频生成模型可在广泛场景与物体类别中合成逼真的人-物交互视频,涵盖动作捕捉系统难以记录的复杂灵巧操作。尽管这些合成视频蕴含丰富的交互知识,对灵巧机器人运动规划极具潜力,但其物理保真度有限且纯为 2D 形式,难以直接作为基于物理的角色模仿目标。我们提出 DeVI(Dexterous Video Imitation),一种新颖框架,利用文本驱动的合成视频,实现与未见目标物体交互的物理可信灵巧智能体控制。为克服生成式 2D 线索的不精确性,我们引入混合跟踪奖励,将 3D 人体跟踪与鲁棒的 2D 物体跟踪融合。与依赖高质量 3D 运动学演示的方法不同,DeVI 仅需生成视频,即可在多样化物体与交互类型上实现零样本泛化。大量实验表明,DeVI 在模仿 3D 人-物交互演示方面优于现有方法,尤其在建模灵巧手-物交互时表现突出。我们进一步在多物体场景与文本驱动动作多样性中验证 DeVI 的有效性,展示视频作为 HOI 感知运动规划器的优势。
查看原文
查看缓存全文

缓存时间: 2026/04/23 11:54

论文页面 - DeVI:基于物理的灵巧人-物交互合成视频模仿

来源:https://huggingface.co/papers/2604.20841

摘要

DeVI 通过融合 3D 与 2D 追踪的混合追踪奖励,利用文本条件合成视频,实现物理可信的灵巧机器人控制,显著提升手-物交互建模效果。

近期视频生成模型(https://huggingface.co/papers?q=video%20generative%20models)的进展,可在广泛场景与物体类别中合成逼真的人-物交互视频,涵盖动作捕捉系统难以记录的复杂灵巧操作。尽管这些合成视频蕴含丰富的交互知识,对运动规划(https://huggingface.co/papers?q=motion%20planning)与灵巧机器人操控(https://huggingface.co/papers?q=dexterous%20robotic%20manipulation)极具潜力,但其物理保真度有限且纯 2D 特性,难以直接作为基于物理的角色模仿目标。我们提出 DeVI(Dexterous Video Imitation),一种新颖框架,利用文本条件合成视频(https://huggingface.co/papers?q=text-conditioned%20synthetic%20videos)实现与未见目标物体交互的物理可信灵巧智能体控制。为克服生成式 2D 线索不精确的问题,我们引入混合追踪奖励(https://huggingface.co/papers?q=hybrid%20tracking%20reward),将 3D 人体追踪(https://huggingface.co/papers?q=3D%20human%20tracking)与鲁棒 2D 物体追踪(https://huggingface.co/papers?q=2D%20object%20tracking)相结合。与依赖高质量 3D 运动学演示的方法不同,DeVI 仅需生成视频,即可在多样物体与交互类型上实现零样本泛化(https://huggingface.co/papers?q=zero-shot%20generalization)。大量实验表明,DeVI 在模仿 3D 人-物交互演示方面优于现有方法,尤其在灵巧手-物交互(https://huggingface.co/papers?q=hand-object%20interactions)建模上表现突出。我们进一步验证了 DeVI 在多物体场景与文本驱动动作多样性中的有效性,彰显其作为 HOI 感知运动规划器(https://huggingface.co/papers?q=HOI-aware%20motion%20planner)的视频优势。

查看 arXiv 页面(https://arxiv.org/abs/2604.20841)
查看 PDF(https://arxiv.org/pdf/2604.20841)
项目主页(https://snuvclab.github.io/devi/)
GitHub15(https://github.com/snuvclab/devi)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.20841)

在智能体中获取本文:

hf papers read 2604.20841

未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

暂无模型引用该论文

在模型 README.md 中引用 arxiv.org/abs/2604.20841 即可在此页面显示链接。

引用该论文的数据集 0

暂无数据集引用该论文

在数据集 README.md 中引用 arxiv.org/abs/2604.20841 即可在此页面显示链接。

引用该论文的 Spaces 0

暂无 Space 引用该论文

在 Space README.md 中引用 arxiv.org/abs/2604.20841 即可在此页面显示链接。

包含该论文的收藏 0

暂无收藏包含该论文

将本论文添加到收藏(https://huggingface.co/new-collection)即可在此页面显示链接。

相似文章

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。