视频扩散模型在手部运动重建中的惊人有效性

Hugging Face Daily Papers 论文

摘要

ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。

从自我中心视频进行4D手部运动重建受到现有方法明显局限性的阻碍:基于图像的流程依赖于在严重遮挡下失效的检测器,而基于视频的方法则依赖仅从稀缺的手部姿态标注中学习的时间模块,这种狭窄的信号不足以建模运动动态、遮挡推理和手物交互。然而,这些能力正是视频生成模型在互联网规模训练合成连贯视频时必须隐式获得的。受此启发,我们提出了ViDiHand,它利用预训练视频扩散模型的表示来重建4D双手姿态。我们通过一个手部覆盖渲染目标对其进行调整,使其特征专门针对手部,同时保留其世界先验。然后,一个解码器从调整后的特征中恢复公制尺度的姿态。整个流程直接在全帧上运行——无需检测器、无需填充器、无需测试时优化。在ARCTIC、HOT3D和HOI4D上,ViDiHand显著优于先前方法,将视频扩散模型确立为手部运动重建的强大新基础,并为具身AI的可扩展野外数据收集提供了一条有前景的途径。项目页面:https://vidihand.github.io。
查看原文
查看缓存全文

缓存时间: 2026/06/30 07:35

论文页面 - 视频扩散模型在手部运动重建中的惊人有效性

来源:https://huggingface.co/papers/2606.30308

摘要

ViDiHand 利用预训练视频扩散模型的表征,结合手部叠加渲染,直接从视频帧中重建 4D 手部运动,无需检测器或优化。

以自我为中心的视频(https://huggingface.co/papers?q=egocentric%20video)进行 4D 手部运动重建(https://huggingface.co/papers?q=4D%20hand%20motion%20reconstruction)受限于现有方法的明显不足:基于图像的流水线依赖于在严重遮挡下失败的检测器,而基于视频的方法依赖仅从稀缺的手部姿态标注(https://huggingface.co/papers?q=hand-pose%20annotations)中学习到的时间模块(https://huggingface.co/papers?q=temporal%20modules),这是一种不足以建模运动动态、遮挡推理和手物交互的狭窄信号。然而,这些能力正是视频生成模型(https://huggingface.co/papers?q=video%20generative%20models)在训练合成互联网规模连贯视频时必须隐式获得的。受此启发,我们提出了 ViDiHand,它利用预训练视频扩散模型的表征来重建 4D 双手姿态。我们通过一个手部叠加渲染(https://huggingface.co/papers?q=hand-overlay%20rendering)目标来适配它,该目标使其特征专门用于手部,同时保留其世界先验。然后,一个解码器从适配后的特征中恢复公制尺度姿态(https://huggingface.co/papers?q=metric-scale%20pose)。整个流水线直接操作于完整帧(https://huggingface.co/papers?q=full%20frames)——无需检测器、无需填充器,也无需测试时优化。在 ARCTIC、HOT3D 和 HOI4D 上,ViDiHand 大幅优于先前方法,将视频扩散模型(https://huggingface.co/papers?q=video%20diffusion%20models)确立为手部运动重建的强大新基础,并为具身 AI 的可扩展野外数据收集提供了一条有前景的路径。项目页面:https://vidihand.github.io/。

查看 arXiv 页面(https://arxiv.org/abs/2606.30308)查看 PDF(https://arxiv.org/pdf/2606.30308)项目页面(https://vidihand.github.io/)GitHub1(https://github.com/NTUYWANG103/ViDiHand)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.30308)

在您的代理中获取此论文:

hf papers read 2606.30308

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.30308 以从此页面链接它。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.30308 以从此页面链接它。

引用此论文的 Spaces0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.30308 以从此页面链接它。

包含此论文的收藏1

相似文章

VideoMDM: 基于2D监督的3D人体运动生成方法

Hugging Face Daily Papers

VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。

DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹

Hugging Face Daily Papers

DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。