视频扩散模型在手部运动重建中的惊人有效性
摘要
ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。
查看缓存全文
缓存时间: 2026/06/30 07:35
论文页面 - 视频扩散模型在手部运动重建中的惊人有效性
来源:https://huggingface.co/papers/2606.30308
摘要
ViDiHand 利用预训练视频扩散模型的表征,结合手部叠加渲染,直接从视频帧中重建 4D 手部运动,无需检测器或优化。
从以自我为中心的视频(https://huggingface.co/papers?q=egocentric%20video)进行 4D 手部运动重建(https://huggingface.co/papers?q=4D%20hand%20motion%20reconstruction)受限于现有方法的明显不足:基于图像的流水线依赖于在严重遮挡下失败的检测器,而基于视频的方法依赖仅从稀缺的手部姿态标注(https://huggingface.co/papers?q=hand-pose%20annotations)中学习到的时间模块(https://huggingface.co/papers?q=temporal%20modules),这是一种不足以建模运动动态、遮挡推理和手物交互的狭窄信号。然而,这些能力正是视频生成模型(https://huggingface.co/papers?q=video%20generative%20models)在训练合成互联网规模连贯视频时必须隐式获得的。受此启发,我们提出了 ViDiHand,它利用预训练视频扩散模型的表征来重建 4D 双手姿态。我们通过一个手部叠加渲染(https://huggingface.co/papers?q=hand-overlay%20rendering)目标来适配它,该目标使其特征专门用于手部,同时保留其世界先验。然后,一个解码器从适配后的特征中恢复公制尺度姿态(https://huggingface.co/papers?q=metric-scale%20pose)。整个流水线直接操作于完整帧(https://huggingface.co/papers?q=full%20frames)——无需检测器、无需填充器,也无需测试时优化。在 ARCTIC、HOT3D 和 HOI4D 上,ViDiHand 大幅优于先前方法,将视频扩散模型(https://huggingface.co/papers?q=video%20diffusion%20models)确立为手部运动重建的强大新基础,并为具身 AI 的可扩展野外数据收集提供了一条有前景的路径。项目页面:https://vidihand.github.io/。
查看 arXiv 页面(https://arxiv.org/abs/2606.30308)查看 PDF(https://arxiv.org/pdf/2606.30308)项目页面(https://vidihand.github.io/)GitHub1(https://github.com/NTUYWANG103/ViDiHand)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.30308)
在您的代理中获取此论文:
hf papers read 2606.30308
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.30308 以从此页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.30308 以从此页面链接它。
引用此论文的 Spaces0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.30308 以从此页面链接它。
包含此论文的收藏1
相似文章
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
VideoMDM: 基于2D监督的3D人体运动生成方法
VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。
ReViV:从单目第一人称视频中重建观看者与场景的四维动态
ReViV是一个统一的整体性第一人称4D重建框架,它通过掩码生成式第一人称Transformer,从单目RGB视频中同时重建观看者(身体、手、视线)和场景(深度、相机轨迹)的动态,实现了最先进的准确性和效率。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹
DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。