ReViV:从单目第一人称视频中重建观看者与场景的四维动态

Hugging Face Daily Papers 论文

摘要

ReViV是一个统一的整体性第一人称4D重建框架,它通过掩码生成式第一人称Transformer,从单目RGB视频中同时重建观看者(身体、手、视线)和场景(深度、相机轨迹)的动态,实现了最先进的准确性和效率。

第一人称设备(例如可穿戴的前置摄像头)提供了捕捉人类观看者与周围环境持续交互的独特视角。因此,一个能够重建这种4D表示的整体高效多模态模型极具价值。然而,现有方法通常依赖辅助输入(如预先计算的相机轨迹),将场景感知和人类自我运动建模视为独立问题(尽管它们之间存在强相互依赖性),并且推理时间较慢。为了解决这些局限性,我们提出了ReViV,这是首个统一的整体性第一人称4D重建框架,能够从单个单目RGB视频中同时提取观看者和场景的动态。我们将该任务建模为学习多模态信号(包括RGB视频、相机轨迹、视线方向、全身运动、手部运动和深度)的完整联合概率分布。借助掩码生成式第一人称Transformer,ReViV在单一前馈架构中运行,同时重建观看者和场景在时间上一致的4D表示,并实现快速推理。在包括HoloAssist、HOT3D、ARCTIC、Aria Digital Twin和TACO等多个基准数据集上的广泛实验表明,ReViV在整体自我身体、手部和视线重建、相机跟踪方面达到了最先进的准确性和效率,同时在没有依赖大量任务特定先验的情况下,保持了极具竞争力的第一人称深度估计性能。代码和模型已完全开源:https://reviv4d.github.io/。
查看原文
查看缓存全文

缓存时间: 2026/07/21 14:37

论文页面 - ReViV:从单目第一人称视频中重建4D的观察者与场景

来源:https://huggingface.co/papers/2607.17790

摘要

第一人称设备(如可穿戴前置摄像头)提供了捕捉人类观察者与周围环境连续交互的独特视角。因此,一个能够重建这种4D表示的整体且高效的多模态模型极具吸引力。然而,现有方法通常依赖辅助输入(如预计算的相机轨迹),将场景感知和人体自我运动建模视为独立问题(尽管它们高度相互依赖),并且推理时间较慢。为解决这些局限,我们提出ReViV——首个统一的整体第一人称4D重建框架,能够从单目RGB视频中同时提取观察者与场景的动态信息。我们将该任务建模为学习多模态信号(包括RGB视频、相机轨迹、注视方向、全身运动、手部运动和深度)的完整联合概率分布。借助掩码生成式第一人称Transformer,ReViV在单一前馈架构中运行,同时重建观察者与场景中时间一致的4D表示,且推理速度快。在多个基准(包括HoloAssist、HOT3D、ARCTIC、Aria Digital Twin和TACO)上的大量实验表明,ReViV在整体自我身体、手部和注视重建以及相机跟踪方面达到了最先进的准确性和效率,同时在不依赖繁重任务特定先验的情况下保持了极具竞争力的第一人称深度估计性能。代码和模型完全开源:https://reviv4d.github.io/。

查看 arXiv 页面 (https://arxiv.org/abs/2607.17790)查看 PDF (https://arxiv.org/pdf/2607.17790)项目页面 (https://reviv4d.github.io/)GitHub2 (https://github.com/lvsean/reviv4d)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17790)

在你的智能体中获取这篇论文:

hf papers read 2607.17790

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.17790 即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.17790 即可从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.17790 即可从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Lift4D:协调单视角3D估计用于野外4D重建

Hacker News Top

Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。

迈向一致视频几何估计

Hugging Face Daily Papers

ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。

GenRecon:结合生成先验的多视图3D场景重建

Hugging Face Daily Papers

GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。