ReViV:从单目第一人称视频中重建观看者与场景的四维动态
摘要
ReViV是一个统一的整体性第一人称4D重建框架,它通过掩码生成式第一人称Transformer,从单目RGB视频中同时重建观看者(身体、手、视线)和场景(深度、相机轨迹)的动态,实现了最先进的准确性和效率。
查看缓存全文
缓存时间: 2026/07/21 14:37
论文页面 - ReViV:从单目第一人称视频中重建4D的观察者与场景
来源:https://huggingface.co/papers/2607.17790
摘要
第一人称设备(如可穿戴前置摄像头)提供了捕捉人类观察者与周围环境连续交互的独特视角。因此,一个能够重建这种4D表示的整体且高效的多模态模型极具吸引力。然而,现有方法通常依赖辅助输入(如预计算的相机轨迹),将场景感知和人体自我运动建模视为独立问题(尽管它们高度相互依赖),并且推理时间较慢。为解决这些局限,我们提出ReViV——首个统一的整体第一人称4D重建框架,能够从单目RGB视频中同时提取观察者与场景的动态信息。我们将该任务建模为学习多模态信号(包括RGB视频、相机轨迹、注视方向、全身运动、手部运动和深度)的完整联合概率分布。借助掩码生成式第一人称Transformer,ReViV在单一前馈架构中运行,同时重建观察者与场景中时间一致的4D表示,且推理速度快。在多个基准(包括HoloAssist、HOT3D、ARCTIC、Aria Digital Twin和TACO)上的大量实验表明,ReViV在整体自我身体、手部和注视重建以及相机跟踪方面达到了最先进的准确性和效率,同时在不依赖繁重任务特定先验的情况下保持了极具竞争力的第一人称深度估计性能。代码和模型完全开源:https://reviv4d.github.io/。
查看 arXiv 页面 (https://arxiv.org/abs/2607.17790)查看 PDF (https://arxiv.org/pdf/2607.17790)项目页面 (https://reviv4d.github.io/)GitHub2 (https://github.com/lvsean/reviv4d)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17790)
在你的智能体中获取这篇论文:
hf papers read 2607.17790
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.17790 即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.17790 即可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.17790 即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
Lift4D:协调单视角3D估计用于野外4D重建
Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。
@vincieye: 单目视频实时转3D?MAGiSt3R使用多个代理和合并模型(MAGMA)从……重建场景
MAGiSt3R是一个多代理前馈框架,能够以10 FPS的速度从单目RGB视频实现实时3D重建,使用合并模型(MAGMA)结合局部点地图和姿态图优化来减少漂移。
迈向一致视频几何估计
ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。
GenRecon:结合生成先验的多视图3D场景重建
GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。