Lift4D:协调单视角3D估计用于野外4D重建

Hacker News Top 论文

摘要

Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/23 16:44

# 协调单视角3D估计以实现野外4D重建 来源: https://lift4d.github.io/ ## Lift4D 从单个野外单目视频中重建场景中动态物体的完整几何形状、外观和形变,包括相机从未观察到的区域。 ## 摘要 从单目视频重建完整的动态物体需要将直接观测的视觉线索与数据驱动的几何和外观先验相结合。现有方法要么直接从视觉输入逐帧预测3D表示,要么初始化一个3D表示,然后基于视频证据进行形变和优化。然而,前者受限于4D训练数据的稀缺性,而后者仅在初始重建时使用先验信息,之后完全依赖视频监督;两者都无法很好地处理存在大形变和遮挡的复杂野外场景。 我们提出 **Lift4D**,一个测试时优化框架,解决了上述两个局限性。首先,我们调整现有单视角3D重建模型,通过因果潜在条件生成时间上一致的逐帧预测,为可形变的3D高斯泼溅表示提供连贯的初始化。然后,我们通过遮挡感知优化来“雕琢”这一表示,使其匹配输入视频:忠实恢复可见表面细节,同时使用视图条件扩散先验补全未观察区域。我们证明 **Lift4D** 显著优于先前的4D重建方法,特别是在存在严重遮挡和非刚性运动的挑战性野外序列上。 ## 重建完整的野外 4D 在下方选择一个场景,在交互式查看器中探索其完整的4D重建。点击并拖拽以旋转;滚动以缩放。 点击缩略图切换场景。部分场景较大,请耐心等待。 ## 方法 单视角重建先验 因果潜在传播 ↓ 高斯泼溅解码器 ↓ 逐帧3D重建 完整4D重建 规范高斯 + 形变节点 精细外观形变节点 遮挡感知外观损失 ← 场景深度 / 逐帧3D 遮挡修复帧 带噪形变3DGS渲染 ↓ 新视角扩散先验 ↓ 新视角样本 + (−) 渲染监督 L_rec L_app 从单目输入视频开始,一个图像到3D的DiT模型通过**因果潜在传播**生成时间一致的逐帧3D重建:每帧的3D潜在由混合新鲜噪声与前一帧的去噪潜在初始化,输出解码为独立的几组高斯泼溅。我们将这些逐帧预测的集合整合成一个**完整的4D高斯泼溅重建**,由**两组稀疏形变节点驱动的规范高斯**表示。第一组通过重建损失(L_rec)拟合逐帧输出的几何,然后通过优化颜色以及第二组**精细外观形变节点**,结合**遮挡修复帧**和渲染损失来优化外观:从随机新视角渲染4D重建并加噪,新视角扩散先验对这些带噪渲染进行去噪,条件为使用逐帧3D输出修复了遮挡的逐帧帧。得到的去噪新视角样本蒸馏以及可见像素上的渲染损失提供了外观监督信号(L_app),**在帧间聚合可见细节,并在遮挡和未观察区域进行幻觉补全**。 ## 对比 Lift4D 在合成和野外视频上均优于先前的4D重建基线,即使在严重遮挡下也能提供完整的、时间一致的几何、更清晰的外观和更准确的运动。 ## BibTeX `` @article{litman2026lift4d, author = {Litman, Yehonathan and Ma, Xiaoxuan and Shah, Manan and Ugrinovic, Nicol\'{a}s and Kitani, Kris and De la Torre, Fernando and Tulsiani, Shubham}, title = {Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild}, journal = {arXiv}, year = {2026}, } ``

相似文章

TT4D:一种基于单目视频进行乒乓球4D重建的Pipeline与数据集

Hugging Face Daily Papers

本文介绍了TT4D,这是一种新颖的Pipeline和大规模数据集,旨在从单目视频中重建乒乓球比赛的4D场景。该方案采用独特的“先升维”策略,在进行时间分割之前,先估计乒乓球的3D轨迹和旋转,从而即使在存在遮挡的情况下也能实现稳健的重建。

从低重叠拍摄进行4D人体-场景重建

Hugging Face Daily Papers

提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。

Helix4D:复杂4D网格生成

Hugging Face Daily Papers

Helix4D 提出了一种从视频生成高质量动态4D网格的框架,通过扩展Trellis2,引入跨帧注意力机制和4D时间编码,在不增加参数的情况下重新利用冗余的空间RoPE频带,从而实现这一目标。

D4RT:教会 AI 以四维视角观察世界

Google DeepMind Blog

DeepMind 推出 D4RT,一个统一的 AI 模型,用于动态 4D 场景重建与追踪,效率较此前方法提升高达 300 倍。该模型采用基于查询的 Transformer 架构,为机器人技术与 AR 应用解决复杂的空间和时序任务。