从低重叠拍摄进行4D人体-场景重建

Hugging Face Daily Papers 论文

摘要

提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。

现有的动态人体表演体积捕捉通过密集相机阵列实现了高保真度。然而,在真实场景中,只有少数低重叠相机可用,这降低了输出质量并留下了大片未观测区域。最近的4D重建方法专注于低重叠设置,但它们仍然在欠观测区域产生明显的伪影。视频扩散模型作为另一种选择出现,但它们在人体上显示出几何不一致的结果。为解决这些限制,我们提出StudioRecon,这是一个通过解耦背景和人体从稀疏、低重叠相机中重建4D人物场景的流程。我们通过使用视频扩散模型合成数百个相机控制的新视角来增密背景监督。我们还通过跨视角身份关联和三角化多视角关键点拟合来稳健地初始化可变形高斯人体。最后,我们的递归增强模块通过运动自适应一致性注入来协调组合输出,从而进一步避免残留伪影。我们在四个真实世界数据集上实现了最先进的新视角合成,并展示了诸如新轨迹渲染和人体替换等应用。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:12

论文页面 - 低重叠拍摄下的4D人体-场景重建

来源:https://huggingface.co/papers/2607.09125

房间四周放置四台相机,彼此相隔约90°,相邻视角几乎没有任何重叠。COLMAP甚至无法注册它们。这就是我们追求的设定。

我们的洞察是:背景和人体需要不同的先验,因此我们不再让单一模型同时解决两者。

🎬 视频扩散模型对背景进行密集化处理,将4个真实视角扩展为数百个。🧍 SMPL约束人体,弥补视频扩散在运动场景下的不足。✨ 递归增强模块协调两者,消除帧闪烁。

在来自EgoHumans、Harmony4D、Mobile Stage和SelfCap的8个场景中,StudioRecon在每个场景上都优于先前方法:PSNR比最优基线提升1.5至5.0 dB,LPIPS降低33%至74%。

被SIGGRAPH 2026会议论文接收。前两位作者贡献相同。

相似文章

4DAnyone:从普通单目视频创建4D人物

Hugging Face Daily Papers

4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。

Lift4D:协调单视角3D估计用于野外4D重建

Hacker News Top

Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。

GenRecon:结合生成先验的多视图3D场景重建

Hugging Face Daily Papers

GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。

超越像素:从视频先验到4D世界

Hugging Face Daily Papers

本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。