从低重叠拍摄进行4D人体-场景重建
摘要
提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。
查看缓存全文
缓存时间: 2026/07/14 04:12
论文页面 - 低重叠拍摄下的4D人体-场景重建
来源:https://huggingface.co/papers/2607.09125
房间四周放置四台相机,彼此相隔约90°,相邻视角几乎没有任何重叠。COLMAP甚至无法注册它们。这就是我们追求的设定。
我们的洞察是:背景和人体需要不同的先验,因此我们不再让单一模型同时解决两者。
🎬 视频扩散模型对背景进行密集化处理,将4个真实视角扩展为数百个。🧍 SMPL约束人体,弥补视频扩散在运动场景下的不足。✨ 递归增强模块协调两者,消除帧闪烁。
在来自EgoHumans、Harmony4D、Mobile Stage和SelfCap的8个场景中,StudioRecon在每个场景上都优于先前方法:PSNR比最优基线提升1.5至5.0 dB,LPIPS降低33%至74%。
被SIGGRAPH 2026会议论文接收。前两位作者贡献相同。
相似文章
4DAnyone:从普通单目视频创建4D人物
4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。
Lift4D:协调单视角3D估计用于野外4D重建
Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。
GenRecon:结合生成先验的多视图3D场景重建
GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
超越像素:从视频先验到4D世界
本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。