VidSplat:利用几何引导的视频扩散先验进行高斯泼溅重建
摘要
VidSplat 是一种无需训练的生成式重建框架,它利用视频扩散先验,通过合成新视角,从稀疏输入中恢复完整的 3D 场景。
查看缓存全文
缓存时间: 2026/05/13 04:10
论文页面 - VidSplat:结合几何引导的视频扩散先验的高斯溅射重建
来源: https://huggingface.co/papers/2605.11424
摘要
VidSplat 是一个无需训练的生成式重建框架,它利用视频扩散先验,通过自适应去噪和迭代优化,从稀疏输入中合成新视角并恢复完整的 3D 场景。
高斯溅射(Gaussian Splatting)(https://huggingface.co/papers?q=Gaussian%20Splatting) 在多视图表面重建(multi-view surface reconstruction)(https://huggingface.co/papers?q=multi-view%20surface%20reconstruction) 方面取得了显著进展,但在可用视角较少时会出现明显的性能下降。尽管近期的研究通过增强多视图一致性来生成合理的表面以缓解这一问题,但它们难以推断输入覆盖范围之外未见过的、被遮挡的或弱约束的区域。为了解决这一局限性,我们提出了 VidSplat,这是一个无需训练的生成式重建框架,它利用强大的视频扩散先验(video diffusion priors)(https://huggingface.co/papers?q=video%20diffusion%20priors) 迭代合成新视角,以补偿缺失的输入覆盖,从而从稀疏输入中恢复完整的 3D 场景。具体而言,我们解决了两个关键挑战,以实现生成与重建的有效整合。首先,针对 3D 一致性生成(3D consistent generation)(https://huggingface.co/papers?q=3D%20consistent%20generation),我们提出了一种无需训练的、分阶段的去噪策略(denoising strategy)(https://huggingface.co/papers?q=denoising%20strategy),利用渲染的 RGB 图像和掩码图像自适应地引导去噪方向趋向于基础几何结构。其次,为了增强重建效果,我们开发了一种迭代机制,该机制采样相机轨迹(camera trajectories)(https://huggingface.co/papers?q=camera%20trajectories),探索未观察到的区域,合成新视角,并通过置信度加权优化(confidence weighted refinement)(https://huggingface.co/papers?q=confidence%20weighted%20refinement) 补充训练数据。VidSplat 对稀疏输入甚至单张图像表现出强大的鲁棒性。在广泛使用的基准上的大量实验证明了我们在稀疏视角场景重建中的优越性能。
查看 arXiv 页面 (https://arxiv.org/abs/2605.11424) 查看 PDF (https://arxiv.org/pdf/2605.11424) 项目页面 (https://tangjm24.github.io/VidSplat/) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.11424)
在您的智能体中获取此论文:
hf papers read 2605\.11424
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接到此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.11424 即可从此页面链接它。
引用此论文的数据集0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.11424 即可从此页面链接它。
引用此论文的 Spaces0
没有链接到此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2605.11424 即可从此页面链接它。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加至收藏 (https://huggingface.co/new-collection) 即可从此页面链接它。
相似文章
InfiniSplat:面向大基线单目视图合成的隐式高斯解码
InfiniSplat 提出了一种前馈式单图像 3D 高斯泼溅框架,利用几何引导采样和查询条件隐式解码来实现表面对齐的高斯表示,从而改善大基线单目视图合成,并从合成室内训练泛化到开放世界场景。
GlobalSplat: 通过全局场景标记实现高效的前馈式三维高斯散射
GlobalSplat 引入了一种高效的前馈框架,用于三维高斯散射,通过全局场景标记实现紧凑且一致的场景重建,将计算开销和推理时间降低至78毫秒以下。该方法采用从粗到细的训练策略,防止表示膨胀,同时以显著更少的高斯原语(16K)达到有竞争力的新视角合成性能,与密集基线相比更为高效。
从实况画面重建不同视角
4D Gaussian Splatting 是一种将平面2D图像转换为三维空间数据的技术,能够从实况画面重建不同视角。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
FLAT: 面向几何精确场景生成的前馈潜在三角形溅射
FLAT提出了一种方法,直接从视频扩散潜在表示中解码显式三角形溅射,用于几何精确的3D场景生成。它引入了以射线为中心的旋转参数化和乘积窗口函数来改善梯度流,实现了比先前前馈方法更好的几何精度,同时支持实时渲染。