UniWorld-View:基于视频扩散模型的大基线视图合成

Hugging Face Daily Papers 论文

摘要

提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。

社交媒体上大量随意拍摄的单目视频和图像为沉浸式内容创作提供了宝贵的来源,从这些稀疏观测中生成新视图可以极大提升用户体验。然而,在输入覆盖极其有限的情况下,生成具有精确相机控制的逼真且几何一致的视图仍然具有挑战性。基于重建的方法(如NeRF和3D Gaussian Splatting (3DGS))在稀疏输入下会严重退化,并且无法显式处理遮挡。生成式方法缓解了数据需求,但由于几何引导不准确或隐式,仍难以应对大基线视图合成。为了克服这些局限,我们提出了UniWorld-View,一个用于从单目输入进行可控大基线新视图合成的统一框架。UniWorld-View将显式3D引导与生成式扩散建模相结合,以实现精确的相机控制和几何一致的视图生成。几何引导通过一种遮挡感知的点云渲染策略获得,该策略解决了可见性歧义,并为基于扩散的合成提供了准确的先验。通过将该渲染策略与强大的视频扩散骨干网络相结合,UniWorld-View即使在极端相机运动和宽基线变化下也能实现高保真的新视图生成,并可进一步为下游动态3DGS重建提供多视角视频。在WorldScore基准和零样本NVS基准上的实验证明了UniWorld-View在可控性、几何一致性和视觉保真度方面的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:50

论文页面 - UniWorld-View:基于视频扩散模型的大基线视角合成

来源:https://huggingface.co/papers/2608.04701

摘要

社交媒体上大量随意拍摄的单目视频和图像为沉浸式内容创作提供了宝贵的来源,从这些稀疏观测中生成新视角可以极大地增强用户体验。然而,当输入覆盖范围极其有限时,生成具有精确相机控制的照片级逼真且几何一致的视角仍然具有挑战性。基于重建的方法(如 NeRF 和 3D 高斯泼溅 (3DGS))在稀疏输入下会严重恶化,并且无法显式处理遮挡。生成方法降低了对数据的要求,但由于不准确或隐式的几何引导,仍然难以进行大基线视角合成。为了克服这些限制,我们提出了 UniWorld-View,一个用于从单目输入进行可控大基线新视角合成的统一框架。UniWorld-View 将显式 3D 引导与生成式扩散建模相结合,以实现精确的相机控制和几何一致的视角生成。几何引导通过一种基于遮挡感知的点云渲染策略获得,该策略解决了可见性歧义,并为基于扩散的合成提供了准确的先验。通过将这种渲染策略与强大的视频扩散骨干网络相结合,UniWorld-View 即使在极端的相机运动和宽基线变化下也能实现高保真的新视角生成,并可以进一步为下游动态 3DGS 重建提供多视角视频。在 WorldScore 基准和零样本 NVS 基准上的实验证明了 UniWorld-View 在可控性、几何一致性和视觉保真度方面的有效性。

查看 arXiv 页面查看 PDF项目页面GitHub92添加到收藏

在您的智能体中获取此论文:

hf papers read 2608\.04701

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.04701 以从此页面链接它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.04701 以从此页面链接它。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2608.04701 以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章