MoVerse: 实时视频世界建模与全景高斯脚手架

Hugging Face Daily Papers 论文

摘要

MoVerse 通过创建360°全景图和3D高斯脚手架,从单张图像生成实时交互式视频,利用基于扩散的技术实现高效渲染。

我们提出了 MoVerse,一种实时视频世界模型,能够从一张窄视场图像创建可交互导航的场景。这一设定具有挑战性,因为输入仅观察到环境的一小部分,而交互式漫游需要一个完整的周围世界、持久的几何结构、可控的相机运动以及时间一致的高保真观察结果。MoVerse 通过将世界构建与观察渲染分离来解决这个问题。它首先将输入扩展为与重力对齐的360°全景图,使用拓扑感知扩散,在3D推理之前填补缺失的视场。然后,它使用全景几何感知残差预测将全景图提升为持久的3D高斯脚手架,从而产生密集且可直接渲染的空间记忆。最后,一个高斯条件视频渲染器将用户指定的相机轨迹上的脚手架渲染转换为照片级真实的视频。为了使该渲染器适用于交互,我们训练了一个双向扩散教师模型用于高质量条件渲染,并将其蒸馏到一个因果自回归学生模型中,以实现有限延迟的流式处理。这种设计结合了显式3D表示的可控性和长程一致性以及生成视频模型的感知质量。MoVerse 在单个 NVIDIA RTX 4090 GPU 上支持8 FPS的实时场景漫游,展示了从单张图像创建世界并输出交互式视频的可行路径。
查看原文
查看缓存全文

缓存时间: 2026/06/12 02:52

论文页面 - MoVerse: 实时视频世界建模与全景高斯支架

来源: https://huggingface.co/papers/2606.13376

摘要

MoVerse 通过创建 360° 全景图和 3D Gaussian scaffold 从单张图像生成实时交互视频,并借助扩散技术实现高效渲染。

我们提出 MoVerse,这是一种实时视频世界模型,能够从单张窄视野图像创建可交互导航的场景。该任务具有挑战性,因为输入仅观察环境的一小部分,而交互式漫游需要完整的周围世界、持久的几何结构、可控的相机运动以及时间一致的高保真观测。MoVerse 通过将世界构建与观测渲染分离来解决这一问题。它首先利用拓扑感知扩散将输入扩展为重力对齐的 360° 全景图,在 3D 推理之前补全缺失的视野。然后,通过全景几何感知残差预测将全景图提升为持久的 3D Gaussian scaffold,从而获得密集且可直接渲染的空间记忆。最后,高斯条件视频渲染器将沿用户指定相机轨迹的支架渲染结果转换为逼真的视频。为使该渲染器适用于交互,我们训练了一个双向扩散教师模型用于高质量条件渲染,并将其蒸馏为因果自回归学生模型以实现有界延迟流式传输。这种设计结合了显式 3D 表示的可控性和长程一致性,以及生成式视频模型的感知质量。MoVerse 在单块 NVIDIA RTX 4090 GPU 上支持 8~FPS 的实时场景漫游,展示了从单张图像创建世界并输出交互式视频的实用路径。

查看 arXiv 页面 (https://arxiv.org/abs/2606.13376) 查看 PDF (https://arxiv.org/pdf/2606.13376) 项目页面 (https://orange-3dv-team.github.io/MoVerse/) GitHub (https://github.com/Orange-3DV-Team/MoVerse) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13376)

引用此论文的模型0

无模型链接到此论文

请在模型的 README.md 中引用 arxiv.org/abs/2606.13376 以在此页面显示链接。

引用此论文的数据集0

无数据集链接到此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2606.13376 以在此页面显示链接。

引用此论文的 Spaces0

无 Space 链接到此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2606.13376 以在此页面显示链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到一个收藏集中以在此页面显示链接。

相似文章

PanoWorld:真实世界全景生成

Hugging Face Daily Papers

PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。