MoVerse: 实时视频世界建模与全景高斯脚手架
摘要
MoVerse 通过创建360°全景图和3D高斯脚手架,从单张图像生成实时交互式视频,利用基于扩散的技术实现高效渲染。
查看缓存全文
缓存时间: 2026/06/12 02:52
论文页面 - MoVerse: 实时视频世界建模与全景高斯支架
来源: https://huggingface.co/papers/2606.13376
摘要
MoVerse 通过创建 360° 全景图和 3D Gaussian scaffold 从单张图像生成实时交互视频,并借助扩散技术实现高效渲染。
我们提出 MoVerse,这是一种实时视频世界模型,能够从单张窄视野图像创建可交互导航的场景。该任务具有挑战性,因为输入仅观察环境的一小部分,而交互式漫游需要完整的周围世界、持久的几何结构、可控的相机运动以及时间一致的高保真观测。MoVerse 通过将世界构建与观测渲染分离来解决这一问题。它首先利用拓扑感知扩散将输入扩展为重力对齐的 360° 全景图,在 3D 推理之前补全缺失的视野。然后,通过全景几何感知残差预测将全景图提升为持久的 3D Gaussian scaffold,从而获得密集且可直接渲染的空间记忆。最后,高斯条件视频渲染器将沿用户指定相机轨迹的支架渲染结果转换为逼真的视频。为使该渲染器适用于交互,我们训练了一个双向扩散教师模型用于高质量条件渲染,并将其蒸馏为因果自回归学生模型以实现有界延迟流式传输。这种设计结合了显式 3D 表示的可控性和长程一致性,以及生成式视频模型的感知质量。MoVerse 在单块 NVIDIA RTX 4090 GPU 上支持 8~FPS 的实时场景漫游,展示了从单张图像创建世界并输出交互式视频的实用路径。
查看 arXiv 页面 (https://arxiv.org/abs/2606.13376) 查看 PDF (https://arxiv.org/pdf/2606.13376) 项目页面 (https://orange-3dv-team.github.io/MoVerse/) GitHub (https://github.com/Orange-3DV-Team/MoVerse) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13376)
引用此论文的模型0
无模型链接到此论文
请在模型的 README.md 中引用 arxiv.org/abs/2606.13376 以在此页面显示链接。
引用此论文的数据集0
无数据集链接到此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2606.13376 以在此页面显示链接。
引用此论文的 Spaces0
无 Space 链接到此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.13376 以在此页面显示链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到一个收藏集中以在此页面显示链接。
相似文章
HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。
@vincieye: 单目视频实时转3D?MAGiSt3R使用多个代理和合并模型(MAGMA)从……重建场景
MAGiSt3R是一个多代理前馈框架,能够以10 FPS的速度从单目RGB视频实现实时3D重建,使用合并模型(MAGMA)结合局部点地图和姿态图优化来减少漂移。
Pantheon360: 通过3D感知360度视频扩散驯服数字孪生生成
Pantheon360引入了一种3D感知360度视频扩散框架,该框架使用显式3D缓存来强制执行几何一致性,从而能够从稀疏360度输入中生成高保真数字孪生。
PanoWorld:真实世界全景生成
PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。
UniWorld-View:基于视频扩散模型的大基线视图合成
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。