Holo-World:面向视频世界模型的统一相机、物体与天气控制
摘要
Holo-World 提出了一种统一的可控视频世界模型,能够从单张图像生成视频,并显式控制相机、物体运动与天气。该工作引入了一个新颖的数据集与技术,可在将场景迁移至目标天气状态的同时保持场景结构。
查看缓存全文
缓存时间: 2026/06/20 14:29
论文页面 - Holo-World: 统一控制相机、物体与天气的视频世界模型
来源: https://huggingface.co/papers/2606.20083
摘要
一种统一可控的视频世界模型,能够从单张图像生成视频,同时保留场景结构,并通过专门的参数化和条件技术将场景转移到目标天气状态。
视频世界模型(https://huggingface.co/papers?q=Video%20world%20models)正朝着在可控相机和物体运动(https://huggingface.co/papers?q=object%20motion)下保留观察到的世界,同时允许其环境状态发生变化的方向发展。然而,这些控制仍然彼此孤立,而天气生成(https://huggingface.co/papers?q=weather%20generation)通常依赖于已经指定了未来结构的源视频或重建场景。我们研究了一种以第一帧为锚点的源到状态设定(https://huggingface.co/papers?q=source-to-state%20setting),其中模型从单张图像开始,遵循明确的相机和物体控制以及可选的天气指令,然后生成一个视频,该视频要么保留源世界,要么将其转移到目标天气状态。为了应对这些挑战,我们首先构建了 HoloStateData(https://huggingface.co/papers?q=HoloStateData),这是一个状态视频数据集,将多样化的视频转化为用于相机、物体和天气监督的统一控制样本。其次,我们引入了 Holo-World(https://huggingface.co/papers?q=Holo-World),一种统一可控的视频世界模型,能够从单张图像联合控制场景。其统一场景适配器(https://huggingface.co/papers?q=Unified%20Scene%20Adapter)将世界保留和天气转移(https://huggingface.co/papers?q=weather%20transfer)分解为不同的参数子空间,利用渲染背景(https://huggingface.co/papers?q=rendered%20background)、几何缓冲区(https://huggingface.co/papers?q=geometry%20buffers)和物体控制来维持受控的场景结构,同时建模依赖于天气的外观和粒子效果。此外,场景-天气分解 CFG(https://huggingface.co/papers?q=Scene-Weather%20Decomposed%20CFG)分别引导场景和天气残差,在不过度放大整体条件的情况下增强目标天气效果。定量与定性实验表明,Holo-World(https://huggingface.co/papers?q=Holo-World)在保持精确的相机和物体控制以及一致的场景结构的同时,能够将场景转移到各种目标天气状态,在天气状态生成方面优于视频到视频的天气编辑(https://huggingface.co/papers?q=video-to-video%20weather%20editing)基线。我们的项目页面请见 https://xiangchenyin.github.io/Holo-World(https://huggingface.co/papers?q=Holo-World)/。
查看 arXiv 页面(https://arxiv.org/abs/2606.20083)查看 PDF(https://arxiv.org/pdf/2606.20083)项目页面(https://xiangchenyin.github.io/Holo-World/)GitHub4(https://github.com/XiangchenYin/Holo-World)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20083)
引用此论文的模型 0
无模型链接此论文
请在模型的 README.md 中引用 arxiv.org/abs/2606.20083 以从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2606.20083 以从此页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.20083 以从此页面链接。
包含此论文的收藏 1
相似文章
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。
UniWorld-View:基于视频扩散模型的大基线视图合成
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
WorldCraft:从相机导航到交互式视频世界模型中的物体操控
WorldCraft扩展了交互式视频世界模型,通过专门的控制流水线,在保持相机导航能力的同时实现物体级别的轨迹控制。
MultiWorld:可扩展的多智能体多视角视频世界模型
MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。