Holo-World:面向视频世界模型的统一相机、物体与天气控制

Hugging Face Daily Papers 论文

摘要

Holo-World 提出了一种统一的可控视频世界模型,能够从单张图像生成视频,并显式控制相机、物体运动与天气。该工作引入了一个新颖的数据集与技术,可在将场景迁移至目标天气状态的同时保持场景结构。

视频世界模型正朝着在可控相机与物体运动下保留观察到的世界、同时允许环境状态变化的方向发展。然而,这些控制仍然相互独立,天气生成通常依赖于已指定未来结构的源视频或重建场景。我们研究了一种首帧锚定的源到状态设定:模型从单张图像出发,遵循明确的相机与物体控制以及可选的天气指令,生成视频——要么保留源世界,要么将其迁移至目标天气状态。为应对这些挑战,我们首先构建了 HoloStateData,这是一个状态视频数据集,将多样化的视频转化为用于相机、物体和天气监督的统一控制样本。其次,我们提出了 Holo-World,一个统一的可控视频世界模型,能够从单张图像联合控制场景。其 Unified Scene Adapter 将世界保留和天气迁移分解到不同的参数子空间,利用渲染背景、几何缓冲区以及物体控制来维持受控场景结构,同时建模依赖天气的外观与粒子效果。此外,Scene-Weather Decomposed CFG 分别引导场景与天气残差,增强目标天气效果而不过度放大整体条件。定量与定性实验表明,Holo-World 在将场景迁移至多种目标天气状态时,能够保持精确的相机与物体控制以及一致的场景结构,在天气状态生成上优于视频到视频的天气编辑基线。项目页面:https://xiangchenyin.github.io/Holo-World/。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:29

论文页面 - Holo-World: 统一控制相机、物体与天气的视频世界模型

来源: https://huggingface.co/papers/2606.20083

摘要

一种统一可控的视频世界模型,能够从单张图像生成视频,同时保留场景结构,并通过专门的参数化和条件技术将场景转移到目标天气状态。

视频世界模型(https://huggingface.co/papers?q=Video%20world%20models)正朝着在可控相机和物体运动(https://huggingface.co/papers?q=object%20motion)下保留观察到的世界,同时允许其环境状态发生变化的方向发展。然而,这些控制仍然彼此孤立,而天气生成(https://huggingface.co/papers?q=weather%20generation)通常依赖于已经指定了未来结构的源视频或重建场景。我们研究了一种以第一帧为锚点的源到状态设定(https://huggingface.co/papers?q=source-to-state%20setting),其中模型从单张图像开始,遵循明确的相机和物体控制以及可选的天气指令,然后生成一个视频,该视频要么保留源世界,要么将其转移到目标天气状态。为了应对这些挑战,我们首先构建了 HoloStateData(https://huggingface.co/papers?q=HoloStateData),这是一个状态视频数据集,将多样化的视频转化为用于相机、物体和天气监督的统一控制样本。其次,我们引入了 Holo-World(https://huggingface.co/papers?q=Holo-World),一种统一可控的视频世界模型,能够从单张图像联合控制场景。其统一场景适配器(https://huggingface.co/papers?q=Unified%20Scene%20Adapter)将世界保留和天气转移(https://huggingface.co/papers?q=weather%20transfer)分解为不同的参数子空间,利用渲染背景(https://huggingface.co/papers?q=rendered%20background)、几何缓冲区(https://huggingface.co/papers?q=geometry%20buffers)和物体控制来维持受控的场景结构,同时建模依赖于天气的外观和粒子效果。此外,场景-天气分解 CFG(https://huggingface.co/papers?q=Scene-Weather%20Decomposed%20CFG)分别引导场景和天气残差,在不过度放大整体条件的情况下增强目标天气效果。定量与定性实验表明,Holo-World(https://huggingface.co/papers?q=Holo-World)在保持精确的相机和物体控制以及一致的场景结构的同时,能够将场景转移到各种目标天气状态,在天气状态生成方面优于视频到视频的天气编辑(https://huggingface.co/papers?q=video-to-video%20weather%20editing)基线。我们的项目页面请见 https://xiangchenyin.github.io/Holo-World(https://huggingface.co/papers?q=Holo-World)/。

查看 arXiv 页面(https://arxiv.org/abs/2606.20083)查看 PDF(https://arxiv.org/pdf/2606.20083)项目页面(https://xiangchenyin.github.io/Holo-World/)GitHub4(https://github.com/XiangchenYin/Holo-World)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20083)

引用此论文的模型 0

无模型链接此论文

请在模型的 README.md 中引用 arxiv.org/abs/2606.20083 以从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2606.20083 以从此页面链接。

引用此论文的 Spaces 0

无 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2606.20083 以从此页面链接。

包含此论文的收藏 1

相似文章

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。