Wonder:更优的视频世界模型
摘要
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
查看缓存全文
缓存时间: 2026/07/29 03:50
论文页面 - Wonder:更好的视频世界模型
来源:https://huggingface.co/papers/2607.26037
摘要
我们提出 Wonder,一个通用的视频世界模型,用于实时、可控制摄像头的世界探索。给定一张图像或一段条件视频,Wonder 构建了一个可玩的虚拟世界,用户可以通过移动摄像头进行交互式导航,实时并且长期地发现未观察区域、重新访问之前观察过的区域。实现这一能力需要在控制方法、记忆机制和训练策略上进行系统级的协同设计。我们引入了一种新颖的摄像头条件方法,采用稠密坐标场,其渲染结果提供空间对齐的运动和方向线索,使模型能够将摄像头运动直接解释为视觉证据。为了在逐渐增长的生成上下文中支持快速且精确的记忆检索,我们提出了一种高效的基于稀疏注意力的记忆机制,使模型能够在推理时选择性地关注一小部分相关的上下文 token,无论实际上下文长度如何。我们进一步开发了多种技术来修正自强制式蒸馏流程,提高了学生模型尊重控制信号的能力,同时保持了来自教师模型的多样化生成模式和长期记忆。这些组件共同使 Wonder 能够以16FPS的速度合成多样化、分钟级的视频,同时在整个长序列中保持连贯的几何、外观和动态。除了图像到视频的生成,Wonder 还自然支持视频条件生成,允许现有的动态场景被实时重新拍摄。
查看 arXiv 页面 (https://arxiv.org/abs/2607.26037) 查看 PDF (https://arxiv.org/pdf/2607.26037) 项目页面 (https://wonder-world-model.github.io/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26037)
在你的 agent 中获取此论文:
hf papers read 2607.26037
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.26037 即可链接到此页面。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.26037 即可链接到此页面。
引用此论文的 Spaces0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.26037 即可链接到此页面。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可链接到此页面。
相似文章
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
Holo-World:面向视频世界模型的统一相机、物体与天气控制
Holo-World 提出了一种统一的可控视频世界模型,能够从单张图像生成视频,并显式控制相机、物体运动与天气。该工作引入了一个新颖的数据集与技术,可在将场景迁移至目标天气状态的同时保持场景结构。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模
Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。
minWM:用于实时交互式视频世界模型的全栈开源框架
minWM 是一个全栈开源框架,可将双向视频扩散模型转换为实时交互式视频世界模型,支持可控相机、低延迟推演和模块化架构。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。