Wonder:更优的视频世界模型

Hugging Face Daily Papers 论文

摘要

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

我们提出Wonder,一个通用的视频世界模型,用于实时、可控制摄像头的世界探索。给定一张图像或一个条件视频,Wonder构建了一个可交互的世界,用户可以通过移动摄像头进行交互式导航,发现未见的区域,并在实时和长期范围内重新访问之前观察过的区域。实现这一能力需要在控制方法、记忆机制和训练策略上进行系统级的协同设计。我们引入了一种新颖的摄像头条件化方法,采用密集坐标场,其渲染结果提供空间对齐的运动和方向线索,使模型能够直接将摄像头运动解释为视觉证据。为了支持在不断增长的生成上下文中快速且精确的记忆检索,我们提出了一种高效的基于稀疏注意力的记忆机制,使模型在推理时能够选择性地关注一小部分相关的上下文标记,而不管实际上下文长度如何。我们进一步开发了几种技术来纠正自强制式蒸馏流程,提高了学生模型尊重控制信号的能力,同时保持了来自教师的多样化生成模式和长期记忆。这些组件共同使Wonder能够合成多样化的分钟级视频,帧率为16 FPS,同时在长时间滚动中保持一致的几何、外观和动态。除了图像到视频的生成,Wonder自然支持视频条件生成,允许现有动态场景被实时重新拍摄。
查看原文
查看缓存全文

缓存时间: 2026/07/29 03:50

论文页面 - Wonder:更好的视频世界模型

来源:https://huggingface.co/papers/2607.26037

摘要

我们提出 Wonder,一个通用的视频世界模型,用于实时、可控制摄像头的世界探索。给定一张图像或一段条件视频,Wonder 构建了一个可玩的虚拟世界,用户可以通过移动摄像头进行交互式导航,实时并且长期地发现未观察区域、重新访问之前观察过的区域。实现这一能力需要在控制方法、记忆机制和训练策略上进行系统级的协同设计。我们引入了一种新颖的摄像头条件方法,采用稠密坐标场,其渲染结果提供空间对齐的运动和方向线索,使模型能够将摄像头运动直接解释为视觉证据。为了在逐渐增长的生成上下文中支持快速且精确的记忆检索,我们提出了一种高效的基于稀疏注意力的记忆机制,使模型能够在推理时选择性地关注一小部分相关的上下文 token,无论实际上下文长度如何。我们进一步开发了多种技术来修正自强制式蒸馏流程,提高了学生模型尊重控制信号的能力,同时保持了来自教师模型的多样化生成模式和长期记忆。这些组件共同使 Wonder 能够以16FPS的速度合成多样化、分钟级的视频,同时在整个长序列中保持连贯的几何、外观和动态。除了图像到视频的生成,Wonder 还自然支持视频条件生成,允许现有的动态场景被实时重新拍摄。

查看 arXiv 页面 (https://arxiv.org/abs/2607.26037) 查看 PDF (https://arxiv.org/pdf/2607.26037) 项目页面 (https://wonder-world-model.github.io/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26037)

在你的 agent 中获取此论文:

hf papers read 2607.26037

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.26037 即可链接到此页面。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.26037 即可链接到此页面。

引用此论文的 Spaces0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.26037 即可链接到此页面。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可链接到此页面。

相似文章

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模

Hugging Face Daily Papers

Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。