WorldCrafter: 一致的视频世界模型与隐式3D感知记忆

Hugging Face Daily Papers 论文

摘要

WorldCrafter是一个视频世界模型,它学习一个可相机查询的隐式3D感知记忆,用于从单张图像或文本提示进行一致且相机可控的流式场景探索。

视频世界模型能够实现动态环境的交互式探索,但在长时间范围和跨视角下难以尊重先前观察。我们提出WorldCrafter,一个视频世界模型,它学习一个可相机查询的隐式3D感知记忆来实现此目的。关键洞察是让请求的视角来决定多视图证据如何被压缩到视频生成器的有限令牌预算中。与视频生成器联合训练,一个记忆编码器和一个基于姿态的读取模块将历史观察整合到一组固定的目标视图特定令牌中,在去噪之前,无需显式的基于深度的对应。通过将此记忆与最近的上下文时间和少步蒸馏相结合,WorldCrafter实现了从单个输入图像或文本提示进行流式场景探索。在静态和动态场景上的实验显示,在长时间一致性和相机控制精度上有显著提升,同时在分钟级探索中保持了视觉质量。
查看原文
查看缓存全文

缓存时间: 2026/09/22 03:24

论文页面 - WorldCrafter:基于隐式3D感知记忆的一致性视频世界模型

来源:https://huggingface.co/papers/2609.24984 作者:

,

,

,

,

,

,

,

,

,

摘要

视频世界模型能够实现对动态环境的交互式探索,但在长时间序列和跨视角下难以保持对先前观测的一致性。我们提出WorldCrafter——一种通过学习相机可查询的隐式3D感知记忆来解决此问题的视频世界模型。其核心思想在于让目标视角来指导多视角证据如何被压缩至视频生成器的有限token预算中。该记忆编码器与位姿条件读出模块与视频生成器联合训练,在去噪前将历史观测整合为一组固定的目标视角专属token,无需显式的深度对应关系。通过将此记忆与近期时间上下文及少步蒸馏相结合,WorldCrafter能够基于单张输入图像或文本提示实现场景流式探索。在静态与动态场景中的实验表明,该模型在分钟级探索过程中,在保持视觉质量的同时,显著提升了长时序一致性和相机控制精度。

查看arXiv页面 (https://arxiv.org/abs/2609.24984) 查看PDF (https://arxiv.org/pdf/2609.24984) 项目页面 (https://drexubery.github.io/WorldCrafter) GitHub2 (https://github.com/TencentARC/WorldCrafter) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.24984)

在您的代理中获取此论文:

hf papers read 2609\.24984

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型2

TencentARC/WorldCrafter-快速图像转视频• 5分钟前更新 • 3 (https://huggingface.co/TencentARC/WorldCrafter-Fast)

TencentARC/WorldCrafter-基础图像转视频• 14B• 5分钟前更新 • 2 (https://huggingface.co/TencentARC/WorldCrafter-Base)

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.24984以从本页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2609.24984以从本页面链接。

包含此论文的合集0

无合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

World in World: 用世界模型探索世界

Hugging Face Daily Papers

本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。

用于视频世界模型的潜在空间记忆

Hugging Face Daily Papers

本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。

ReWorld:一个具有长期记忆的交互式世界模型

Hugging Face Daily Papers

ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。