Genie风格的可交互世界模型,在单个5090上以19GB显存运行720p分辨率、16FPS
摘要
ABot-World-0是一个实时交互的世界模型,在单个NVIDIA RTX 5090 GPU上以19GB显存实现了720p分辨率、16FPS的视频生成,支持无限的动作条件世界展开,用于模拟和AI研究。
暂无内容
查看缓存全文
缓存时间: 2026/08/16 12:02
# 1ABot-World-0:将单块 NVIDIA RTX 5090 GPU 转变为实时交互式世界模拟器 ABot-World-0 能够在单块 NVIDIA RTX 5090 GPU 上,以 720P 分辨率、最高 16 FPS 的帧率实现无限的动作条件化世界演化,动作到首帧延迟为 1.2 秒,峰值显存占用约 19 GiB。 来源:https://arxiv.org/html/2607.19191 **基于单桌面 GPU 的无限交互式世界演化** ABot-World 团队 2026 年 7 月 **摘要** 我们推出 **ABot-World-0**,一个用于实时、长周期闭环交互的动作条件化视频世界模型,由跨越 AAA 游戏、模拟引擎和互联网视频的多源数据基础设施支撑,用于学习可控的世界动态。**WorldExplorer** 代理驱动的数据收集系统在训练反馈引导下运行,而统一流程执行 14 项确定性质量检查、基于视觉语言模型(VLM)的评估,以及同步的动作和文本标注。我们通过教师强制(teacher forcing)和常微分方程(ODE)蒸馏,将双向动作条件化教师模型逐步蒸馏为因果学生模型,并引入 **LongForcing** 方法,使学生的长周期自演化与扩展视野的教师模型对齐,以缓解累积分布偏移和自回归漂移。原始键盘操作作为统一的控制接口,用于场景漫游和第三人称角色交互,而参考角色记忆则为第三方演化中的身份一致性提供持久的外观线索。在部署方面,我们协同设计了流式推理栈,包含轻量级变分自编码器(VAE)解码器、高效注意力机制、内存感知调度和低比特扩散变换器(DiT)推理。在优化的低比特配置下,**ABot-World-0** 可在单块 NVIDIA RTX 5090 桌面 GPU 上流式生成 720P 视频,帧率高达 16 FPS,动作到首帧延迟 1.2 秒,峰值显存约 19 GiB。在 WorldRoamBench 和扩展交互式演化上的实验展示了其具有竞争力的可控性和连贯的长周期世界演化能力。 https://github.com/amap-cvlab/ABot-World 参见说明 图 1:ABot-World-0 将单块 NVIDIA RTX 5090 GPU 转变为实时交互式世界模拟器,能够在约 19 GiB 的峰值显存预算内,以 720P 分辨率、最高 16 FPS 的帧率实现无限的动作条件化世界演化,动作到首帧延迟为 1.2 秒。 ## 1 引言 人工智能正从生成静态内容,迈向生成可进入、可控制、可持续演化的世界。其目标不是一系列视觉上逼真的片段,而是一个持久的生成环境:动作改变状态,由此产生的观察结果指导后续动作,并在交互持续过程中保持世界一致性。因此,世界模型 [33, 6, 19, 64, 16, 51, 25] 是迈向通用模拟器的一步:它们必须表示世界的当前状态,预测在干预下的演化方式,并为规划、学习、创作和具身智能提供基础。这是一个系统层面的挑战,而非单一的生成目标。视觉保真度仍然是必要的,但可控性、状态持久性、演化稳定性、延迟、吞吐量和内存占用需要协同优化。 大规模视频生成的快速发展 [23, 57, 24, 4, 66, 36, 37, 53, 61] 提供了日益强大的视觉和动力学先验,然而,要将这些先验转化为响应迅速、易于访问的世界,需要解决闭环问题。近期系统已确立了这一议程的重要部分。Genie [6] 表明,可通过推断的潜在动作从互联网游戏玩法中学习可玩环境,而 Genie 2 和 Genie 3 [52, 19] 则展示了能力日益增强的实时动态环境。GameNGen [64]、Oasis [16]、WHAM [31]、Runway GWM [55]、Cosmos [51] 和 Waymo World Model [29] 探索了游戏、开放世界、物理 AI 和驾驶设计空间中的互补点。 然而,仅仅扩展视频模型并不能解决交互式世界建模的四个耦合瓶颈:获取广泛、时间连贯且具有可靠动作监督的数据;在摄像机导航和具身角色控制两个方面都表示用户意图;防止生成的历史在作为下一步输入时发生漂移;以及在实用硬件上以交互速度部署整个生成和解码栈。一个系统可能在某一方面非常强大,但作为本地、持久的世界模拟器仍然无法使用。 数据问题尤其基础。被动的互联网视频提供视觉多样性,但很少暴露同步的控制信号;游戏录像提供精确的输入,但可能在风格上较为单一;模拟提供几何结构和可控性,但需要精心设计轨迹。我们将这些来源视为互补而非可互换。我们的数据基础设施结合了 AAA 游戏数据、模拟引擎数据和真实世界的互联网视频。**WorldExplorer**,一个代理驱动的收集系统,在训练反馈引导下生成同步的多模态游戏和模拟轨迹,并重新分配收集工作。一个感知来源但统一的处理流程随后执行 14 项确定性检查(涵盖六个质量维度)、基于 VLM 的语义评估、动作标注和结构化语言标注。这将数据集构建转变为世界模型开发的闭环部分:数据分布并非仅收集一次,而是被主动塑造,以暴露模型仍然薄弱的运动、视角、环境和动作领域。 我们基于此基础设施构建了 **ABot-World-0**,一个动作条件化的视频世界模型,旨在作为控制–一致性–效率耦合问题的端到端解决方案。该模型使用统一的、帧同步的键盘动作接口,而非单独的潜在动作接口;源生控制信号和基于姿态的伪动作在数据构建期间被映射到同一动作空间,这在推理时对用户自然是可用的。统一的动作表示涵盖了观察者风格的场景漫游和行动者风格的角色运动,而参考角色记忆则为长周期的第三人称演化提供了持久的外观信息。这些选择使控制通道成为动力学模型本身的一部分,而非外部后处理接口。 学习流程将视觉动力学质量与在线所需的因果约束分离。我们首先在多源动作-视频语料库上训练一个双向教师模型,其中全视野生成为动作条件动力学提供了高质量目标。然后,我们通过教师强制和 ODE 蒸馏将其逐步转换为因果学生模型,这保留了可部署的信息模式,同时降低了去噪预算。关键的是,局部蒸馏本身并不能解决闭环生成问题:每个学生的预测都会改变后续预测的视觉上下文,导致短周期训练状态和长周期推理状态之间的差异逐渐增大。我们引入了 **LongForcing**,这是一个最终的分布匹配阶段,通过扩展视野的双向教师来监督学生的长周期自演化。通过在学生自演化上扩展分布级别的监督,**LongForcing** 为短周期目标仅弱覆盖的长周期演化上下文提供了纠正信号。 实时交互还需要超越少步采样的系统协同设计。**ABot-World-0** 将其因果模型与轻量级 VAE 解码器、内存感知模块调度、低比特 DiT 推理、高效低精度注意力机制和有界局部上下文 KV 缓存相结合。在其优化的低比特运行包络内,生成的 720P 流式管道在单块 NVIDIA RTX 5090 上最高可达 16 FPS,动作到首帧延迟 1.2 秒,同时峰值显存占用约 19 GiB。报告的延迟覆盖了从接收用户动作到第一个解码响应帧可用的完整生成和解码路径,而非孤立地报告采样速度。 我们的贡献有四点: - 我们提出 **ABot-World-0**,一个统一的动作条件化视频世界模型,使用原始键盘输入支持场景漫游和角色控制,并通过参考角色记忆在第三方交互中提供互补的外观线索。 - 我们开发了用于交互式世界建模的多源数据基础设施,包括 **WorldExplorer** 的训练反馈驱动收集循环、同步多模态捕获、多阶段质量控制以及统一的动作和文本标注。 - 我们引入了一个渐进式的双向到因果训练流程和 **LongForcing** 方法,该方法将分布级别的教师监督扩展到学生的长周期自演化中,以缓解累积的自回归漂移。 - 我们展示了一个面向部署的流式栈,其优化的低比特运行包络在一块 RTX 5090 上,在峰值显存约 19 GiB 的预算内,以最高 16 FPS、1.2 秒动作到首帧延迟的 720P 输出,并在 WorldRoamBench 和扩展交互式演化上评估了可控性、视觉质量、物理合理性和时间记忆。 这些组件共同将交互式世界建模定义为一项全栈能力,而非单一的生成目标。**ABot-World-0** 是迈向本地视觉模拟器的一步,这类模拟器可被持续探索、控制和改进,用于交互式创作、智能体学习和具身 AI 研究。 ## 2 相关工作 ### 2.1 双向视频生成 生成建模的最新进展极大地提高了视频合成的质量,扩散模型已成为主导范式 [23, 57, 4]。早期的视频扩散模型通常采用基于 U-Net 的架构,而近期的方法越来越多地采用带有时空注意力机制的扩散变换器 [46, 48, 37, 53, 47, 76]。通过在整个片段上建模空间和时间依赖性,这些方法 [37, 61, 9] 在视觉质量和时间连贯性方面取得了强大性能。这种全片段的双向建模也特别适合插值、填充和有界生成等需要考虑多个时间约束的任务。然而,这种全片段建模通常通过双向注意力实现,其中每一帧都可以访问过去和未来的上下文。虽然有利于时间一致性,但这种设计将整个序列中的帧耦合在一起,使得在低延迟或流式场景中增量生成和输出帧变得困难。这一局限性推动了近期因果或自回归视频扩散方法的发展,这些方法试图将双向视频扩散模型转换或蒸馏为序列生成器,以部分全局上下文换取更高效的在线生成。 ### 2.2 自回归视频生成 为了克服非因果模型的局限性,自回归(AR)视频生成方法 [69, 24, 18, 36, 73] 顺序生成帧,每个新片段仅以前一生成的内容为条件。通过强制执行因果约束,这些方法支持低延迟流式传输,并且当与有界上下文或缓存结合时,可以减少与长视频合成相关的内存开销。早期的 AR 模型主要依赖离散标记(token)的变换器,而近期的工作 [7, 30, 80, 26, 44] 已将因果结构集成到扩散和基于流的框架 [42, 23, 45] 中,以实现更优的视觉质量。AR 生成的因果结构使其非常适合实用的长视频合成,因为它支持流式生成。这使得 AR 生成成为可扩展视频生成的一个有吸引力的范式。因此,在本工作中,我们专注于 AR 范式,并解决提高长周期稳定性的关键挑战。 ### 2.3 长视频生成 自回归模型在超过训练视野后会出现漂移,表现为质量逐渐下降、身份不一致、运动停滞或在有限的自回归演化后坍缩为静态帧。时间漂移与 AR 演化中的暴露偏差(exposure bias)和误差累积密切相关。为了缓解这一问题,Diffusion Forcing [7]、PA-VDM [71] 和 Rolling Forcing [44] 等方法在训练期间采用了异构噪声调度 [8, 60, 35];而像 FIFO-Diffusion [32] 这样的免训练方法通过滑动潜在窗口扩展预训练模型,但没有明确的演化对齐,最终仍会遭受退化。或者,Self-Forcing 及其变体如 LongLive [75]、Self-Forcing++ [14] 使用因果注意力、KV 重缓存和蒸馏,在其自身演化分布下监督模型以进行长视频生成。后续工作进一步解决了细粒度的不匹配问题:Causal Forcing [87] 解决了双向教师和因果学生之间的架构差距,Context Forcing [11] 处理...
相似文章
ABot-World-0:在单台式机GPU上实现无限交互式世界展开
ABot-World-0是一个实时的、长时域交互式视频世界模型,可在单台式机GPU上运行,通过动作条件控制实现无限世界展开。
DreamForge-World 0.1 预览版:低算力实时可控世界模型
DreamForge-World 0.1 预览版是一个低算力世界模型,可在消费级GPU上实现实时交互模拟,支持键盘/鼠标控制,在单个RTX 4090上以480p分辨率达到14-15 FPS。
Genie 3:世界模型的新前沿
DeepMind 发布 Genie 3,一个通用世界模型,能够从文本提示生成交互式环境,分辨率达 720p、帧率 24fps,相比前代版本具有更好的一致性和实时交互能力。
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
AlayaWorld: 交互式长视界世界建模 -- 完整技术报告
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。