Valerant:基于动作条件世界模型探索的自动可导航游戏地图生成器
摘要
Valerant 是一个无需训练的框架,将预训练的动作条件世界模型转换为世界动作模型,用于从单张图像探索和构建 3D 游戏地图,从而减少游戏开发中的手动工作。
arXiv:2609.09418v1 Announce Type: new
摘要:世界动作模型 (WAMs) 将预测性世界建模与动作生成相结合,使预期的未来状态能够指导智能体行为。尽管 WAMs 在具身 AI 领域迅速发展,但在游戏中的通用对应模型仍大多未被探索。现有的游戏导向方法通常将动作条件世界模型与外部策略和奖励函数相结合,以实现类似 WAM 的决策,但它们主要在 2D 视觉观察空间中操作,并未实例化持久的 3D 几何。将此范式扩展到 3D 游戏引入了一个独特的挑战。在自动驾驶和机器人技术中,物理环境独立于模型存在,提供了一个持久的 3D 世界,可以在其中执行选定的动作。游戏没有这样的外部基底;虚拟世界本身必须被实例化。大多数可玩游戏需要一个持久且可导航的空间,而 3D 游戏还额外需要支持移动和交互的显式几何。动作条件视频展开提供视觉观察,但不提供此空间表示。我们提出 \textsc{Valerant},一个无需训练的框架,将预训练的动作条件世界模型转换为 WAM,用于探索和构建 3D 游戏地图。通过将预测性视觉展开与基于 SLAM 的空间重建和探索驱动的动作选择相结合,\textsc{Valerant} 逐步将单张图像转换为持久的 3D 游戏地图。此框架将基于 WAM 的交互扩展到 2D 视觉模拟之外,并提供了一种减少 3D 游戏地图创建中手动工作的新方法。
查看缓存全文
缓存时间: 2026/09/11 08:37
# Valerant:基于动作条件世界模型探索的自动可导航游戏地图生成器
来源:https://arxiv.org/html/2609.09418
作者:冯王
所属机构:约翰斯·霍普金斯大学
邮箱:\{yxq350,jxm1384\}@case\.edu, wangf3014@gmail\.com
作者:马晶††致谢:通讯作者\.所属机构:凯斯西储大学
###### 摘要
世界动作模型(WAMs)将预测性世界建模与动作生成相结合,使预期的未来状态能够指导智能体的行为。尽管世界动作模型正在快速推进具身人工智能的发展,但其通用的对应物在游戏领域仍然很大程度上未被探索。现有的面向游戏的方法通常将动作条件世界模型与外部策略和奖励函数相结合,以实现类似世界动作模型的决策,但它们主要在二维视觉观测空间中操作,并未实例化持久的三维几何结构。将这种范式扩展到三维游戏带来了一个独特的挑战。在自动驾驶和机器人领域,物理环境独立于模型存在,提供了一个持久的三维世界,所选动作可以在其中执行。游戏没有这样的外部基底;虚拟世界本身必须被实例化。大多数可玩的游戏都需要一个持久且可导航的空间,而三维游戏还需要支持移动和交互的显式几何结构。动作条件的视频推演提供视觉观测,但不提供这种空间表示。我们提出Valerant,一个无需训练的框架,它将预训练的动作条件世界模型转化为用于探索和构建三维游戏地图的世界动作模型。通过将预测性视觉推演与基于SLAM的空间重建以及探索驱动的动作选择相结合,Valerant能够将单张图像逐步转化为一个持久的三维游戏地图。该框架将基于世界动作模型的交互扩展到二维视觉模拟之外,为减少三维游戏地图创建中的手动工作提供了一种新方法。
## 1 引言
大规模生成建模的快速发展已将内容合成确立为现代人工智能最活跃的领域之一,催生了人工智能生成内容(AIGC)的广泛范式(Peebles和Xie,2023 (https://arxiv.org/html/2609.09418#bib.bib1);Podell等人,2024 (https://arxiv.org/html/2609.09418#bib.bib2);Wu等人,2025 (https://arxiv.org/html/2609.09418#bib.bib3);Wan等人,2025 (https://arxiv.org/html/2609.09418#bib.bib18))。现代生成模型可以在越来越灵活的条件形式下合成高质量的图像、视频和多模态序列。在其主要的技术基础中,扩散模型通过学习逆转渐进的破坏过程来生成数据(Ho等人,2020 (https://arxiv.org/html/2609.09418#bib.bib4);Rombach等人,2022 (https://arxiv.org/html/2609.09418#bib.bib5)),而流匹配模型则学习一个连续的向量场,将样本从简单的先验分布输送到数据分布(Lipman等人,2022 (https://arxiv.org/html/2609.09418#bib.bib6);Liu等人,2022 (https://arxiv.org/html/2609.09418#bib.bib7))。在日益连贯的视频生成基础上,最近的工作开始将视频生成器公式化为观测空间的世界模型(WMs)(Brooks等人,2024 (https://arxiv.org/html/2609.09418#bib.bib8);Wang等人,2024 (https://arxiv.org/html/2609.09418#bib.bib9);Alhaija等人,2025 (https://arxiv.org/html/2609.09418#bib.bib10);Qin等人,2024 (https://arxiv.org/html/2609.09418#bib.bib11))。通过预测时间上连贯的视觉轨迹,这些模型捕捉了物体运动、场景演变以及物理交互可观察结果的规律性,从而近似地模拟了世界的演化,而无需显式表示其底层的三维状态。当动作作为条件信号引入时,由此产生的动作条件世界模型在指定的动作或动作序列下预测未来的观测(Yang等人,2023 (https://arxiv.org/html/2609.09418#bib.bib12);Valevski等人,2025 (https://arxiv.org/html/2609.09418#bib.bib13);Che等人,2025 (https://arxiv.org/html/2609.09418#bib.bib14);Bar等人,2025 (https://arxiv.org/html/2609.09418#bib.bib15);Parker-Holder等人,2024 (https://arxiv.org/html/2609.09418#bib.bib16);Ball等人,2025 (https://arxiv.org/html/2609.09418#bib.bib17))。至关重要的是,预测给定动作的后果本身并不能决定应该采取哪个动作。世界动作模型(WAMs)更进一步,将预测性世界建模与动作生成或选择相结合(Wang等人,2026a (https://arxiv.org/html/2609.09418#bib.bib53);Zhang等人,2026 (https://arxiv.org/html/2609.09418#bib.bib54))。这种结合可以通过级联流水线(从预测的未来推导动作)或统一模型(联合建模未来状态和动作)来实现(Du等人,2023 (https://arxiv.org/html/2609.09418#bib.bib55);Zhao等人,2025 (https://arxiv.org/html/2609.09418#bib.bib56))。世界动作模型不仅仅是模拟在外部指定动作下可能发生的情况,而是利用预期的世界演化来告知智能体应该做什么。总之,这一进展将生成建模从被动的内容合成,扩展到可控的预测,再到动态环境中的预测性决策。
这种转变的实际价值在自动驾驶和机器人领域尤为明显,在那里,世界动作模型利用预测的世界演化来指导运动规划和策略生成(Xia等人,2026 (https://arxiv.org/html/2609.09418#bib.bib19);Zhao等人,2025 (https://arxiv.org/html/2609.09418#bib.bib56);Kim等人,2026 (https://arxiv.org/html/2609.09418#bib.bib37))。其动机很直接:在物理世界中收集闭环经验和评估策略成本高昂、耗时且难以扩展,而失败的试验可能损坏硬件或产生不可接受的安全风险(Li等人,2024 (https://arxiv.org/html/2609.09418#bib.bib21);Quevedo等人,2026 (https://arxiv.org/html/2609.09418#bib.bib22))。通过将前瞻性世界预测与动作生成相结合,世界动作模型使得在昂贵的物理部署之前,可能的行为及其后果能够为决策提供信息。
游戏创作呈现了一个根本不同的环境。通用的世界动作模型在游戏领域仍然很大程度上未被探索,特别是在需要实例化底层三维世界本身的应用中。现有方法遵循两条相关的路线:基于模型的智能体将学习到的世界模型与外部策略或奖励函数相结合以优化行为;而交互式游戏世界模型则从用户输入中生成动作条件的视觉观测(Alonso等人,2024 (https://arxiv.org/html/2609.09418#bib.bib23);Hafner等人,2025 (https://arxiv.org/html/2609.09418#bib.bib32);Valevski等人,2025 (https://arxiv.org/html/2609.09418#bib.bib13);Li等人,2025 (https://arxiv.org/html/2609.09418#bib.bib24);Wang等人,2026b (https://arxiv.org/html/2609.09418#bib.bib25))。尽管这些系统可以在流水线级别上实现类似世界动作模型的交互或决策,但它们学习到的环境仍然由二维帧或潜在观测序列表示,而非持久、显式的三维几何结构。类似的模块化世界模型-策略系统也用于自动驾驶和机器人(Wang等人,2024 (https://arxiv.org/html/2609.09418#bib.bib9);Bar等人,2025 (https://arxiv.org/html/2609.09418#bib.bib15);Gao等人,2026 (https://arxiv.org/html/2609.09418#bib.bib20))。然而,重要的是,这些物理领域中建模的世界独立于学习系统而存在。车辆或机器人在持久的物理三维环境中运行,该环境提供了空间基底,模型预测可以基于此接地,并且在执行后可以从中获得新的观测。相比之下,在游戏创作中,被建模的世界同时也是必须生成的产物。不存在一个独立存在的物理环境可以为合成的观测提供背后的持久三维场景。大多数第一人称射击游戏需要一个持久、可导航的三维空间,在其中相机的运动、碰撞、可见性以及物体交互可以在时间上得到一致地解决。因此,观测空间的世界模型和现有的世界模型-策略系统无法直接提供建造此类游戏所需的显式三维地图。因此,有必要弥合基于世界动作模型的探索与显式三维地图构建之间的鸿沟,以将这些模型从交互式视觉模拟扩展到实际的游戏创作。
为了解决这一局限性,我们推出了Valerant,一个自动游戏地图生成器,可将单张输入图像转化为可导航的三维环境。无需额外训练,Valerant通过将其预测性推演与探索驱动的动作选择相结合,将预训练的动作条件世界模型转化为世界动作模型。Valerant实例化一个虚拟智能体,在每个探索步骤中向世界模型查询一组有限的候选动作,从共同的“动作前”状态生成反事实的视频推演。每个推演都由视觉SLAM处理(Teed和Deng,2021 (https://arxiv.org/html/2609.09418#bib.bib26);Matsuki等人,2024 (https://arxiv.org/html/2609.09418#bib.bib27);Murai等人,2025 (https://arxiv.org/html/2609.09418#bib.bib28)),以估计相机轨迹并重建观测到的三维结构。一个探索策略根据这些候选的映射效用为其评分,然后智能体返回“动作前”状态,仅执行得分最高的动作。被选中的观测被整合到持久地图中,此过程重复进行直至探索预算耗尽,最终生成一个整合的三维点云游戏地图。我们的贡献有三方面:
- • 我们介绍了Valerant,一个统一的、无需训练的框架,它将预训练的动作条件世界模型转化为世界动作模型,并将其探索与基于SLAM的重建相结合,以实现自动游戏地图生成。
- • 我们开发了一种反事实探索过程,其中替代的世界模型推演指导动作选择,并被转化为持久的三维环境,弥合了视觉世界模拟与游戏所要求的显式空间实例化之间的鸿沟。
- • 我们为游戏地图创作确立了一个新方向,即一个单一的视觉概念可以扩展为可导航的三维几何结构,从而减少游戏开发者对耗时且繁琐的地图构建工作流程的依赖。
## 2 相关工作
参考说明图1:Valerant概览。从单张输入图像开始,一个虚拟智能体使用候选动作查询世界模型,生成替代的“假设”视频推演。视觉SLAM重建相应的三维几何结构,一个探索策略选择具有最高映射效用的分支。选中的观测被提交给一个持久点云地图,该地图通过迭代扩展最终形成三维游戏地图。上图示意性地展示了流水线,下图使用一个示例场景演示了该过程。
### 2.1 世界模型与世界动作模型
世界模型学习环境动力学的预测性表示,以支持规划和控制。早期的方法将高维观测压缩到潜在状态中,并在这些紧凑空间中学习动作条件转移(Ha和Schmidhuber,2018 (https://arxiv.org/html/2609.09418#bib.bib29);Hafner等人,2019b (https://arxiv.org/html/2609.09418#bib.bib30);Hafner等人,2019a (https://arxiv.org/html/2609.09418#bib.bib31))。后续方法提高了潜在世界建模的可扩展性、鲁棒性和通用性,使智能体能够通过想象轨迹在越来越多样的控制任务中学习(Hansen等人,2024 (https://arxiv.org/html/2609.09418#bib.bib44);Hafner等人,2025 (https://arxiv.org/html/2609.09418#bib.bib32))。这些模型主要优化以捕捉对决策任务相关的动力学,而非合成照片级真实且空间上持久的环境。
视频生成的进步将世界建模转向直接预测视觉未来。iVideoGPT(Wu等人,2024 (https://arxiv.org/html/2609.09418#bib.bib33))将观测、动作和奖励表示为交错的标记,用于可扩展的交互预测;而AVID(Rigter等人,2024 (https://arxiv.org/html/2609.09418#bib.bib34))则通过轻量级领域特定适配器,将预训练的视频扩散模型改造为动作条件模拟器。在机器人领域,IRASim(Zhu等人,2025 (https://arxiv.org/html/2609.09418#bib.bib35))根据动作轨迹生成细粒度的机器人-物体交互。这些系统都是动作条件世界模型:动作为条件输入,模型预测其观测后果,而非生成动作本身。遵循最近的正式化(Wang等人,2026a (https://arxiv.org/html/2609.09418#bib.bib53);Zhang等人,2026 (https://arxiv.org/html/2609.09418#bib.bib54)),我们将“世界动作模型(WAM)”一词保留给那些将前向世界预测与动作生成或选择相结合的系统。这种结合可以通过级联架构(从预测的未来推导动作)或联合架构(在统一框架内建模未来状态和动作)来实现(Du等人,2023 (https://arxiv.org/html/2609.09418#bib.bib55);Zhao等人,2025 (https://arxiv.org/html/2609.09418#bib.bib56);Bi等人,2026 (https://arxiv.org/html/2609.09418#bib.bib36);Kim等人,2026 (https://arxiv.org/html/2609.09418#bib.bib37))。游戏为这些模型提供了一个自然的测试平台,因为观测和动作都可以大规模收集。WHAM(Kanervisto等人,2025 (https://arxiv.org/html/2609.09418#bib.bib38))联合建模游戏画面和控制器动作,代表了一种用于游戏玩法构思的游戏特定联合世界动作模型。相比之下,Oasis(Decart等人,2024 (https://arxiv.org/html/2609.09418#bib.bib39))、MineWorld(Guo等人,2025 (https://arxiv.org/html/2609.09418#bib.bib40))和Matrix-Game(Wang等人,2026b (https://arxiv.org/html/2609.09418#bib.bib25))是动作条件世界模型,它们根据用户控制生成未来的游戏观测。最近的工作进一步将动作条件生成扩展到包含反应式智能体和复杂多智能体行为的环境(Agarwal等人,2026 (https://arxiv.org/html/2609.09418#bib.bib41))。尽管它们在视觉保真度和可控性上不断提高,但这些方法主要将它们生成的世界实现为视觉观测的自回归流。
几何感知的世界模型已开始通过引入持久点云记忆或潜在三维场景状态来解决空间遗忘问题(Wu等人,2026 (https://arxiv.org/html/2609.09418#bib.bib42);Garcin等人,2026 (https://arxiv.org/html/2609.09418#bib.bib43))。然而,它们的主要目标是提高视觉生成的空间一致性和长期稳定性,而非构建可复用的游戏地图。相比之下,Valerant从一个预训练的动作条件世界模型出发,在无需额外训练的情况下,将其反事实推演与探索策略相结合,从而形成一个级联的世界动作模型,其选中的观测被重建为显式的三维点云游戏地图。
### 2.2 视觉SLAM与在线建图
同步定位与建图(SLAM)联合估计智能体的轨迹,并从周围环境中增量式地构建空间表示。相似文章
VisualPatchWorld:作为规划潜在结构化表示的代码世界模型
VisualPatchWorld 提出了一种将世界动力学学习为代码的方法,能够从数据中构建可检查和可编辑的模拟器。在导航和操作任务中,它实现了强大的规划成功率。
GameWAM:一种用于视频游戏的统一世界动作模型
GameWAM 引入了首个统一的世界动作模型,用于原生视频游戏控制,通过块因果流匹配和模式特定分布联合预测未来视觉和可执行动作。
GameWAM:视频游戏的世界动作模型
GameWAM引入了首个用于视频游戏原生闭环游戏玩法和GUI控制的世界动作模型,联合生成视觉观察和可执行动作,具有竞争力的任务成功率,并揭示了源敏感性故障模式。
WorldAct: 将单体3D世界激活为可交互的以对象为中心的场景
WorldAct是一个框架,利用多模态智能体和几何重建技术,将静态的3D生成环境转换为可编辑、可交互的以对象为中心的场景,支持对象级编辑和具身任务执行。
基于代理的游戏开发:作为可验证轨迹数据引擎以扩展世界模型
本文提出利用游戏引擎作为可验证轨迹数据引擎来扩展世界模型,引入RLHEV以结合密集引擎信号与人类反馈,用于强化学习后训练。