ReactiveGWM:在反应式游戏世界模型中引导NPC
摘要
ReactiveGWM是一种反应式游戏世界模型,通过扩散模型和交叉注意力模块将玩家控制与NPC行为解耦,实现动态的玩家-NPC互动,并能在不同游戏间实现零样本策略迁移。
查看缓存全文
缓存时间: 2026/05/18 02:23
论文页面 - ReactiveGWM:在反应式游戏世界模型中引导NPC
来源:https://huggingface.co/papers/2605.15256
摘要
ReactiveGWM 通过在扩散模型中解耦玩家控制与NPC行为,并利用交叉注意力模块实现与游戏无关的策略迁移,从而在游戏世界中实现动态的玩家与NPC交互。
当前的游戏世界模型从主观的、以玩家为中心的视角模拟环境。然而,仅将非玩家角色(NPC)视为背景像素,这些模型无法捕捉玩家与NPC之间的交互。从这一意义上说,它们更像是被动的视频渲染器,而非真正的模拟引擎,缺乏建模动作引发NPC反应所需的物理理解。我们提出 ReactiveGWM,一个反应式游戏世界模型(https://huggingface.co/papers?q=reactive%20game%20world%20model),它能够合成玩家与NPC之间的动态交互。ReactiveGWM 不将所有交互动力学纠缠在一起,而是显式地解耦玩家控制(https://huggingface.co/papers?q=player%20controls)与NPC行为(https://huggingface.co/papers?q=NPC%20behaviors)。玩家动作通过轻量级的加性偏置注入到扩散骨干网络中,而高层级的NPC响应(例如进攻、控制、防守)则通过交叉注意力模块(https://huggingface.co/papers?q=cross-attention%20modules)进行接地。关键的是,这些模块学习了一种与游戏无关的交互逻辑表示(https://huggingface.co/papers?q=game-agnostic%20representation%20of%20interactive%20logic)。这使得零样本策略迁移(https://huggingface.co/papers?q=zero-shot%20strategy%20transfer)成为可能:我们学习到的模块可以直接插入到不同游戏的现成、无标注世界模型中。这立即解锁了可引导的NPC交互,无需任何特定领域的重新训练。在两个《街头霸王》游戏上的评估表明,ReactiveGWM 在保持精细玩家可控性的同时,实现了稳健的、与提示一致的NPC策略遵循,为可扩展的、策略丰富的NPC交互铺平了道路。
查看arXiv页面(https://arxiv.org/abs/2605.15256)查看PDF(https://arxiv.org/pdf/2605.15256)项目页面(https://inv-wzq.github.io/ReactiveGWM/)GitHub9(https://github.com/INV-WZQ/ReactiveGWM)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15256)
在你的代理中获取这篇论文:
hf papers read 2605\.15256
没有最新版本的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2605.15256以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2605.15256以从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2605.15256以从此页面链接。
包含此论文的集合1
相似文章
WorldMind:用于状态感知NPC行为的解耦游戏世界模型
WorldMind引入了一个用于游戏世界模型中状态感知NPC行为的解耦框架,将世界建模分离为理解、决策、控制和生成层,以增强响应性。
GameWAM:视频游戏的世界动作模型
GameWAM引入了首个用于视频游戏原生闭环游戏玩法和GUI控制的世界动作模型,联合生成视觉观察和可执行动作,具有竞争力的任务成功率,并揭示了源敏感性故障模式。
ReWorld:一个具有长期记忆的交互式世界模型
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
多智能体世界模型(3分钟阅读)
γ-World 是一个生成式多智能体世界模型,支持独立可控、排列对称的智能体,采用 Simplex Rotary Agent Encoding 和 Sparse Hub Attention 技术,实现了实时 24 FPS 的推演,并具有从两个玩家到四个玩家的零样本泛化能力。
GameWAM:一种用于视频游戏的统一世界动作模型
GameWAM 引入了首个统一的世界动作模型,用于原生视频游戏控制,通过块因果流匹配和模式特定分布联合预测未来视觉和可执行动作。