理解图世界模型中的展开误差
摘要
本文分析了图世界模型(GWM)中的长时域展开误差,提出了一个包含动态边的统一框架,并引入了误差感知图世界模型(Error-Aware GWM),该模型利用谱正则化、展开一致性和关键节点加权来防止发散。
arXiv:2606.27780v1 公告类型:新
摘要:世界模型通常通过前向滚动学习到的动态来进行规划。然而,许多规划环境并非向量或图像,而是由智能体、工具、技能、路径和依赖关系构成的图。在这些场景中,局部预测错误可能停留在局部,也可能通过图传播,并且当边是预测得到的而非固定时,失败模式会再次改变。本文研究了图世界模型(GWM)中的长时域展开误差。我们构建了一个统一的固定边和动态边GWM框架,其中包含用于节点级、边级和图级决策的动作节点。我们推导了图值展开界限,将拓扑引起的放大与模型引起的放大分开,并引入了一个用于动态边展开的联合节点-边算子。在分析指导下,我们提出了误差感知图世界模型(Error-Aware GWM),它结合了谱正则化、展开一致性和关键节点加权。在合成拓扑和异构智能体图测试平台上,展开误差和规划遗憾随视界增长,当结构演化时需要动态边训练,而Error-Aware GWM在保持预测精度的同时防止了长时域发散。真实图基准测试阐明了GWM的适用范围:它们在动态图展开和智能体规划中最有用,而专门的图模型在静态或稀疏预测任务上仍然表现强劲。
查看缓存全文
缓存时间: 2026/06/29 05:27
# 理解图世界模型中的展开误差 来源:https://arxiv.org/html/2606.27780 宋欣远1蔡泽坤2,3 1埃默里大学,亚特兰大,佐治亚州,美国2东京大学,东京,日本 3LocationMind,东京,日本 xinyuan\.song@emory\.edu, caizekun@csis\.u\-tokyo\.ac\.jp ###### 摘要 世界模型常用于通过滚动学习到的动力学进行规划。然而,许多规划环境并非向量或图像,而是由智能体、工具、技能、路线和依赖关系构成的图。在这些设置中,局部预测误差可能保持局部性,也可能通过图扩散,当边是预测而来而非固定不变时,失败模式会再次改变。本文研究图世界模型(GWM)中的长时域展开误差。我们构建了一个统一的固定边和动态边GWM框架,其中包含用于节点级、边级和图级决策的动作节点。我们开发了图值展开界,将拓扑引起的放大与模型引起的放大区分开,并引入了一个用于动态边展开的联合节点-边算子。在分析指导下,我们提出了**误差感知GWM**,它结合了谱正则化、展开一致性和关键节点加权。在合成拓扑和异构智能体图测试平台上,展开误差和规划遗憾随时域增长,当结构演变时需要动态边训练,而误差感知GWM能防止长时域发散并保持预测精度。真实世界图基准明确了GWM的适用范围:它们在动态图展开和智能体规划中最有用,而专用图模型在静态或稀疏预测任务上仍保持优势。匿名实现和基准套件将在提交时发布。代码可在https://github.com/Hik289/graph_world_model_accumulative_error.git获取。 理解图世界模型中的展开误差 宋欣远1蔡泽坤2,31埃默里大学,亚特兰大,佐治亚州,美国2东京大学,东京,日本3LocationMind,东京,日本xinyuan\.song@emory\.edu, caizekun@csis\.u\-tokyo\.ac\.jp ## 1 引言 世界模型Ha and Schmidhuber (2018 (https://arxiv.org/html/2606.27780#bib.bib9))将环境观测表示为状态,并根据动作预测未来状态。在大规模数据上训练的现代世界模型Hafneret al. (2018 (https://arxiv.org/html/2606.27780#bib.bib20),2020 (https://arxiv.org/html/2606.27780#bib.bib11),2023 (https://arxiv.org/html/2606.27780#bib.bib22)); Chuaet al. (2018 (https://arxiv.org/html/2606.27780#bib.bib70)); Wuet al. (2024 (https://arxiv.org/html/2606.27780#bib.bib64)); Bruceet al. (2024 (https://arxiv.org/html/2606.27780#bib.bib63))展现了强大的规划、预测和生成能力。然而,它们大多数是为向量或图像类状态构建的,无法直接捕捉状态为图的环境。这类环境在智能体规划中很常见:多智能体调用树协调分布式任务执行Anokhinet al. (2024 (https://arxiv.org/html/2606.27780#bib.bib31)),技能图编码工具依赖关系,通信网络在交互实体间路由动作。在这些环境中进行规划需要推理节点状态以及效应如何通过关系传播。支持长时域规划的自回归展开同时也带来了风险:预测误差可能累积并降低下游决策质量Asadiet al. (2018 (https://arxiv.org/html/2606.27780#bib.bib1)); Janneret al. (2019 (https://arxiv.org/html/2606.27780#bib.bib4))。图世界模型(GWM)通过自回归预测图状态G_t=(V,E_t,X_t,A_t)来解决这一设置Fenget al. (2025 (https://arxiv.org/html/2606.27780#bib.bib24))。给定一个学习到的转移模型F_θ(Ĝ_k,a_k),GWM展开Ĝ_1,...,Ĝ_H并对候选动作序列进行评分。现有工作主要研究静态图任务的图基础模型Liuet al. (2024 (https://arxiv.org/html/2606.27780#bib.bib65)); Chenet al. (2024 (https://arxiv.org/html/2606.27780#bib.bib66))或特定领域的图规划Zhanget al. (2021 (https://arxiv.org/html/2606.27780#bib.bib26)); Ammanabrolu and Riedl (2021 (https://arxiv.org/html/2606.27780#bib.bib33))。Feng等人Fenget al. (2025 (https://arxiv.org/html/2606.27780#bib.bib24))引入了一个带有动作节点的统一GWM,但其设置专注于固定边(FE)环境。目前尚不清楚GWM在**长时域展开误差**和**动态边(DE)模式**下的行为。图结构使得累积误差的分析比向量状态世界模型更困难。在向量设置中,展开误差通常通过标量Lipschitz常数来概括。在图设置中,相同的局部误差根据拓扑结构的不同可能表现迥异。链上的误差可能保持局部化;而在枢纽、密集图或高谱半径拓扑上的误差可能广泛传播,这与图传播、图网络动力学和GNN稳定性的谱分析一致Battagliaet al. (2016 (https://arxiv.org/html/2606.27780#bib.bib71),2018 (https://arxiv.org/html/2606.27780#bib.bib36)); Sanchez-Gonzalezet al. (2018 (https://arxiv.org/html/2606.27780#bib.bib72)); Oono and Suzuki (2020 (https://arxiv.org/html/2606.27780#bib.bib34)); Chamberlainet al. (2021 (https://arxiv.org/html/2606.27780#bib.bib73))。当边是被预测的时候问题更难:节点状态误差可能破坏未来的边预测,而边误差可能改变后续的消息传递。因此,GWM展开误差不仅仅是标量预测误差,而是一个依赖于拓扑、有时甚至是耦合的节点-边动态过程。现有的展开误差理论并非为图结构规划而设计。标准基于模型强化学习的分析使用固定维度状态向量上的标量Lipschitz常数来约束累积误差Asadiet al. (2018 (https://arxiv.org/html/2606.27780#bib.bib1)); Janneret al. (2019 (https://arxiv.org/html/2606.27780#bib.bib4))。这忽略了图展开的三个方面。首先,拓扑是显式的:对于消息传递GWM,节点误差增长可分解为拓扑项ρ(A)和模型项∏_ℓ‖W_ℓ‖_2,其中A是邻接矩阵,ρ(A)是其谱半径,W_ℓ是层权重。其次,动态图需要耦合的误差动态:节点特征误差e_k^X=‖X̂_k-X_k‖_F和边误差e_k^A=‖Â_k-A_k‖_F共同演化,而非通过标量递归。第三,展开误差必须与时域H上的规划 regret 相关联。这些差距促使我们进行图值分析,我们用GEAF̂=ρ(A)∏_ℓ‖W_ℓ‖_2替换标量常数,并使用联合节点-边算子B来处理动态边GWM中(e_k^X,e_k^A)的递归。我们从理论和实践上分析了GWM中的累积展开误差。图误差放大因子GEAF̂=ρ(A)∏_ℓ‖W_ℓ‖_2将拓扑依赖的放大与模型依赖的谱范数乘积区分开。对于动态边GWM,我们引入了一个联合节点-边误差算子B,它捕捉节点到节点、边到节点、节点到边以及边到边的传播。该算子清晰地分离了两种模式:固定边(FE)模型没有边预测头,因此M_X=0且动态退化为仅节点预测;动态边(DE)模型有边预测头,因此M_X>0且节点-边交叉耦合变为活跃。我们在一个七拓扑合成基准上评估了该框架,使用的现有GWM基线包括GCNKipf and Welling (2017 (https://arxiv.org/html/2606.27780#bib.bib13))、MPNNGilmeret al. (2017 (https://arxiv.org/html/2606.27780#bib.bib14))、GPSRampášeket al. (2022 (https://arxiv.org/html/2606.27780#bib.bib15))和ActionNode GWMFenget al. (2025 (https://arxiv.org/html/2606.27780#bib.bib24))。该基准包括FE和DE模拟器,以及异构智能体图测试平台。结果支持一种依赖于模式的GWM展开误差观点。长展开将小的预测误差转化为更大的规划误差。当图结构演变时,动态边训练显著优于固定边训练,并且学习到的动态表现出联合算子预测的节点-边耦合。中心实证点是GWM稳定性不仅仅是架构属性;它取决于拓扑、时域和展开模式。我们进一步提出了**误差感知GWM**以提高高谱半径图上的展开稳定性。它结合了谱正则化、展开一致性和关键节点加权,以在保持预测精度的同时控制拓扑引起的放大。实验表明,误差感知GWM消除了vanilla GCN展开中观察到的发散,并保持长时域预测误差较低。更简单的稳定器可以减少发散,但往往会损失预测保真度。这种区别很重要:一个有用的图世界模型必须足够稳定以进行展开,并且足够准确以使这些展开能够支持规划。我们的贡献总结如下: - •**统一的FE/DE实例化GWM框架(第3节 (https://arxiv.org/html/2606.27780#S3))**。我们将图结构智能体规划形式化为状态-动作-转移建模,并支持固定边和动态边展开。 - •**拓扑感知的展开误差理论(第4节 (https://arxiv.org/html/2606.27780#S4))**。我们开发了图值误差界,解释了自回归展开过程中拓扑依赖的放大和节点-边耦合。 - •**用于稳定规划的误差感知GWM(第6节 (https://arxiv.org/html/2606.27780#S6))**。我们引入了一个训练目标,结合谱控制、展开一致性和关键节点加权,以提高长时域稳定性。 - •**在合成和智能体图设置上的评估(第7节 (https://arxiv.org/html/2606.27780#S7))**。我们在多样化的图拓扑、展开模式和智能体图环境中测试该框架,以研究GWM何时稳定或不稳定。 - •**在真实世界基准上的范围分析(第7.7.1节 (https://arxiv.org/html/2606.27780#S7.SS7.SSS1))**。我们评估了超出受控合成动态的GWM,并阐明了它们相对于标准图方法的实际边界。 ## 2 相关工作 ##### 用于规划的世界模型。世界模型在基于模型的强化学习中被广泛研究,其中学习到的动力学模型用于模拟未来轨迹以进行规划或策略学习。一个核心挑战是累积误差:小的单步模型误差可以在长时间展开中累积并降低决策质量。Asadi等人Asadiet al. (2018 (https://arxiv.org/html/2606.27780#bib.bib1))通过学习到的转移模型的Lipschitz连续性分析这种效应。PETS使用概率集成和轨迹采样在基于模型的规划中传播不确定性Chuaet al. (2018 (https://arxiv.org/html/2606.27780#bib.bib70))。Janner等人Janneret al. (2019 (https://arxiv.org/html/2606.27780#bib.bib4))研究使用短分支展开进行基于模型的策略优化以减少误差积累。Kakade和LangfordKakade and Langford (2002 (https://arxiv.org/html/2606.27780#bib.bib62))提供了仿真引理风格的工具,将模型误差与策略性能联系起来。最近的系统通过检索增强上下文Chenet al. (2025 (https://arxiv.org/html/2606.27780#bib.bib37))、层次化隐空间规划Zhanget al. (2026 (https://arxiv.org/html/2606.27780#bib.bib38))、基于不确定性的展开截断Niet al. (2025 (https://arxiv.org/html/2606.27780#bib.bib44))、模块化动力学专家Liet al. (2025a (https://arxiv.org/html/2606.27780#bib.bib43))、技能级抽象Gürtler and Martius (2025 (https://arxiv.org/html/2606.27780#bib.bib39))、计划采样式训练Rivardet al. (2025 (https://arxiv.org/html/2606.27780#bib.bib42))和受控长时域评估基准Liet al. (2025b (https://arxiv.org/html/2606.27780#bib.bib40))来减少展开漂移。这些工作推动了展开误差分析,但它们未建模图拓扑、消息传递或耦合的节点-边预测。 ##### 图神经网络和图结构预测。图神经网络提供了一种通过沿边传播信息来学习图结构数据的标准框架。交互网络和图网络引入了面向对象和关系的神经动力学用于物理推理Battagliaet al. (2016 (https://arxiv.org/html/2606.27780#bib.bib71),2018 (https://arxiv.org/html/2606.27780#bib.bib36)),图网络物理引擎表明此类模型可以支持动态系统中的推理和控制Sanchez-Gonzalezet al. (2018 (https://arxiv.org/html/2606.27780#bib.bib72))。图卷积网络聚合归一化的邻域信息Kipf and Welling (2017 (https://arxiv.org/html/2606.27780#bib.bib13))。消息传递神经网络泛化了局部基于边的聚合Gilmeret al. (2017 (https://arxiv.org/html/2606.27780#bib.bib14))。图变换器如GPS结合了消息传递与全局注意力Rampášeket al. (2022 (https://arxiv.org/html/2606.27780#bib.bib15))。先前的理论表明,图传播强烈受邻接矩阵或归一化邻接矩阵的谱性质影响Oono and Suzuki (2020 (https://arxiv.org/html/2606.27780#bib.bib34)),而基于扩散的GNN将图学习与离散化扩散动力学的稳定性联系起来Chamberlainet al. (2021 (https://arxiv.org/html/2606.27780#bib.bib73))。关于图重连的相关工作研究如何修改拓扑以改善信息流并减少有害传播效应Toriet al. (2024 (https://arxiv.org/html/2606.27780#bib.bib50))。物理信息重连进一步研究图神经网络中长程交互的拓扑修改Yuet al. (2025 (https://arxiv.org/html/2606.27780#bib.bib51))。这些结果表明拓扑可以塑造预测行为,但它们主要研究表示学习或一步动态,而非自回归图展开(其中预测误差成为未来输入)的情况。 ##### 图世界模型。图世界模型将世界建模扩展到图结构状态。Feng等人Fenget al. (2025 (https://arxiv.org/html/2606.27780#bib.bib24))引入了一个GWM框架,在统一图接口中表示多模态观测、图状态、动作节点和目标节点。WorldGraph使用潜在地标作为用于规划的图结构抽象Zhanget al. (2021 (https://arxiv.org/html/2606.27780#bib.bib26))。Value Memory Graph构建了用于离线强化学习的图结构记忆Zhuet al. (2022 (https://arxiv.org/html/2606.27780#bib.bib27))。知识图谱世界模型通过结构化关系记忆表示文本环境Ammanabrolu and Riedl (2021 (https://arxiv.org/html/2606.27780#bib.bib33))。对比性结构化世界模型学习以对象为中心的关系动态Kipfet al. (2020 (https://arxiv.org/html/2606.27780#bib.bib32))。Dyn-O构建了带有以对象为中心的表征的结构化世界模型Wanget al. (2025 (https://arxiv.org/html/2606.27780#bib.bib29))。
相似文章
想象展开是运动学的,而非动力学的:长时程世界模型失败的诊断
本文诊断了世界模型中的长时程失败,并将其归因于运动学而非动力学想象。作者引入了一个度量(iKCE),并表明即使策略奖励崩溃,想象展开也无法捕捉动态状态变化。
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
修复放大器而非症状:面向Agent Rollouts的稳定世界模型纠正
本文介绍了WM-SAR,一种面向Agent规划的世界模型纠正方法,该方法修复因果子图而非可见症状,在令牌预算下相比标准LLM纠正器实现了更好的稳定性。
基于小语言模型的闭环图算法执行:步骤准确性与展开可靠性
本文研究将小语言模型(SLMs)作为图算法执行的闭环策略,评估了多个图程序中的步骤准确性和展开可靠性。结果表明,局部决策质量与全局执行可靠性之间存在差距,尤其是在加权算法中。
AGWM:面向具有组合先决条件环境的具身世界模型
本文提出了 AGWM,一种基于可供性的世界模型,该模型使用动态先决条件图来跟踪具有组合先决条件环境中的动作可执行性。实验表明,与标准世界模型相比,AGWM 能够降低预测误差并提高泛化能力。