物理世界模型中的守恒与分解:稳定性和反事实推理的基石
摘要
本文指出了学习型物理模拟器中的两个不同失败点——长序列中的不稳定性以及无法适应变化的物理定律——并提出了相应的结构解决方案:使用辛积分来提高稳定性,使用显式分解来实现反事实泛化。
arXiv:2609.19674v1 公告类型:新
摘要:一个学习型模拟器可以准确重现其训练条件,但一旦这些条件改变,它可能以两种不同的方式失败。在长序列中,小误差会累积,直到轨迹偏离物理合理行为;在对物理参数进行干预时,模型可能继续遵循训练时看到的定律,而不是被干预的定律。我们展示了这两种失败需要不同的结构解决方案。使用辛积分器演化学习到的能量可以保持保守动力学的几何结构,并将序列保持在物理意义范围内,最长可达训练序列长度的100倍,而相同容量的预测器、能量正则化预测器和调优的神经常微分方程则会发散。相比之下,通过显式线性分解编码物理耦合使模型能够遵循从未见过的耦合符号,而无限制的参数化则会锁定到训练定律。关键是,这两个机制是可分离的:移除负责长期稳定性的结构不会影响反事实迁移,而移除分解耦合会破坏反事实迁移但不消除稳定性。这种双重分离是通过匹配对照建立的,一次移除或替换一个结构组件,不仅在标题三体系统中成立,而且当物理状态必须从像素推断而非直接提供时仍然可见。结果是物理世界模型的一个具体设计原则:长期稳定性和改变定律的泛化来自不同的结构承诺,每个都可以在不依赖另一个的情况下被刻意施加。
查看缓存全文
缓存时间: 2026/09/18 09:02
# 物理世界模型中:守恒性换取稳定性,因式化分解换取反事实泛化能力 来源:https://arxiv.org/html/2609.19674 Parivesh Priye 隶属机构:佐治亚理工学院 Lu Wei 隶属机构:石溪大学 Haibin Ling 隶属机构:西湖大学 ###### 摘要 学习型模拟器能够精确复现其训练条件,但一旦条件变化,会以两种不同方式失效。在长时间轨迹展开中,微小误差会累积直至轨迹偏离物理合理行为;在对物理参数进行干预时,模型可能继续遵循训练时学到的规律而非干预后的规律。我们证明这两种失效需要*不同的结构性修复方案*。通过辛积分器演化学习到的能量,能保持保守动力学的几何结构,使轨迹在长达训练时长*100倍*的范围内保持物理意义且不发散;而等容量预测器、能量正则化预测器以及调优后的神经ODE则会出现发散。另一方面,通过显式线性因式分解编码物理耦合关系,能使模型遵循从未见过的耦合符号;而无约束参数化则会锁定于训练规律。关键在于,这两种机制是可分离的:移除负责长期稳定性的结构不会影响反事实迁移能力;移除因式化耦合会破坏反事实迁移但不会消除稳定性。这种*双重解离*通过匹配对照实验建立(每次移除或替换一个结构组件),不仅在经典三体系统中成立,在必须从像素推断物理状态而非直接提供时也依然可见。研究结果为物理世界模型提出了具体设计原则:长期稳定性与规律变更泛化源于不同的结构承诺,且每种承诺可刻意施加而无需依赖对方。 ## 1 引言 学习型模拟器预测物理系统的下一状态,并将该预测迭代为轨迹。现代模型在轨迹精度或视觉逼真度等传统指标上表现良好,但一旦控制条件超出训练范围,常以两种特定方式失效:第一,预测误差累积导致长时间轨迹漂移或失稳;第二,当物理规律本身发生变化(例如重力反向、耦合翻转或时间倒流)时,模型往往继续遵循训练时学到的规律。这两种失效在当前系统中仍然存在:最佳报道的视频生成器在VideoPhy-2的困难划分中仅达到22%的联合准确率,所有模型在PhyGround上均未超过3.3/5,且PhyWorldBench包含专门的“反物理”类别用于检测规律变更失效(Yi等,2020;Bear等,2021;Gu等,2025;Bansal等,2025;Nam等,2026)。类似局限也出现在不同尺度的学习型模拟器中(Sanchez-Gonzalez等,2020;Zhong等,2021a)。 本文探讨:*哪种物理结构修复哪种失效?* 我们通过直接编码物理不变性(而非让模型从有限数据中推断)来解决该问题。已有成熟要素包括:哈密顿与拉格朗日神经网络、广义坐标模型、约束动力学及辛结构保持参数化(Greydanus等,2019;Cranmer等,2020;Lutter等,2019;Finzi等,2020;Zhong等,2020b)。但尚不明确的是:何种结构承诺产生何种行为,以及每种承诺的效用边界何在。 我们发现*双重解离现象*: - 通过辛更新保持学习到的能量守恒,能维持长时间轨迹的物理有界性,但不决定系统对规律变更的响应方式; - 通过物理耦合的线性因式化编码相互作用力,能实现对从未见过的耦合符号的迁移,但无法防止长期漂移。 通过每次移除或替换一个要素的匹配对照实验表明:稳定性依赖于几何与能量一致性,而反事实迁移取决于干预参数进入动力学的方式。 本文贡献包括四点: 1. 通过匹配对照建立双重解离,证明守恒性产生长期稳定性,因式化耦合产生反事实反演,两者互不生成且无法被容量、积分器选择或形式体系单独解释; 2. 形式化每种行为背后的机制,并划定每种先验失效的边界; 3. 证明该解离超越光滑少体运动,适用于广义坐标、接触力、多体系统、混合力族及基于像素的具身感知(包括学习型物体绑定器与冻结公开视频编码器); 4. 将该结构框架扩展至非保守动力学,通过被动摩擦端口达到正确温度,并利用因式化驱动实现对未知驱动力强度和符号的泛化。 我们研究从物理状态(含位置与动量)到下一状态的学习型转移映射,并将其迭代为轨迹。为分离动力学与感知,提供三种状态输入方式: 1. 神谕状态; 2. 通过编码器从合成渲染恢复的状态(位置通道由固定渲染器或无标签质心锚定); 3. 从像素中发现的状态(无锚定点)。 前两种设置能复现目标行为,第三种则暴露了当前方法的边界。因此本研究关注物理规律保真度而非视觉保真度,不涉及真实视频生成、图像质量或排行榜性能的提升。 ## 2 相关工作 **结构化动力学与参数条件化** 哈密顿与拉格朗日网络编码守恒律或变分结构(Greydanus等,2019;Cranmer等,2020;Lutter等,2019)。广义坐标、约束及本质辛变体将这些思想扩展至刚体与结构化系统(Finzi等,2020;Zhong等,2020b;Jin等,2020),其中学习能量具有连续守恒表述,离散行为部分由数值积分器决定(Zhong等,2021a)。通过物理参数(包括乘性系数)条件化动力学也是标准方法(Greydanus等,2019;Cranmer等,2020;Lutter等,2019;Zhong等,2020b;Jin等,2020;Brunton等,2016;Han等,2021;Raissi等,2019),而上下文适应则将预测扩展至训练参数族内的新采样(Kirchmeyer等,2022;Yin等,2021;Wang等,2022)。 我们的设置在两方面不同:第一,干预的耦合符号超出训练支持范围;第二,通过比较HNN、DeLaN和SymODEN的匹配因式化与无约束版本,确定哪种结构承诺支持稳定性,哪种支持反事实反演。 **模拟器、耗散、接触与感知** 图网络模拟器是强大的关系预测器(Sanchez-Gonzalez等,2020;Battaglia等,2016;Satorras等,2021),训练噪声是缓解轨迹不稳定性的常用方法;在本文研究的模拟器中,它仅能延迟但无法阻止无界漂移。耗散、端口哈密顿及GENERIC或度量辛模型分离可逆与不可逆动力学(Sosanya和Greydanus,2022;Zhong等,2020a;Desai等,2021;Lee等,2021)。D-HNN评估未见摩擦系数,端口哈密顿网络恢复能量、驱动力和耗散,组合式端口哈密顿学习从学习组件组装系统(Neary和Topcu,2023)。可微接触模型进一步将结构化动力学扩展至碰撞(Zhong等,2021b;Hochlehnert等,2021)。在感知方面,哈密顿生成模型与无监督拉格朗日模型直接从图像学习动力学(Toth等,2020;Zhong和Leonard,2020),而Botev等(2021)将连续时间可逆性识别为像素学习中最广泛适用的物理先验。我们证明仅靠结构无法诱导规范潜表示,且可逆性仅在基础动力学本身可逆时才有效。 尽管近期视频世界模型与物理推理基准报告了与物理定律的持续不一致(Yi等,2020;Bear等,2021;Riochet等,2018;Gu等,2025;Assran等,2025;Bansal等,2025;Nam等,2026;Lin等,2026),本工作分离了保证长期稳定性和反事实泛化所需的具体结构承诺。 ## 3 方法 ### 3.1 设置与两种测量行为 **图1概述**:施加的两种物理结构(左)、产生的双重解离(中)、行为测量方式与边界(右下)。 图1总结了研究框架:左侧是施加的两种结构承诺——通过辛步骤演化学习能量实现能量守恒,以及因式化耦合(干预参数线性进入力,其余内容从前向规律数据学习)。中间展示双重解离:守恒性提供列向稳定性,因式化提供行向规律变更响应,因此只有同时包含两种结构的模型才能保持稳定*且*响应反事实。右侧与底部标明相应测量指标、用于排除容量/积分器选择/形式体系影响的匹配对照实验,以及每种结构的效用边界。 对于N体系统,状态为x=(q,p),其中q表示位置,p表示动量,参数向量c=(G, m₁, ...)包含耦合常数G与质量。动力学模型是迭代为轨迹的状态转移映射: xₜ₊₁ = f_θ(xₜ, c), x₀:ₜ = (x₀, f_θ(x₀, c), ...) (1) 该模型仅使用吸引引力(G>0)前向规律数据进行单步预测训练。我们的核心系统是软化三体引力,势能V(q)=-∑ᵢ<ⱼ G mᵢ mⱼ / ‖qᵢ-qⱼ‖,并在未见的排斥机制(G<0)中评估。 设x̂₀:ₜ为模型轨迹,x⁻₀:ₜ与x⁺₀:ₜ分别为相同初始条件下翻转规律与训练规律的参考轨迹。规律匹配指标记录学习轨迹遵循的定律: RM = 𝟙[‖x̂₀:ₜ - x⁻₀:ₜ‖ < ‖x̂₀:ₜ - x⁺₀:ₜ‖] (3) 同时报告归一化轨迹误差(平方轨迹误差除以参考方差)(定义1)。 ### 3.2 两种结构承诺及其保证 **辛模型**通过辛更新演化学习到的哈密顿量H_θ。连续时间对应流为: q̇ = ∂H_θ/∂p, ṗ = -∂H_θ/∂q (4) 该流守恒H_θ。但离散蛙跳算法既不精确守恒H_θ也不守恒参考能量。 **命题1(修正哈密顿量的近似守恒;形式陈述见附录B)**:在向后误差分析的正则性、有界轨道及小步长假设下,应用于方程(4)的蛙跳算法在指数长时间内保持修正哈密顿量Ĩ_θ = H_θ + O(dt²)至指数小误差(Hairer等,2006)。该命题针对Ĩ_θ而非物理参考能量。此外,通用MLP势能不一定具有强制性,因此真实能量的有界性仍是经验有限时域性质。因此我们分别报告学习能量守恒、物理能量漂移、状态逃逸和轨迹保真度作为独立结果。 第二种承诺是**因式化耦合势能**,使相互作用力严格线性依赖于G: U_θ(q) = ∑ᵢ<ⱼ φ_θ(qᵢ, qⱼ) · G (5) 其中φ_θ学习空间结构,但标量耦合显式线性化。这确保模型可通过符号翻转G→-G响应规律变更。第4.2节表明,此类模型能表征翻转规律,但仅从正向规律数据中无法学会选择它。证明见附录B。 ### 3.3 对照实验与声明验证 每个声明均通过对照实验验证:每次移除或替换一个结构要素,从而将每种行为归因于其依赖的组件。针对守恒性,我们对照:
相似文章
守恒定律何时能在学习到的表示中存续?潜在世界模型的可认证时域
本文研究了在学习到的潜在世界模型中如何认证守恒定律,提出了有界时域,通过可测量的模型缺陷可提前保证轨迹在物理不变水平集上保持多少步。
利用典范多项式不变量诊断强化学习模拟器与世界模型中的故障
本文提出了一种利用精确多项式不变量对强化学习模拟器和世界模型进行诊断的方法,开发了筛选和归因程序,以定位失效约束并识别故障参数。
从生成到模拟:世界模型距离真正的模拟器还有多远?
本文系统性地评估了生成式世界模型在八个能力上与传统模拟器的对比,发现在交互性和可控性方面取得了进展,但在物理保证、状态反馈和长期稳定性方面存在差距。
世界模型与语言模型相遇:论具体推理与抽象推理的互补性
本文提出特权未来在策略自蒸馏(PF-OPSD)方法,用于受控具体推理,结合世界模型的视觉模拟与语言模型的抽象推理,在两个新基准上提升预测准确性和鲁棒性。
注意仿真与现实的差距,并像科学家一样思考
本文研究在序贯决策问题中,规划者何时以及如何用真实实验补充预训练模拟器,提出Fisher-SEP以最小化目标策略值的后验方差。