解锁哈密顿视频动力学模型中的时间泛化
摘要
本文识别了哈密顿生成网络(HGN)在非保守环境中阻止时间泛化到不同步长的失败模式,并提出了针对性的修复方案,以实现可变时间分辨率下的稳定动力学预测。
arXiv:2607.07763v1 Announce Type: new
摘要:世界模型通常被训练为以固定的步长预测离散时间的物理动力学,该步长被嵌入模型权重中,从而无法在可变时间分辨率下进行预测。这对于分层规划、仿真到现实迁移以及需要以多个时间尺度查询相同动力学的科学或游戏引擎应用至关重要。哈密顿生成网络(HGN)提供了一条原则性的前进道路,将预测基于连续时间能量函数,该函数原则上独立于观测帧率。然而在实践中,它们在非保守设置下的时间泛化会失效。我们表明,在外力驱动、耗散环境中,HGN在超出训练范围的步长下的展开会因不同的失败模式而失败,包括由无约束作用-力映射驱动的潜在幅度增长,以及由分辨率不足的积分器引起的全局截断误差累积。我们针对每种机制确定了有针对性的修复方案,并展示了在远超出训练分布的时间分辨率下的稳定动力学预测。在详细分析中,我们推荐了几种实现连续时间视频生成时间泛化的策略。
查看缓存全文
缓存时间: 2026/07/10 06:15
# 解锁哈密顿视频动力学模型中的时间泛化能力
来源:https://arxiv.org/html/2607.07763
11institutetext:南方卫理公会大学计算机科学系,达拉斯,德克萨斯州,美国
11email:\{ejlaird,coreyc\}@smu\.edu
###### 摘要
世界模型通常在离散时间物理动力学上进行训练,并将固定的步长编码进模型权重中,从而无法在可变的时间分辨率下进行预测。这对于层次化规划、仿真到现实的迁移,以及需要以多种时间尺度查询相同动力学的科学或游戏引擎应用至关重要。哈密顿生成网络(HGN)提供了一条有原则的前进道路,将其预测建立在连续时间能量函数的基础上,该函数原则上独立于观察帧率。然而,在实践中,它们的时间泛化能力在非保守环境中会失效。我们表明,在外部受迫、耗散的环境中,HGN在超出训练范围的步长下的展开会因不同的失效模式而失败,包括由无约束的动作-力映射驱动的潜在幅度增长,以及由分辨率不足的积分器导致的全局截断误差累积。我们针对每种机制提出了有针对性的修复,并展示了在远超出训练分布的时间分辨率下的稳定动力学预测。在详细分析中,我们推荐了几种策略,以实现在连续时间视频生成中的时间泛化能力。
## 1 引言
大多数世界模型架构在离散时间网格上预测物理动力学,并在训练时使用固定的步长。世界模型中的主导范式是离散时间转移 `z_{t+1}=f(z_t, a_t)`,这一结构是早期世界模型架构 [32 (https://arxiv.org/html/2607.07763#bib.bib20), 11 (https://arxiv.org/html/2607.07763#bib.bib21), 12 (https://arxiv.org/html/2607.07763#bib.bib22)]、Dreamer 系列 [14 (https://arxiv.org/html/2607.07763#bib.bib7), 15 (https://arxiv.org/html/2607.07763#bib.bib8), 16 (https://arxiv.org/html/2607.07763#bib.bib9)]、基于JEPA的模型 [19 (https://arxiv.org/html/2607.07763#bib.bib13), 4 (https://arxiv.org/html/2607.07763#bib.bib14), 35 (https://arxiv.org/html/2607.07763#bib.bib15), 20 (https://arxiv.org/html/2607.07763#bib.bib16)] 以及其它模型 [1 (https://arxiv.org/html/2607.07763#bib.bib17), 28 (https://arxiv.org/html/2607.07763#bib.bib25), 10 (https://arxiv.org/html/2607.07763#bib.bib23), 23 (https://arxiv.org/html/2607.07763#bib.bib24)] 的基础。这些模型在其训练速率下学习到了有能力的预测器,但没有机制可以跨时间分辨率进行泛化,这关系到层次化规划(粗粒度和细粒度时间尺度)[25 (https://arxiv.org/html/2607.07763#bib.bib33), 13 (https://arxiv.org/html/2607.07763#bib.bib34), 34 (https://arxiv.org/html/2607.07763#bib.bib32)]、仿真到现实迁移(仿真和控制速率很少匹配)[22 (https://arxiv.org/html/2607.07763#bib.bib35), 26 (https://arxiv.org/html/2607.07763#bib.bib36)],以及必须同时以多种时间尺度查询相同动力学的科学模拟引擎 [5 (https://arxiv.org/html/2607.07763#bib.bib37)]。
神经常微分方程(Neural ODEs)[6 (https://arxiv.org/html/2607.07763#bib.bib3), 24 (https://arxiv.org/html/2607.07763#bib.bib26)] 通过将动力学参数化为向量场 `dz/dt = f(z)` 并在任意所需步长下进行积分,解决了固定步长的限制。但学习到的场是一个无约束的网络,如果没有物理归纳偏置,可能不遵守守恒定律或辛结构,从而破坏长时域展开的稳定性。
哈密顿神经网络正好提供了这种保守的和辛的结构 [9 (https://arxiv.org/html/2607.07763#bib.bib6)]。哈密顿量是一个标量能量函数 `H(q, p)`,其梯度定义了运动方程,并保证了能量守恒、时间可逆性和辛流。哈密顿生成网络(HGN)[27 (https://arxiv.org/html/2607.07763#bib.bib19)] 证明了在单个模型下,以两倍和一半的训练速率以及时间反转的动力学下,可以生成看似合理的视觉展开。然而,在非保守环境中,这种时间泛化能力会下降,并且其局限性尚未被系统性地表征。
我们通过插值和外推的视角研究哈密顿生成网络中的时间泛化能力,即分别在小于和大于训练的步长下进行预测。插值自然泛化,因为辛积分器可以细化任何目标步长而无需重新训练;外推,其中步长超过训练所见过的任何步长,则更为脆弱,也是本工作的重点(第3节 (https://arxiv.org/html/2607.07763#S3))。
我们扩展了HGN,添加了端口-哈密顿结构,以处理外部受迫、耗散的环境,并识别出在超出训练范围时展开失败的多种模式,包括由无约束的动作-力映射驱动的指数级潜在幅度增长,以及由分辨率不足的积分器导致的全局截断误差累积(图1 (https://arxiv.org/html/2607.07763#S1.F1))。我们针对每种模式提供了有针对性的修复,并提出了一种在多种时间分辨率下学习视觉连续时间动力学的策略。
参考图例 图1:在评估步长超出训练步长时,动力学展开可能失败三种视角。在每个面板中,顶部条带(青色)是地面真实帧序列,底部条带(灰色)是模型的开环预测。(a) *步长泛化失败*:超过训练步长后,预测的展开默认恢复到训练步长下的记忆动力学。(b) *幅度爆炸*:无约束的积分器注入能量,导致渲染的质量涂抹成高幅度伪影。(c) *积分器误差*:在约束了能量爆炸后,展开保持有界,但从分辨率不足的积分器积累了全局截断误差,与地面真实相位漂移。
## 2 相关工作
### 2.1 世界模型
大多数世界模型将环境动力学预测为离散时间潜在转移 `z_{t+1}=f(z_t, a_t)`,并以单一的训练帧率学习。早期的潜在动力学模型直接从像素建立了这种模板。Embed to Control [32 (https://arxiv.org/html/2607.07763#bib.bib20)] 从原始图像中学习了一个局部线性的潜在转移用于控制,而Ha和Schmidhuber的世界模型 [11 (https://arxiv.org/html/2607.07763#bib.bib21), 12 (https://arxiv.org/html/2607.07763#bib.bib22)] 将变分自编码器与一个循环混合密度网络配对,每次将潜在状态向前滚动一步。Dreamer系列扩展了这一方案。Dreamer [14 (https://arxiv.org/html/2607.07763#bib.bib7)] 通过在循环状态空间模型内的潜在想象来学习行为,DreamerV2 [15 (https://arxiv.org/html/2607.07763#bib.bib8)] 将连续潜在变量替换为离散分类编码,DreamerV3 [16 (https://arxiv.org/html/2607.07763#bib.bib9)] 则在不同领域稳定了该方法。在每种情况下,循环更新都使状态恰好前进一个固定的环境步长,没有底层连续时间的概念。
第二个家族在学习的表示空间而非像素空间中进行预测。LeCun [19 (https://arxiv.org/html/2607.07763#bib.bib13)] 提出的联合嵌入预测架构(JEPA),其图像级实例如 I-JEPA [2 (https://arxiv.org/html/2607.07763#bib.bib1)] 和免崩溃的 LeJEPA [3 (https://arxiv.org/html/2607.07763#bib.bib2)],推动了预测未来嵌入而非重建观察。在这些JEPA编码器的基础上,DINO-WM [35 (https://arxiv.org/html/2607.07763#bib.bib15)] 学习在冻结的DINO特征上进行下一步动力学预测,以实现零样本规划,Navigation World Models [4 (https://arxiv.org/html/2607.07763#bib.bib14)] 预测以导航动作为条件的未来自我中心观察,而 LeWorldModel [20 (https://arxiv.org/html/2607.07763#bib.bib16)] 从像素端到端地训练JEPA下一步嵌入预测器。这些预测器同样在固定步长上自回归,无法以任意时间分辨率查询。
生成式视频模型构成了第三个家族:DIAMOND [1 (https://arxiv.org/html/2607.07763#bib.bib17)] 学习了一个扩散世界模型,为智能体训练保留了精细的视觉细节,GameNGen [28 (https://arxiv.org/html/2607.07763#bib.bib25)] 将扩散下一步预测器变成了一个实时的神经游戏引擎,长上下文状态空间视频世界模型 [23 (https://arxiv.org/html/2607.07763#bib.bib24)] 则采用状态空间骨干来扩展自回归帧预测的记忆。少数模型在多个时间尺度上进行推理,但仅限于基础步长的整数倍。THICK [10 (https://arxiv.org/html/2607.07763#bib.bib23)] 学习了一个层次结构,其中高层在离散的底层潜在动态之上预测稀疏的上下文变化事件。在所有这些家族中,预测器都受限于其训练数据的时间分辨率,通过固定步长前进,而非积分一个连续时间向量场。
### 2.2 神经常微分方程与状态空间中的连续时间动力学
另一条并行的工作线,专注于神经常微分方程,通过架构化的归纳偏置将物理学嵌入到学习到的动力学中。哈密顿神经网络 [9 (https://arxiv.org/html/2607.07763#bib.bib6)] 从状态观察中学习了一个标量哈密顿量 `H(q, p)`,在简单系统上证明了能量守恒。拉格朗日神经网络 [7 (https://arxiv.org/html/2607.07763#bib.bib4)] 在位置-速度空间中采用了对偶方法。Neural ODEs [6 (https://arxiv.org/html/2607.07763#bib.bib3)] 通过ODE求解器参数化了连续时间动力学,使时间步长成为一个自由参数,而 Latent ODEs [24 (https://arxiv.org/html/2607.07763#bib.bib26)] 将其扩展到潜在空间中不规则采样的观测。端口-哈密顿神经网络 [8 (https://arxiv.org/html/2607.07763#bib.bib5)] 基于端口-哈密顿形式 [29 (https://arxiv.org/html/2607.07763#bib.bib29)] 来处理具有外部强迫的耗散系统。所有这些方法都在已知的低维状态空间中运行,而我们的模型将端口-哈密顿结构嵌入到像素到像素的生成流水线中,引入了联合学习视觉状态表示和动力学的额外挑战。
### 2.3 哈密顿生成网络
与我们的方法最直接可比的是哈密顿生成网络(HGN)[27 (https://arxiv.org/html/2607.07763#bib.bib19)],它首次从像素观测端到端地学习了哈密顿动力学。HGN推断一个潜在的相空间状态,使用辛流跳点积分器积分一个学习到的可分离哈密顿量,并从潜在的“位置”坐标解码图像。该模型使用时间扩展的ELBO目标 [18 (https://arxiv.org/html/2607.07763#bib.bib27)] 进行训练,并通过改变积分步长的大小,展示了从单个模型进行前向、后向、2倍和一半速度展开的能力。我们的工作扩展了HGN,加入了端口-哈密顿外部力(动作)注入,并描述了在更大步长比率下时间泛化何时以及为何失效。
## 3 插值与外推
参考图例 图2:基线端口-HGN的时间泛化。每个块展示了同一底层振荡器轨迹以不同评估步长 `Δt_eval` 采样的结果,显示为地面真实(顶部)、预测(中部)和预测误差(底部)。在训练步长之下,模型准确插值(`Δt_eval ∈ {0.1, 0.2}`),并且再现了训练分辨率(`Δt_eval = Δt_train = 0.4`),误差行保持近黑色。在外推中(`Δt_eval = 0.8`),随着预测漂相离相,误差行发展出明显的残差。时间泛化有两个方向,它们测试的是模型所学内容根本不同的东西。**插值**指在小于训练步长的步长下进行评估。在这种情况下,模型更密集地采样其学习到的轨迹,辛积分器可以将任何目标步长分解为更精细的子步长,而无需重新训练。然而,强插值性能并不能区分一个学习了连续时间物理的模型和一个记住了平滑曲线的模型。**外推**指在大于训练的步长下进行评估,此时积分步长超过了模型在学习期间遇到的任何步长。一个学习了真正连续时间向量场的模型应该由于数值原因而失败,包括求解器步长过大,产生可以通过更精细积分消除的截断误差。一个记住了固定步长转移映射的模型应该由于表征原因而失败。这些固定步长模型只是以训练步长重现动力学,而细化积分也无济于事。这种不对称性使得外推成为测试连续时间结构的一个有用测试,也是后续分析的重点。
## 4 方法
我们的模型遵循 HGN 设计 [27 (https://arxiv.org/html/2607.07763#bib.bib19)],其中编码器从像素推断动力学状态,一个可分离哈密顿网络在抽象相空间中积分动力学,解码器从积分状态重建图像。我们对此进行了扩展,加入了端口-哈密顿结构,增加了能量耗散和动作强迫。
**编码器和解码器**。一个具有四个残差块和步幅2下采样(64个通道)的卷积网络,后接一个2层MLP,将每个64×64×3帧映射到 `d=64` 维的潜在向量。潜在向量被等分为抽象位置 `q` 和动量 `p`。一个卷积上采样网络仅从位置坐标重建图像:`x̂_t = D_ρ(q_t)`,遵循 Toth 等人 [27 (https://arxiv.org/html/2607.07763#bib.bib19)] 的方法。
**端口-哈密顿预测器**。给定状态 `(q, p)` 和动作 `a`,预测器积分端口-哈密顿方程:
```
q̇ = ∂H/∂p, ṗ = −∂H/∂q − γ ∂H/∂p + G(a)
``` (1)
其中 `H(q, p) = T(p) + V(q)` 是一个学习到的可分离哈密顿量,`T` 和 `V` 各自参数化为具有 Softplus 激活的标量输出 MLP,`γ ≥ 0` 是一个学习到的标量阻尼系数,`G(a)` 是一个学习到的动作-力映射。
**跳点积分器**。物理积分器是一个修改过的跳点 [30 (https://arxiv.org/html/2607.07763#bib.bib30)],它将阻尼和强迫对称地折叠进两个动量半部:
```
p_half = p_t + (Δt/2)(−∂H/∂q|_t − γ ∂H/∂p|_t + G(a)) (2)
q_{t+1} = q_t + Δt ∂H/∂p|_half
p_{t+1} = p_half + (Δt/2)(−∂H/∂q|_{t+1} − γ ∂H/∂p|_half + G(a))
```相似文章
MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。
幽灵吸引子网络:用于闭环序列生成的盆地结构动态解码器
提出幽灵吸引子网络作为闭环序列生成的盆地结构动态解码器,相比大规模Transformer和扩散模型实现了显著的效率提升,同时保持高精度和低延迟。
使用时间段模型进行预测和控制
OpenAI 推出了一种使用深度生成模型在时间段上学习复杂非线性系统动力学的方法,能够实现稳定的长期预测和可微分的轨迹优化以进行基于模型的控制。
One-Forcing: 迈向稳定的单步自回归视频生成
One-Forcing 通过用辅助 GAN 损失增强 DMD 目标,改进了单步视频生成,以更低的训练成本实现了最先进的性能。
从微分几何视角看哈密顿神经网络
一篇博客文章,通过微分几何解释哈密顿神经网络,使用简单的质量-弹簧系统演示如何通过网络架构施加守恒定律以实现更高效的学习。作者从基础微积分开始逐步构建了辛流形和泊松括号等数学工具。