HyperODE:动力系统仿真与推断的零样本替代模型

arXiv cs.LG 论文

摘要

介绍HyperODE,一种零样本替代模型,将ODE结构映射到超图,无需重新训练即可对整类动力系统进行仿真和参数推断。

arXiv:2608.00852v1 公告类型:新增 摘要:理解并控制复杂的动力系统通常需要在庞大的参数空间内执行数千次数值仿真,这非常耗时。机器学习替代模型通过预测不同初始条件和参数值下的状态轨迹,显著加速仿真。然而,替代模型专门针对单一仿真模型。修改底层微分方程——例如添加生理状态或改变流行病接触网络——会使训练好的模型失效,并被迫从头进行代价高昂的重新训练。我们提出了HyperODE,一种无需重新训练即可在整类近似质量守恒的房室模型上运行的替代模型。通过将常微分方程(ODE)的结构映射为有向超图,HyperODE将系统相互作用的函数形式与神经网络架构解耦。HyperODE将任意参数分布(通过分位数定义)的ODE形式的房室模型转换为超图,并输出原始ODE中所有状态轨迹的分位数形式分布。然后,我们利用该替代模型构建一个编码器,该编码器接收带噪声的轨迹并输出原始ODE参数上的分布,从而单次前向传播即可完成模型校准。在训练中从未见过的系统族和系统规模上,HyperODE通过单次前向传播生成校准的分位带,其加权区间分数和覆盖率与针对每种结构的专用替代模型相当。对于逆向推断,HyperODE使用单个共享编码器在几毫秒内从带噪声的状态轨迹实现校准,与现有方法具有竞争力。HyperODE将零样本能力扩展到打破质量守恒的ODE以及外部强迫情形。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:43

# 动力系统的零样本代理模拟与推断

来源:https://arxiv.org/html/2608.00852

###### 摘要

理解并控制复杂动力系统,通常需要在庞大的参数空间中执行成千上万次数值模拟,这非常耗时。机器学习代理模型通过预测不同初始条件和参数值下的状态轨迹,显著加速了模拟过程。然而,代理模型通常专用于单一模拟模型。修改底层微分方程——例如,增加一个生理状态或改变流行病接触网络——会使已训练模型失效,并迫使从零开始进行代价高昂的重新训练。我们提出 HyperODE,一种无需重新训练即可在整个近似质量守恒的房室模型类别上运行的代理模型。通过将常微分方程(ODE)的结构映射为有向超图,HyperODE 将系统交互的函数形式与神经网络架构解耦。HyperODE 接受一个以 ODE 形式表示的房室模型,其中参数分布通过分位数任意定义,并将其转换为超图。它构建一个超图神经常微分方程,从而以分位数形式输出原始 ODE 中所有状态的轨迹分布。然后,我们利用该代理模型构建一个编码器,该编码器接收带噪声的轨迹,并输出原始 ODE 参数上的分布,从而通过单次前向传播完成模型校准,而非传统的昂贵马尔可夫链蒙特卡洛(MCMC)采样。在训练中从未见过的模型族和系统规模上,HyperODE 通过单次前向传播生成已校准的分位数带,其加权区间分数和覆盖率与针对每种结构的专用代理模型相当。对于逆向推断,HyperODE 使用单个共享编码器,在几毫秒内从带噪声的状态轨迹中完成校准,性能与现有方法相当。HyperODE 将零样本能力扩展到打破质量守恒的 ODE 以及受外部强迫的 ODE。

## 引言

参数化动力系统的数值模拟是计算科学许多领域的基础。流行病情景建模、化学反应网络筛选或控制策略设计,都可以归结为在不确定参数和初始条件上反复求解常微分方程组(ODE)成千上万次。这一过程耗时且耗费大量计算资源,加速它有助于推动科学发现。机器学习代理模型旨在通过用快速的神经网络前向传播替代数值求解器来实现这一目标,该前向传播将参数和初始条件映射到状态轨迹(Lu et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib8); Li et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib25); Sanchez-Gonzalez et al. 2020 (https://arxiv.org/html/2608.00852#bib.bib38); Pfaff et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib9); Kochkov et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib10))。然而,现有的代理模型几乎总是绑定到*单一、固定*的模型。即使控制方程发生微小变化——例如,向流行病模型添加潜在房室、重新连接接触或移动网络,或引入新的反应通道——已学习的代理模型就会失效,必须从头重新训练,这需要重新生成训练数据并重新优化网络。这阻碍了代理模型在实际中出现的许多紧密相关模型之间复用。

参见标题 图 1:在 kk 个耦合组上模拟元种群 SIR 模型。我们转而寻求一个*单一*的代理模型,能够无需重新训练地适用于整个*类别*的模型:给定一个带有参数分布的 ODE,它应返回所得轨迹的已校准不确定性(而非点估计)。例如,考虑在 kk 个耦合组上的元种群 SIR 流行病模型,每组 i=1,...,ki=1,\\dots,k 中具有易感状态 SiS\\_\\{i\\}、感染状态 IiI\\_\\{i\\} 和恢复状态 RiR\\_\\{i\\}(图1 (https://arxiv.org/html/2608.00852#Sx1.F1))。为了用初始条件模拟该模型,人们可能假设参数 βij\\beta\\_\\{ij\\}、γi\\gamma\\_\\{i\\} 和 mijm\\_\\{ij\\} 具有某些分布,然后从这些分布中采样以生成一组轨迹——每组采样参数需要一次 ODE 求解。结果是由轨迹分位数量化的轨迹分布。或者,给定一条观测轨迹,人们可能希望通过推断参数来校准模型,这通常通过 MCMC 采样完成,需要多次 ODE 求解来探索参数的后验分布(Tan et al. 2022 (https://arxiv.org/html/2608.00852#bib.bib3))。这两个过程都很昂贵,特别是对于大的 kk。

我们的关键观察是,ODE 的结构可以作为*有向超图*暴露给神经网络,其中每个节点是一个状态变量,每条超边是动力学的一个加性单项式项,描述状态之间的交互。一个单一的超边算子,在任意系统的每个节点和边之间共享,定义了向量场。我们提出 *HyperODE* —— 一个单一的预训练模型(少于 1515k 个参数)在单次前向传播中为未见过的系统预测分位数轨迹带。作为一个完全可微的模型,它能够通过基于梯度的校准,从单条带噪声轨迹中恢复参数分布。HyperODE 可以进一步发展成一种单次前向传播的校准方法,使用编码器消费带噪声的轨迹,生成参数分布,并复用代理模型在毫秒级构建分位数轨迹带。相同的代理模型和校准模型能够在广泛的 ODE 族、系统规模和交互阶数上零样本泛化。HyperODE 专为近似质量守恒系统(如元种群房室模型和反应网络)的推断而设计。具体而言,我们的贡献是:

1. 1. 我们提出一个超图算子,它对系统结构、规模和交互阶数不可知,在给定结构和参数分布的情况下生成 ODE 的轨迹分布。
2. 2. 我们表明该代理模型可用于从带噪声输入轨迹进行基于梯度的校准。
3. 3. 我们提出一个编码器,当附加到代理模型上时,可以通过单次前向传播直接从单条带噪声轨迹生成校准分布。它以精度换取速度。
4. 4. 我们证明它适用于外部强迫(季节性、时变移动性),无需重新训练即可复用预训练模型。

## 背景与相关工作

#### 模拟与机器学习代理模型。

在整个科学领域,理解和控制系统意味着在其许多参数设置和初始条件下反复模拟其控制方程,通常是常微分方程。例如,为正在进行的流行病进行情景预测时,常见的方法如下(Borchering et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib2))。我们从分布中采样模型参数,并成千上万次求解 ODE 以获得多条轨迹,然后生成分位数带以呈现结果的分布。这成千上万次 ODE 求解构成了校准、不确定性量化和控制的瓶颈。机器学习代理模型试图降低这一成本——一个训练好的神经网络直接将参数和初始条件映射到轨迹,通过一次快速前向传播替代数值求解器。神经算子如傅里叶神经算子和 DeepONet 直接学习微分方程的解映射,使得单次前向传播对于新的参数场返回解,替代数值求解(Li et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib25); Lu et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib8))。图网络模拟器则从数据中学习物理系统的局部更新规则,比它们模仿的模拟器更快地滚动物体或网格动力学(Sanchez-Gonzalez et al. 2020 (https://arxiv.org/html/2608.00852#bib.bib38); Pfaff et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib9))。另一条互补路线是将学习组件嵌入数值方法内部,在保持经典求解器稳定性和精度保证的同时加速它(Kochkov et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib10))。然而,每个这样的代理模型都是为一个固定系统训练的,因此对控制方程的任何更改——添加房室、重新连接接触网络、引入反应——都会使已训练的代理模型过时并迫使重新训练。我们的目标是设计一个*单一*代理模型,能够服务于整个*类别*的系统,无需重新训练即可跨结构和规模迁移。

#### 逆问题与校准。

另一个关键任务是从带噪声的观测数据中校准给定的 ODE。例如,为正在进行的流行病进行情景预测时,我们首先将模型参数拟合到带噪声的观测数据,同时考虑不确定性(Borchering et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib2)),以便我们可以修改它们来模拟未来情景并运行前向模拟。复杂模型通常不可辨识——不同的参数集可能产生相同的结果。因此,校准质量通过使用推断参数模拟生成的分位数带覆盖观测到的带噪声轨迹的程度来衡量。从观测中恢复参数在经典上被表述为贝叶斯校准,并通过 MCMC 或变分推断在真实模拟器上求解——精确但昂贵,而且如我们所示,在大规模下容易混合不良。摊销的基于模拟的推断则训练一个神经估计器,通过一次前向传播将观测映射到后验,例如神经后验和神经比率估计(Papamakarios and Murray 2016 (https://arxiv.org/html/2608.00852#bib.bib29); Greenberg et al. 2019 (https://arxiv.org/html/2608.00852#bib.bib30); Hermans et al. 2020 (https://arxiv.org/html/2608.00852#bib.bib31))。关键在于,这些估计器是*针对每个模拟器*训练的:新的结构需要新的模拟和新训练的网络。

HyperODE 使用相同的共享模型解决这两个方向。由于代理模型是可微的,我们可以通过训练好的前向模型进行梯度下降来校准系统,优化一个参数分布,使其诱导的轨迹带针对观测进行校准。或者,我们提出了一个带有训练好的解码器的单一编码器,将带噪声的轨迹直接映射到参数分布,通过一次前向传播实现毫秒级推断,适用于每种结构,无需逐系统重新训练。

我们使用加权区间分数(WIS)评估校准质量,这是预测文献中的一种适当评分规则,同时奖励锐度和校准性(Bracher et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib41)),并辅以区间覆盖率。WIS 正是预测分位数水平上平均的 pinball(分位数)损失,因此在训练期间最小化它是一种无分布方式,用于拟合已校准的区间带——将我们的目标与分位数回归(Koenker and Hallock 2001 (https://arxiv.org/html/2608.00852#bib.bib39))和共形式校准(Shafer and Vovk 2008 (https://arxiv.org/html/2608.00852#bib.bib40))联系起来。

#### 基础模型与学习 ODE。

已有尝试为 ODE 创建“基础模型”——*单一*模型,给定观测轨迹后,通过一次前向传播发现一个*新*系统的动力学。这些包括 ODEformer(d’Ascoli et al. 2024 (https://arxiv.org/html/2608.00852#bib.bib34)),它符号化地推断 ODE,以及 ODE 的基础推断模型(FIM-ODE)(Mauel et al. 2026 (https://arxiv.org/html/2608.00852#bib.bib33)),它推断一个神经场。然而,它们从数据中*发现*向量场,而 HyperODE 则*利用*房室和反应网络建模中可用的已知结构。这些基础模型仅展示在低维系统上(ODEformer 和 FIM-ODE 评估到三到四个状态维度),并输出点估计而非已校准的不确定性。相反,HyperODE 不受规模限制(展示了 500+ 耦合状态),并返回已校准的分位数带。

#### HyperODE 覆盖的 ODE

HyperODE 面向具有有界状态的质量守恒系统,其右侧是多项式,这涵盖了房室流行病模型(SIR、SEIR 及其元种群变体)以及广泛的化学反应网络空间。然而,两个观察使这个范围远超定义本身的暗示。首先,尽管训练类别是质量守恒且自治的,但学习到的算子零样本外推到违反这些假设的系统:具有出生和死亡率的系统,以及受外部强迫的时变传播。其次,一大类 ODE,包括具有有理、指数和三角项的系统,可以通过引入辅助变量,使用二次化 / 二次重铸重写为仅含二次项的等价系统(Kerner 1981 (https://arxiv.org/html/2608.00852#bib.bib4); Carothers et al. 2005 (https://arxiv.org/html/2608.00852#bib.bib5); Hemery et al. 2020 (https://arxiv.org/html/2608.00852#bib.bib6))。适用于二次质量作用定律的代理模型可能覆盖实践中出现的相当大比例的 ODE。

#### 图与超图神经网络

消息传递图神经网络在成对边上聚合信息,是在网络上有效的学习过程(Battaglia et al. 2016 (https://arxiv.org/html/2608.00852#bib.bib37); Sanchez-Gonzalez et al. 2020 (https://arxiv.org/html/2608.00852#bib.bib38); Li et al. 2021 (https://arxiv.org/html/2608.00852#bib.bib25))。超图神经网络将消息传递推广到高阶关系,其中单条超边连接任意节点集(Feng et al. 2019 (https://arxiv.org/html/2608.00852#bib.bib36))。我们采用超图表示,因为它允许我们自然地对质量作用单项式中出现的多个状态进行分组,但我们的算子在一个决定性方面不同于通用(超)图网络:它将源状态的显式乘法*乘积*作为归纳偏置,精确匹配质量作用定律,而不是通过学习的消息函数来近似它。我们的消融实验证实了超边视角的重要性——缺乏这一点的团展开 GCN 和 GAT 基线差了数倍。

## 问题设置与指标

我们首先考虑房室 ODE 类别 X ̇=f\(X;θ\)\\dot\\{X\\}=f\(X;\\theta\),其中 ff 是多项式(质量作用)项之和,且总质量守恒。具体而言,这包括在任意数量 kk 个耦合组上的元种群 SIS\\mathrm\\{SIS\\}、SIR\\mathrm\\{SIR\\}、SI\\mathrm\\{SI\\}、SIRS\\mathrm\\{SIRS\\} 和 SEIR\\mathrm\\{SEIR\\} 模型,以及随机生成的多项式反应网络。每个系统由已知的*结构*(哪些状态出现在哪些项中)和一个速率参数向量 θ\\theta 指定。这些参数被描述为*分布*而非固定值,从而引入不确定性。

我们研究两项任务。*前向*任务接受一个结构、一个初始条件、一个

相似文章

ODEWorld:通过物理时间流的连续预测架构

Hugging Face Daily Papers

本文介绍了 ODEWorld,一种使用物理时间流(PT-Flow)的连续时间潜在世界模型,该模型学习由常微分方程参数化的潜在速度场,能够实现任意时间分辨率、回溯预测,并改进视频生成和机器人控制的规划。