从多个稀疏数据集中学习动力系统:一种分层贝叶斯建模方法

arXiv cs.LG 论文

摘要

提出了一种分层贝叶斯框架,用于从多个稀疏、含噪声的数据集中对动力系统进行元学习,利用基于梯度的MCMC与嵌入的ODE求解器,对共享参数和数据集特定参数进行高效的后验推断。

arXiv:2606.24966v1 Announce Type: new 摘要:从稀疏、含噪声且采样不规则的观测数据中估计动力系统参数通常是严重病态的。当有多个相关数据集可用时,如果对共享结构和变异性进行适当建模,它们能提供额外信息。我们提出了一种分层贝叶斯框架,用于动力系统的概率元学习,将数据集特定参数建模为从共享总体分布中抽取的样本。在基于梯度的MCMC中嵌入数值ODE求解器,以实现对共享总体和数据集特定参数分布的高效后验推断。实验表明,与独立估计方法相比,预测性能有所提升,突显了在数据稀疏情况下进行数据高效系统识别的潜力。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:08

# 从多稀疏数据集学习动力系统:一种分层贝叶斯建模方法
来源:https://arxiv.org/html/2606.24966
Lea Multerer, Marco Forgione, Laura Azzimonti
SUPSI, 达勒莫尔人工智能研究所 (IDSIA USI-SUPSI), 卢加诺, 瑞士 (电子邮箱: [email protected])

###### 摘要

从稀疏、有噪声且不规则采样的数据中估计动力系统的参数通常是一个严重病态的问题。当存在多个相关数据集时,如果能够正确建模其共享结构和变异性,这些数据集就能提供额外信息。我们提出了一种用于动力系统概率元学习的分层贝叶斯框架,将数据集特定参数建模为来自共享总体分布的样本。我们在基于梯度的 MCMC 中嵌入数值 ODE 求解器,以实现共享总体和数据集特定参数分布的高效后验推断。实验表明,与未池化方法相比,其预测性能有所提升,突显了在数据稀疏场景下进行数据高效系统识别的潜力。

###### 关键词:

系统识别,分层贝叶斯建模,概率元学习,稀疏数据,不可辨识性。

## 1 引言

基于常微分方程 (ODE) 的灰盒模型是描述工程、生物学和流行病学等领域中随时间演化的物理系统的标准方法。在许多应用中,其参数必须从少量、有噪声且不规则采样的数据集中估计。当数据信息量极低时,这个逆问题可能是病态的,导致估计不可靠甚至无定义 (Gevers et al., 2009 (https://arxiv.org/html/2606.24966#bib.bib32))。这体现了实际(而非结构)上的非可辨识性 (Raue et al., 2009 (https://arxiv.org/html/2606.24966#bib.bib30))。

在系统识别中,针对低数据信息量的经典补救方法是正则化:通过显式的惩罚项或通过可调内核(其超参数通过边际似然最大化从数据中调整)注入先验信息以稳定估计 (Pillonetto et al., 2022 (https://arxiv.org/html/2606.24966#bib.bib26))。另一种补充方法是贝叶斯推断,其中参数的概率先验通过以数据为条件进行更新,从而得到未知量的完整后验。

当存在由*相似*动力系统生成的*一组*实验时,第二个杠杆就会出现;其有效性取决于这些系统变化的大小。假设所有系统完全相同,这组实验就简化为一个长的、可能信息丰富的实验;假设它们完全独立,共享结构就被丢弃,每个弱数据集只能各自为政。通常,这两种极端都不符合实际情况:系统之间相关但不完全相同,它们之间的变异性本身是未知的,必须从整个数据集集合中推断出来。

估计跨数据集变异性正是混合效应模型或多层模型所做的,这是一种在应用统计学中历史悠久的构造 (Pinheiro and Bates, 2000 (https://arxiv.org/html/2606.24966#bib.bib28))。我们在此工作中采用其贝叶斯形式,称为分层贝叶斯建模 (HBM) (Gelman et al., 2013 (https://arxiv.org/html/2606.24966#bib.bib27))。在 HBM 中,数据集特定参数被视为来自共享分布的样本,该分布的参数(包括分散程度)与参数一起被推断。稀疏的纵向数据,例如流行病学 (Congdon, 2019 (https://arxiv.org/html/2606.24966#bib.bib3); Lawson, 2018 (https://arxiv.org/html/2606.24966#bib.bib12)) 和群体药代动力学 (Wakefield, 1996 (https://arxiv.org/html/2606.24966#bib.bib29)) 中的数据,是最广泛的应用之一。

当前 HBM 实现的一个局限性是要求参数到观测的映射是线性的,或者至少是封闭形式的,这显著限制了其适用性。特别是对于动力系统,这个映射贯穿 ODE 解,而对于非线性情况通常没有封闭形式,因此只能通过数值积分方案近似评估。

因此,ODE 的贝叶斯推断主要局限于非层次化的单数据集情况 (Stuart, 2010 (https://arxiv.org/html/2606.24966#bib.bib10); Roda, 2020 (https://arxiv.org/html/2606.24966#bib.bib4); Green et al., 2015 (https://arxiv.org/html/2606.24966#bib.bib34))。层次化的多数据集扩展仅存在于特殊情况下,例如已知解析 ODE 解(简化为非线性混合效应回归)(Multerer et al., 2021 (https://arxiv.org/html/2606.24966#bib.bib5)),或用基函数或配置代理替换 ODE (Loos et al., 2018 (https://arxiv.org/html/2606.24966#bib.bib9); Huang et al., 2020 (https://arxiv.org/html/2606.24966#bib.bib1))。既跨相关数据集池化又在贝叶斯推断方案中支持数值 ODE 求解器的方法仍然很少。

相关工作线通过元学习解决低数据信息量问题 (Forgione et al., 2023 (https://arxiv.org/html/2606.24966#bib.bib23); Chakrabarty et al., 2025 (https://arxiv.org/html/2606.24966#bib.bib24); Lakshminarayanan et al., 2025 (https://arxiv.org/html/2606.24966#bib.bib25))。通过利用系统总体中的共享结构,元学习补偿了个别弱数据集,甚至允许识别高维黑盒模型(例如神经网络)。然而,当前方法需要大量相关数据集的集合,在实践中,只有当过程的数字孪生能够大规模合成这些数据集时才可行。

在这项工作中,我们转而针对规模适中的真实测量数据集,每个数据集本身很弱。我们在 HBM 框架内形式化了灰盒 ODE 系统的概率元学习,其中每个数据集的 ODE 系数和噪声参数形成了层次结构的数据集特定层级。近似后验推断通过马尔可夫链蒙特卡洛 (MCMC) 采样进行。由于后验维度随着数据集的数量增加而增长(通过数据集特定参数),无梯度采样器变得不实用;因此我们采用 No-U-Turn 采样器 (NUTS) (Hoffman and Gelman, 2014 (https://arxiv.org/html/2606.24966#bib.bib33)),这是一种基于梯度的采样器,可扩展到高维概率问题。其关键要素是可微分的 ODE 求解器:将其嵌入计算图允许似然梯度通过数值积分步骤传播,使得 NUTS 在 ODE 设置中可行。在 Lotka-Volterra 基准测试上,我们表明,与未池化的贝叶斯和非线性最小二乘基线相比,系统地跨稀疏、有噪声且不规则采样的轨迹进行池化,显著改善了实际可辨识性和预测准确性。

本文的其余部分组织如下。我们在第2节 (https://arxiv.org/html/2606.24966#S2) 介绍具有共享结构的元数据集的问题公式化。在第3节 (https://arxiv.org/html/2606.24966#S3) 中,我们在 HBM 框架内发展了元学习方法。我们在第4节 (https://arxiv.org/html/2606.24966#S4) 详述了实现,并在第5节 (https://arxiv.org/html/2606.24966#S5) 给出了一个数值示例。最后,第6节 (https://arxiv.org/html/2606.24966#S6) 讨论了结论和未来工作方向。

## 2 问题公式化

### 2.1 系统描述

我们考虑由一阶 ODE 系统描述的动力系统:

ddtx(t)=f(x(t),t;θf),x(0)=x0, (1a)

其中 x(t) ∈ R^{n_x} 表示在连续时间 t ∈ R^+ 上演化的状态向量,f: R^{n_x} → R^{n_x} 定义了状态动态,θf ∈ R^{n_{θf}} 是 f 的不确定参数,这些参数因系统而异。系统在一组有限的 T 个测量时刻被部分观测,这些时刻在时间上不规则分布。令 t = {t_1, t_2, ..., t_T}, t_i ∈ R^+ 和 y = {y_1, y_2, ..., y_T}, y_i ∈ R^{n_y} 分别表示采样时间和相应的输出测量值的集合。在时间步 t_i 的测量值 y_i ∈ R^{n_y} 为:

y(t_i) = g(x(t_i); θg) + η_i, (1b)

其中函数 g: R^{n_x} → R^{n_y} 具有不确定参数 θg ∈ R^{n_{θg}},这些参数也随系统实例变化。f 和 g 的函数形式假设已知。此外,η_i ∈ R^{n_y} 是由概率密度函数 p_η(·, θ_η) 生成的加性测量噪声,该函数依赖于其他可能未知的参数 θ_η ∈ R^{n_{θη}}。在下文中,我们将系统待估计的不确定参数的完整集合表示为 θ = [θf, θg, θ_η]^⊤ ∈ R^{n_θ}。

### 2.2 元数据集与共享结构

存在一个有限的 J 个数据集的集合。所有数据集都由定义的 ODE 结构 (1) 生成。然而,每个系统以不同的参数 θ 实现和可能不同的测量时刻集合为特征。与元学习文献一致,这个集合被称为 *元数据集*:

D = {D^1, D^2, ..., D^J}, (2a)

其中第 j 个数据集 D^j ∈ D 的特征为 D^j = {t^j, y^j},其中 t^j = {t_1^j, ..., t_{T_j}^j} 且 y^j = {y_1^j, ..., y_{T_j}^j}。一些(或所有)数据集 D^j ∈ D 被假设为各自 *信息贫乏*。这意味着将标准监督学习技术(例如,最大似然、最大后验或在弱先验下的完全贝叶斯推断)应用于单个数据集将导致难以接受的大不确定性,甚至导致不适定的估计问题。

然而,元数据集表现出一种强烈但先验未知的 *相似模式*。具体来说,一个未知分布 p^o(θ) 描述了 θ^j 的生成,从而描述了跨数据集的共同结构。我们假设,如果 p^o(θ) 已知,那么每个单独数据集上的参数后验 p(θ^j | D^j; p^o),正式定义为:

p(θ^j | D^j; p^o) = p(D^j | θ^j) p^o(θ^j) / p(D^j) (2b)

将充分集中在真实 θ^j 周围,以支持对所有 j = 1, 2, ..., J 的可靠推断。

### 示例:LTI 元数据集

考虑由一阶线性时不变 (LTI) 动力系统生成的元数据集 D:

d/dt x(t) = -1/τ (x(t) - d), (3a)

其中 τ 是时间常数,d 是稳态值,x0 = 0 是初始状态(假设已知)。注意在这个简单示例中,ODE 解 x(t) = d + (x0 - d) e^{-t/τ} 是封闭形式的。测量值 y 对应于被白高斯噪声污染的状态变量 x:

y(t_i) = x(t_i) + η_i, η_i ∼ N(0, σ_η^2), (3b)

其中噪声标准差(σ_η = 0.05)在所有数据集中是已知且固定的。

相反,系数 θ = [τ d]^⊤ 跨数据集变化,并由(未知)分布 p^o(θ) 表征:

τ ∼ U(0.9, 1.1), d ∼ U(0.5, 2.0). (4)

元数据集包含 J = 50 个实现。前 48 个包含 T = 2 个在区间 [0, 10] 中随机分布的样本,而最后两个(第 49 和第 50 个)分别具有在时刻 t_1^49 = 1 和 t_1^50 = 10 的单个测量 (T=1)。图 1 (https://arxiv.org/html/2606.24966#S2.F1) 展示了四个代表性数据集。对于每个数据集,显示了测量点 y(t_i)、真实状态 x(t) 以及在知道 p^o 的情况下导出的后验状态均值(附 95% 可信带)。

参照图注 图 1: LTI 数据集:有噪声测量 y(t_i)(黑色圆点)、真实状态 x(t)(黑色线)以及在真实先验 p^o 下的后验均值轨迹及 95% 可信带,见式 (4) (https://arxiv.org/html/2606.24966#S2.E4)(绿色),以及在弱先验(范围内均匀分布)下的,见式 (5) (https://arxiv.org/html/2606.24966#S2.E5)(粉色)。我们注意到,即使对于这个简单示例,后验也缺乏封闭形式的解析解,此处用 MCMC 采样近似。然而,在这种情况下,由于 ODE 解析解可用,使得似然无需数值积分即可评估,因而 MCMC 实现得到了简化。关于近似概率推断的全面讨论推迟到第4节 (https://arxiv.org/html/2606.24966#S4)。

看来,在知道生成性先验 p^o 的情况下,所有数据集上状态预测的不确定性仍然非常窄。同时,如果先验 p^o 未知,则收集中的某些数据集的信息将非常弱。例如,在 D^5 中,两个数据点彼此接近且都处于稳态,阻碍了动态参数 τ 和 d 的实际辨识。此外,D^49 和 D^50 各包含一个数据点,结构上是非可辨识的。

现在假设模型结构 (3) (https://arxiv.org/html/2606.24966#S2.E3) 和常数 x0=0, σ_η=0.05 是已知的,而 (4) (https://arxiv.org/html/2606.24966#S2.E4) 中的生成分布 p^o 是未知的。唯一(正确但模糊)的背景知识是:

τ ∈ [0.1, 6.0], d ∈ [-6, 6] (5)

即,系统是稳定的,时间常数 τ 不是非常小,并且稳态值 d 的绝对值不是非常大。基于此背景,贝叶斯系统识别从业者可能会假设一个弱先验 p^{weak},在式 (5) (https://arxiv.org/html/2606.24966#S2.E5) 给出的范围内均匀分布¹。

相似文章