SciML 在现实中的应用:结构先验何时有益、何时有害的诊断研究

arXiv cs.LG 论文

摘要

本文评估了五种宏观经济预测模型族,发现 ARIMA 和神经常微分方程 (Neural ODE) 等约束较少的模型优于物理信息神经网络 (PINN) 等优先考虑结构约束的模型,表明结构先验在不匹配时可能扮演错误正则化器的角色。

arXiv:2607.09684v1 公告类型:新 摘要:科学机器学习 (SciML) 方法,如神经常微分方程 (NODE)、物理信息神经网络 (PINN) 和通用微分方程 (UDE),在结构先验反映可靠控制动力学时最为有效。我们探讨了当这一假设被违反时会发生什么。以宏观经济预测作为压力测试领域,我们评估了五个模型族:ARIMA、LSTM、NODE、PINN 和 UDE,涵盖 23 个国家,使用稀疏的年度数据、多个时间划分和五个随机种子。结果表明,所有被评估的模型均未实现持续强劲的预测性能,突显了低频宏观经济预测的难度。然而,出现了清晰的相对层级:约束较少的模型,尤其是 ARIMA 和 NODE,持续优于约束较多、依赖启发式先验的模型,如 PINN 和 UDE。我们并未将此视为对 SciML 的否定,而是将其解读为一项诊断结果:当结构先验与数据生成过程不匹配时,它们可能扮演错误正则化器的角色。我们识别了包括先验错位、体制切换、结构突变和优化不稳定在内的失败模式,并主张 SciML 从业者在假设更多结构有益之前,应首先测试结构是否确实有帮助。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:12

# 野外的 SciML:结构先验何时有帮助、何时有害的诊断研究
来源:https://arxiv.org/html/2607.09684
Vrishank Sai Anand GEMS Modern Academy Dubai, United Arab Emirates vrishanksai\.anand@gmail\.com &Prathamesh Dinesh Joshi Vizuara AI Labs, Pune, India prathamesh@vizuara\.com &Raj Abhijit Dandekar Vizuara AI Labs Pune, India raj@vizuara\.com &Rajat Dandekar Vizuara AI Labs Pune, India rajatdandekar@vizuara\.com &Sreedath Panat Vizuara AI Labs Pune, India sreedath@vizuara\.com

###### 摘要

科学机器学习(SciML)方法,如神经常微分方程(Neural Ordinary Differential Equations,NODEs)、物理知情神经网络(Physics-Informed Neural Networks,PINNs)和通用微分方程(Universal Differential Equations,UDEs),在结构先验反映可靠控制动力学时最为有效。我们探讨当这一假设被违背时会发生什么。我们以宏观经济预测作为压力测试领域,通过稀疏年度数据、多个时间分割和五个随机种子,对 23 个国家的五种模型家族(ARIMA、LSTM、NODE、PINN 和 UDE)进行评估。我们的结果表明,没有一个评估模型能达到一致的强预测性能,凸显了低频宏观经济预测的难度。然而,一个清晰的相对层次出现:约束较少的模型,特别是 ARIMA 和 NODE,始终优于约束较多的启发式先验模型,如 PINN 和 UDE。我们不将其视为对 SciML 的否定,而是将其解读为一项诊断结果:当结构先验与数据生成过程不匹配时,它们可能充当错误的正则化器。我们识别了包括先验错位、制度转换、结构断裂和优化不稳定性在内的失败模式,并认为 SciML 实践者应在假设更多结构有益之前,先测试结构是否真的有帮助。

*关键词* Scientific Machine Learning ⋅ Macroeconomic Forecasting ⋅ Neural ODE ⋅ PINN ⋅ Universal Differential Equations

## 1 引言

宏观经济危机很少作为孤立冲击出现。相反,它们是通过债务积累、增长动态、通货膨胀和政策响应在较长时期内的相互作用而发展的。国际金融的经验证据表明,此类危机往往先于持续的宏观经济失衡和系统性脆弱性出现(Kaminsky和Reinhart,1999(https://arxiv.org/html/2607.09684#bib.bib12);Berg和Pattillo,1999(https://arxiv.org/html/2607.09684#bib.bib1);Caballero等人,2021(https://arxiv.org/html/2607.09684#bib.bib7))。尽管存在这些反复出现的模式,预测宏观经济动力学仍然是一个困难的问题,尤其是在低频和数据受限的背景下。

宏观经济预测的传统方法,包括诸如 ARIMA、VAR 和早期预警系统等计量经济学模型,依赖于宏观经济指标之间的统计关系(Box等人,2016(https://arxiv.org/html/2607.09684#bib.bib2);Lütkepohl,2005(https://arxiv.org/html/2607.09684#bib.bib16);Hamilton,1994(https://arxiv.org/html/2607.09684#bib.bib10);Berg和Pattillo,1999(https://arxiv.org/html/2607.09684#bib.bib1))。虽然这些方法提供了可解释的基线,但它们常常难以捕捉现实经济中常见的非线性交互、结构断裂和制度转换(Hamilton,1989(https://arxiv.org/html/2607.09684#bib.bib9);Makridakis等人,2018(https://arxiv.org/html/2607.09684#bib.bib17))。较新的机器学习方法,包括诸如 LSTM 等序列模型,试图通过直接从数据中学习模式来弥补这些局限(Hochreiter和Schmidhuber,1997(https://arxiv.org/html/2607.09684#bib.bib11);Goodfellow等人,2016(https://arxiv.org/html/2607.09684#bib.bib6)),但它们仍然对数据稀缺、非平稳性和分布不稳定性敏感(Makridakis等人,2018(https://arxiv.org/html/2607.09684#bib.bib17);Lim和Zohren,2021(https://arxiv.org/html/2607.09684#bib.bib14))。近期在深度预测方面的进展,包括基于Transformer的架构,在大规模基准测试中表现出色,但其对宏观经济数据的适用性仍因数据稀疏和制度不稳定性而受限(Zeng等人,2023(https://arxiv.org/html/2607.09684#bib.bib20);Liu等人,2022(https://arxiv.org/html/2607.09684#bib.bib15))。

科学机器学习(SciML)提供了一种替代范式,通过将结构先验纳入学习过程。诸如神经常微分方程(NODEs)(Chen等人,2018(https://arxiv.org/html/2607.09684#bib.bib4))、物理知情神经网络(PINNs)(Raissi等人,2019(https://arxiv.org/html/2607.09684#bib.bib19))和通用微分方程(UDEs)(Rackauckas等人,2020(https://arxiv.org/html/2607.09684#bib.bib18))等方法旨在将数据驱动学习与已知的系统动力学相结合。这些方法在物理、生物和工程等领域展现了强劲性能,这些领域中的控制方程是明确定义且稳定的(Karniadakis等人,2021(https://arxiv.org/html/2607.09684#bib.bib13);Brunton和Kutz,2022(https://arxiv.org/html/2607.09684#bib.bib3))。在这些设定下,结构约束充当归纳偏差,改善泛化并减少数据需求。

然而,这些方法对宏观经济学的适用性尚不明确。与物理系统不同,宏观经济环境是由人类行为、制度决策和外部冲击塑造的(Farmer和Foley,2009(https://arxiv.org/html/2607.09684#bib.bib5))。因此,潜在的动力学往往是非平稳的、依赖于制度的,并且仅部分可观测(Hamilton,1989(https://arxiv.org/html/2607.09684#bib.bib9);Farmer和Foley,2009(https://arxiv.org/html/2607.09684#bib.bib5))。这提出了一个根本性问题:当结构先验不确定或与数据生成过程错位时,它们会改善模型性能,还是会降低性能?

在这项工作中,我们通过一项涵盖 23 个国家的大规模实证研究来回答这个问题。我们将宏观经济预测视为 SciML 的压力测试领域。数据稀疏、低频、嘈杂且易受结构断裂影响。我们在统一的评估框架下,使用多个时间分割和重复随机初始化,比较五种模型家族:ARIMA、LSTM、神经 ODE(NODE)、PINN 和 UDE。重要的是,本研究中使用的物理知情组件是启发式结构先验,而非理论推导的经济模型。这使我们能够在受控设定下隔离归纳约束的影响。

本研究探讨了在稀疏、非平稳的宏观经济设定中,结构先验是否能提高预测性能,或者在与潜在动力学不匹配时是否会变得有害(Hamilton,1989(https://arxiv.org/html/2607.09684#bib.bib9);Makridakis等人,2018(https://arxiv.org/html/2607.09684#bib.bib17);Farmer和Foley,2009(https://arxiv.org/html/2607.09684#bib.bib5))。为回答这个问题,我们在统一实验框架下,对 23 个国家进行了大规模实证评估,比较了经典统计基线、序列模型、连续时间神经动力学以及结构约束的 SciML 方法(Box等人,2016(https://arxiv.org/html/2607.09684#bib.bib2);Hochreiter和Schmidhuber,1997(https://arxiv.org/html/2607.09684#bib.bib11);Chen等人,2018(https://arxiv.org/html/2607.09684#bib.bib4);Raissi等人,2019(https://arxiv.org/html/2607.09684#bib.bib19);Rackauckas等人,2020(https://arxiv.org/html/2607.09684#bib.bib18))。

我们不假设额外的结构偏差必然有益,而是考察不同层次的结构约束如何与嘈杂、低频且依赖制度的宏观经济数据相互作用。我们的目标不是评估基于理论的经济结构模型,而是诊断启发式结构先验在应用于控制方程不够完善的领域之外时的行为(Karniadakis等人,2021(https://arxiv.org/html/2607.09684#bib.bib13);Brunton和Kutz,2022(https://arxiv.org/html/2607.09684#bib.bib3))。

本工作的贡献如下:

- •我们提供了一个 23 个国家的实证评估,考察 SciML 方法在宏观经济预测中的应用——这是一个以稀疏、非平稳和行为驱动数据为特征的领域。
- •我们表明,PINN 和 UDE 模型中的启发式结构先验并不能改善,反而经常降低相对于约束较少方法(如 ARIMA 和 NODE)的预测性能。
- •我们识别并刻画了物理知情学习在非平稳性下的四种失败模式,为结构先验何时可能有害而非有益提供了诊断框架。

这些结果表明,SciML 的有效性关键取决于其基本假设的有效性。在控制方程不确定或演变的领域中,灵活性可能比强加的结构更有价值。这突显了经验性地测试归纳先验的重要性,而非先验地假设其益处。

## 2 相关工作

#### 宏观经济预测。

宏观经济预测传统上依赖于统计和计量经济学模型,如 ARIMA、VAR 和基于因子的方法(Box等人,2016(https://arxiv.org/html/2607.09684#bib.bib2);Lütkepohl,2005(https://arxiv.org/html/2607.09684#bib.bib16);Hamilton,1994(https://arxiv.org/html/2607.09684#bib.bib10))。早期预警系统也被广泛研究,用于通过宏观经济指标预测金融危机(Kaminsky和Reinhart,1999(https://arxiv.org/html/2607.09684#bib.bib12);Berg和Pattillo,1999(https://arxiv.org/html/2607.09684#bib.bib1))。近期工作通过机器学习方法扩展了这些方法,以改进宏观金融建模和预测(Gu等人,2020(https://arxiv.org/html/2607.09684#bib.bib8))。虽然这些方法提供了可解释的基线,但它们的预测性能在样本外设定中仍然有限,尤其是在存在结构断裂和制度转换的情况下(Hamilton,1989(https://arxiv.org/html/2607.09684#bib.bib9);Caballero等人,2021(https://arxiv.org/html/2607.09684#bib.bib7))。这些局限性促使我们探索更灵活的建模方法。

#### 用于时间序列预测的机器学习。

机器学习的最新进展引入了用于时间序列预测的数据驱动方法,包括循环神经网络和基于注意力的架构(Hochreiter和Schmidhuber,1997(https://arxiv.org/html/2607.09684#bib.bib11);Goodfellow等人,2016(https://arxiv.org/html/2607.09684#bib.bib6))。最近,基于Transformer和混合架构在大规模预测基准测试中表现出色(Lim和Zohren,2021(https://arxiv.org/html/2607.09684#bib.bib14);Zeng等人,2023(https://arxiv.org/html/2607.09684#bib.bib20);Liu等人,2022(https://arxiv.org/html/2607.09684#bib.bib15))。然而,它们在宏观经济设定中的有效性仍然受限于有限的数据可用性、低采样频率和非平稳性(Makridakis等人,2018(https://arxiv.org/html/2607.09684#bib.bib17))。因此,纯数据驱动模型在应用于宏观经济时间序列时常常表现出过拟合和不稳定性。

#### 科学机器学习与物理知情建模。

科学机器学习(SciML)引入了一种替代范式,通过将结构先验纳入学习过程。诸如神经常微分方程(NODEs)(Chen等人,2018(https://arxiv.org/html/2607.09684#bib.bib4))、物理知情神经网络(PINNs)(Raissi等人,2019(https://arxiv.org/html/2607.09684#bib.bib19))和通用微分方程(UDEs)(Rackauckas等人,2020(https://arxiv.org/html/2607.09684#bib.bib18))等方法在控制方程已知或近似良好的领域中表现出了强劲性能(Karniadakis等人,2021(https://arxiv.org/html/2607.09684#bib.bib13);Brunton和Kutz,2022(https://arxiv.org/html/2607.09684#bib.bib3))。这些方法将结构约束用作归纳偏差,以改善泛化和数据效率。然而,它们在物理科学之外的应用仍相对未被充分探索。特别是,很少有研究系统地评估此类结构先验在以非平稳性、制度转换和部分观测动力学为特征的领域中的行为。

#### 本工作的定位。

本文通过将宏观经济预测作为 SciML 的压力测试领域,为填补这一空白做出贡献。与先前假设结构先验有效性的工作不同,我们明确评估了当这些假设不确定或与数据生成过程错位时它们的行为。我们不提出新模型,而是贡献诊断性结果:我们提供了跨越 23 个国家的实证证据,说明结构先验何时及为何会降低性能,并识别了在非物理领域应用 SciML 方法时至关重要的失败模式。

## 3 方法论

### 3.1 数据与状态表示

我们使用来自世界银行和国际货币基金组织公共数据库的数据构建了一个多国宏观经济数据集。该数据集包含 23 个国家的年度观测值,涵盖多个地区和经济体制。根据数据可得性,个别国家的时间序列覆盖 1990–2024 年(N=35N=35)或 1960–2024 年(N=65N=65)两个时段。

对于每个国家,在时间 tt 的宏观经济系统由一个五维状态向量表示:

u(t)=[GDPUSD(t)Y˙(t)π(t)D(t)E(t)]∈R5,\mathbf{u}(t)=\begin{bmatrix}\text{GDP}_{\text{USD}}(t)\\ \dot{Y}(t)\\ \pi(t)\\ D(t)\\ E(t)\end{bmatrix}\in\mathbb{R}^5,(1)

其中 GDPUSD\text{GDP}_{\text{USD}} 表示以当前美元计价的国内生产总值,Y˙\dot{Y} 是实际 GDP 增长率(%),π\pi 是通货膨胀率(%),DD 是政府债务占 GDP 的百分比,EE 是以美元计的外债。这些变量共同捕获经济规模、增长动态、价格稳定性、财政压力和外部脆弱性。

为确保不同量级变量之间的可比性,所有特征均使用 MinMax 缩放标准化到区间 [0,1][0,1]。为防止数据泄露,缩放器仅基于每个国家时间序列的训练部分进行拟合,然后应用于验证和测试数据。

### 3.2 时间分割协议

为保持宏观经济数据的序列结构,所有数据集均按时间顺序分割。对于一个有 NN 个观测值的国家,我们有:

Ntrain=⌊0.70N⌋,Nval=⌊0.15N⌋,Ntest=N−Ntrain−Nval.N_{\text{train}}=\lfloor 0.70N\rfloor,\quad N_{\text{val}}=\lfloor 0.15N\rfloor,\quad N_{\text{test}}=N-N_{\text{train}}-N_{\text{val}}.(2)

除此默认分割外,还使用 65/15/20 和 80/10/10 的替代分区进行鲁棒性检查。

对于基于序列的模型,包括 LSTM 和 PINN,输入使用长度为 L=5L=5 的滑动窗口构建。为保持严格的时间分离,测试序列使用验证集的最后 LL 个观测值初始化,确保任何训练输入窗口内不包含测试数据。

#### 关于结构先验。

本研究中使用的结构约束是启发式的,并非源自正式宏观经济理论,如 DSGE 或 RBC 模型。相反,它们是简化假设,设计

相似文章

重新审视用于3D CT报告生成的LLM适配:规模与诊断先验研究

arXiv cs.CL

本文研究了将大语言模型适配到3D CT报告生成的参数高效策略,提出了RAD3D-Prefix,一个轻量级的诊断先验条件框架,该框架保持LLM冻结,仅需极少的可训练参数。结果表明,冻结更大的LLM(约10亿参数以上)并仅训练轻量级投影层,能够在性能、泛化能力和计算效率之间实现更优的权衡。

模型能力主导:AIMO 3推理时优化的经验启示

Hugging Face Daily Papers

本论文分析了AIMO 3的推理时优化技术,发现模型能力优于提示工程和多样化采样策略。研究表明高温度采样已经能够最大程度地去相关化误差,为基于提示的改进留下了很少余地,并识别出单个模型pass@20与多数投票共识之间存在6分的选择损失差距。