HERO:面向长时程自回归神经算子的历史增强展开训练

arXiv cs.LG 论文

摘要

本文提出HERO(历史增强展开训练),一种通过模型自身优化历史的相对监督来增强自回归神经算子的标准轨迹监督的方法,提高了PDE基准上的长时程精度和稳定性。

arXiv:2607.29135v1 公告类型:新 摘要:神经算子通过将学习到的演化算子递归应用于自身预测,为含时偏微分方程(PDE)提供快速替代模型,但这种自回归展开会将每次预测误差反馈为输入,因此局部误差会不断累积。现有的展开训练策略减少了训练输入与自生成状态之间的失配,但其监督仍仅衡量与真实轨迹的绝对偏差。因此,这种监督无法告知算子是否已经克服了其在优化早期表现出的长时程失效行为。我们提出历史增强展开训练(HERO),该方法在传统绝对轨迹监督的基础上,增加了源自模型自身优化历史的相对监督。HERO 对来自周期性刷新的滞后算子、当前模型以及扰动输入的分离候选展开,按展开误差、谱偏差、能量漂移和误差增长进行排序,并选择最强的失效轨迹作为参考。该参考作为固定的比较基线进入基于间隔的目标函数,诱导对真实轨迹梯度进行有界、依赖样本的重新加权,而非独立的梯度方向;我们对此进一步进行了理论分析。在九个使用谱和注意力骨干的 PDE 基准上的实验表明,HERO 在无推理时间成本的情况下,持续提高了长时程精度、稳定展开长度和分布外鲁棒性。这些结果表明,历史增强的相对监督对于稳定长时程自回归预测是有效的。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:37

# HERO:面向长时程自回归神经算子的历史增强展开训练

来源:https://arxiv.org/html/2607.29135 ,Shuxu Chen
亚洲大学电子与信息融合工程系,韩国龙仁市
,Haifan Meng
电子科技大学计算机科学与工程学院,中国成都
,Yi Lu
利物浦大学数学科学系,英国利物浦
,Zhihan Lyu
西安电子科技大学计算机科学与技术学院,中国陕西
,Fan Mo
电子科技大学机械与电气工程学院,中国成都
,Wei Dong
西安建筑科技大学计算机与信息工程学院,中国西安
,Yang Yang
电子科技大学计算机科学与工程学院,中国成都
及Chaoning Zhang
电子科技大学计算机科学与工程学院,中国成都
(2018)

###### 摘要。神经算子通过将学习到的演化算子递归地应用于自身预测,为含时偏微分方程(PDE)提供快速替代模型,但这种自回归展开会将每一次预测误差作为输入反馈回去,导致局部误差不断累积。现有的展开训练策略可以减小训练输入与自生成状态之间的失配,但其监督依然只衡量与真实轨迹的绝对偏差。因此,这种监督无法有效说明算子是否已克服其在优化早期表现出的长时程失效行为。我们提出历史增强展开训练(HERO),将传统的绝对轨迹监督与源于模型优化历史的相对监督相结合。HERO 从周期刷新的滞后算子、当前模型以及受扰动输入中分离出候选展开轨迹,并按展开误差、频谱偏差、能量漂移和误差增长对它们进行排序,并选择最强的失效轨迹作为参考。该参考以固定比较基线的形式进入基于间隔的目标函数,从而对真实轨迹展开梯度产生一个有界、样本相关的重新加权,而非引入独立的梯度方向,我们对此进行了理论分析。在九个 PDE 基准上使用频谱和注意力主干网络的实验表明,HERO 在不增加推理成本的情况下,持续改善了长时程精度、稳定展开长度以及分布外鲁棒性。这些结果表明,历史增强的相对监督对于稳定长时程自回归预测是有效的。

††copyright:acmlicensed††journalyear:2018††doi:XXXXXXX.XXXXXXX††conference:请从您的权利确认邮件中填写正确的会议名称;2018年6月3–5日;纽约州伍德斯托克††isbn:978-1-4503-XXXX-X/2018/06††ccs:计算方法 神经网络

## 1. 引言

在自回归推理过程中,每次预测都会被反馈为输入,反复传播局部误差,并使展开轨迹偏离训练分布(Liet al.,2023a (https://arxiv.org/html/2607.29135#bib.bib18); McCabeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib9))。非线性、多尺度以及重复的频谱动力学可能放大这些偏差,导致频谱失真并最终引发展开不稳定(McCabeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib9); Lippeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib10); Liet al.,2026 (https://arxiv.org/html/2607.29135#bib.bib11); Jianget al.,2025 (https://arxiv.org/html/2607.29135#bib.bib12))。因此,较低的单步误差并不能保证准确且稳定的长时程展开(McCabeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib9); Lippeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib10))。对于混沌系统,必须将长期统计保真度与逐点单步精度分开评估(Liet al.,2022 (https://arxiv.org/html/2607.29135#bib.bib14); Schiffet al.,2024 (https://arxiv.org/html/2607.29135#bib.bib16))。

现有方法通过让算子接触训练期间的自生成状态来缓解这一失配,包括多步展开训练、前推策略、可微求解器策略以及循环算子训练(Brandstetteret al.,2022 (https://arxiv.org/html/2607.29135#bib.bib3); Umet al.,2020 (https://arxiv.org/html/2607.29135#bib.bib4); Yeet al.,2025 (https://arxiv.org/html/2607.29135#bib.bib17))。这些展开训练策略通过修改训练中遇到的状态来减小训练与推理输入之间的失配,但其目标仍然基于预测轨迹与参考轨迹之间的偏差,而非明确的历史增强失效参考(Brandstetteret al.,2022 (https://arxiv.org/html/2607.29135#bib.bib3); Umet al.,2020 (https://arxiv.org/html/2607.29135#bib.bib4); Yeet al.,2025 (https://arxiv.org/html/2607.29135#bib.bib17))。这种监督衡量的是当前展开偏离目标演化的程度,但并不能明确揭示其长时程误差增长或先前观察到的失效模式是否持续存在(McCabeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib9); Listet al.,2025 (https://arxiv.org/html/2607.29135#bib.bib8); Lippeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib10))。

为说明这一局限性,我们比较了标准傅里叶神经算子(FNO)与其前推变体 FNO-PF,后者将模型生成的状态传播到后续步骤,并根据由此产生的展开误差更新算子。如图1 (https://arxiv.org/html/2607.29135#S3.F1) 所示,与 FNO 相比,FNO-PF 延迟了退化的开始时间,但保留了类似的长期增长趋势。因此,暴露于自生成状态能够改善长时程预测,但绝对监督仍然无法表明算子是否已克服其在优化早期产生的失效行为。

模型的优化历史为弥补这一监督缺口提供了天然的对比信息来源。我们将优化早期阶段保存的参数状态视为历史检查点;每个检查点都定义了一个完整的自回归算子,其长时程展开从相同的初始条件进行评估。将这些展开与最终算子进行比较(图2 (https://arxiv.org/html/2607.29135#S3.F2))表明,检查点的相对质量取决于展开视界,并且不会随训练单调改善:某些检查点在初始步骤中保持竞争力,但在更长视界上落后,而另一些检查点在转变时间和误差增长模式上有所不同。因此,历史检查点并非最终算子的统一弱化副本;每个检查点都保留着独特的长时程失效行为。此外,随着当前算子的改进,固定的历史轨迹变得过于容易被超越,从而降低了相对目标的贡献。这些观察结果表明,需要根据展开行为和当前优化阶段来自适应地调整参考。

我们提出了一种历史增强展开训练框架(HERO),在传统真实轨迹回归的基础上补充相对长时程监督。HERO 不依赖固定的历史检查点,而是从周期刷新的滞后算子、当前展开和可选的局部扰动输入中动态构建至多三条分离的候选轨迹。它评估这些轨迹的展开误差、频谱偏差、能量偏差和误差增长行为,并选择一条信息量较大的失效轨迹作为比较参考。然后,当前算子既被优化以匹配真实演化,又通过基于间隔的目标函数超越所选参考。所选参考仅用作分离的比较基线,不引入独立的梯度方向。相反,相对目标会对当前真实轨迹展开梯度产生一个有界、样本相关的重新加权。我们通过聚合更新方向的协方差分解来刻画这一机制,并在此过程中,在明确的正则性和对齐条件下,建立了预设长时程风险区域的有限步可达性。HERO 与架构无关,所有参考构建组件仅在训练期间使用,因此推理时的架构和成本保持不变。

主要贡献总结如下:

(i) 我们提出 HERO,一种与架构无关的历史增强展开训练框架,将动态选择的长时程失效行为转化为相对监督,同时保留传统的真实轨迹回归。

(ii) 我们刻画了由停止梯度参考轨迹所引发的优化机制。参考不是引入独立的蒸馏方向,而是对真实轨迹展开梯度施加有界、样本相关的重新加权。我们进一步推导了聚合更新方向的协方差分解,并建立了预设长时程风险区域的有限步可达性。

(iii) 我们在九个 PDE 基准上进行了实验,涵盖一维、二维和三维动力学,并使用频谱和注意力主干网络。结果表明,与强自回归训练基线相比,HERO 持续提高了长时程展开精度、稳定性和分布外鲁棒性,且不增加推理成本。

## 2. 相关工作

基于展开的训练通过使模型接触自生成状态来减少自回归神经算子的训练–测试失配(Kovachkiet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib1); Liet al.,2021 (https://arxiv.org/html/2607.29135#bib.bib2)),具体方法包括前推和时间捆绑(Brandstetteret al.,2022 (https://arxiv.org/html/2607.29135#bib.bib3))、可微求解器在环校正(Umet al.,2020 (https://arxiv.org/html/2607.29135#bib.bib4))、递归图模拟器(Sanchez-Gonzalezet al.,2020 (https://arxiv.org/html/2607.29135#bib.bib5); Pfaffet al.,2021 (https://arxiv.org/html/2607.29135#bib.bib6))、展开分类法(Koehleret al.,2024 (https://arxiv.org/html/2607.29135#bib.bib7); Listet al.,2025 (https://arxiv.org/html/2607.29135#bib.bib8))以及循环算子(Yeet al.,2025 (https://arxiv.org/html/2607.29135#bib.bib17));然而它们的监督仅衡量与真实轨迹的绝对偏差。一个互补的方向通过频谱和结构设计(McCabeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib9); Lippeet al.,2023 (https://arxiv.org/html/2607.29135#bib.bib10); Liet al.,2026 (https://arxiv.org/html/2607.29135#bib.bib11); Jianget al.,2025 (https://arxiv.org/html/2607.29135#bib.bib12); Huang and Greenberg,2025 (https://arxiv.org/html/2607.29135#bib.bib13))或长期统计约束(Liet al.,2022 (https://arxiv.org/html/2607.29135#bib.bib14); Jianget al.,2023 (https://arxiv.org/html/2607.29135#bib.bib15); Schiffet al.,2024 (https://arxiv.org/html/2607.29135#bib.bib16))来稳定长时程预测,但这会修改算子或目标,而不是针对模型自身的失效进行监督。HERO 弥补了这一互补缺口,它保持推理时算子不变,并使用动态选择的历史失效轨迹来监督当前展开是否相对于先前观察到的失效行为有所改进。相关工作的完整介绍见附录A (https://arxiv.org/html/2607.29135#A1)。

## 3. 动机

本节给出两个促使我们提出 HERO 的观察结果:预测误差在长自回归展开过程中会显著累积,且历史检查点表现出不同的依赖于视界的行为。这些发现促使我们将历史增强的相对监督补充到绝对轨迹监督之中。

### 3.1. 长时程误差累积

图1 (https://arxiv.org/html/2607.29135#S3.F1) 比较了 FNO、FNO-PF 和 HERO 在相同测试初始条件下进行 200 步自由自回归展开的表现。三种方法在初始区间内保持相对接近,但随着展开视界的增加,它们的误差显著分离。FNO 表现出快速的误差累积。FNO-PF 推迟了部分退化过程,但仍保留了类似的长期增长趋势。相比之下,HERO 在中长期展开过程中始终保持更低的误差和更慢的放大速度。图1 (https://arxiv.org/html/2607.29135#S3.F1) 显示了代表性测试轨迹在第 100 步的真实场和预测场。FNO 和 FNO-PF 的预测表现出明显的相位、振幅和局部振荡误差,而 HERO 更准确地保留了真实场的空间结构。这些结果表明,短时程精度和暴露于自生成状态本身并不能消除长时程退化。绝对监督衡量的是当前展开与真实轨迹之间的偏差,但并不能明确表明算子是否已克服优化早期产生的失效行为。

参考图注图 1.FNO、FNO-PF 和 HERO 的短时程精度与长时程展开稳定性。(a) 在相同测试初始条件下进行 200 步自由自回归展开的平均归一化均方根误差(nRMSE)。(b) 根据预定标准选择的代表性测试轨迹在第 100 步的真实场和预测场参考图注图 2.200 步自由自回归展开中不同训练检查点的相对展开误差图景。每一行显示历史检查点与最终 HERO 之间展开误差的以 10 为底的对数比率。最下面一行对应于最终 HERO,且恒为零。虚线标记展开步骤 40、100 和 160。

### 3.2. 不同训练检查点的不同展开行为

每个中间检查点都定义了一个完整的自回归算子,因此会引发其自身的长时程展开行为。图2 (https://arxiv.org/html/2607.29135#S3.F2) 比较了在训练步骤 4000、6000 和 8000 保存的检查点与最终 HERO。所有检查点均在相同测试初始条件下进行 200 步自由自回归展开评估。对于检查点 \(s\),在展开步骤 \(t\) 的平均相对误差为

(1) 
\[
E_{s}(t)=\frac{1}{N_{\mathrm{test}}}\sum_{i=1}^{N_{\mathrm{test}}}\frac{\left\|\hat{u}_{s,t}^{(i)}-u_{t}^{(i)}\right\|_{2}}{\left\|u_{t}^{(i)}\right\|_{2}+\varepsilon},
\]
其中 \(N_{\mathrm{test}}\) 是测试轨迹的数量,\(\hat{u}_{s,t}^{(i)}\) 和 \(u_{t}^{(i)}\) 分别是轨迹 \(i\) 在展开步骤 \(t\) 的预测状态和真实状态,\(\varepsilon>0\) 是数值稳定性常数。

我们通过以 10 为底的对数比率来比较每个检查点与最终 HERO:
(2)
\[
\Delta_{s}(t)=\log_{10}\left(\frac{E_{s}(t)+\varepsilon}{E_{\mathrm{Final}}(t)+\varepsilon}\right),
\]
其中 \(E_{\mathrm{Final}}(t)\) 是最终 HERO 的相应误差。\(\Delta_{s}(t)\) 的正值表示展开误差大于最终 HERO,负值表示误差更小,接近零的值表示误差相当。将各检查点的 \(\Delta_{s}(t)\) 堆叠起来,便得到图2 (https://arxiv.org/html/2607.29135#S3.F2) 中的相对误差图景。水平轴表示展开步骤,而(截断文本)

相似文章