用于算子学习的神经均值与核校正

arXiv cs.LG 论文

摘要

本文提出了一种结合神经网络均值与精确Matérn kernel校正的方法,用于偏微分方程中的算子学习,在结构力学和OCO-2辐射传输模拟等公开基准测试中达到了竞争性或改进的性能。

arXiv:2609.00389v1 公告类型:新 摘要:我们将神经网络均值与精确Matérn kernel回归应用于它们的残差和学到的特征,并在两个公开的模拟问题上评估这种组合,这些基准测试已发布:de Hoop等人的结构力学基准和Lamminpää等人的OCO-2辐射传输模拟器。在结构力学中,这种组合达到了4.55%的测试误差,与已发布的最佳架构相匹配,并且在低数据情况下为5.38%,对比已发布的6.49%。在OCO-2上,它在该问题自身的测试点上改进了已发布的高斯过程模拟器,在三个光谱波段中的两个上直接胜出;在原始状态上落后网络十倍的同一核在网络特征上超过了它,我们测量了原因(目标的平方本征空间范数在固定有效维度下下降了约四十倍)并证明了机制。当两者持平时,我们训练的每个架构的残差相关性均高于0.86,且它们的共享组件在多样性和样本量上是平坦的,这将已发布的平台期解读为数据的属性。支持性结果包括一个从测量相关性预测堆叠结果的二阶矩恒等式、一个最优恢复证书和一个无分布覆盖带,这是唯一在我们的测试中存活的不确定性信号。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:12

# 神经算子学习中的均值与核校正方法  
来源:https://arxiv.org/html/2609.00389  
Yitzchak Shmalo  
耶路撒冷希伯来大学爱因斯坦数学研究所,以色列耶路撒冷  
.yitzchak\.shmalo@gmail\.com\.  
代码、数据指针及此处报告的所有数字背后每次运行的摘要见  
https://github.com/yspennstate/neural-means-kernel-corrections  
(2026年7月)  

###### 摘要  
我们将神经网络均值与残差及学习特征的精确Matérn核回归相结合,并在两个公开基准问题(含已发表的基线)上评估该组合:de Hoop等人的结构力学基准测试和Lamminpää等人的OCO-2辐射传输模拟。在结构力学问题上,该组合达到4.55%的测试误差,与已发表的最佳架构匹配;在低数据区间达到5.38%,对比已发表的6.49%表现更优。在OCO-2问题上,该方法在其自身测试点上超越了已发表的高斯过程模拟器,在三个光谱波段中的两个波段上直接胜出;同一核方法在原始状态上落后网络十倍,但在网络特征上反超,我们测量了原因(目标空间的平方范数下降约四十倍,同时有效维度不变),并证明了该机制。在两个家族打平的情况下,我们训练的每种架构的残差相关性均高于0.86,且其共享成分在多样性及样本量上保持稳定,这表明已发表的平台期是数据的固有属性。支持性结果包括:基于测量相关性预测堆叠结果的二阶矩恒等式、最优恢复证明以及分布无关覆盖带——这是唯一通过我们测试的不确定性信号。  

## 1 引言  
算子学习为参数偏微分方程和物理正向模型的解映射构建快速代理模型。神经算子\[8,12,11\]学习自身表征;核与高斯过程方法\[2,15,16\]提供精确求解和误差证明,并在相同基准上拥有良好记录。本文结合两者:在应用所报告的度量下训练的神经网络均值,与对其残差及学习特征的精确Matérn核回归。我们在两个公开问题(含已发表基线)上深入评估该组合——de Hoop等人的结构力学基准测试\[5\]和Lamminpää等人的OCO-2辐射传输模拟问题\[9\]——并使用单一固定配方覆盖由Batlle等人\[2\]从de Hoop等人\[5\]和Lu等人\[13\]的问题中整理出的七项基准测试。表1收集了已发表数据和我们的结果。  

表1:深入研究的两个问题(OCO-2、结构力学)及算子学习套件的其他问题,展示最佳已发表平均相对L2测试误差与我们的结果。OCO-2行针对Lamminpää等人\[9\]在其自身测试点上的高斯过程模拟器进行比较(采用该文的降维系数度量);第5节报告了其两种度量,我们的O2和强CO2代理模型在两种度量上均胜出,而弱CO2度量由两个不同头部获胜。已发表的套件数据为作者针对每个问题调整的方法;我们在深入研究的两个问题之外的数据均来自单一固定配方(使用中位数长度尺度的Matérn核,拟合上限为6000点,残差MLP均值,输出经PCA降维,在验证集上选择阶段)。Burgers和Darcy使用的训练划分略小于其基线(分别为800和824对),且Darcy使用了不同网格(基于我们可获取的副本)。  

深入研究的两个问题位于神经-核频谱的两端,而这对组合正是关键。在结构力学问题上,两个家族持平:流水线在20000样本协议下达到4.55%误差,在运行噪声范围内匹配最佳已发表架构(PARA-Net,4.55%);在1250样本协议下达到5.38%,优于已发表的最佳6.49%。耦合在此处带来的主要是理解。我们训练的每种架构的残差相关性在0.86至0.96之间,其共享成分集中在有限元数据最不可靠的区域,且在集成多样性及训练集规模上保持平稳,因此证据将已发表的约4.5%平台期解读为基准数据的属性而非任何代理模型的特性(第4.3节)。在无重新生成的有限元数据情况下,这仍是推论,但我们的所有测量均支持此解读。  

在套件的其他问题上,相同配方以相同逻辑对问题排序:在映射平滑且数据充足的情况下(亥姆霍兹、纳维-斯托克斯、达西),核阶段在流水线内部选择中获胜,并落入Batlle等人\[2\]针对问题调整的核方法的两倍范围内;在Burgers问题上,校正均值接近傅里叶神经算子。在OCO-2问题上,相同组件相差一个数量级,流水线任务随之改变:不是耦合两个可比模型,而是将核的精确性转移到网络的表征上。在卫星的每个光谱波段,任务将降维大气状态映射到降维辐射光谱,基线是Lamminpää等人\[9\]的核流模拟器,我们在相同测试点上对其存储预测进行评分。在训练网络的特征上使用精确的Matérn头部达到3.8%,而相同核在原始状态上达到40%;两个格拉姆矩阵的有效维度不变,目标空间的平方范数下降约四十倍,命题6.8解释了该机制。  

在报告的度量下训练并按输出坐标组合后,该结果在两个问题的两种误差度量上同时超越模拟器(在三个波段中的两个波段上);在第三个波段,每种度量由不同头部获胜(第5节精确说明具体是哪个)。流水线的每个阶段带来一个支持性结果:反射平均背后的对称化引理、基于残差相关性预测堆叠结果的二阶矩恒等式、校正代理模型的最优恢复界‖G−m‖K Pλ(u)、特征核的拉回恒等式与收敛率,以及所报告不确定性的分布无关覆盖陈述。最后一点重要,因为设计因子Pλ虽然是有效界,但实际上是实际误差的较差逐点排序器,其分裂保形重缩放是唯一通过我们测试的不确定性信号(第4.4节)。  

第2节描述问题、协议及已发表结果。第3节定义流水线。第4节和第5节报告两项研究,包括数据缩放实验。第6节陈述支持性理论(每个阶段一个结果),证明见附录A;第7节讨论局限性。  

## 2 基准、协议与相关工作  
### 2.1 问题与数据  
数据集源自de Hoop等人\[5\]的成本-精度研究,是Batlle等人\[2\]和Mora等人\[15\]分发的数据。各向同性弹性板占据域D=(0,1)²;位移场w满足∇⋅σ=0,采用固定本构律,底部及侧边边界施加位移条件,顶部边缘Γt=[0,1]×{1}上施加指定法向牵引力\bar{t}。关注量为域D上的冯·米塞斯应力场σv。学习任务是映射G:\bar{t}↦σv。载荷从高斯随机场GP(100,400²(-Δ+3²I)⁻¹)中采样(拉普拉斯算子带齐次诺伊曼边界条件);输出为有限元解插值到正则41×41网格,载荷在41个点采样。分发文件包含40000个输入/输出对;输入数组存储沿第二网格坐标广播的载荷(我们验证这是精确副本,所有40000个样本的最大偏差为0),因此我们的所有方法将载荷视为ℝ⁴¹中的向量。误差为测试集上的平均相对L2误差:(1/N_test)∑ₙ ‖Ĝ(uₙ)−G(uₙ)‖₂ / ‖G(uₙ)‖₂,在双精度网格值上计算。求积权重(梯形法代替普通向量范数)使报告数字变化小于0.02个百分点,我们沿用先前工作的普通范数约定。  

### 2.2 协议与已发表结果  
文献中存在两种协议,我们均遵循。在*高数据*协议中,前20000个样本可用于训练,后20000个形成测试集;de Hoop等人\[5\]在20000训练样本下报告:4.55%(PARA-Net)、4.67%(PCA-Net)、4.76%(FNO)和5.20%(DeepONet);Batlle等人\[2\]在相同任务上报告其最优恢复核方法(Matérn/有理二次;线性核为27.11%)为5.18%。在20000样本预算内,我们留出最后1000个样本(固定排列)用于模型选择和堆叠,在剩余19000个上训练,因此我们的方法未超过基线使用的20000个训练样本。  

在Mora等人\[15\]的*低数据*协议中,有1250个样本可用,测试集仍为相同的20000样本;其表格显示:8.70%(DeepONet)、6.62%(FNO)、6.95%(Batlle等人\[2\]的核方法)、6.74%(其零均值GP)、7.12%(DeepONet均值GP)和6.49%(FNO均值GP)。在此区间,我们从1250个样本中划分验证集(250样本),训练使用1000个样本,流水线的所有选择仅基于1250个可用标签。  

### 2.3 镜像对称性的数据驱动检验  
连续问题在x₁↦1−x₁下不变:域和边界划分对称,输入定律具有对称协方差。在网格上,反射载荷(S)应沿第一网格坐标反射应力场(T),即G(Su)=TG(u)。我们未假设此点,而是通过数据检验。对于前200个样本中的每个,在所有40000个载荷中搜索反射载荷Suᵢ的最近邻,并比较对应输出。对于五个最佳匹配对,输入失配‖Suᵢ−uⱼ‖/‖uⱼ‖范围在0.27–0.32,输出失配‖Tvᵢ−vⱼ‖/‖vⱼ‖范围在0.085–0.14;若改为沿第二坐标反射,则输出失数量级。近镜像输入的输出比输入本身更接近,这正是等变性加利普希茨解映射所预测的,且该效应指出了正确的输出反射轴。  

输入定律的补充检验:训练载荷的经验证均值和协方差在反射下不变性分别为1.1%和1.5%以内,符合命题6.1的要求。与此一致,测试时的反射平均改善了我们训练的每个模型(第4节),如命题6.1在对称性成立时平均必然如此。  

### 2.4 相关工作  
该基准位于三条研究线的交汇点。*神经算子*学习函数空间之间的映射:DeepONet\[12\]及其分支/主干分解、傅里叶神经算子\[11\]和更广泛的神经算子框架\[8\],以及为de Hoop等人\[5\]的成本-精度研究组装的降基PCA-Net和PARA-Net架构。这些方法快速且网格灵活,但本身不提供误差控制,其在该问题上的数字定义了我们起始的平台期。  

*核与高斯过程方法*通过再生核处理相同映射:Batlle等人\[2\]的最优恢复框架及其收敛理论与先验界是最直接比较,其在考虑的多数基准上与神经算子具有竞争力。通过交叉验证学习的数据自适应核\[4\]和向量值核公式扩展了该家族的应用范围。  

*混合方法*将神经网络和核放在同一估计器中,是我们的流水线最近的亲属:Mora等人\[15\]使用神经算子作为高斯过程的均值并同时拟合两者,这是我们的工作直接建立的基础,不同之处在于我们先拟合均值后拟合核,通过交叉验证而非边缘似然调优,并在一万九千个点上精确求解校正。  

两条线索进一步影响设计。核流方法\[17\]通过最小化半样本交叉验证损失从数据学习核;其作为网络内部层正则化器的使用\[23\]正是我们在命题6.2中分析的项;核流此后被大规模用作物理正向模型的模拟器,例如在大气辐射传输反演\[9\]和从卫星观测推断对流风暴结构\[18\]中,其中以物理参数化呈现输入并使核适应数据是模拟器精确的关键。我们的流水线遵循相同直觉,将更平滑的

相似文章

多尺度算子学习的Frame Kernel Method

arXiv cs.LG

论文提出了Frame Kernel Method,这是一种用于PDEs代理建模的新型多尺度算子学习方法。该方法利用核帧近似,并比流行的神经算子达到更高的精度,同时实现多尺度分解。

多输入神经算子学习在Sobolev空间中的泛化保证

arXiv cs.LG

本文提供了多输入神经算子在Sobolev范数下测量的近似误差和泛化误差估计,分析了多个输入函数(具有不同定义域和正则性)如何影响误差界,适用于偏微分方程和科学计算问题。

内核重启:突破神经场中神经切向核的边界

arXiv cs.LG

本文开发了NTK-KIP、MetaQuill和MetaQuill-KIP算法,以改善从稀疏观测中重建神经场,使基于神经切向核(NTK)的神经场变得非线性和元可学习,从而实现高效的少样本适应。