面向MIONet的混合最小二乘/梯度下降方法
摘要
提出了一种用于MIONet的混合最小二乘/梯度下降方法,通过利用交替最小二乘法优化多个分支网络的最后一层参数,并借助Kronecker和Khatri-Rao乘积,从而加速训练。
arXiv:2607.06976v1 公告类型:新
摘要:本文提出了一种用于MIONet的高效混合最小二乘/梯度下降(LSGD)方法,以加速训练。该方法是对DeepONet的LSGD方法的推广。由于MIONet是多个分支网络与一个主干网络的逐元素乘积之和,因此可以将其视为关于每个分支网络最后一层参数的多线性函数。这些参数集可以通过交替最小二乘法进行优化,即依次求解单个分支网络的最小二乘系统。为处理大型系统矩阵,我们引入了Kronecker和Khatri-Rao乘积以及张量置换矩阵,将大矩阵分解为小矩阵。我们的方法与通用的$L^2$损失兼容,该损失包含每个分支最后层参数的正则化项,其中每个损失项中可对MIONet输出应用线性算子。
查看缓存全文
缓存时间: 2026/07/09 07:46
# 用于MIONet的混合最小二乘/梯度下降方法
来源:https://arxiv.org/html/2607.06976
Chang-Ock Lee 韩国科学技术院数学科学系,大田 34141,韩国
Minam Moon 韩国军事学院数学系,首尔 01805,韩国
###### 摘要
本文提出了一种用于MIONet的高效混合最小二乘/梯度下降 \(LSGD\) 方法,以加速训练。该方法将DeepONet的LSGD方法进行了推广。由于MIONet是多个分支网络与一个主干网络的逐元素乘积之和,它可以被看作是关于每个分支网络最后一层参数的多线性函数。这些参数集可以使用交替最小二乘法进行优化,其中我们轮流为单个分支网络求解LS系统。为了处理大规模的系数矩阵,我们引入了Kronecker积和Khatri-Rao积以及张量置换矩阵,将大矩阵分解为小矩阵。我们的方法适用于一般类型的 \(L^2\) 损失,并带有每个分支最后一层参数的正则化项,其中可以在每个损失项中对MIONet输出应用线性算子。
关键词:混合最小二乘梯度下降法,MIONet,Kronecker积,Khatri-Rao积,张量置换矩阵
MSC代码:15A69, 47-08, 65F45, 65Y10, 68T07, 68T20
††脚注:资金支持:本研究由韩国国家研究基金会 (NRF) 基础科学研究计划资助 \[RS2025–25397599\]。
## 1 引言
得益于近期科学机器学习的进展,包括深度学习 (DL) 和深度神经网络 (DNNs) 在内的核心架构已迁移到科学计算领域,以增强现有的求解各种偏微分方程 (PDEs) 的数值方法。特别是,物理信息神经网络 (PINN) \[Raissi2019\] 是其中最成功且应用最广泛的方法,其中 PINN 将 PDE 的解表示为 DNN,并通过使用物理信息损失 (PI-loss) 和自动微分方法 \[Baydin2018\] 训练 DNN 来求解。然而,由于 PINN 需要对不同的 PDE 实例进行单独训练,因此产生了使用 DL 架构建立 PDE 组件与解之间映射的需求,这现已推广到函数空间之间的神经算子映射。神经算子的例子很多,包括深度算子网络 (DeepONet) \[Lu2021\]、傅里叶神经算子 \[Li2020\]、图核网络 \[Li2020neural\]、基于 PCA 的模型降阶 \[Bhattacharya2021\] 和多小波神经算子 \[Gupta2021\]。
在这些神经算子中,DeepONet 是使用最广泛的神经算子框架,具有通用近似性质。它由两个神经网络(分支网络和主干网络)输出的内积组成,其中分支网络编码输入函数,主干网络编码输出函数域的坐标。基于 DeepONet 架构,已经提出了许多变体,例如 POD-DeepONet \[Lu2022\]、多保真 DeepONet \[Lu2022multifidelity\]、NOMAD \[Seidman2022\]、多输入算子网络 (MIONet) \[Jin2022\]、Shift-DeepONet \[Hadorn2022\]、HyperDeepONet \[Lee2023hyper\] 和 Geom-DeepONet \[He2024\]。
在本文中,我们专注于 MIONet,因为它是 DeepONet 的直接推广,将多个输入函数映射到一个输出函数,并具有相应的通用逼近定理 (UAT) \[Jin2022, Theorem 3.1\]。与 DeepONet 中的单个分支网络不同,MIONet 使用多个分支网络来编码每个输入函数,并计算每个分支输出的逐元素乘积,以便与主干网络的输出进行内积。
然而,MIONet 的训练具有挑战性,因为多个网络之间的逐元素乘积和内积使得结构更加复杂,并且需要足够大的数据集才能进行有意义的训练。这使得使用 Adam 优化器 \[Kingma2017\] 的常规 MIONet 训练需要非常高的计算资源和时间。
为了优化和加速 MIONet 训练,我们深入研究了适用于 DeepONet 的混合最小二乘/梯度下降 (LSGD) 方法 \[Choi2025, Cyr2020\]。我们将 LSGD 方法推广到具有典型结构的 MIONet 框架中,其中每个分支网络的输出层是一个全连接线性层。对于一般类型的 \(L^2\) 损失,并带有分支网络最后一层参数的正则化项,我们制定了一个关于最后一层参数的平方多线性函数之和的最小化问题。为了优化这个问题,我们首先固定除一个之外的所有分支的最后一层参数,然后最小化问题就变成了关于未固定的最后一层参数的 LS 系统。现在,通过生成并求解关于未固定的最后一层参数的 LS 问题,并按顺序交替处理分支,我们可以优化所有分支网络的最后一层参数。我们称之为交替最小二乘 (ALS) 方法。尽管每个 LS 系统都非常庞大,但我们可以将大的系统矩阵分解为来自每个分支和主干网络的更小矩阵,其中使用了列式 Kronecker 积 (Khatri-Rao 积 \[Khatri1968\]) 和通常的 Kronecker 积。此外,我们引入了张量置换矩阵 \[Rakotonirina2005\],以匹配由于 Kronecker 积而打乱的行顺序与维度轴的字典序。之后,LS 系统被转化为特殊类型的矩阵方程 \(AXB + \lambda X = E\),其中系数矩阵 \(A\) 和 \(B\) 来自 LS 系统的分量矩阵。此外,我们提供了一个定理,有助于在给定数据张量仅依赖于 MIONet 的一个输入函数参数时,降低数据张量计算的复杂度。最后,我们提出了 ALS 加 Adam (ALS+Adam) 方法,作为 MIONet 的 LSGD 的实用算法,这是对 LS+Adam 方法 \[Choi2025\] 的修改。
本文组织如下。在第2节中,我们介绍 MIONet 并提供典型 MIONet 的 UAT。我们还简要总结了 LSGD 方法 \[Cyr2020\] 和 DeepONet 的 LSGD 方法 \[Choi2025\]。在第3节中,我们根据分支网络的最后一层参数,从一般类型的平方 \(L^2\) 损失中制定最小化问题。之后,我们将解释这个问题如何被理解为关于最后一层参数的 LS 系统,并给出相应的 MIONet 的 LSGD 方法。在第4节中,我们对一个非线性 PDE 进行监督学习,对线性 PDE 进行无监督学习,以比较使用 Adam 的常规 MIONet 训练和使用 ALS+Adam 的 MIONet 训练之间的训练性能。
## 2 预备知识
在本节中,我们介绍 MIONet 及其通用逼近性质 \[Jin2022\],以及 DeepONet 的混合 LSGD 方法 \[Choi2025\]。关于本文中使用的符号和变量的含义,请参考表1。
表1:符号表。
| 符号 | 空间 | 描述 |
|------|------|------|
| \(N\) | \(\mathbb{N}\) | 分支网络的数量 |
| \(I\) | \(\mathbb{N}\) | 分支和主干网络的输出节点数 |
| \(J_m\) | \(\mathbb{N}\) | 第 \(m\) 个分支输出层的输入节点数 |
| \(M_m\) | \(\mathbb{N}\) | 第 \(m\) 个分支输入的离散化点数 |
| \(d_0\) | \(\mathbb{N}\) | 输出函数坐标的维度数 |
| \(\mathbf{u}^{(m)}\) | \(\mathbb{R}^{M_m}\) | 第 \(m\) 个分支的离散化输入函数 |
| \(y\) | \(\mathbb{R}^{d_0}\) | 输出函数的坐标 |
| \(\mathbf{b}_m(\mathbf{u}^{(m)})\) | \(\mathbb{R}^{I}\) | 典型 MIONet 第 \(m\) 个分支网络的输出 |
| \(\mathbf{t}(y)\) | \(\mathbb{R}^{I}\) | 典型 MIONet 主干网络的输出 |
| \(\tilde{\mathbf{b}}_m(\mathbf{u}^{(m)})\) | \(\mathbb{R}^{J_m}\) | 第 \(m\) 个分支网络最后一层之前的输出 |
| \(C_m\) | \(\mathbb{R}^{I \times J_m}\) | 第 \(m\) 个分支的最后一层参数矩阵 |
| \(\theta_m^B\) | - | 第 \(m\) 个分支的隐藏层参数 |
| \(\theta^T\) | - | 主干网络的参数 |
| \(\theta_m^L\) | \(\mathbb{R}^{IJ_m}\) | 第 \(m\) 个分支的最后一层参数,\(\theta^L = \text{vec}(C_m^T)\) |
| \([d_1,\dots,d_N]_{D_1,\dots,D_N}\) | \(\mathbb{N}\) | 第3.2节中秩 \(N\) 张量条目的大端序 |
| \(K\) | \(\mathbb{N}\) | 除正则化项外的损失项数 |
| \(\epsilon_k\) | \(\mathbb{R}^{>0}\) | 第 \(k\) 个损失项的权重 |
| \(\lambda_m\) | \(\mathbb{R}^{>0}\) | \(\theta_m^L\) 的 \(L^2\) 正则化项权重 |
| \(\mathcal{L}_k\) | \(\mathcal{L}(C(\mathbb{R}), C(\mathbb{R}))\) | 第 \(k\) 个损失项的线性算子 |
| \(D_k\) | \(\mathbb{N}\) | 第 \(k\) 个损失项的数据对数量 |
| \(\chi_k\) | \(\left((\prod_{m=1}^N \mathbb{R}^{M_m}) \times \mathbb{R}^{d_0}\right)^{D_k}\) | 第 \(k\) 个损失项的数据 \((\mathbf{u}^{(1)},\dots,\mathbf{u}^{(N)}, y)\) 集合 |
| \(\mathcal{A}_k\) | \(\mathbb{R}^{D_k}\) | 长向量,其第 \(d_k\) 个条目为 (3.4) |
| \(A_{k,m}\) | \(\mathbb{R}^{D_k \times IJ_m}\) | 关于 \(\theta_m^L\) 的 LS 问题中第 \(k\) 个损失项的系统矩阵 |
| \(f_k\) | \(\mathbb{R}^{D_k}\) | 第 \(k\) 个损失项的 LS 问题数据 |
| \(P_m\) | \(\mathbb{N}\) | 第 \(m\) 个分支的输入函数数量 |
| \(Q_k\) | \(\mathbb{N}\) | 第 \(k\) 个损失项的坐标点数量 |
| \(\beta_m\) | \((\mathbb{R}^{M_m})^{P_m}\) | 第 \(m\) 个分支的离散化输入函数集合 |
| \(\tau_k\) | \((\mathbb{R}^{d_0})^{Q_k}\) | 第 \(k\) 个损失项的坐标点集合 |
| \(K_{D,\sigma}\) | \(\mathbb{R}^{D_1 \cdots D_m \times D_1 \cdots D_m}\) | 定义3.2中的张量置换矩阵 |
| \(B_m\) | \(\mathbb{R}^{P_m \times J_m}\) | 第 \(m\) 个分支预输出矩阵,\(\left(\tilde{b}_j(\mathbf{u}_p^{(m)})\right)\) |
| \(T_k\) | \(\mathbb{R}^{Q_k \times I}\) | 第 \(k\) 个损失项的主干输出矩阵(应用 \(\mathcal{L}_k\)),\(\left(\mathcal{L}_k[t_i](y_q)\right)\) |
| \(F_k\) | \(\mathbb{R}^{P_1 \times \cdots \times P_N \times Q_k}\) | 第 \(k\) 个损失项的张量形式数据 |
### 2.1 多输入算子网络 (MIONet)
Jin 等人 \[Jin2022\] 证明了在具有 Schauder 基的 Banach 空间乘积上的多输入算子的 UAT。关于 Schauder 基及其典范投影的更多细节,我们参考 \[Fabian2011, Hu2025, Semadeni2006\]。该定理指出,在具有 Schauder 基的 Banach 空间 \(X_m\) 的紧致子集乘积上的连续多输入算子 \(G\),可以通过如下形式逼近
\[\Big\langle \underbrace{(\mathbf{b}_1 \circ \phi_{M_1}^1)}_{\text{分支1}} \odot \cdots \odot \underbrace{(\mathbf{b}_N \circ \phi_{M_N}^N)}_{\text{分支N}}, \underbrace{\mathbf{t}}_{\text{主干}} \Big\rangle \quad (2.1)\]
其中,对于足够大的正整数 \(I\) 和 \(M_m\),连续向量函数 \(\mathbf{b}_m \in C(\mathbb{R}^{M_m}, \mathbb{R}^I)\) 和 \(\mathbf{t} \in Y^I\),\(\phi_{M_m}^m: X_m \to \mathbb{R}^{M_m}\) 提取 Schauder 基表示的前 \(M_m\) 个系数,\(Y\) 是目标 Banach 空间,\(\odot\) 表示哈达玛(逐元素)积。
这里,根据向量函数 \(\mathbf{b}_m\) 和 \(\mathbf{t}\) 的内积结构 (2.1),可以通过将这些函数替换为神经网络来构建多输入算子网络 (MIONet)。根据 DeepONet 的 UAT \[Lu2021\],我们想使用 \(u^{(m)}\) 的离散化函数值作为 \(\mathbf{b}_m\) 的输入,其中 \(\phi_n^m\) 提取某些点上的函数值。注意,对于 \([0,1]\) 中具有 \(t_1=0\) 和 \(t_2=1\) 且稠密于 \([0,1]\) 的不同点序列 \(\{t_i\}_{i=1}^\infty\),存在 \(C([0,1])\) 的一个 Schauder 基 \(\{e_i\}_{i=1}^\infty\)(称为 Faber-Schauder 基),其中 \(e_1(t)=1\),而 \(e_n\) 被选为满足 \(e_n(t_n)=1\) 的分段线性函数,其中集合 \(\{e_1,\dots,e_n\}\) 构成了所有在节点点 \(\{t_i\}_{i=1}^n\) 处分段线性函数空间的一组基。关于 \(C([0,1])\) 的详细 Faber-Schauder 基构造,我们参考 \[Fabian2011, Semadeni2006\];关于 \(C([0,1]^d)\) 的多变量推广,参考 \[Glenn2019\]。此外,不失一般性,MIONet 可以具有类似于 \[Choi2025, Son2025\] 中 DeepONet 的典型结构,其中每个分支网络的最后一层是没有偏置和激活函数的全连接层。这可以通过在每个分支网络的输出中添加一个恒等层来实现。图1显示了典型 MIONet 的结构。注意,当 \(N=1\) 时的 MIONet 成为具有相同结构的 DeepONet,并具有 \[Choi2025\] 中讨论的通用逼近性质。
参见图注
图1:具有全连接层的典型 MIONet 的结构。
我们现在讨论典型 MIONet 的 UAT,其中输入函数是离散化的函数值。该定理是 \[Hu2025, Theorem 2\] 和 \[Lu2021, Theorem 2\] 的修改。
###### 定理2.1(典型 MIONet 的通用逼近定理)。
令 \(\tilde{X}_m\) 为 Banach 空间,\(\tilde{K}_m \subset \tilde{X}_m\),\(K_0 \subset \mathbb{R}^{d_0}\) 分别是 \(\tilde{X}_m\) 和 \(\mathbb{R}^{d_0}\) 的紧致子集,\(V_m\) 是 \(C(\tilde{K}_m)\) 中的紧致集,\(G\) 是一个将 \(V_1 \times \cdots \times V_N\) 映射到 \(C(K_0)\) 的连续算子。那么,对于任意 \(\epsilon > 0\),存在正整数 \(I, M_m\),连续向量函数 \(\mathbf{b}_m \in C(\mathbb{R}^{M_m}, \mathbb{R}^I)\) 和 \(\mathbf{t} \in C(\mathbb{R}^{d_0}, \mathbb{R}^I)\),以及点 \(x_i^{(m)} \in \tilde{K}_m\),其中 \(m=1,\dots,N\) 且 \(i=1,\dots,M_m\),使得
\[\Biggl\| G(u^{(1)},\dots,u^{(N)})(y) - \Big\langle \underbrace{\mathbf{b}_1(\mathbf{u}^{(1)})}_{\text{分支1}} \odot \cdots \odot \underbrace{\mathbf{b}_N(\mathbf{u}^{(N)})}_{\text{分支N}}, \underbrace{\mathbf{t}(y)}_{\text{主干}} \Big\rangle \Biggr\| < \epsilon \quad (2.2)\]
对于所有 \(u^{(m)} \in V_m\) 和 \(y \in K_0\) 成立,其中 \(\langle \cdot, \cdot \rangle\) 表示 \(\mathbb{R}^I\) 中的内积。相似文章
通过隐式梯度传输加速基于 LMO 的优化
本文提出了 LMO-IGT,这是一类新的随机优化方法,它利用隐式梯度传输来加速收敛,同时保持每次迭代仅计算一次梯度的结构。文中引入了一个统一的理论框架,并展示了相较于 Muon 等现有基于 LMO 的优化器,该方法具有更优的性能。
输入凸神经网络训练的一种提升方法
提出了一种用于训练输入凸神经网络(ICNN)的“提升”方法,该方法使用无约束的超网络生成非负的层间权重,从而软化损失景观并避免梯度衰减,相比投影梯度下降和softplus重参数化,实现了更低的测试损失。
大步长梯度下降恢复多路径深度线性网络中的对称性
本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。
基于同族架构引导的LLM驱动神经网络生成:迁移与适应的解耦
本文提出一种源引导协议,其中LLM利用更强的同族源模型为弱目标模型生成候选修改方案,在CIFAR-10和SVHN基准测试上实现了显著的精度提升,同时解耦了迁移效应与适应效应。
基于LMO方法的零阶无参数优化:高效微调的新方法
本文介绍了AdaNAGED,一种结合零阶优化、无参数自适应和非欧几里得更新几何的方法,用于大型语言模型的内存高效微调,具有理论收敛保证,并在OPT-1.3B模型上进行了验证。