使用固定深度符号回归搜索前馈神经网络权重更新规则空间
摘要
本文研究使用符号回归发现显式神经网络权重更新规则,这些规则在小型符号回归基准上优于标准手工设计的优化器,在30个基准/网络组合中的25个上实现了44.47%的聚合MSE降低。
arXiv:2607.21855v1 公告类型:新
摘要:我们研究符号回归是否能够发现显式神经网络权重更新规则,这些规则在小型符号回归基准上优于标准手工设计的优化器。候选更新规则表示为固定深度的符号表达式,其操作数来自常见优化器,包括梯度、动量、自适应梯度和矩估计量。在30个基准/神经网络组合中,符号回归过程发现了一个更新规则,在25个案例中优于最佳超参数调优的已建立优化器,在改进案例中聚合MSE降低了44.47\%。发现的规则并不都共享单一的通用符号形式,但许多规则结合了自适应归一化、动量类量、非线性变换和有理表达式。这些结果表明,符号回归可以作为发现紧凑优化器变体的轻量级机制,同时也强调了需要更大规模的验证。
查看缓存全文
缓存时间: 2026/07/27 07:42
# 搜索固定深度符号回归的前馈神经网络权重更新规则空间
来源:https://arxiv.org/html/2607.21855
11美国加州大学欧文分校
11电子邮箱:edfink234@gmail\.com
22美国加州圣地亚哥
22电子邮箱:charlieb1658@gmail\.com
###### 摘要
我们研究符号回归能否发现显式的神经网络权重更新规则,并在小型符号回归基准测试中超越标准手工设计的优化器。候选更新规则表示为固定深度的符号表达式,其操作数来源于常见优化器,包括梯度、动量、自适应梯度和矩估计量。在30个基准测试/神经网络组合中,符号回归过程在25个案例中找到了优于最佳超参数调优的已有优化器的更新规则,在改进案例中总体均方误差降低了44.47%。发现的规则并不共享单一的通用符号形式,但许多规则结合了自适应归一化、动量式量、非线性变换和有理表达式。这些结果表明,符号回归可以作为发现紧凑优化器变体的轻量机制,同时也凸显了更大规模验证的必要性。
## 1 神经网络权重更新规则
训练前馈神经网络需要反复更新其权重以降低误差函数。基本的梯度下降更新规则为:
\(w_{t+1}=w_t-\alpha\nabla f(w_t)\), (1)
其中 \(w_t\) 表示第 \(t\) 次迭代时的权重,\(\alpha>0\) 为学习率,且
\(f=\frac{1}{N}\|x(w)-y\|^2\)。 (2)
这里 \(x(w)\) 为预测向量,\(y\) 为目标向量,\(N\) 为向量大小。
几种广泛使用的优化器通过引入动量、自适应学习率或矩估计来修改(1)。重球动量公式为:
\(v_{t+1}=\theta v_t+\alpha\nabla f(w_t)\)
\(w_{t+1}=w_t-v_{t+1}\), (3)
其中 \(\theta\in[0,1]\) 控制前一次速度的影响。Nesterov加速梯度则在预判点处计算梯度:
\(v_{t+1}=\theta v_t+\alpha\nabla f(w_t-\theta v_t)\)
\(w_{t+1}=w_t-v_{t+1}\)。 (4)
自适应梯度方法利用过去梯度的信息重新缩放更新。AdaGrad公式为:
\(w_{t+1}=w_t-\alpha\,g_{\Sigma}\circ g_t\), (5)
其中 \(g_t=\nabla f(w_t)\),\(\circ\) 表示哈达玛积,且
\(g_{\Sigma}=\left\{\left(\epsilon+\sum_{i=1}^{t}g_{i,1}^2\right)^{-1/2},\ldots,\left(\epsilon+\sum_{i=1}^{t}g_{i,N}^2\right)^{-1/2}\right\}\)。 (6)
RMSProp将累积的平方梯度之和替换为指数加权移动平均:
\(w_{t+1}=w_t+\Delta w_t\) (7)
\(\Delta w_t=-\frac{\alpha}{\sqrt{E[g^2]_t+\epsilon}}g_t\) (8)
\(E[g^2]_t=\gamma E[g^2]_{t-1}+(1-\gamma)g_t^2\)。 (9)
Adadelta对梯度和更新都应用类似的滑动平均归一化:
\(E[g^2]_t=\gamma E[g^2]_{t-1}+(1-\gamma)g_t^2\) (10)
\(\Delta w_t=-\sqrt{\frac{E[\Delta w^2]_{t-1}+\epsilon}{E[g^2]_t+\epsilon}}g_t\) (11)
\(E[\Delta w^2]_t=\gamma E[\Delta w^2]_{t-1}+(1-\gamma)\Delta w_t^2\) (12)
\(w_{t+1}=w_t+\Delta w_t\)。 (13)
Adam结合了过往梯度的滑动平均和过往平方梯度的滑动平均,以适配更新方向和尺度:
\(\mu_t=\beta_1\mu_{t-1}+(1-\beta_1)g_t\) (14)
\(\nu_t=\beta_2\nu_{t-1}+(1-\beta_2)g_t^2\) (15)
\(\widehat{\mu}_t=\frac{\mu_t}{1-\beta_1^t}\) (16)
\(\widehat{\nu}_t=\frac{\nu_t}{1-\beta_2^t}\) (17)
\(w_{t+1}=w_t-\frac{\alpha\widehat{\mu}_t}{\sqrt{\widehat{\nu}_t+\epsilon}}\)。 (18)
最后,AdamW在保持自适应矩估计不变的情况下,直接将正则化应用于权重:
\(w_{t+1}=w_t-\eta\lambda w_t-\frac{\alpha\widehat{\mu}_t}{\sqrt{\widehat{\nu}_t+\epsilon}}\)。 (19)
这些优化器中出现的操作数启发了本工作中使用的符号回归搜索空间。
## 2 将符号回归应用于权重更新问题
鉴于当前实践中开发和使用的大多数权重更新规则都是**启发式**的,一个有趣的问题出现了:是否可以通过算法找到一种经验上**更好**的权重更新算法,而无需显著改变现有算法的复杂性和/或计算成本。本节概述了本文探讨该问题答案的步骤。
### 2.1 符号回归
符号回归涉及在预先指定的数学运算符和操作数基集中进行算法搜索,寻找能够最小化用户定义损失度量 \(\mathcal{L}\) 的表达式。在本文中,\(\mathcal{L}\) 简单地取为数据集 \((\vec{X},\vec{Y})\) 的真实标签 \(\vec{Y}\) 与经过前馈神经网络 \(f(\vec{X},\vec{w})\)(其权重 \(\vec{w}\) 需被优化)的输出之间的均方误差。
在本文中,所有测试中考虑的运算符集相同,具体如下:
- • 一元运算符:\-, \(\mathbf{ln}\), \(\mathbf{exp}\), \(\mathbf{cos}\), \(\mathbf{sin}\), \(\mathbf{sqrt}\), \(\mathbf{asin}\), \(\mathbf{acos}\), \(\mathbf{tanh}\)
- • 二元运算符:\+, \-, \*, /, \(\bm{\wedge}\)
- • 超参数:\(\bm{\eta}\), \(\bm{\theta}\), \(\bm{\epsilon}\), \(\bm{\gamma}\), \(\bm{\beta_1}\), \(\bm{\beta_2}\)
### 2.2 权重更新问题
在第1节中,描述了各种权重更新规则,所有这些规则都可以使用预定义的一元和二元运算符及操作数集的表达式树来表示。表2对此概念进行了举例说明。
表1:第1节中的权重更新规则及其对应的最小表达式树信息。该表中的输入指树中的唯一叶节点。表达式树基于本文表2中定义的输入操作数构建。用于浏览表达式树的小程序可在此处找到。
操作数的选择(见表2)反映了第1节中权重更新规则所使用的操作数,并做了简化:本文进行的研究仅考虑具有 sigmoid 和/或线性感知器激活函数的全连接前馈神经网络。
表2:本文符号搜索中考虑的输入操作数。符号 \(f\) 表示误差函数,\(x_j=\sum_i y_i w_{j,i}\) 是神经元 \(j\) 的非激活输入,其中 \(y_i\) 是前一层神经元 \(i\) 的个体输出,\(w_{j,k}\) 是连接“当前”层神经元 \(j\) 与下一层神经元 \(k\) 的权重。超参数初始化为 \(\{\eta\leftarrow 0.5, \theta\leftarrow 0.01, \gamma\leftarrow 0.9, \epsilon\leftarrow 10^{-8}, \beta_1\leftarrow 0.9, \beta_2\leftarrow 0.999\}\);实际上符号演化过程中会自动形成组合常数。
### 2.3 符号回归方法
本文使用的符号回归方法是在先前工作[7]和[6]中使用的通用固定深度后缀语法及配套遗传规划算法的多线程实现。本文附带的代码仓库包含一个驱动程序,该程序生成符号表达式,并对于每个权重更新规则表达式,通过使用生成的权重更新规则更新随机初始化的前馈神经网络的权重若干轮,然后计算其损失,从而评估其“得分”。本文实验所使用的代码超链接如下并加以描述:
- • NeuralNetworks_VecSR.cpp:实现遗传规划进化和候选权重更新规则生成的文件。
- • MLP_Vec.h 和 MLP_Vec.cpp:实现多层感知器类和权重更新规则逻辑的文件。
- • RunTestsNeuralNetworksVecSRPart1.py:用于对作为基准的已有权重更新规则进行超参数网格扫描的驱动程序代码;见表3。
- • RunTestsNeuralNetworksVecSRPart2.py:用于执行30个不同符号遗传进化的驱动程序代码,每个进化对应本文考虑的10个基准测试和3种前馈神经网络架构。
因此,本工作的主要贡献是一项实证研究,表明使用产生固定表达式树深度表达式的语法的符号回归,能够在一系列小型神经网络符号回归任务中发现紧凑的、显式的权重更新规则,这些规则优于经过超参数调优的标准优化器。
## 3 背景
发现前馈神经网络的最优参数需要设计一种更新它们的方法。为此,多年来出现了许多新颖的想法。例如,[8]采用神经网络来学习权重和激活函数更新规则,并表明这些规则的最优性取决于问题复杂性和神经元类型。在[1]中,作者采用长短期记忆神经网络作为传统梯度下降权重更新规则的替代,并表明这种方法可以泛化到LSTM更新器训练过的类似示例上。
通常,在神经网络优化背景下,元学习或“学会学习”领域已经研究和理论化了相当长的时间[12][14]。例如,[11]将学习更新规则表示为用于预测的神经网络的一部分,并发现更复杂(深度20-30)的神经网络权重更新在线性可分学习任务中表现更好。另一方面,在[3]的工作中,遗传算法也被证明能够学习有效的神经网络更新器。
另一种元学习方法在[2]中实现;他们的框架使用一个控制器来生成定义权重更新规则的字符串(这些字符串被特殊设计为不包含括号)。每个更新规则对两个操作数分别应用两个一元运算符,然后将结果两个操作数用一个二元运算符组合,形成形如 \(\Delta w = \lambda \cdot b(u_1(o_1), u_2(o_2))\) 的原语。虽然作者创建的领域特定语言不足以表达所有数学方程,但他们表明它足够广泛,可以表示在不同机器学习任务上具有竞争力的优化器。
[2]的工作指向了与我们研究最相关的研究方向:直接探索从数据中发现**显式的、符号化的权重更新规则**。与我们工作最密切相关的是,秉承Auto-ML Zero[10]的精神,[4]的作者强烈地将范式从神经网络权重更新规则转向对用于更新神经网络权重的**算法**空间的符号发现。具体来说,[4]的作者在不同的任务上对可能的 `train` 程序函数的空间进行搜索。在评估他们最终得到的 *Lion*(*EvoLved Sign Momentum*)算法的性能时,需要注意的是,作者将自适应算法(如AdamW)填充到搜索空间中,并温和地约束 `train` 程序依赖于第 \(t\) 次迭代时梯度向量的第一和第二非中心矩。然而,就像在[2]中一样,他们强制权重更新为:
\(w_{j,m,t=\tau} = w_{j,m,t=\tau-1} - \hat{f}(\texttt{Operands})\), (20)
其中 \(\hat{f}\) 表示候选的符号权重更新规则,操作数集包含在表2中。
在本工作中,我们只包含用于**形成**自适应算法的运算符和操作数,而不是将算法本身显式地插入到方程种群中。此外,我们将问题框架化为搜索形如 \(^3\) 的权重更新规则:相似文章
EditSR:通过基于编辑的修正增强神经符号回归
EditSR 提出了一种双层框架,将神经符号回归模型与基于编辑的修正器(Rectifier)相结合,以高效修正生成表达式中的结构错误,减少错误累积,并以有限的额外成本提高复杂符号结构的恢复能力。
在弯曲权重空间中学习:用于改进优化的指数-线性权重重参数化
介绍了SymExpLin (SEL),一种结合对称指数路径和线性路径的权重重参数化方法,用于改进神经网络的优化,在Transformer上将训练步数减少最多1.49倍。
语言模型通过控制搜索引导符号方程发现
本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。
在自回归强化学习策略中注入LTLf约束的神经符号方法
提出一种神经符号框架,通过可微自动机表示和基于逻辑的损失函数,将LTLf约束注入基于Transformer的强化学习策略中,在保持竞争性回报的同时提高约束满足度。
RIMRULE: 通过MDL引导的规则学习改进工具使用语言代理
RimRule提出了一种神经符号方法,利用最小描述长度原则从失败轨迹中提炼出紧凑、可解释的规则,在不修改权重的情况下提升LLM工具使用性能,并展示了规则在模型间的可迁移性。