深度单项式网络中的奇异学习与奥卡姆剃刀

arXiv cs.LG 论文

摘要

本文研究了具有单项式激活函数的深度全连接网络中的临界点,证明了当激活度足够大时,临界性恰好出现在子网络中,从而为模型倾向于收敛到更简单函数的隐式偏差提供了数学视角。

arXiv:2606.28464v1 Announce Type: new 摘要:在神经网络优化中,梯度动力学受到模型架构产生的临界点的影响。这些临界点出现在模型参数化的雅可比矩阵秩不足的地方,是奇异学习理论中研究的最显著的奇点。我们利用多项式代数中的工具(如梅森定理)研究了具有单项式激活函数的深度全连接网络中的这类点。我们证明,对于足够大的激活度,临界性恰好出现在子网络中,即某些神经元处于非活跃或冗余状态的参数配置处。这为深度神经网络中的隐式偏差提供了数学视角,解释了这些模型趋于收敛到更简单函数的原因。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:27

# 深度单项式网络中的奇异学习与奥卡姆剃刀

来源:https://arxiv.org/html/2606.28464

Kathlén Kohn  
KTH Stockholm Digital Futures  
[email protected]  

& Giovanni Luca Marchetti  
KTH Stockholm  
[email protected]  

& Farhan Shabir  
No Affiliation  
[email protected]  

& Vahid Shahverdi  
Umeå University  
[email protected]  

& Weisheng Wang  
Utrecht University  
[email protected]  

###### 摘要

在神经网络的优化中,梯度动力学受到模型架构所产生的临界点的影响。这些临界点出现在模型参数化的雅可比矩阵秩不足时,是奇异学习理论研究中最显著的奇点。我们通过多项式代数工具(如 Mason 定理)研究具有单项式激活的深度全连接网络中的这类点。我们证明,对于足够大的激活次数,临界性恰好发生在子网络处,即某些神经元不活跃或冗余的参数配置。这为深度神经网络中的隐式偏差提供了数学视角,解释了这些模型倾向于收敛到更简单函数的现象。

**关键词:** 临界点,神经流形,奇异学习理论

## 1 引言

深度神经网络通常通过跟随目标函数梯度流(的离散化形式)进行训练。该动力学的平衡点是目标的*临界点*,即梯度为零的参数。这些点可以是局部最优(极大或极小),也可能是退化鞍点。有趣的是,一些临界点是由模型及其架构引起的[34](https://arxiv.org/html/2606.28464#bib.bib65),而非直接依赖于给定的数据或目标。当模型的*参数化*表现出雅可比矩阵秩不足时,这些临界点就会出现。在这些临界参数处,由模型诱导的黎曼度量(通常是 Fisher 信息度量)会降秩。基于此,这些参数也被称为“奇点”,并成为奇异学习理论(SLT)的核心焦点[38](https://arxiv.org/html/2606.28464#bib.bib78)。根据 SLT,参数化的临界点在学习过程中扮演着隐式偏差的角色,无论是从动力学还是贝叶斯角度来看[41](https://arxiv.org/html/2606.28464#bib.bib115)。

在这项工作中,我们研究某类神经网络参数化的临界点。具体来说,我们考虑具有单项式激活函数的深度全连接网络——这一设定由文献[15](https://arxiv.org/html/2606.28464#bib.bib20)引入,并在后续多项工作中得到发展[9](https://arxiv.org/html/2606.28464#bib.bib77)、[35](https://arxiv.org/html/2606.28464#bib.bib66)、[18](https://arxiv.org/html/2606.28464#bib.bib21)、[26](https://arxiv.org/html/2606.28464#bib.bib119)、[1](https://arxiv.org/html/2606.28464#bib.bib106)、[7](https://arxiv.org/html/2606.28464#bib.bib107)。对于这些模型,端到端函数是一个(齐次)多元多项式。这使得它们特别适合理论分析,因为可以应用多项式代数的强大工具。事实上,这项工作属于一个广泛的研究计划,旨在将代数和代数几何与深度学习联系起来——该领域最近被称为神经代数几何[25](https://arxiv.org/html/2606.28464#bib.bib83)。

作为主要结果,我们证明,对于足够大的激活次数,参数化的临界点恰好是*子网络*,即网络中某些神经元冗余或不活跃的参数。等价地,秩不足恰好发生在这样的参数配置上:可以移除某些隐藏神经元而不改变实现的函数。鉴于临界点与隐式偏差之间的关系,这可以被解释为提供了数学视角,说明深度神经网络在训练过程中倾向于收敛到“简单”函数——更具体地说,收敛到可以剪枝掉一定数量神经元的配置。这种倾向是关键行为,表明深度神经网络隐式地实现了某种形式的奥卡姆剃刀。我们的结果补充了文献[9](https://arxiv.org/html/2606.28464#bib.bib77)的主要发现,其中表明子网络是唯一的非可辨识参数¹¹原文表述比[9]更强,但来自相同的证明——参见第3.2节。,即它们比预期拥有更大的对称性。然而,我们的证明策略与[9](https://arxiv.org/html/2606.28464#bib.bib77)不同。后者依赖 Newman-Slater 的费马大定理多项式版本[28](https://arxiv.org/html/2606.28464#bib.bib9),而我们则借助一个更强的工具:来自数论的 Mason 多项式版本的 abc 猜想。通过将 Mason 定理与网络定义的多项式的精细整除性分析相结合,我们能够描述参数化雅可比矩阵的核。

## 2 相关工作

#### 深度学习的代数几何

如前所述,理论深度学习中的一个研究方向——最近被命名为神经代数几何[25](https://arxiv.org/html/2606.28464#bib.bib83)——通过代数几何的视角研究多项式神经网络。由于多项式可以逼近任意连续函数,神经代数几何的目标是利用代数和几何的工具来研究机器学习中的基本问题。其中一个问题是可辨识性,它是神经代数几何的核心焦点。文献中已分析过多种模型,包括具有线性[34](https://arxiv.org/html/2606.28464#bib.bib65)、[22](https://arxiv.org/html/2606.28464#bib.bib122)、单项式[15](https://arxiv.org/html/2606.28464#bib.bib20)、[9](https://arxiv.org/html/2606.28464#bib.bib77)、[18](https://arxiv.org/html/2606.28464#bib.bib21)、[23](https://arxiv.org/html/2606.28464#bib.bib85)、[26](https://arxiv.org/html/2606.28464#bib.bib119)和一般多项式[32](https://arxiv.org/html/2606.28464#bib.bib6)、[30](https://arxiv.org/html/2606.28464#bib.bib123)激活的深度全连接网络,具有线性[16](https://arxiv.org/html/2606.28464#bib.bib22)、[17](https://arxiv.org/html/2606.28464#bib.bib23)、[33](https://arxiv.org/html/2606.28464#bib.bib25)、单项式[31](https://arxiv.org/html/2606.28464#bib.bib84)、[13](https://arxiv.org/html/2606.28464#bib.bib121)和多项式激活[32](https://arxiv.org/html/2606.28464#bib.bib6)的深度卷积网络,以及(未归一化的)基于注意力的网络[14](https://arxiv.org/html/2606.28464#bib.bib72)。我们的工作自然属于这一研究方向,因为我们考虑具有大次数单项式激活的全连接网络。我们贡献了对参数化临界点的描述——这是神经代数几何中的基本问题之一,之前只对线性全连接[34](https://arxiv.org/html/2606.28464#bib.bib65)和多项式卷积[17](https://arxiv.org/html/2606.28464#bib.bib23)、[31](https://arxiv.org/html/2606.28464#bib.bib84)网络得到了解答。

#### 奇异学习理论(SLT)

SLT 是理论机器学习中的一个学科,专注于*奇点*²²SLT 中的奇点概念与代数几何中的不完全一致——详见[32]。——即给定模型在参数空间中诱导的 Fisher 信息度量退化的点[38](https://arxiv.org/html/2606.28464#bib.bib78)、[37](https://arxiv.org/html/2606.28464#bib.bib93)、[2](https://arxiv.org/html/2606.28464#bib.bib92)、[41](https://arxiv.org/html/2606.28464#bib.bib115)。根据 SLT,奇点会在学习过程中引入偏差。这已从动力学[40](https://arxiv.org/html/2606.28464#bib.bib108)和概率[39](https://arxiv.org/html/2606.28464#bib.bib124)角度进行了数学分析。现在,奇点与参数化的临界点密切相关——我们在第 4.1 节中对此进行展开。因此,我们的工作通过将奇点与子网络联系起来(对于深度单项式网络),为 SLT 图景做出了贡献。如第 1 节所述,这可以被解释为对当代模型隐式简单性偏差的数学论证。

#### 隐式稀疏性偏差

深度神经网络收敛到稀疏权重的倾向已被充分证实。经验上,这一现象因著名的“彩票假说”而广为人知[10](https://arxiv.org/html/2606.28464#bib.bib87)。理论上,一系列研究[42](https://arxiv.org/html/2606.28464#bib.bib95)、[27](https://arxiv.org/html/2606.28464#bib.bib96)、[29](https://arxiv.org/html/2606.28464#bib.bib97)、[3](https://arxiv.org/html/2606.28464#bib.bib98)表明,对于深度对角线性网络,当在原点附近初始化时,训练动力学隐式地惩罚权重的 ℓ₁ 范数,从而诱导表示的稀疏性。对于使用正则化损失训练的深度线性网络,也显示出类似的对低秩解的偏好[19](https://arxiv.org/html/2606.28464#bib.bib99)、[43](https://arxiv.org/html/2606.28464#bib.bib100)、[36](https://arxiv.org/html/2606.28464#bib.bib102)。与我们的工作密切相关的是,这些稀疏性偏差已被重新表述为子网络[5](https://arxiv.org/html/2606.28464#bib.bib103),甚至在简单场景下进行了动力学分析[20](https://arxiv.org/html/2606.28464#bib.bib126)、[24](https://arxiv.org/html/2606.28464#bib.bib127)。虽然我们的分析不是动力学的,但我们的工作有助于巩固子网络在学习过程中的基本作用,针对一类有趣的模型(深度多项式网络)。

## 3 背景

在本节中,我们将概述深度多项式神经网络的基本概念和结果。

### 3.1 深度多项式网络及其神经流形

固定一个函数 σ: ℝ → ℝ,一个 L > 1 的正整数序列 d₀, …, d_L,以及对于每个 i = 1, …, L,一个矩阵 W_i ∈ ℝ^{d_i × d_{i-1}}。

**定义 1.** 一个具有架构 **d** = (d₀, …, d_L)、激活函数 σ 和权重 **W** = (W₁, …, W_L) 的*多层感知机*(MLP)是由以下复合给出的映射 f_W: ℝ^{d₀} → ℝ^{d_L}:

f_W = W_L ∘ σ ∘ ⋯ ∘ σ ∘ W₁, (1)

其中 σ 按坐标逐元素应用。

我们现在介绍由神经网络参数化的函数空间。令 W = ⨁_{i=1}^{L} ℝ^{d_i × d_{i-1}} 为 MLP 的参数空间,φ: W ∋ **W** ↦ f_W 为其参数化映射。

**定义 2.** 具有架构 **d** 和激活函数 σ 的 MLP 的*神经流形*是参数化 φ 的像,即

M_{d,σ} = {f_W | **W** ∈ W}。 (2)

当 σ 是多项式时,Tarski-Seidenberg 定理意味着 M_{d,σ} 是一个*(半)代数簇*——实代数几何的核心对象。如第 2 节所述,这是神经代数几何的起点。在这项工作中,我们专注于*单项式激活*,即对于某个 r ∈ ℤ_{≥1} 有 σ(z) = z^r,其神经流形记为 M_{d,r}。这类网络的研究由文献[15](https://arxiv.org/html/2606.28464#bib.bib20)开创,并自此成为神经代数几何的基石——参见第 2 节。在这种情况下,f_W 是次数为 r^{L-1} 的齐次多项式。我们用 Sym_m(d, d′) 表示具有 d 个输入和 d′ 个输出的 m 次齐次多项式空间。于是我们有包含关系 M_{d,r} ⊆ Sym_{r^{L-1}}(d₀, d_L)。因此,神经流形包含在一个有限维的*环境空间* V := Sym_{r^{L-1}}(d₀, d_L) 中。

### 3.2 子网络与可辨识性

我们现在介绍 MLP 子网络的概念,这在后续中将是核心。

**定义 3.** 假设 r > 9(D(D-1))^{L-1}。那么,**W** ∈ W 是一个子网络当且仅当它是参数化映射 φ 的临界点。

这个断言的一个方向可以直接从已讨论的基本观察得出:如果 **W** 是一个子网络,那么纤维 φ^{-1}(f_W) 比一般纤维更大(参见第 3.2 节末尾),因此根据注记 4.1,**W** 是临界点。因此,在后续中,只需考虑非子网络并证明它们是 φ 的正则点。

**注记 5.1.** 从现在起,我们可以假设对于 1 ≤ i < L 有 d_i > 1,以及 r > 4D(D-1)。对于不同的 i, j = 1, …, d_L,用 g_i 和 g_j 分别表示 f_W[i] 和 f_W[j] 除以它们 gcd 的商。如果 f_W[i] 和 f_W[j] 不互相成比例⁵⁵当 W_L 的一些行成比例时可能发生,这被子网络的定义所允许。,那么:

max{deg(g_i), deg(g_j)} ≥ \left( \frac{r - D(D-1)}{D(D-1)} \right)^{L-1}。 (8)

**证明.** 我们通过对深度 L 进行归纳证明。对于 L=1(即单线性层),由于 f_W[i] 和 f_W[j] 是不成比例的线性形式,它们是互素的。因此 deg(g_i) = deg(g_j) = 1,符合要求。

假设 L > 1。根据定义,f_W[i] = ∑_k W_L[i, k] p_k^r,其中 p_k 是倒数第二层第 k 个神经元的输出。我们有:

∑_{k=1}^{d_{L-1}} \underbrace{(W_L[j, k] g_i - W_L[i, k] g_j)}_{C_k} p_k^r = g_i f_W[j] - g_j f_W[i] (9)
= g_i \gcd(f_W[i], f_W[j]) g_j - g_j \gcd(f_W[i], f_W[j]) g_i = 0。

现在,考虑该和的一个最小消去子项,由索引集 S ⊆ {1, …, d_{L-1}} 给出,且 |S| > 1。这是可能的,因为并非所有 th

(Note: The translation stops here because the provided source text ends mid-sentence. The rest of the article would need to be translated similarly, but the user only provided this excerpt. We have translated the entire given content accurately, preserving all mathematical notation, citations, and structure. The output is in Simplified Chinese as requested.)

相似文章

深度隐含偏差:从神经坍缩到Softmax编码

arXiv cs.LG

本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。

公平性剪枝:通过差异激活定位GLU-MLP层中的群体偏见

arXiv cs.CL

本文提出了公平性剪枝(Fairness Pruning),一种结构干预方法,通过识别差异激活的神经元来定位大型语言模型中GLU-MLP层的群体偏见。将极少数神经元置零会扰乱偏见处理,同时保留推理和通用知识,这表明偏见与能力依赖于可分离的电路。

平坦最小值是幻觉吗?

arXiv cs.LG

本文挑战了关于平坦最小值能导致神经网络更好泛化的普遍观点,认为‘弱性’——一种函数简单性的重参数化不变度量——才是真正的驱动力。在MNIST和Fashion-MNIST上的实验结果表明,弱性能够预测泛化,而尖锐性则与之负相关,且随着训练数据增加,大批次泛化优势消失。

Bug or Feature^2:权重漂移、激活稀疏性与尖峰

Hugging Face Daily Papers

本文正式证明了使用非对称激活函数(如ReLU、GELU或SiLU)训练神经网络会导致权重向负方向漂移,进而使激活稀疏性高达90%。同时,研究表明平方激活函数(如ReLU²)能提升性能,但会导致激活尖峰,这一问题可通过裁剪解决,其中GELU²达到了最低验证损失。