深度隐含偏差:从神经坍缩到Softmax编码
摘要
本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。
arXiv:2605.23087v1 Announce Type: new \nAbstract: 神经坍缩(NC)描述了训练分类器的特征和权重中出现的结构化几何结构。近期理论表明,在深层架构中NC可能是次优的,并将其归因于来自L2正则化的显式低秩偏差。我们研究深度无约束特征模型(UFM)——等同于具有正交输入的深度线性网络——在无正则化训练下,以隔离梯度下降和深度本身如何塑造NC。我们证明深度引致隐式低秩偏差:低秩矩阵通过连续乘法更有效地传播范数,从而促进NC的低秩替代方案。我们认为,这些替代方案对应于Softmax编码:先前在宽度瓶颈网络中发现的最大间隔解。通过分析谱初始化下的训练动态,我们识别出奇异值之间的早期排斥驱动低秩出现,并刻画了深度如何缩小NC的吸引域。最后,我们表明一些效应是反向作用的:对于随机初始化的网络,增加宽度会使训练偏向更高秩的解。我们的结果首次给出了在无正则化多类交叉熵训练下深度UFM中隐式偏差的渐近和动态表征。
查看缓存全文
缓存时间: 2026/05/25 09:00
# 深度的隐式偏置:从神经坍缩到Softmax编码 来源:https://arxiv.org/html/2605.23087
###### 摘要
神经坍缩(Neural collapse, NC)描述了已训练分类器中特征和权重出现的结构化几何。近期理论表明,NC在深度架构中可能并非最优,并将此归因于L2正则化带来的显式低秩偏置。我们研究深度无约束特征模型(UFM)——等价于具有正交输入的深度线性网络——且*不*使用正则化进行训练,以分离出梯度下降和深度本身如何塑造NC。我们证明,深度会引发隐式低秩偏置:低秩矩阵通过连续相乘更有效地传播范数,从而促进NC的低秩替代方案。我们认为,这些替代方案对应于softmax编码:先前在宽度瓶颈网络中发现的最大间隔解。通过在谱初始化下分析训练动态,我们识别出早期奇异值之间的排斥机制,该机制驱动低秩结构的出现,并刻画了深度如何缩小NC的吸引域。最后,我们表明某些效应方向相反:对于随机初始化的网络,增加宽度会使训练偏向于更高秩的解。我们的结果首次对使用无正则化多类交叉熵训练的深度UFM中的隐式偏置给出了渐近和动态刻画。
神经坍缩,梯度下降,深度学习,低秩偏置。
## 1 引言
深度神经网络分类器在训练超过插值点后,会收敛到一种高度结构化的几何排列,称为神经坍缩(Papyan等人,2020(https://arxiv.org/html/2605.23087#bib.bib129)):类均值形成单纯形等角紧框架(ETF),且特征和分类器权重均与该框架对齐。有趣的是,这种构型无需任何显式正则化或架构约束即可出现。*梯度下降动态或架构本身固有的哪些偏置导致了这种几何规律性?* 大量工作通过无约束特征模型(UFM)(Mixon等人,2020(https://arxiv.org/html/2605.23087#bib.bib143);Fang等人,2021(https://arxiv.org/html/2605.23087#bib.bib125))来研究这一问题,该模型将最后一层特征视为与分类器权重联合优化的自由优化变量,而抽象掉前面各层。这些研究大多在特征和权重上同时使用L2正则化分析UFM,主要针对均方误差(MSE)损失(Mixon等人,2020(https://arxiv.org/html/2605.23087#bib.bib143);Han等人,2022(https://arxiv.org/html/2605.23087#bib.bib148);Zhou等人,2022a(https://arxiv.org/html/2605.23087#bib.bib144);Tirer和Bruna,2022(https://arxiv.org/html/2605.23087#bib.bib130);Dang等人,2023(https://arxiv.org/html/2605.23087#bib.bib29);Tirer等人,2023(https://arxiv.org/html/2605.23087#bib.bib8)),而较少使用更实用的交叉熵(CE)损失(Zhu等人,2021(https://arxiv.org/html/2605.23087#bib.bib42);Li等人,2023(https://arxiv.org/html/2605.23087#bib.bib85);Zhao等人,2024(https://arxiv.org/html/2605.23087#bib.bib113))。在此框架中,正则化对于NC出现至关重要。然而,当UFM扩展到多层——即深度UFM——时,在L2正则化下,NC及其推广深度神经坍缩(DNC)不再全局最优(Súkeník等人,2024(https://arxiv.org/html/2605.23087#bib.bib28);Garrod和Keating,2024a(https://arxiv.org/html/2605.23087#bib.bib39)):L2正则化诱导低秩偏置,抑制了深度架构中的NC。
基于L2正则化的分析面临关键限制。首先,尚不清楚正则化后的模型能否告诉我们无正则化训练中出现的结构(Thrampoulidis等人,2022(https://arxiv.org/html/2605.23087#bib.bib122))。其次,在深度UFM中,尽管NC在有限正则化下是次优的,但经验上需要较大的正则化值才能阻止其出现(Súkeník等人,2024(https://arxiv.org/html/2605.23087#bib.bib28);Garrod和Keating,2024a(https://arxiv.org/html/2605.23087#bib.bib39))。第三,可能更令人担忧的是,UFM中应用L2正则化的方式——直接作用于特征——与标准训练显著不同,在标准训练中正则化作用于网络权重。当考虑没有显式正则化的UFM时,这些担忧得到缓解。Garrod等人(2025(https://arxiv.org/html/2605.23087#bib.bib9))表明,使用CE损失*不*加显式正则化训练的UFM仍然收敛到NC,证明了NC源于CE训练本身的隐式偏置。然而,他们的分析仅限于单隐藏层。深度如何影响隐式偏置仍是一个开放问题:*深度引入的归纳偏置如何影响NC的收敛,包括渐近性和有限训练时间?如果深度偏好NC的替代方案,那么什么几何结构取而代之,且为什么NC在实际深度网络中仍然普遍存在?*
### 1.1 贡献
我们首次全面刻画了深度、优化动态和初始化带来的隐式偏置如何相互作用以决定NC是否出现。我们的设置是使用CE损失*不*加显式正则化训练的深度UFM——在该模型中,损失最小值仅在参数范数无穷大时达到,且许多几何构型都能达到该值。因此,出现的结构纯粹反映了优化和模型深度的隐式偏置,我们从两个互补的角度进行分析:
**渐近性:深度诱导低秩偏置。** 在时间渐近条件下,梯度流(GF)动态归结为一个非凸的最大间隔问题(Lyu和Li,2019(https://arxiv.org/html/2605.23087#bib.bib108))。通过分析其景观,我们发现,与浅层情况不同,深层景观存在多个稳定的局部极小值,其中NC严格非最优。我们识别出这种非良性景观背后的机制:低秩结构通过矩阵乘法更有效地传播范数,从而在固定参数范数下实现更大的logits。在深度很大时,我们证明全局最优对应于d=2的softmax编码(Jiang等人,2023(https://arxiv.org/html/2605.23087#bib.bib121)),将深度诱导的偏置与显式宽度约束联系起来。经验证据表明,这种联系可推广到有限深度下的更高秩softmax编码。
**动态:深度重塑轨迹。** 基于Garrod等人(2025(https://arxiv.org/html/2605.23087#bib.bib9))的Hadamard框架,我们分析有限时间下的GF动态。与浅层UFM不同(其中NC在整个轨迹中是唯一的稳定方向),在多层级设置中,我们证明这不再成立:NC在原点附近变得不稳定,且不稳定区域随层数增加而增大,而替代的低秩方向变得稳定。我们证明其机制是一种“富者愈富”效应,其中较大的奇异值增长更快,从而在退出线性化区域之前促进低秩结构。我们进一步证明,NC的KL散度(浅层UFM中的Lyapunov函数)在深度下可能发散。最后,我们证明随机初始化会引发测度集中效应,对于足够大的网络宽度,该效应驱使早期动态走向NC。这为低秩结构虽然在理论上受深度偏好但在实践中并非必然出现提供了理由。我们在深度UFM和神经网络上通过实验验证了我们的结果。
超越NC,深度UFM(等价于具有正交输入的线性网络)是将深度诱导的隐式偏置与显式正则化分离的最小模型。因此,我们对这一经典设置的分析为深度如何塑造深度学习中的隐式偏置这一更广泛问题提供了启示。
### 1.2 相关工作
在此,我们回顾最相关的工作。完整综述及其他参考文献见附录A(https://arxiv.org/html/2605.23087#A1)。
深度NC已被He和Su(2022(https://arxiv.org/html/2605.23087#bib.bib136))、Parker等人(2023(https://arxiv.org/html/2605.23087#bib.bib140))、Rangamani等人(2023(https://arxiv.org/html/2605.23087#bib.bib138))实验探索,但理论工作主要基于使用*MSE损失*训练的深度UFM(Tirer和Bruna,2022(https://arxiv.org/html/2605.23087#bib.bib130);Dang等人,2023(https://arxiv.org/html/2605.23087#bib.bib29);Súkeník等人,2023(https://arxiv.org/html/2605.23087#bib.bib131);Garrod和Keating,2024b(https://arxiv.org/html/2605.23087#bib.bib141);Súkeník等人,2024(https://arxiv.org/html/2605.23087#bib.bib28))。同样在MSE损失下,一个平行方向研究更一般线性网络中的隐式正则化,探讨GD与深度之间的相互作用(Arora等人,2018a(https://arxiv.org/html/2605.23087#bib.bib61),b(https://arxiv.org/html/2605.23087#bib.bib38);Bah等人,2022(https://arxiv.org/html/2605.23087#bib.bib98);Yaras等人,2023(https://arxiv.org/html/2605.23087#bib.bib100);Tu等人,2024(https://arxiv.org/html/2605.23087#bib.bib83))及矩阵分解动态(Gunasekar等人,2017(https://arxiv.org/html/2605.23087#bib.bib78);Arora等人,2019(https://arxiv.org/html/2605.23087#bib.bib34);Li等人,2020(https://arxiv.org/html/2605.23087#bib.bib112);Razin和Cohen,2020(https://arxiv.org/html/2605.23087#bib.bib99))。更实用的CE设置因其额外复杂性而研究较少。直到最近,Garrod和Keating(2024a(https://arxiv.org/html/2605.23087#bib.bib39))才表明*显式*L2正则化在DNC中诱导低秩偏置。我们首次直接分析使用CE损失且无显式正则化的深度UFM,专注于GF动态所诱导的隐式偏置。
在隐式偏置文献中,最相关的研究是Ji和Telgarsky(2019(https://arxiv.org/html/2605.23087#bib.bib31)),他们分析了二元逻辑损失下深度线性网络中的GF动态。虽然深度UFM是具有正交输入的深度线性网络的一个特例,但我们的结果更一般,因为:(i)直接适用于*多类*设置;(ii)关于GF收敛到*显式几何构型*而非通过KKT点(Lyu和Li,2019(https://arxiv.org/html/2605.23087#bib.bib108))的隐式非凸刻画是决定性的;(iii)超越渐近收敛,研究了*完整动态*。CE损失的GF动态比MSE损失困难得多:即使在浅层UFM中,直到近期Garrod等人(2025(https://arxiv.org/html/2605.23087#bib.bib9))才引入基于谱初始化的框架来研究这些动态,将Saxe等人(2013(https://arxiv.org/html/2605.23087#bib.bib93))针对MSE的工作进行推广。我们将此框架推广到深度模型。
先前工作表明,深度可以使优化偏向于低秩解,特别是在矩阵分解中(Gunasekar等人,2017(https://arxiv.org/html/2605.23087#bib.bib78);Arora等人,2019(https://arxiv.org/html/2605.23087#bib.bib34);Li等人,2020(https://arxiv.org/html/2605.23087#bib.bib112);Chou等人,2020(https://arxiv.org/html/2605.23087#bib.bib80)),在非线性和齐次网络中也有相关证据(Huh等人,2021(https://arxiv.org/html/2605.23087#bib.bib71);Jacot,2023(https://arxiv.org/html/2605.23087#bib.bib81);Timor等人,2023(https://arxiv.org/html/2605.23087#bib.bib54))。我们的工作不同之处在于聚焦于CE训练的过参数化分类器模型,表明在此设置中深度诱导低秩表示、减小归一化间隔,并驱动从神经坍缩到softmax编码的转变。
## 2 背景
(深度)UFM。我们研究深度无约束特征模型(UFM)上使用CE损失的梯度流(GF),用于每个类有n个样本的K类分类。模型参数为矩阵W_L ∈ ℝ^{K×d},W_{L-1}, …, W_1 ∈ ℝ^{d×d},以及H_1 ∈ ℝ^{d×nK},其中d是嵌入维度。H_1的列是*可训练的*特征向量h_{ic} ∈ ℝ^d,对应于类c的样本i,按类排序。损失函数为
L(Z) = -∑_{c=1}^K ∑_{i=1}^n log( exp((z_{ic})_c) / ∑_{c'=1}^K exp((z_{ic})_{c'}) ), (1)
其中z_{ic} = W_L W_{L-1} … W_1 h_{ic}是logit向量,构成logit矩阵Z ∈ ℝ^{K×nK}的列。当L=1(单隐藏层)时,这退化为(浅层)UFM;我们的重点在于深层情况L>1。深度UFM作为过参数化DNN分类器的抽象,其中特征h_{ic}代表与权重联合训练的无约束嵌入(Mixon等人,2020(https://arxiv.org/html/2605.23087#bib.bib143);Fang等人,2021(https://arxiv.org/html/2605.23087#bib.bib125);Han等人,2022(https://arxiv.org/html/2605.23087#bib.bib148))。这模拟了高度表达性的特征映射(例如ResNet)加上线性分类头。我们将在未来工作中考虑头部具有齐次激活的情况。更多细节见附录B(https://arxiv.org/html/2605.23087#A2),以及Garrod和Keating(2024b(https://arxiv.org/html/2605.23087#bib.bib141),附录A)对UFM作为深度学习建模工具的合理性论证。此外,由于深度UFM等价于具有正交输入的L层线性网络(即展示深度依赖动态的最简单架构),它成为将显式正则化与优化和深度所诱导的隐式偏置分离开的最小设置。线性网络在深度学习理论中被广泛研究,但几乎完全是在MSE损失下,而非更实用的CE损失。
(深度)神经坍缩。DNC指在训练网络最后几层经验观察到的几何规律性(Papyan等人,2020(https://arxiv.org/html/2605.23087#bib.bib129);Parker等人,2023(https://arxiv.org/html/2605.23087#bib.bib140))。关键性质是中心化类均值嵌入的Gram矩阵与单纯形ETF矩阵S = I_K - (1/K) 1_K 1_K^T成比例。我们将DNC的详细定义推迟到附录B(https://arxiv.org/html/2605.23087#A2);这里我们使用以下已建立的等价刻画(Garrod和Keating,2024a(https://arxiv.org/html/2605.23087#bib.bib39))。设⊗表示Kronecker积。
###### 定义2.1(深度UFM中的DNC)。当归一化参数矩阵Ŵ_L, …, Ŵ_1, Ĥ_1(其中X̂ = X/‖X‖_F)满足平衡关系
Ŵ_l^T Ŵ_l = Ŵ_{l-1} Ŵ_{l-1}^T, l = 1, …, L, (2)
其中Ŵ_0 ≔ Ĥ_1,且归一化logit矩阵与单纯形成比例:Ŵ_L … Ŵ_1 Ĥ_1 ∝ S ⊗ 1_n^T时,称为DNC解。平衡性渐近出现:量W_l^T W_l - W_{l-1} W_{l-1}^T。相似文章
梯度下降早期动力学中逻辑回归的非渐近隐式偏差
这篇理论论文研究了梯度下降下逻辑回归的非渐近隐式偏差,证明了参数向量能在与对齐误差相关的双指数次迭代内快速弱对齐最大间隔方向。
深度促进局部熵:深层变分范数ReLU回归中的二次深度依赖
本文证明了深层变分范数ReLU回归的极小极大风险对深度具有二次依赖关系,使用了局部打包论证和逼近定理。
类别编码在神经坍缩中的作用
本文研究了类别标签编码如何影响神经网络分类器中的神经坍缩,表明在独热编码和平衡数据下,随着偏置正则化增加,未中心化的均值特征从单纯形等角紧框架转变为正交框架。
深度双下降
OpenAI研究揭示了“双下降”现象,即测试误差随着模型规模和训练步数的增加呈现出非单调的模式,挑战了传统上对深度学习偏差-方差权衡的理解。
平坦最小值是幻觉吗?
本文挑战了关于平坦最小值能导致神经网络更好泛化的普遍观点,认为‘弱性’——一种函数简单性的重参数化不变度量——才是真正的驱动力。在MNIST和Fashion-MNIST上的实验结果表明,弱性能够预测泛化,而尖锐性则与之负相关,且随着训练数据增加,大批次泛化优势消失。