随机初始化自编码器:不动点与混沌边缘
摘要
本文研究随机初始化自编码器中的不动点与稳定性,并使用随机矩阵理论和高斯过程引入局部和全局混沌边缘概念。
arXiv:2608.14638v1 公告类型:新
摘要:本文研究自编码器,一类特殊的深度神经网络(DNNs),其性能可以通过其不动点来表征。这一视角自然引出了关于这些不动点的存在性、稳定性以及吸引域的问题。这些问题通过自编码器的压缩性质来解决,并且与混沌边缘的概念密切相关。
混沌边缘(EoC)是深度神经网络理论中的一个重要概念。它描述了在随机初始化网络中,分隔有序和混沌信号传播的临界状态。在此临界状态或其附近进行初始化,提供了多个理论和实际优势,包括网络对输入扰动的稳定性。此前,混沌边缘是通过平均场近似方法为广泛的神经网络类别引入的。在本文中,我们修改了混沌边缘的概念以用于自编码器的研究。具体来说,我们为自编码器引入了局部和全局混沌边缘,分别控制输入的局部(小)和全局(任意)扰动。
自编码器稳定性的研究属于随机矩阵理论(RMT)中的非线性问题范畴。我们对局部混沌边缘的分析基于随机矩阵理论的谱技术,而全局混沌边缘则通过应用高斯过程的Sudakov-Fernique不等式进行研究。
查看缓存全文
缓存时间: 2026/08/18 10:18
# 随机初始化的自编码器:不动点与混沌边缘
来源:https://arxiv.org/html/2608.14638
###### 摘要
本文研究自编码器,这是一类特殊的深度神经网络(DNN),其性能可通过其不动点来刻画。这一视角自然引出了关于不动点存在性、稳定性以及吸引域的问题。这些问题通过自编码器的压缩性质得以探讨,并与“混沌边缘”概念密切相关。混沌边缘(EoC)是DNN理论中的重要概念,它描述了随机初始化网络中信号传播在有序与混沌之间的临界状态。在此临界状态或其附近进行初始化,具有理论和实践上的多重优势,包括网络对输入扰动的稳定性。此前,混沌边缘概念已通过平均场方法被广泛引入各类神经网络。本文针对自编码器的研究,对混沌边缘概念进行了修正。具体而言,我们引入了自编码器的局部混沌边缘与全局混沌边缘,分别用于控制输入的小范围局部扰动和任意全局扰动。自编码器的稳定性研究属于随机矩阵理论(RMT)中的非线性问题范畴。我们对局部混沌边缘的分析基于RMT的谱技术,而全局混沌边缘则通过运用高斯过程的Sudakov-Fernique不等式来研究。
## 1 引言
### 1.1 自编码器DNN:是什么?为何重要?
自编码器(AE)是一类重要的深度神经网络(DNN),旨在通过压缩与重构来学习数据(例如图像)的高效表征。首先回顾前馈全连接DNN的定义。对每个 \( k=1,2,\ldots,L \),第 \( k \) 层函数为
\[
\Phi^{(k)}:\mathbb{R}^{n_k}\to\mathbb{R}^{n_{k+1}},\quad \Phi^{(k)}(s)=\lambda(W^{(k)}s+b^{(k)}),
\]
其中 \( W^{(k)} \) 是 \( n_{k+1}\times n_k \) 矩阵,\( b^{(k)}\in\mathbb{R}^{n_{k+1}} \) 是向量,\( \lambda \) 是逐坐标作用的非线性函数。换言之,对每个 \( k \),\( \Phi^{(k)} \) 由仿射映射 \( s\mapsto W^{(k)}s+b^{(k)} \) 与非线性函数 \( \lambda:\mathbb{R}\to\mathbb{R} \)(作用于 \( W^{(k)}s+b^{(k)} \) 的每个坐标)复合而成。矩阵 \( W^{(k)} \) 称为*权重矩阵*,向量 \( b^{(k)} \) 称为*偏置向量*,函数 \( \lambda \) 称为激活函数。一个 \( L \) 层DNN函数定义为复合映射:
\[
\mathbf{X}(s)=(\Phi^{(L)}\circ\Phi^{(L-1)}\circ\ldots\circ\Phi^{(2)}\circ\Phi^{(1)})(s).
\]
向量 \( s\in\mathbb{R}^{n_1} \) 和 \( \bar{s}=\mathbf{X}(s)\in\mathbb{R}^{n_{L+1}} \) 分别称为输入向量和输出向量。自编码器(AE)是当输入和输出向量维度相同(\( n_1=n_{L+1}=N \))时的一类特殊DNN。自编码器由两个DNN函数构成:编码器 \( \mathbf{X}_E \) 和解码器 \( \mathbf{X}_D \),即
\[
\mathbf{X}_{AE}=\mathbf{X}_D\circ\mathbf{X}_E.
\]
编码器 \( \mathbf{X}_E \) 将输入 \( \boldsymbol{s} \) 映射到低维潜在表示 \( \boldsymbol{z}\in\mathbb{R}^n \)(其中 \( n\ll N \)),而解码器 \( \mathbf{X}_D \) 从该潜在空间重构原始输入:
\[
\mathbf{X}_E(\boldsymbol{s})=\boldsymbol{z},\quad \mathbf{X}_D(\boldsymbol{z})=\boldsymbol{\bar{s}}.
\]
图1展示了一个简单的单层编码器和解码器的AE。自编码器因其能够以无监督方式学习高维数据的紧凑且信息丰富的表征,已成为现代数据分析中的通用工具。AE的应用之一是非线性降维,它将经典技术(如主成分分析)推广到非线性情形(参见例如[7])。在此情况下,AE函数 \( \mathbf{X}_{AE} \) 执行输入向量(图像)\( \boldsymbol{s} \) 到潜在层向量 \( \boldsymbol{z} \) 的顺序映射,再将 \( \boldsymbol{z} \) 映射回 \( \boldsymbol{s} \),即 \( \mathbf{X}_{AE} \) 充当恒等函数。由于潜在层小于甚至远小于输入和输出层,AE函数无法在整个 \( \mathbb{R}^N \) 上提供恒等映射。我们的目标是在低维流形上提供一个与恒等映射偏差很小的映射。若AE函数 \( \mathbf{X}_{AE} \) 在流形的某个子集 \( S \) 上提供压缩性,则根据Banach不动点定理,在 \( S \) 中存在唯一不动点:
\[
\mathbf{X}_{AE}(s)=s,
\]
其吸引域为 \( S \)。这些不动点对应于被精确压缩和解压的图像,而来自 \( S \) 的其余输入向量构成一类可被近似恢复的数据。因此,不动点可用作所有位于吸引域内的输入向量的唯一标识符(标签)。为此,\( \mathbf{X}_{AE} \) 的压缩性准则对AE设计至关重要,也是本研究的重点。公式(1)中的权重矩阵 \( W^{(k)} \) 和偏置向量 \( b^{(k)} \) 由其分量的选择确定,此过程称为初始化。然而,对于给定的 \( W^{(k)} \) 和 \( b^{(k)} \),AE可能没有不动点,这些点会在权重的迭代调整后出现(参见[2])。此过程称为训练,即最小化所谓的损失函数(例如[1,9])。在图像编码/解码问题中,损失函数可选为:
\[
\mathcal{L}(\{\alpha\})=\sum_{s\in T}\|\mathbf{X}_{AE}(\boldsymbol{s},\{\alpha\})-\boldsymbol{s}\|,
\]
其中 \( T\subset S \) 是训练集。这里 \( \{\alpha\} \) 表示所有权重矩阵和偏置向量的分量集合。训练的效率(如速度和精度)关键取决于初始化[8],且已证明(例如[25,23])当矩阵随机初始化时可达到最佳训练效果。我们的主要关注点是如何通过随机初始化的选择来确定AE不动点的存在性、稳定性和吸引域。本文考虑使用中心化高斯权重初始化的AE,并研究其行为对权重方差的依赖性。特别关注对前馈DNN(参见例如[21,19,14,10,5])的混沌边缘(EoC)研究。这是参数初始化的临界状态,对应于DNN两种行为的转变:稳定性与混沌。当初始化选择在混沌边缘附近时,输入数据的小扰动在通过DNN传播时既不会消失也不会爆炸,从而实现层间信息的最有效传输。在高斯初始化(权重分布为 \( \mathcal{N}(0,\sigma^2/n) \))的情况下,混沌边缘是方差参数 \( \sigma^2 \) 的临界值 \( \sigma^2_{\text{crit}} \),使得当 \( \sigma^2<\sigma^2_{\text{crit}} \) 时输入扰动消失,而当 \( \sigma^2>\sigma^2_{\text{crit}} \) 时扰动在层间传播时爆炸。本文重点研究自编码器DNN。因此,我们引入专用于自编码器的混沌边缘概念,以研究不动点的存在性、稳定性和吸引域。此外,不动点的稳定性可针对小扰动(局部稳定性)或任意扰动(全局稳定性)进行研究。为此,在定理1.1和推论1.4的讨论中,我们分别引入了自编码器的局部混沌边缘和全局混沌边缘。注意,在神经科学文献中关于发放网络不动点的研究(例如[30,32,22,24])中,局部稳定性已足够。对于自编码器,关于输入的均匀收敛对全局稳定性至关重要。在局部稳定性分析中,随机矩阵理论(RMT)技术可成功应用于研究自编码器函数的输入-输出雅可比矩阵。然而,对于全局稳定性,需要输入 \( s \) 的一致性,这使用标准RMT方法难以捕捉。我们基于高斯过程理论和Sudakov-Fernique不等式(定理2.1,参见[27,28,6])开发了新颖的技术。
### 1.2 记号与主要结果
我们研究的核心对象是 \( L \) 层自编码器 \( \mathbf{X}^{(N)}_{L,\sigma^2}(s) \),其形式为
\[
\Phi_k(s)=\phi_\alpha(W^{(k)}s+b^{(k)}),
\]
其中 \( W^{(k)} \) 是 \( n_{k+1}\times n_k \) 随机矩阵,其分量服从 \( \mathcal{N}\left(0,\dfrac{\sigma^2}{n_k}\right) \) 分布;\( b^{(k)}\in\mathbb{R}^{n_{k+1}} \) 是随机向量,服从 \( \mathcal{N}(0,\tilde{\sigma}^2) \) 分布;所有随机变量联合独立;输入和输出维度相等:\( n_1=n_{L+1}=N \);激活函数 \( \phi_\alpha \)(其中 \( 0\leq\alpha<1 \))定义为
\[
\phi_\alpha(x)=\begin{cases}
x, & x\geq 0; \\
\alpha x, & x<0,
\end{cases}
\]
(当 \( \alpha=0 \) 时称为ReLU,当 \( 0<\alpha<1 \) 时称为LeakyReLU)。令
\[
\mathbf{J}^{(N)}_{L,\sigma^2}(s)=\dfrac{\partial \mathbf{X}^{(N)}_{L,\sigma^2}(s)}{\partial s}
\]
为神经网络的输入-输出雅可比矩阵。我们的第一个结果描述了固定向量 \( s \) 下 \( \|\mathbf{J}^{(N)}_{L,\sigma^2}(s)\| \) 的典型行为。
###### 定理 1.1
假设 \( \alpha=0 \)(ReLU激活)。假设对每个 \( k=2,3,\ldots,L \),存在
\[
\lim_{N\to\infty}\frac{n_k}{N}=c_k\in(c,C)
\]
对某些 \( C>c>0 \)。则对任意 \( s\in\mathbb{R}^N \),几乎必然有
\[
\lim_{L\to\infty}\lim_{N\to\infty}\frac{1}{L}\log\|\mathbf{J}^{(N)}_{L,\sigma^2}(s)\|=\frac{1}{2}\log(\sigma^2/2).
\]
为了将此结果重述为DNN术语中熟悉的形式,我们可定义**自编码器的局部混沌边缘**为临界值 \( \sigma^2_{L,\text{crit},\text{loc}} \),使得几乎必然有
\[
\lim_{N\to\infty}\frac{1}{L}\log\|\mathbf{J}^{(N)}_{L,\sigma^2}(s)\|=0.
\]
则定理1.1可等价表述为
\[
\lim_{L\to\infty}\sigma^2_{L,\text{crit},\text{loc}}=2.
\]
混沌边缘概念已在广泛类别的DNN中引入并研究(例如[21,19,14,10,5]),并定义为初始化 \( \mathcal{N}(0,\sigma^2/n_k) \) 中方差 \( \sigma^2 \) 的临界值 \( \sigma^2_{\mathrm{crit}} \),使得
\[
\mathbb{E}\Bigl\{\frac{1}{N}\mathrm{Tr}\,\bigl(\mathbf{J}^{(k)}(s)\bigr)^T\mathbf{J}^{(k)}(s)\Bigr\}\to 1\quad\text{当 }N\to\infty,
\]
其中 \( \mathbf{J}^{(k)}(s) \) 是DNN第 \( k \) 层函数 \( \Phi^{(k)} \) 的输入-输出雅可比矩阵。注意 \( \sigma^2_{\mathrm{crit}} \) 与 \( k \) 无关,因为假设雅可比矩阵的对角分量独立于 \( k \)(例如[19, 第2.2节]和[21, 第3节])。例如在[21,19,14,10,5]中引入的混沌边缘表明,当输入数据的小(局部)扰动通过多层DNN传播时是衰减还是爆炸,而我们引入的局部混沌边缘则显示多层DNN是否具有局部压缩性质(关于小扰动的稳定性)。相反,下文引入的全局混沌边缘显示多层DNN是否在数据集上具有压缩性质(关于任意扰动的稳定性)。注意,在[19, 子节3.4]中已证明,当 \( \sigma^2=\sigma^2_{\mathrm{crit}} \) 时,收敛(12)也对 \( \mathbf{J}^{(N)}_{L,\sigma^2} \) 成立(取代 \( \mathbf{J}^{(k)} \)),即混沌边缘 \( \sigma^2_{\mathrm{crit}} \) 可基于整个DNN的输入-输出雅可比矩阵定义。则Hilbert-Schmidt范数与算子范数的标准不等式蕴含
\[
\sigma^2_{L,\text{crit},\text{loc}}\leq\sigma^2_{\mathrm{crit}}.
\]
此外,由于对ReLU激活 \( \sigma^2_{\mathrm{crit}}=2 \)(这已针对宽度相同的DNN层证明,见[19, 表1]),我们的结果(14)表明对ReLU激活有
\[
\lim_{L\to\infty}\sigma^2_{L,\text{crit},\text{loc}}=\sigma^2_{\mathrm{crit}},
\]
即对大量层而言,这两个混沌边缘值重合。一个重要的推论是……相似文章
不稳定特征,可重现子空间:理解稀疏自编码器中的种子依赖性
本文研究稀疏自编码器中的种子依赖性,发现稳定特征携带大部分预测信号,而不稳定特征反映了可重现的低维子空间。
理解边缘:稀疏自编码器追踪Transformer泛化的界限
本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。
稳定边缘选择性塑造数据分布上的学习
MIT研究人员表明,神经网络训练中的稳定边缘(EoS)不仅仅是一个全局优化现象,而是选择性地在训练分布的子集上重新分配学习,放大某些数据组的进展同时抑制其他组。他们识别出控制这种分配的两个关键条件:梯度与Hessian矩阵最大特征向量的对齐,以及持续非消失的梯度幅度。
稀疏自编码器中特征饥饿的几何不稳定性
本文将稀疏自编码器中的特征饥饿识别为一种几何不稳定性,并提出自适应弹性网络 SAE(AEN-SAE)来在不依赖启发式方法的情况下缓解该问题。
特征组合的结构不稳定性
本文提出了一个几何框架来分析稀疏自编码器中特征组合的不稳定性,揭示了非线性导致棘轮效应,从而在超过临界密度时引发组合坍塌。