Adam在单维二次函数上的可证明稳定性边缘
摘要
本文对Adam优化器在单维二次函数上的稳定性边缘现象进行了理论分析,证明了Adam表现出一种恢复机制,将尖锐度推向稳定性阈值。
arXiv:2608.20638v1 公告类型:新
摘要:Adam的稳定性边缘(EoS)现象已被广泛观察到,但其底层的动态机制尚未完全理解。我们在一维二次函数上研究未校正的Adam,这是一个简洁的设置,其中恒定曲率隔离了由优化器引起的、导致EoS的动态。我们表征了参数空间中由此产生的动态。在广泛的情境下,我们证明Adam表现出一种恢复趋势,趋向于其固定的稳定性阈值$2(1+\beta_1)/[\eta(1-\beta_1)]$。我们还识别了这种边缘寻求机制失效的设置,包括严格次临界的周期轨道和特别调整的轨迹,这些轨迹收敛到最优点的同时保持均匀超临界。这些结果为Adam的EoS在无演化损失几何的设置中提供了具体的动态解释,同时也暴露了其局限性。
查看缓存全文
缓存时间: 2026/08/24 04:31
# 一维二次源上Adam的可证稳定性边缘
https://arxiv.org/html/2608.20638
作者:Yiman Fong
致谢:哈佛大学工程与应用科学学院。邮箱:yiman\_fong@seas\.harvard\.edu, fangyimin05@gmail\.com
Heng Yang
致谢:哈佛大学工程与应用科学学院。邮箱:hankyang@seas\.harvard\.edu
#### 摘要
Adam优化器的“稳定性边缘”现象已被广泛观察到,但其背后的动力学机制尚未被完全理解。我们在一维二次函数这一简洁设定下研究未修正的Adam,该设定下的恒定曲率可以分离出稳定性边缘背后的优化器诱导动力学。我们刻画了参数空间上由此产生的动力学行为。在广泛参数范围内,我们证明Adam表现出一种恢复趋势,使其朝向其冻结的稳定性阈值 $2(1+\beta_1)/[\eta(1-\beta_1)]$ 移动。我们还识别出该寻找边缘的机制失效的设定,包括严格次临界的周期轨道和经过特殊调优、能在保持一致超临界状态的同时收敛到最优点的轨迹。这些结果为Adam在损失几何形状完全不变的设定下的稳定性边缘提供了具体动力学解释,同时也揭示了其局限性。
## 1 引言
Adam优化器是现代深度学习中使用最广泛的优化器之一。当神经网络使用一阶梯度下降或Adam等方法进行训练时,会出现一个引人注目的经验规律——*稳定性边缘*:损失函数的锐度(即Hessian矩阵的最大特征值)上升至稳定性阈值,然后在其附近振荡(图1,左)。对于梯度下降,这一行为已在神经网络训练中被广泛观察到,锐度趋近于学习率 $\eta$ 对应的经典阈值 $2/\eta$。对于自适应方法,研究者在Adam上观察到了类似现象:*预条件锐度* $\mathsf{S}_t$——经过Adam坐标缩放后的Hessian矩阵最大特征值——上升并停留在相应冻结动力学的稳定性阈值附近。这些结果确立了稳定性边缘是一个稳健但迄今主要基于经验的现象,并且是对经典优化理论的强烈偏离。虽然稳定性边缘在梯度下降上吸引了大量理论研究,但Adam的稳定性边缘机制仍然是个谜。这留下了一个基本问题尚未解决:*为什么*会发生这种情况?
图1:稳定性边缘行为及其负反馈机制。左:在神经网络训练和本文研究的一维二次问题中,Adam的锐度在其冻结的稳定性阈值附近振荡。右:在边缘之上,扩张提高了 $v_t$ 并压低 $w_t$;在边缘之下,收缩降低了 $v_t$ 并抬高 $w_t$。实验细节见附录H。
在这项工作中,我们提供理论证据表明,与梯度下降不同,Adam的自适应特性本身就诱导了稳定性边缘。更具体地说,我们在最简单的情况下工作,即一维二次函数 $f(x) = \frac{1}{2}x^2$,并证明了稳定性边缘行为确实会发生,同时识别了产生该行为的机制,如图1右的负反馈回路所示。在该目标函数上,未修正的Adam迭代为:
$$m_{t+1} = \beta_1 m_t + (1-\beta_1) x_t, \quad v_{t+1} = \beta_2 v_t + (1-\beta_2) x_t^2, \quad x_{t+1} = x_t - \frac{\eta}{\sqrt{v_{t+1}}+\varepsilon} m_{t+1},$$
其中动量和二阶矩参数 $0 \le \beta_1 < 1$,$0 \le \beta_2 < 1$,学习率 $\eta > 0$,稳定器 $\varepsilon > 0$,初始状态 $(x_0, m_0, v_0)$。我们使用归一化锐度 $w_t = c\eta \mathsf{S}_t$,其中 $c = (1-\beta_1)/(1+\beta_1)$,此时冻结的稳定性阈值变为无参数边界 $w=2$。关键机制是由Adam的二阶矩适应驱动的负反馈回路:在边缘之上,迭代点扩张,$v_t$ 膨胀,有效步长缩小,$w_t$ 被推回下方;在边缘之下,迭代点收缩,$v_t$ 衰减,$w_t$ 被推回上方。在广泛参数范围内,我们证明这种反馈迫使 $w_t$ 持续在2附近波动:它不能长期稳定地远高于或远低于边缘。这种有效步长的内置自稳定特性也可能是Adam在实践中表现如此出色的部分原因。将此机制转化为证明需要在边缘两侧进行论证;图2总结了由此产生的证明结构(第3节)。在次临界区域(左),自适应Lyapunov函数证明了收缩持续到一个显式截止值 $\overline{W} < 2$,这削弱了二阶矩的驱动力并推动 $w_t$ 向上趋近边缘。该机制并非普遍适用:在互补参数区域,在某些条件下,当 $\varepsilon = 0$ 时可能出现严格次临界的周期轨道。在超临界区域(右),符号几何分离出两种不同行为。对齐的轨迹会扩张,并在有限时间内被迫离开每个固定的超临界带;而例外的持续未对齐轨迹则能在保持一致超临界状态的同时收缩至原点。总而言之,这些结果证明了即使在损失曲率完全固定的情况下,Adam的自适应状态也能产生朝向冻结稳定性边界的负反馈,如图1所示。同时,正动量引入了此寻找边缘机制可能失效的精确方式,说明了一般情形的额外复杂性。因此,我们的分析即使在最简单的二次设定中,也识别出了稳定性边缘的优化器诱导机制及其局限性。将这种精确的离散分析扩展到更高维度是未来工作的一个重要方向。
次临界相 ($w_t < 2$)
$\beta_2 = \beta_1^2$
$\beta_1$ | $\beta_2$ | $(0.9, 0.999)$ | $w=2$ | $\overline{W}$
收缩将 $w_t$ 推至 $\overline{W}$ (命题3.1,推论3.2)
存在四周期循环: (命题3.3)
超临界相 ($w_t > 2$)
$x_t(m_t + c x_t)$ 的符号
对齐:$x_t(m_t + c x_t) > 0$ | 未对齐:$x_t(m_t + c x_t) < 0$
$w=2$
有限次退出回到边缘 (引理3.4,推论3.5)
$\|x_t\|$ 指数衰减,在超临界状态下收敛 (命题3.6;图4)
一般扰动会重新对齐
图2:$\beta_1 > 0$ 的证明路线图。左:在边缘之下,当 $\beta_2 > \beta_1^2$ 时,自适应Lyapunov函数证明收缩持续到截止值 $\overline{W} < 2$(命题3.1,推论3.2);而当 $\varepsilon = 0$ 时,对于某些互补参数选择,严格次临界的四周期循环可能出现(命题3.3)。右:在边缘之上,$x_t h_t$ 的符号分离出对齐轨迹(在有限时间内退出每个固定的超临界带)和例外的持续未对齐轨迹(在保持一致超临界状态的同时收敛)(引理3.4,推论3.5,命题3.6)。
## 2 数学表述及 $\beta_1 = 0$ 的情形
### 2.1 稳定性阈值
为了看清阈值的来源,将式(2)中的二阶矩冻结为一个常数值 $v \ge 0$。定义 $c := \frac{1-\beta_1}{1+\beta_1}$,$w_t := \frac{c\eta}{\sqrt{v_t}+\varepsilon}$,$w_{\max} := \frac{c\eta}{\varepsilon}$。则在几乎所有现实配置中,$w_{\max} > 2$;这正是我们研究的情形,全局次临界情形 $w_{\max} < 2$ 在附录G中处理。注意,冻结迭代的Schur稳定性只是一个逐点判据:$v_t$,从而 $w_t$,沿轨迹演化,因此它本身并不能决定自适应动力学的稳定性——然而我们的结果表明,这个局部边界正是 $w_t$ 围绕其振荡的水平。在神经网络训练的一般设定中,冻结算子、预条件锐度 $\mathsf{S}_t$ 及其阈值 $\mathsf{S}^\star$ 在附录B中有类似定义。
### 2.2 示例说明:$\beta_1 = 0$ 的情形
作为说明性示例,本节聚焦于 $\beta_1 = 0$ 的情形,此时Adam退化为RMSProp。这是更简单的情形,因为动量变量从位置递归中消失且 $c=1$。Adam简化为:
$$v_{t+1} = \beta_2 v_t + (1-\beta_2) x_t^2, \quad x_{t+1} = (1 - w_{t+1}) x_t,$$
其中我们记得 $w_t = \frac{\eta}{\sqrt{v_t}+\varepsilon}$。已有研究在附加条件下,针对无动量的一维二次函数研究了相关的阈值穿越机制。附录D通过一个双向有限穿越结果加强了此直觉:对于每个 $\overline{w} < 2 < w_{\max}$,任何满足 $w_0 \le \overline{w}$ 的初始状态最终都会穿越 $\overline{w}$(推论D.1),并且任何满足 $w_0 \ge \overline{w} > 2$ 的初始状态最终都会下降到 $\overline{w}$(推论D.2)。
## 3 次临界和超临界分析
### 3.1 次临界分析
在次临界区域 $w < 2$,我们证明迭代点表现出朝向边缘的恢复行为。关键工具是一个自适应Lyapunov函数,当 $\beta_2 > \beta_1^2$ 时,该函数在某个截止值 $\overline{W} < 2$ 以下证明收缩。
**命题 3.1(次临界收缩)。** 假设 $\beta_2 > \beta_1^2$。存在一个显式函数 $V(x_t, m_t, w_t)$,使得对于所有满足 $w_t \le \overline{W} < 2$ 的状态,有 $V_{t+1} < V_t$,其中 $\overline{W}$ 是由 $\beta_1, \beta_2, \eta, \varepsilon$ 决定的常数。
该命题意味着一旦 $w_t$ 下降到足够低(具体来说,在 $\overline{W}$ 以下),就会有一个恢复力将其推回向上。这种恢复力源于二阶矩 $v_t$ 的适应:当 $w_t$ 较低时,$v_t$ 较小(因为锐度较低),有效步长较大,这倾向于放大状态并增加后续的锐度,从而提高 $w_t$。
**推论 3.2(边缘恢复)。** 假设 $\beta_2 > \beta_1^2$,$w_{\max} > 2$,且初始 $w_0 \le \overline{W}$。则对某个 $T \ge 1$,有 $w_T > w_0$。定量地,恢复时间最多为 $O\left( \frac{1}{2 - w_0} \log \frac{w_{\max}}{w_0} \right)$。
**次临界循环的存在性**
命题3.1在 $\beta_2 > \beta_1^2$ 时给出了一个充分收缩区域,这确实是标准参数选择 $(\beta_1, \beta_2) = (0.9, 0.999)$ 所在的区域。在互补参数范围内,可能出现严格次临界循环。
**命题 3.3(严格次临界四周期循环的存在性)。** 在无尺度情形 $\varepsilon = 0$ 下,假设
$$\sqrt{2}-1 \le \beta_1 < 1, \qquad 0 \le \beta_2 \le \beta_1^2.$$
则对于每个 $\eta > 0$,存在一个初始状态 $(x_0, m_0, v_0)$,其Adam轨道是素数周期为4的,且对每个 $t \ge 0$ 满足 $w_t < 2$。
附录E中的图3显示了在参数区域(9)的一个具体点上的构造。
### 3.2 超临界分析
在超临界区域 $w > 2$,$x_t h_t$ 的符号分离出两种截然不同的行为。当 $x_t$ 和 $h_t$ 对齐时,下一步保持对齐并扩张位置。这种扩张馈入二阶矩递归,增加 $v_t$,因此将 $w_t$ 推回边缘。当它们未对齐时,持续的未对齐反而迫使位置收缩,即使冻结矩阵是不稳定的。以下引理记录了单步几何。
**引理 3.4(超临界符号几何)。** 假设 $w_{t+1} > 2$。
1. (i) 如果 $x_t h_t > 0$,则 $x_{t+1} h_{t+1} > 0$ 且 $\left| x_{t+1} \right| > (w_{t+1}-1) \left| x_t \right|$。
2. (ii) 如果 $x_t h_t < 0$ 且 $x_{t+1} h_{t+1} < 0$,则 $\left| x_{t+1} \right| < \frac{\left| x_t \right|}{w_{t+1}-1}$。
特别地,保持在固定边界 $2+\delta$ 以上的对齐轨迹至少以 $1+\delta$ 的速率扩张。这种扩张无法无限期持续:它驱动二阶矩变得如此之高,以至于 $w_t$ 无法再保持在 $2+\delta$ 以上。这给出了从边缘上方每个固定带定量退出的结果。
**推论 3.5(从一致超临界带的有限退出)。** 假设 $x_T h_T > 0$ 且 $w_T \ge 2+\delta$,其中 $\delta \in (0, 1]$,并定义 $\tau := \min \{ n \in \mathbb{N}_{\ge 1} : w_{T+n} < 2+\delta \}$。则
$$\tau \le 1 + \delta^{-1} \log\!\left( 1 + \frac{\delta (c\eta)^2}{(1-\beta_2) x_T^2} \right).$$
因此,如果一个对齐轨迹在未来所有时间都保持超临界,那么 $\liminf_{t \to \infty} w_t = 2$。
##### 不稳定收敛阶段
引理3.4的 (ii) 部分提出了未对齐是否最终必须结束的问题。答案是否定的:对于每个满足 $w_0 > 2$ 的初始 $v_0$,可以选择初始位置和动量使得轨迹永远保持未对齐。然后它沿着一条例外的收缩轨迹收敛到原点,即使其冻结动力学保持不稳定。
**命题 3.6(持续超临界未对齐)。** 假设 $0 < \beta_1 < 1$ 且 $w_{\max} > 2$。对于每个满足 $w_0 = c\eta/(\sqrt{v_0}+\varepsilon) > 2$ 的 $v_0 > 0$,存在 $x_0 \ne 0$ 和 $m_0 \in \mathbb{R}$ 使得对每个 $t \ge 0$ 有 $x_t(m_t + c x_t) < 0$。沿此轨迹,
$$w_t \ge w_0, \qquad \left| x_t \right| \le (w_0-1)^{-t} \left| x_0 \right|, \qquad t \ge 0.$$
特别地,$(x_t, m_t, v_t) \to (0, 0, 0)$ 且 $w_t \to w_{\max}$,尽管轨迹在所有时间都保持一致超临界。
## 4 结论
我们研究了未修正Adam在一维二次函数上的精确离散动力学。我们的分析识别了一种朝向冻结稳定性边界的恢复机制。在标准参数设定下带有动量时,我们证明了这种行为持续到一个接近阈值的显式次临界截止值。我们还通过严格次临界的周期轨道和尽管一致超临界却收敛的轨迹展示了其局限性。这些结果为Adam在最简单二次设定中的稳定性边缘现象提供了具体的动力学解释,既揭示了自适应优化器如何产生稳定性边缘,也揭示了其局限性。将此分析扩展到更一般的损失函数和更高维度是一个重要的未来方向。相似文章
随机动态系统的Adam算法分析
本文建立了针对时变和非平稳随机系统的Adam优化器的通用理论,在允许非平稳和依赖数据的随机激励条件下,提供了参数跟踪和输出预测误差界。
所择之路:优化器在稳定性边缘的角色
本文重新审视了深度学习优化中的稳定性边缘现象,提出了一种基于方向海森矩阵和梯度对齐分数的新表述,以实现更准确的预测和诊断工具。
Adam在重尾噪声下的收敛行为
本文为普通向量形式的Adam优化器在重尾随机噪声下建立了首个收敛保证,表明其收敛到驻点,但迭代复杂度次优;当已知域半径时,可提升至最优速率。
针对边缘稳定性下 Adam 优化器的杆流模型
本文提出了一种适用于 Adam 及其他自适应优化器的“杆流”模型,以更好地分析其在边缘稳定性(Edge of Stability)下的行为。该研究将连续时间建模扩展至动量方法,结果表明,与稳定的流模型相比,该模型在追踪离散迭代点方面具有更高的准确性。
非均匀光滑性下最速下降与Adam的收敛性
本文将非均匀光滑性假设推广到曲率与目标值呈仿射关系的目标函数,证明了最速下降法以及RMSProp和Adam的对角变体的收敛速率,并应用于逻辑回归和神经网络。