Adam在重尾噪声下的收敛行为

arXiv cs.LG 论文

摘要

本文为普通向量形式的Adam优化器在重尾随机噪声下建立了首个收敛保证,表明其收敛到驻点,但迭代复杂度次优;当已知域半径时,可提升至最优速率。

arXiv:2607.27383v1 公告类型:新 摘要:我们为普通向量形式\emph{Adam}优化器在重尾随机噪声下建立了首个收敛保证。虽然已知多种Adam变体在有界方差非凸优化中能达到最优迭代复杂度,但当随机梯度仅具有有界的$p$阶中心矩(其中$p \in (1,2]$)时,其行为却鲜有研究,而这一设置在现代深度学习中日益常见。为弥补这一空白,我们将最新的在线到非凸转换框架推广至可处理重尾鞅差噪声。基于这一推广框架,我们发展了一种针对Adam的折扣遗憾分析,且无需限制性的参数耦合。我们的结果表明,Adam在重尾噪声下收敛到$(\rho,\epsilon)$-驻点。然而,其迭代复杂度次优且收敛依赖于$p$,即使在有界方差情形($p=2$)下该次优性依然存在。当域半径已知并用于控制在线学习器输出时(这是相关文献中的标准设置),收敛速率可提升至与最优复杂度匹配。这些发现为Adam在重尾机制下的鲁棒性和局限性提供了新的理论见解。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:02

# 重尾噪声下 Adam 的收敛行为 来源:https://arxiv.org/html/2607.27383 ###### 摘要 我们建立了在重尾随机噪声下普通向量形式 \*Adam\* 优化器的首个收敛保证。虽然已知若干 Adam 变体可以在有界方差非凸优化中达到最优迭代复杂度,但当随机梯度仅具有某个 \(p\in(1,2]\) 的有界 \(p\) 阶中心矩时(这一设定在现代深度学习中日益常见),人们对它们的行为知之甚少。为填补这一空白,我们将最近的在线到非凸转换框架推广到能处理重尾鞅差噪声的情形。在此推广框架的基础上,我们为 Adam 发展了一种折现遗憾分析,且无需施加限制性的参数耦合。我们的结果表明,Adam 在重尾噪声下收敛到 \((\rho,\epsilon)\) 稳定点。然而,其迭代复杂度是次优的,并且收敛速率依赖于 \(p\);即使在有界方差情形(\(p=2\))下,这种次优性依然存在。当域半径已知并用于控制在线学习器输出时(这是相关文献中的标准设定),收敛速率会改进到与最优复杂度匹配。这些发现为 Adam 在重尾机制下的鲁棒性和局限性提供了新的理论见解。 ## 1 引言 自适应梯度方法,尤其是 Adam [kingma2014adam],已成为训练现代深度神经网络的事实标准优化工具。尽管其经验成功显著,但对 Adam 类算法的理论理解仍不完整,特别是在梯度噪声偏离经典有界方差假设的随机环境中。近期的经验与理论研究 [battash2024revisiting, ahn2023linear, garg2021proximal] 表明,深度学习中的随机梯度常常表现出重尾行为。噪声可能只对某个 \(p\in(1,2]\) 具有有界 \(p\) 阶中心矩,而非满足有界方差条件。这种重尾现象已在大规模语言模型训练和其他高维学习问题中被观察到。在这些机制下,依赖于次高斯或有界方差假设的分析不再适用,甚至经典随机梯度下降(SGD)[robbins1951stochastic] 也可能遭受不稳定或发散 [zhang2020adaptive]。 在过去几年中,关于重尾噪声下非自适应与自适应方法的研究都取得了实质性进展。裁剪 SGD、归一化梯度方法和基于符号的优化器已被证明能在重尾设定中提供更好的鲁棒性 [zhang2020adaptive, liu2023breaking, sun2024gradient, he2025complexity]。在自适应方法方面,近期工作分析了 AdaGrad 和 Adam 类方法的裁剪或修改变体,并建立了(高概率)收敛保证 [chezhegov2024clipping, fradin2025tight]。更近期,经典算法已被证明在凸设定下达到最优收敛保证,并在重尾噪声的非光滑非凸优化中达到近乎最优的速率 [liu2025online]。尽管如此,在不做算法修改的情况下,Adam 更新在重尾噪声下的收敛保证仍未得到充分探索。事实上,直到最近,Adam 类方法在重尾随机梯度下的严格收敛结果仍是空白 [yu2026sign]。即使在有界方差情形(\(p=2\))下,许多现有分析也侧重于 Adam 的简化或修改变体,而非实践中使用的精确算法。 近年来一个重要的概念进展是在线到非凸转换框架 cutkosky2023optimal, ahn2024understanding, zhang2024random,它在自适应优化与在线学习之间建立了原理性联系。我们简要回顾基本设定。在线线性优化(OLO)进行 \(T\) 轮。在第 \(t\) 轮,学习器选择 \(\mathbf{z}_t\in\mathbb{R}^d\),然后观察到线性损失 \(\ell_t(\cdot):=\langle\mathbf{v}_t,\cdot\rangle\),其中 \(\mathbf{v}_t\) 是环境揭示的成本向量。目标是最小化*静态遗憾*
\[
\mathrm{Regret}_T(\mathbf{u}):=\sum_{t=1}^{T}\langle\mathbf{v}_t,\mathbf{z}_t-\mathbf{u}\rangle,
\]
对任意域 \(\mathcal{D}\) 中的比较器 \(\mathbf{u}\)。为了将在线学习与非凸优化联系起来,近期工作引入了 \(\beta\) 折现遗憾的概念。折现损失定义为
\[
\ell_t^{[\beta]}(\cdot)=\langle\beta^{-t}\mathbf{v}_t,\cdot\rangle,
\]
由此得到折现遗憾
\[
\mathrm{Regret}_T^{[\beta]}(\mathbf{u})=\sum_{t=1}^{T}\langle\beta^{T-t}\mathbf{v}_t,\mathbf{z}_t-\mathbf{u}\rangle.
\]
在该框架下,有效的非凸优化器对应于实现在线学习器具有较小的折现遗憾。这一视角为自适应方法提供了结构性洞见。例如,将 Adam 解释为一种 Follow-the-Regularized-Leader(FTRL)过程,可以阐明其更新结构,并有助于解释当问题性质未知时 Adam 相对于 SGD 的经验优势 [ahn2024adam]。此外,该转换框架已为 Adam 带来了尖锐的迭代复杂度结果。然而,现有分析往往依赖技术性简化,例如去除偏差校正项 \(1/(1-\beta_1^t)\) 和 \(1/(1-\beta_2^t)\),或施加 \(\beta_2=\beta_1^2\) 等参数耦合以便分析处理。虽然这些假设有利于证明技术,但它们偏离了实践中使用的精确算法,并在一定程度上掩盖了其内在行为。此外,当前的转换框架不能直接处理重尾噪声。 鉴于这些进展,一个核心问题仍然悬而未决:*在无限制性修改的情况下,Adam 更新能建立怎样的收敛保证?在重尾设定中,这个问题更具吸引力。* #### 我们的贡献。 在本工作中,我们为 Adam 更新在重尾随机噪声下提供了首个收敛保证。我们的主要贡献总结如下: - •重尾转换理论。我们将在线到非凸转换框架推广到能处理重尾鞅差噪声的情形。 - •向量形式 Adam 遗憾分析。我们为精确的向量形式 Adam 更新建立了完整的折现遗憾分析,且无需施加限制性的参数耦合:(a) 我们仅要求 \(\beta_1\le\beta_2\);(b) Adam 分母中的数值稳定器 \(\epsilon\) 被视为固定的正常数,且不要求随 \(G\) 或 \(\sigma\) 缩放。 - •重尾非凸收敛。我们证明 Adam 在重尾噪声下收敛到 \((\rho,\epsilon)\) 稳定点。所得的复杂度依赖于 \(p\),且相对于最优非光滑随机速率是次优的;即使在有界方差情形 \(p=2\) 下,这种次优性依然存在。 - •已知域半径下的最优速率。当域半径已知并用于裁剪在线学习器输出时(这是相关文献中的标准假设),迭代复杂度改进到与最优速率匹配。 ## 2 相关工作 #### 重尾随机优化 重尾梯度噪声通常通过假设仅对某个 \(p\in(1,2]\) 有有界 \(p\) 阶中心矩来建模,已被广泛研究为深度学习中比有界方差假设更现实的替代。在非自适应优化中,大量工作为此机制开发了鲁棒方法。zhang2019gradient 分析了裁剪 SGD,并在重尾噪声下建立了收敛保证及下界。gorbunov2020stochastic 和 nguyen2023improved 将这些结果加强到高概率保证,并研究了加速变体。除显式裁剪外,gorbunov2020stochastic 和 yu2026sign 分析了基于归一化和基于符号的方法,表明幅度抑制可以在没有显式截断的情况下达到最优或接近最优的速率。对于自适应方法,理论保证相对有限。chezhegov2024clipping 研究了裁剪的 AdaGrad 和 Adam 类算法,并在重尾噪声下建立了高概率收敛保证。ilboudo2023adaterm 提出了基于重尾建模的鲁棒矩估计器并分析了其稳定性。这些工作表明,自适应方法可以在重尾机制中变得鲁棒,但需要显式的算法修改。 #### 在线到非凸转换与重尾在线学习 自适应优化的一个近期重要发展是在线到非凸转换框架。cutkosky2023optimal, ahn2024understanding, zhang2024random, ahn2024general 通过折现遗憾将非凸稳定性保证与在线学习器的遗憾界联系起来。这些工作在有界方差设定中为精心设计的带动量更新的在线学习器建立了最优迭代复杂度。与这些发展并行,重尾在线学习也得到了研究。zhang2022parameter 通过梯度截断技术为在线凸优化建立了高概率遗憾保证。liu2025online 在没有显式截断的情况下为经典在线凸优化算法建立了遗憾保证。 ## 3 预备知识 在本节中,我们介绍全文使用的假设和基本概念。我们的假设在很大程度上遵循非光滑非凸随机优化和自适应方法的先前工作 [cutkosky2023optimal, ahn2024adam, zhang2024random],同时明确只允许随机梯度噪声具有有界 \(p\) 阶矩。我们还回顾 \((\rho,\epsilon)\) 稳定性的概念,它作为我们分析中的最优性准则。这一概念在近期非光滑非凸随机优化研究中是标准的 [zhang2024random, ahn2024adam, zhang2019gradient, jordan2023deterministic, tian2022finite]。尽管 \((\rho,\epsilon)\) 稳定性放宽了 Goldstein 稳定性 [goldstein1977optimization],但它在额外的光滑性假设下仍保留了足够结构以恢复一阶稳定性。 ###### 假设 3.1。 令 \(F:\mathbb{R}^d\to\mathbb{R}\) 是一个可微函数,具有以下性质: - •函数有下界:\(\inf_{\mathbf{x}}F(\mathbf{x})>-\infty\)。我们定义 \(\Delta:=F(\mathbf{x}_0)-\inf_{\mathbf{x}}F(\mathbf{x})\)。 - •函数 \(F\) 是良态的,即 \(\forall\mathbf{x}\) 和 \(\mathbf{y}\),
\[
F(\mathbf{y})-F(\mathbf{x})=\int_0^1\langle\nabla F(\mathbf{x}+t(\mathbf{y}-\mathbf{x}),\mathbf{y}-\mathbf{x})\rangle dt.
\]
 - •函数 \(F\) 是 \(G\)-Lipschitz 的,即 \(\forall\mathbf{x},\|\nabla F(\mathbf{x})\|\le G\)。 - •对于每个查询点 \(\mathbf{x}\),随机梯度 \(\mathbf{g}\leftarrow\mathrm{StoGrad}(\mathbf{x},r)\) 满足
\[
\mathbb{E}[\mathbf{g}\mid\mathbf{x}]=\nabla F(\mathbf{x}),\quad
\mathbb{E}\!\left[\|\mathbf{g}-\nabla F(\mathbf{x})\|^p\mid\mathbf{x}\right]\le\sigma^p.
\]
 ###### 定义 3.2(\((\rho,\epsilon)\) 稳定点)。 假设 \(F:\mathbb{R}^d\to\mathbb{R}\) 是可微的。那么 \(\mathbf{x}\) 是 \(F\) 的一个 \((\rho,\epsilon)\) 稳定点,如果
\[
\|\nabla F(\mathbf{x})\|^{[\rho]}\le\epsilon
\]
其中
\[
\|\nabla F(\mathbf{x})\|^{[\rho]}:=
\inf_{p\in\mathcal{P}(\mathbb{R}^d),\mathbb{E}_{\mathbf{y}\sim p}[\mathbf{y}]=\mathbf{x}}
\left\{\|\mathbb{E}[\nabla F(\mathbf{y})]\|+\rho\mathbb{E}[\|\mathbf{y}-\mathbf{x}\|^2]\right\}.
\]
 为了便于对 Adam 进行在线学习解释,我们引入一个关于成本向量的等价假设,该假设对应于假设3.1 (https://arxiv.org/html/2607.27383#S3.Thmtheorem1) 中的随机梯度。 ###### 假设 3.3。 对每个 \(t\in[T]\),令 \(\mathbf{v}_t\in\mathbb{R}^d\) 表示在历史 \(\mathcal{F}_{t-1}\) 之后揭示的随机成本向量。定义
\[
\bm{\mu}_t:=\mathbb{E}[\mathbf{v}_t\mid\mathcal{F}_{t-1}],\qquad
\bm{\xi}_t:=\mathbf{v}_t-\bm{\mu}_t.
\]
假设几乎必然有
\[
\|\bm{\mu}_t\|\le G,\quad
\mathbb{E}\!\left[\|\bm{\xi}_t\|^p\mid\mathcal{F}_{t-1}\right]\le\sigma^p,\quad
\mathbb{E}\!\left[\bm{\xi}_t\mid\mathcal{F}_{t-1}\right]=0.
\]
 ###### 假设 3.4(球约束域)。 令 \(\mathcal{D}\subseteq\mathbb{R}^d\) 表示半径为 \(D>0\) 的欧几里得球,即
\[
\mathcal{D}:=\{x\in\mathbb{R}^d:\|x\|\le D\}.
\]
任何比较器 \(\mathbf{u}\in\mathcal{D}\) 都满足 \(\|\mathbf{u}\|\le D\)。 假设3.4 (https://arxiv.org/html/2607.27383#S3.Thmtheorem4) 用于指定在线学习分析中的比较器类。 ## 4 折现到非凸转换 算法 1:折现到非凸转换算法 [zhang2024random] 1:输入:初始点 \(\mathbf{x}_0\)、\(T\)、在线学习器 \(\mathcal{A}\)(输出 \(\mathbf{z}\))、折现因子 \(\beta\in(0,1)\) 2:for \(t=1\) 到 \(T\) do 3:从 \(\mathcal{A}\) 接收 \(\mathbf{z}_t\) 4:更新 \(\mathbf{x}_t\leftarrow\mathbf{x}_{t-1}+\kappa_t\mathbf{z}_t\),其中 \(\kappa_t\sim\text{Exp}(1)\) i.i.d. 5:计算 \(\mathbf{g}_t\leftarrow\text{StoGrad}(\mathbf{x}_t,r_t)\) 6:将 \(\ell_t^{[\beta]}(\mathbf{z}_t):=\langle\beta^{-t}\mathbf{g}_t,\mathbf{z}_t\rangle\) 发送给 \(\mathcal{A}\) 7:end for 我们现在提出一个推广的折现到非凸转换框架,它同时适用于重尾噪声和有界方差噪声。本节的结果独立于 Adam 的分析,具有独立价值。为了获得一个 \((\rho,\epsilon)\) 稳定点,定义3.2 (https://arxiv.org/html/2607.27383#S3.Thmtheorem2) 中的两个分量都必须被控制:(i) 期望梯度范数/光滑一阶项 \(\|\mathbb{E}[\nabla F(\mathbf{y})]\|\);(ii) 方差项 \(\mathbb{E}[\|\mathbf{y}-\mathbf{x}\|^2]\)。我们分别界这两个项。 ### 4.1 界定两个项 #### 通过折现遗憾界定期望梯度范数 我们首先

相似文章

随机动态系统的Adam算法分析

arXiv cs.LG

本文建立了针对时变和非平稳随机系统的Adam优化器的通用理论,在允许非平稳和依赖数据的随机激励条件下,提供了参数跟踪和输出预测误差界。

非均匀光滑性下最速下降与Adam的收敛性

arXiv cs.LG

本文将非均匀光滑性假设推广到曲率与目标值呈仿射关系的目标函数,证明了最速下降法以及RMSProp和Adam的对角变体的收敛速率,并应用于逻辑回归和神经网络。

针对边缘稳定性下 Adam 优化器的杆流模型

arXiv cs.LG

本文提出了一种适用于 Adam 及其他自适应优化器的“杆流”模型,以更好地分析其在边缘稳定性(Edge of Stability)下的行为。该研究将连续时间建模扩展至动量方法,结果表明,与稳定的流模型相比,该模型在追踪离散迭代点方面具有更高的准确性。

关于随机低秩自适应的收敛性

arXiv cs.LG

本文强化了LoRA的收敛性分析,将确定性预言机复杂度从指数级提升至O(epsilon^{-4}),并提出了随机变体LoRA-NSGDM和LoRA-STORM,其预言机复杂度分别改进为O(epsilon^{-8})和O(epsilon^{-6})。