带梯度裁剪和加性噪声的随机梯度方法的几乎必然收敛分析
摘要
本文证明了在平滑性和有界梯度噪声假设下,带裁剪和加性噪声的随机梯度下降(包括动量变体)几乎必然收敛,为凸和非凸环境中的稳定训练提供了理论基础。
arXiv:2609.12119v1 公告类型:新
摘要:带梯度裁剪和加性噪声的随机梯度下降(SGD)已成为训练机器学习模型的标准技术,特别是在需要鲁棒性或隐私保证的应用中。然而,裁剪在随机梯度中引入偏差,而加性噪声引入额外方差,使得单个优化轨迹的长期行为难以刻画。在这项工作中,我们证明了在平滑性和一致有界随机梯度噪声假设下,带裁剪和加性高斯噪声的SGD(SGD-CN)几乎必然(a.s.)收敛,前提是步长满足某些标准衰减条件。我们的分析扩展到动量变体,如随机重球法和Nesterov加速梯度法,我们展示了通过仔细的能量构造可以得到类似的保证。这些结果为理解带裁剪的随机梯度方法的路径行为提供了更强的理论基础,并表明尽管裁剪和扰动引入了偏差和噪声,算法在凸和非凸情况下仍然保持稳定。
查看缓存全文
缓存时间: 2026/09/14 08:34
# 带裁剪与加性噪声的随机梯度方法的几乎处处收敛分析
来源:https://arxiv.org/html/2609.12119
刘俊††致谢:Amartya Mukherjee 和 Jun Liu 位于加拿大安大略省滑铁卢市滑铁卢大学应用数学系,邮编 N2L 3G1(邮箱:\(a29mukhe,j\.liu\)@uwaterloo\.ca\)。
###### 摘要
带梯度裁剪和加性噪声的随机梯度下降(\(SGD\))已成为训练机器学习模型的标准技术,尤其在需要鲁棒性或隐私保证的应用中。然而,裁剪会在随机梯度中引入偏差,而加性噪声则会引入额外的方差,这使得单个优化轨迹的长期行为难以刻画。本文证明,在光滑性和随机梯度噪声一致有界的假设下,只要步长满足某些标准衰减条件,带裁剪和加性高斯噪声的随机梯度下降(\(SGD\-CN\))几乎处处(\(a\.s\.\))收敛。我们的分析扩展到动量变体,如随机重球法和Nesterov加速梯度法,其中我们展示了通过仔细的能量构造可以得出类似的保证。这些结果为理解带裁剪随机梯度方法的路径行为提供了更强的理论基础,并表明尽管裁剪和扰动引入了偏差和噪声,该算法在凸和非凸情形下均能保持稳定。
## I引言
梯度裁剪在机器学习模型训练中被广泛使用,以控制大的随机梯度并提高数值稳定性。它在隐私保护优化中也扮演着重要角色,其中裁剪在添加随机噪声之前约束了单个梯度贡献的敏感性\[5 (https://arxiv.org/html/2609.12119#bib.bib4),1 (https://arxiv.org/html/2609.12119#bib.bib5)\]。这些考量催生了将梯度裁剪与加性噪声相结合的随机梯度方法。我们将这类方法称为带裁剪和加性噪声的随机梯度下降(\(SGD\-CN\))。
尽管具有重要的实际意义,裁剪显著改变了随机梯度方法的行为。特别是,即使随机梯度是真实梯度的无偏估计,其裁剪版本也未必保持无偏。由此产生的偏差可能改变预期更新的方向和幅度。加性高斯扰动引入了第二个难题,因为单个迭代在整个训练过程中持续受到随机扰动。相应地,标准无偏\(SGD\)的收敛论证不能直接应用于\(SGD\-CN\)。
近年来,梯度裁剪的收敛行为受到了广泛关注。多项工作在随机梯度噪声或裁剪操作几何的假设下分析了带裁剪的随机梯度方法。特别相关的是,\[9 (https://arxiv.org/html/2609.12119#bib.bib10)\]刻画了梯度裁剪引入的随机偏差,并表明,在仅有的标准方差有界假设下,带裁剪的\(SGD\)不一定收敛到精确平稳点。相反,裁剪偏差会产生一个大小取决于随机梯度方差和裁剪阈值的不消失的邻域。这一观察强调,对于固定裁剪阈值的精确收敛,需要随机梯度预言机具有额外的结构。关于梯度裁剪和隐私保护随机优化的相关分析包括\[6 (https://arxiv.org/html/2609.12119#bib.bib9),15 (https://arxiv.org/html/2609.12119#bib.bib11)\],而差分隐私优化也在分布式和多智能体设置中被研究\[7 (https://arxiv.org/html/2609.12119#bib.bib13),3 (https://arxiv.org/html/2609.12119#bib.bib14),8 (https://arxiv.org/html/2609.12119#bib.bib15)\]。
本文中,我们在随机梯度噪声一致有界的假设下,研究\(SGD\-CN\)的几乎处处收敛性。具体而言,我们假设目标函数是光滑的,并且随机梯度噪声是一致有界的。我们表明,尽管裁剪会使随机梯度产生偏差,但只要裁剪阈值相对于随机梯度噪声足够大,其条件均值仍然是一个下降方向。我们的收敛分析基于这一观察。对于\(SGD\-CN\)及其动量变体,我们建立了一个感知裁剪的平稳性度量的几乎处处可加权和性,由此可以得出最佳迭代的收敛速率。然后,我们通过控制梯度范数的振荡,将这些结果加强为最后迭代收敛。
## II预备知识与假设
我们提供正式定义,并引入一些在\(SGD\)收敛分析中常用的假设\[10 (https://arxiv.org/html/2609.12119#bib.bib1),4 (https://arxiv.org/html/2609.12119#bib.bib12)\]。
问题陈述:我们关注求解以下无约束最小化问题
\[\min\_{\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}}f\(\\mathbf\{x\}\),\tag{1}\]
其中\(f:\\mathbb\{R\}^\{d\}\\to\\mathbb\{R\}\),使用带裁剪和加性噪声的随机梯度方法。令\(f^\{\*\}\)为真实最小值。在凸情形下,我们希望证明当\(t\\to\\infty\)时,\(f\(\\mathbf\{x\}\_\{t\}\)\-f^\{\*\}\\to 0\)。在非凸情形下,我们希望证明当\(t\\to\\infty\)时,\(\\nabla f\(\\mathbf\{x\}\_\{t\}\)\\to 0\)。
###### 定义 1(随机梯度下降(\(SGD\)))
\(SGD\)的迭代格式为
\[\mathbf\{x\}\_\{t\+1\}=\\mathbf\{x\}\_\{t\}\-\\alpha\_\{t\}\\mathbf\{g\}\_\{t\},\tag{2}\]
其中\(\\mathbf\{g\}\_\{t\}=\\nabla f\(\\mathbf\{x\}\_\{t\};\\xi\_\{t\}\)\)是在\(\\mathbf\{x\}\_\{t\}\)处的随机梯度,带有随机过程\(\\xi\_\{t\}\),且\(\\alpha\_\{t\}\)是步长。本文假设随机梯度是无偏的,并记\(\\mathbb\{E\}\_\{t\}\[\\mathbf\{g\}\_\{t\}\]=\\nabla f\(\\mathbf\{x\}\_\{t\}\)\)为真实梯度。
###### 定义 2(带裁剪和加性噪声的\(SGD\)\[1 (https://arxiv.org/html/2609.12119#bib.bib5)\])
\(SGD\-CN\)是\(SGD\)的一种修改,其中梯度被裁剪,并向裁剪后的梯度添加噪声。
\[\mathbf\{x\}\_\{t\+1\}=\\mathbf\{x\}\_\{t\}\-\\alpha\_\{t\}\\mathbf\{g\}\_\{t\}^\{CN\},\tag{3}\]
其中带裁剪的含噪随机梯度\(\\mathbf\{g\}\_\{t\}^\{CN\}\)由下式给出:
\[\\mathbf\{g\}\_\{t\}^\{CN\}=\\text\{clip\}\_\{q\}\(\\nabla f\(\\mathbf\{x\}\_\{t\};\\xi\_\{t\}\)\)\+q\\zeta\_\{t\},\tag{4}\]
其中\(\\text\{clip\}\_\{q\}\)函数对\(q\>0\)定义为
\[\\text\{clip\}\_\{q\}\(\\nabla f\(\\mathbf\{x\}\_\{t\};\\xi\_\{t\}\)\)=\\min\\left\(1,\\frac\{q\}\{\\\|\\nabla f\(\\mathbf\{x\}\_\{t\};\\xi\_\{t\}\)\\\|\}\\right\)\\nabla f\(\\mathbf\{x\}\_\{t\};\\xi\_\{t\}\),\tag{5}\]
其中\(\\zeta\_\{t\}\\sim\\mathcal\{N\}\(0,\\sigma\_\{CN\}^\{2\}I\)是独立的零均值高斯噪声,方差为\(\\sigma\_\{CN\}^\{2\}\)。
我们提出以下在\(SGD\)文献中常用的假设\[12 (https://arxiv.org/html/2609.12119#bib.bib2)\]。
###### 假设 1(\(L\)\-光滑性)
\(f\)的下界为\(f^\{\*\}:=\\min\_\{\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}\}f\(\\mathbf\{x\}\)\),其梯度\(\\nabla f\)是\(L\)\-Lipschitz的,即
\[\\\|\\nabla f\(\\mathbf\{x\}\)\-\\nabla f\(\\mathbf\{y\}\)\\\|\\leq L\\\|\\mathbf\{x\}\-\\mathbf\{y\}\|,\tag{6}\]
对所有\(\\mathbf\{x\},\\mathbf\{y\}\\in\\mathbb\{R\}^\{d\}\)。
###### 假设 2(\(\\mu\)\-强凸性)
存在正数常量\(\\mu\>0\)使得
\[f\(\\mathbf\{y\}\)\\geq f\(\\mathbf\{x\}\)\+\\langle\\nabla f\(\\mathbf\{x\}\),\\mathbf\{y\}\-\\mathbf\{x\}\\rangle\+\\frac\{\\mu\}\{2\}\\\|\\mathbf\{y\}\-\\mathbf\{x\}\|^\{2\},\tag{7}\]
对所有\(\\mathbf\{x\},\\mathbf\{y\}\\in\\mathbb\{R\}^\{d\}\)。\(f\)是\(\\mu\)\-强凸的一个推论是
\[\\frac\{1\}\{2\\mu\}\\\|\\nabla f\(\\mathbf\{x\}\)\|^\{2\}\\geq f\(\\mathbf\{x\}\)\-f^\{\*\}\.\tag{8}\]
我们对随机梯度预言机施加以下标准的有界噪声假设。
###### 假设 3(一致有界的随机梯度噪声)
存在常数\(\\sigma\_\{g\}\\geq 0\)使得
\[\\left\\\|\\nabla f\(\\mathbf\{x\};\\xi\)\-\\nabla f\(\\mathbf\{x\}\)\\right\\\|\\leq\\sigma\_\{g\}\\quad\\text\{a\.s\.\}\tag{9}\]
对每个\(\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}\)。
## III关于上鞅的背景与引理
本文的分析基于\[14 (https://arxiv.org/html/2609.12119#bib.bib3)\]中导出的以下结果。在本文剩余部分,我们使用简写符号\(\\mathbb\{E\}\_\{t\}\[\\cdot\]:=\\mathbb\{E\}\_\{t\}\[\\cdot|\\mathcal\{F\}\_\{t\}\]\),其中\(\\mathcal\{F\}\_\{t\}\)是自然信息流。
###### 命题 1
设\(\\{X\_\{t\}\}\)、\(\\{Y\_\{t\}\}\)和\(\\{Z\_\{t\}\}\)是适应于信息流\(\\{\\mathcal\{F\}\_\{t\}\}\)的三个随机变量序列。设\(\\{\\gamma\_\{t\}\}\)是一个非负实数序列,满足\(\\prod\_\{t=1\}^\{\\infty\}\(1\+\\gamma\_\{t\}\)<\\infty\)。假设以下条件成立:
1. 对所有\(t\\geq 1\),\(X\_\{t\},Y\_\{t\},Z\_\{t\}\)非负。
2. 对所有\(t\\geq 1\),\(\\mathbb\{E\}\[Y\_\{t\+1\}|\\mathcal\{F\}\_\{t\}\]\\leq\(1\+\\gamma\_\{t\}\)Y\_\{t\}\-X\_\{t\}\+Z\_\{t\}\)。
3. \(\\sum\_\{t=1\}^\{\\infty\}Z\_\{t\}<\\infty\)几乎处处成立。
那么,我们有
\[\\sum\_\{t=1\}^\{\\infty\}X\_\{t\}<\\infty\\quad\\text\{a\.s\.,\}\tag{10}\]
且\(Y\_\{t\}\)几乎处处收敛。
以下结果来自\[10 (https://arxiv.org/html/2609.12119#bib.bib1)\],用于非凸情形的收敛结果。
###### 引理 1(\[10 (https://arxiv.org/html/2609.12119#bib.bib1)\]的引理 2)
设\(\\{X\_\{t\}\}\)是一个非负实数序列,\(\\{\\alpha\_\{t\}\}\)是一个递减的正实数序列,且以下条件成立:
\[\\sum\_\{t=1\}^\{\\infty\}\\alpha\_\{t\}X\_\{t\}<\\infty,\\quad\\sum\_\{t=1\}^\{\\infty\}\\frac\{\\alpha\_\{t\}\}\{\\sum\_\{i=1\}^\{t\-1\}\\alpha\_\{i\}\}=\\infty\.\tag{11}\]
那么,
\[\\min\_\{1\\leq i\\leq t\}X\_\{i\}=o\\left\(\\frac\{1\}\{\\sum\_\{i=1\}^\{t\-1\}\\alpha\_\{i\}\}\\right\)\.\tag{12}\]
我们推导出带裁剪的含噪随机梯度的一些性质,以辅助我们的分析。
###### 命题 2(期望裁剪梯度对齐性)
假设假设 3 成立,并定义
\[\\Psi\_\{q\}\(r\):=\\min\\\{r^\{2\},qr\\\},\\quad r\\geq 0\.\tag{13}\]
那么,对于每个\(\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}\),
\[\\displaystyle\\left\\langle\\nabla f\(\\mathbf\{x\}\),\\mathbb\{E\}\_\{t\}\\left\[\\operatorname\{clip\}\_\{q\}\(\\nabla f\(\\mathbf\{x\};\\xi\)\)|\\mathbf\{x\}\\right\]\\right\\rangle\\geq\\\|\\nabla f\(\\mathbf\{x\}\)\|^\{2\}\-\\\|\\nabla f\(\\mathbf\{x\}\)\\\|\\left\(\\\|\\nabla f\(\\mathbf\{x\}\)\|\\+\\sigma\_\{g\}\-q\\right\)\_\{\+\}\.\tag{14}\]
特别地,如果\(q\>\\sigma\_\{g\}\),则
\[\\left\\langle\\nabla f\(\\mathbf\{x\}\),\\mathbb\{E\}\_\{t\}\\left\[\\operatorname\{clip\}\_\{q\}\(\\nabla f\(\\mathbf\{x\};\\xi\)\)|\\mathbf\{x\}\\right\]\\right\\rangle\\geq\\left\(1\-\\frac\{\\sigma\_\{g\}\}\{q\}\\right\)\\Psi\_\{q\}\\left\(\\\|\\nabla f\(\\mathbf\{x\}\)\|\\right\)\.\tag{15}\]
###### 证明:
固定\(\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}\)并记\(\\mathbf\{g\}:=\\nabla f\(\\mathbf\{x\}\),\\quad\\mathbf\{g\}\_\{\\xi\}:=\\nabla f\(\\mathbf\{x\};\\xi\),\\quad r:=\\\|\\mathbf\{g\}\|\\)。定义\(\\mathbf\{h\}\_\{\\xi\}:=\\operatorname\{clip\}\_\{q\}\(\\mathbf\{g\}\_\{\\xi\}\)。由条件无偏性,\(\\mathbb\{E\}\_\{t\}\[\\mathbf\{g\}\_\{\\xi\}|\\mathbf\{x\}\]=\\mathbf\{g\}\),因此
\[\\displaystyle\\left\\langle\\mathbf\{g\},\\mathbb\{E\}\_\{t\}\[\\mathbf\{h\}\_\{\\xi\}|\\mathbf\{x\}\]\\right\\rangle=\\left\\langle\\mathbf\{g\},\\mathbb\{E\}\_\{t\}\[\\mathbf\{g\}\_\{\\xi\}|\\mathbf\{x\}\]\\right\\rangle\-\\left\\langle\\mathbf\{g\},\\mathbb\{E\}\_\{t\}\[\\mathbf\{g\}\_\{\\xi\}\-\\mathbf\{h\}\_\{\\xi\}|\\mathbf\{x\}\]\\right\\rangle=r^\{2\}\-\\left\\langle\\mathbf\{g\},\\mathbb\{E\}\_\{t\}\[\\mathbf\{g\}\_\{\\xi\}\-\\mathbf\{h\}\_\{\\xi\}|\\mathbf\{x\}\]\\right\\rangle\\geq r^\{2\}\-r\,\\mathbb\{E\}\_\{t\}\[\\\|\\mathbf\{g\}\_\{\\xi\}\-\\mathbf\{h\}\_\{\\xi\}\||\\mathbf\{x\}\]\.\tag{16}\]
根据裁剪算子的定义,\(\\\|\\mathbf\{g\}\_\{\\xi\}\-\\mathbf\{h\}\_\{\\xi\}\|=\\left\(\\\|\\mathbf\{g\}\_\{\\xi\}\|\-q\\right\)\_\{\+\}\)。假设 3 进一步给出\(\\\|\\mathbf\{g\}\_\{\\xi\}\|\\leq\\\|\\mathbf\{g\}\|\\+\\\|\\mathbf\{g\}\_\{\\xi\}\-\\mathbf\{g\}\|\\leq r\+\\sigma\_\{g\}\\quad\\text\{a\.s\.\}\)。因此,
\[\\\|\\mathbf\{g\}\_\{\\xi\}\-\\mathbf\{h\}\_\{\\xi\}\|\\leq\(r\+\\sigma\_\{g\}\-q\)\_\{\+\}\\quad\\text\{a\.s\.\}\]
将其代入 (16) 式得到
\[\\left\\langle\\mathbf\{g\},\\mathbb\{E\}\_\{t\}\[\\mathbf\{h\}\_\{\\xi\}|\\mathbf\{x\}\]\\right\\rangle\\geq r^\{2\}\-r\(r\+\\sigma\_\{g\}\-q\)\_\{\+\},\]
即证明了 (14) 式。现在假设\(q\>\\sigma\_\{g\}\)。如果\(r\+\\sigma\_\{g\}\\leq q\),则\(\\left\\langle\\mathbf\{g\},\\mathbb\{E\}\_\{t\}\[\\mathbf\{h\}\_\{\\xi\}|\\mathbf\{x\}\]\\right\\rangle\\geq r^\{2\}\\geq\\left\(1\-\\frac\{\\sigma\_\{g\}\}\{q\}\\right\)\\Psi\_\{q\}\(r\)\)。否则,\(r\+\\sigma\_\{g\}\>q\),且\(r^\{2\}\-r\(r\+\\sigma\_\{g\}\-q\)=r\(q\-\\sigma\_\{g\}\)\)。如果\(r\\leq q\),则\(r\(q\-\\sigma\_\{g\}\)\\geq\\left\(1\-\\frac\{\\sigma\_\{g\}\}\{q\}\\right\)r^\{2\}\),而如果\(r\>q\),则\(r\(q\-\\sigma\_\{g\}\)=\\left\(1\-\\frac\{\\sigma\_\{g\}\}\{q\}\\right\)qr\)。由于\(\\Psi\_\{q\}\(r\)=\\min\\\{r^\{2\},qr\\\}\),即得所需结果。∎
## IV几乎处处收敛速率分析
本节中,我们建立\(SGD\-CN\)及其随机重球扩展的几乎处处收敛速率。我们的分析基于命题 2 中导出的期望裁剪梯度对齐性。
在本节中,定义\(\\Psi\_\{q\}\(\\cdot\)如 (13) 式。在假设 3 下,如果\(q\>\\sigma\_\{g\}\),命题 2 给出
\[\\left\\langle\\nabla f\(\\mathbf\{x\}\),\\mathbb\{E}\\left\[\\operatorname\{clip\}\_\{q\}\(\\nabla f\(\\mathbf\{x\};\\xi\)\)|\\mathbf\{x\}\\right\]\\right\\rangle\\geq\\kappa\_\{q\}\\Psi\_\{q\}\(\\\|\\nabla f\(\\mathbf\{x\}\)\|\\),\]相似文章
带动量的原始SGD在重尾噪声下的收敛性分析:无需梯度裁剪或归一化
本文首次对带动量的原始SGD在重尾噪声下(无需梯度裁剪或归一化)进行了全面的收敛性分析,揭示了其收敛速率劣于经过裁剪的变体,并在合成函数上进行了实验验证。
超越有界方差:Blum-Gladyshev噪声下非凸优化的方差缩减归一化方法
本文研究了Blum-Gladyshev噪声下的非凸随机优化,其中梯度方差随与初始点的距离增长。证明了带有动量的归一化SGD和方差缩减STORM方法的收敛性保证,在某些条件下达到了极小极大最优速率。
非均匀光滑性下最速下降与Adam的收敛性
本文将非均匀光滑性假设推广到曲率与目标值呈仿射关系的目标函数,证明了最速下降法以及RMSProp和Adam的对角变体的收敛速率,并应用于逻辑回归和神经网络。
马尔可夫噪声下的高概率PL-SGD:最优混合与尾部依赖
本文为PL平滑目标在马尔可夫噪声下的随机梯度下降提供了最优高概率界,填补了期望保证与高概率保证之间的差距,并扩展到重尾设置,给出了匹配的下界。
基于广义Lipschitz光滑性的神经网络梯度下降收敛保证
本文针对任意宽度或深度的通用前馈神经网络,建立了梯度下降的收敛保证。文中使用了一种新颖的广义Lipschitz光滑性条件,该条件适用于常见激活函数和均方误差,且不需要特殊的初始化或数据集要求。