随机动态系统的Adam算法分析
摘要
本文建立了针对时变和非平稳随机系统的Adam优化器的通用理论,在允许非平稳和依赖数据的随机激励条件下,提供了参数跟踪和输出预测误差界。
arXiv:2606.28879v1 Announce Type: new
Abstract: 自适应矩估计算法,即Adam,由于每轮迭代计算复杂度低且经验表现强劲,在现代机器学习中广泛应用。尽管应用广泛,但Adam在时变和非平稳系统中的理论基础仍鲜有探索。实际上,现有Adam类算法的理论分析主要关注时不变模型参数,并明确或隐含地依赖于独立同分布(i.i.d.)数据假设,在此假设下,学习任务可表述为最小化一个具有静态极小点的固定期望目标。然而,在时变和非平稳系统中,这些假设常被违反,因此需要超越传统但理想化的i.i.d.设定进行理论研究。本文的主要目标是通过建立针对时变和非平稳随机系统的Adam通用理论来解决这一挑战性问题。我们将引入一些新技术,用于分析由Adam耦合的一阶和二阶矩递归所引发的非平稳和依赖随机矩阵的乘积,并构建一个融合这两种矩动态的新的随机Lyapunov函数。在允许非平稳和依赖数据的随机激励条件下,我们将显式推导参数跟踪误差和输出预测误差界,量化步长、一阶和二阶动量参数、梯度噪声以及参数漂移的影响。这些界不仅为Adam性能提供了保证,还为超参数选择提供了指导。在合成数据和真实数据上的实验验证了我们的理论和设计指南。
查看缓存全文
缓存时间: 2026/06/30 05:29
# Adam算法用于随机动态系统的分析 来源:https://arxiv.org/html/2606.28879 金一飞 与 郭磊 \\IEEE院士会士,IEEE 本文受国家重点研发计划(编号2024YFC3307200)和国家自然科学基金(编号12288201)资助。 郑鑫与郭磊任职于中国科学院数学与系统科学研究院数学科学国家重点实验室,北京100190,以及中国科学院大学数学科学学院,北京100049。(电子邮箱:[email protected], [email protected])。 金一飞任职于中国科学院大学前沿交叉科学学院,北京101408,以及中国科学院数学与系统科学研究院数学科学国家重点实验室,北京100190。(电子邮箱:[email protected])。 ###### 摘要 自适应矩估计算法(称为Adam)因其每轮迭代计算复杂度低且经验性能优异,在现代机器学习中被广泛使用。尽管应用普遍,但对于时变和非平稳系统,Adam的理论基础仍基本未得到探索。事实上,现有关于Adam类型算法的理论分析主要关注时不变模型参数,并明确或隐含地依赖于独立同分布(i.i.d.)数据假设,在此假设下学习任务可被归结为最小化一个具有静态最小化器的固定期望目标函数。然而,在时变和非平稳系统中,这类假设往往被违反,因此需要对超出传统且理想化的i.i.d.设定进行理论探究。本文的主要目标是通过建立Adam在时变和非平稳随机系统中的一般理论来解决这一具有挑战性的问题。我们将引入一些新技术来分析由Adam耦合的一阶和二阶矩递归所诱导的非平稳且依赖的随机矩阵乘积,并将构造一个新的混合这两种矩动力学的随机李雅普诺夫函数。在允许非平稳和依赖数据的随机激励条件下,我们将明确推导出参数跟踪误差和输出预测误差的上界,量化步长、一阶和二阶动量参数、梯度噪声以及参数漂移的影响。这些上界不仅为Adam性能提供了保证,还为超参数选择提供了指导原则。在合成数据和真实数据上的实验验证了我们的理论和设计指导原则。 \{IEEE关键词\} 随机系统,Adam,自适应滤波,性能界,随机激励,随机矩阵乘积,随机李雅普诺夫函数。 ## 1 引言 自适应矩估计算法(称为Adam)[1 (https://arxiv.org/html/2606.28879#bib.bib1)]是现代机器学习中使用最广泛且最著名的优化方法之一,它通过一阶和二阶矩估计实现自适应坐标步长,在大规模随机优化中产生稳定且鲁棒的更新。它在人工智能领域有广泛应用,包括生成对抗网络(GANs)[2 (https://arxiv.org/html/2606.28879#bib.bib2)]、生成预训练变换器(GPTs)[3 (https://arxiv.org/html/2606.28879#bib.bib3)]、视觉变换器(ViTs)[4 (https://arxiv.org/html/2606.28879#bib.bib4)],以及基于强化学习的反馈控制系统,例如软演员-评论家(SAC)[5 (https://arxiv.org/html/2606.28879#bib.bib5)]。 尽管经验上取得了显著成功,但对Adam的理论理解仍然有限[6 (https://arxiv.org/html/2606.28879#bib.bib6),7 (https://arxiv.org/html/2606.28879#bib.bib7),8 (https://arxiv.org/html/2606.28879#bib.bib8)],尽管已有大量理论工作致力于分析Adam的行为(例如[9 (https://arxiv.org/html/2606.28879#bib.bib9),10 (https://arxiv.org/html/2606.28879#bib.bib10),11 (https://arxiv.org/html/2606.28879#bib.bib11),7 (https://arxiv.org/html/2606.28879#bib.bib7),12 (https://arxiv.org/html/2606.28879#bib.bib12),13 (https://arxiv.org/html/2606.28879#bib.bib13),14 (https://arxiv.org/html/2606.28879#bib.bib14),8 (https://arxiv.org/html/2606.28879#bib.bib8)])。例如,Reddi等人[9 (https://arxiv.org/html/2606.28879#bib.bib9)]揭示了Adam潜在的发散问题,并提出了稳定的变体AMSGrad来解决这些问题。相比之下,Zhang等人[11 (https://arxiv.org/html/2606.28879#bib.bib11)]表明,在适当条件下,原始Adam无需修改其更新规则仍然可以收敛。最近的研究放宽了光滑性或正则性假设,并在更广泛的设定下为Adam建立了精细的收敛保证,包括非均匀光滑性条件[7 (https://arxiv.org/html/2606.28879#bib.bib7),14 (https://arxiv.org/html/2606.28879#bib.bib14)]、广义仿射方差噪声假设[12 (https://arxiv.org/html/2606.28879#bib.bib12)]、非光滑优化[13 (https://arxiv.org/html/2606.28879#bib.bib13)]以及统一收敛框架[8 (https://arxiv.org/html/2606.28879#bib.bib8)]。 然而,现有对Adam类型算法的大多数分析都局限于静态学习场景:它们通常假设时不变模型参数以及i.i.d.或平稳遍历数据。在这些假设下,学习问题简化为最小化一个具有静态最小化器的数学期望下的固定目标函数。然而,在众多令人感兴趣的应用中,Adam被部署在时变和非平稳动态系统中[15 (https://arxiv.org/html/2606.28879#bib.bib15),16 (https://arxiv.org/html/2606.28879#bib.bib16)],其中期望目标及其最小化器可能随时间漂移。这种不匹配使得静态保证不充分,并激发了严格刻画跟踪和预测性能的理论框架。然而,相应的理论基础仍远未成熟。 为应对这一挑战,我们借鉴时变和非平稳场景下自适应辨识的成熟理论,该理论为分析Adam在此类设定中的性能提供了强有力的分析工具。例如,郭磊[17 (https://arxiv.org/html/2606.28879#bib.bib17)]开创性地提出了条件激励(CE)条件,该条件可视为确定性持续激励(PE)要求的随机松弛形式,非常适合反馈驱动的随机控制系统。在该条件下,对于具有非平稳和相关数据的时变随机回归模型,建立了基于卡尔曼滤波的参数跟踪的稳定性和收敛性。随后,郭磊[18 (https://arxiv.org/html/2606.28879#bib.bib18)]提出了更一般的CE条件,为具有时变参数和非平稳数据流的随机回归模型的稳定性和性能分析建立了统一理论,涵盖了若干基础自适应跟踪算法,如卡尔曼滤波器、最小均方(LMS)和遗忘因子递归最小二乘(FFRLS)[18 (https://arxiv.org/html/2606.28879#bib.bib18)]。此外,受具有递减增益的递归随机算法分析中的思想启发[19 (https://arxiv.org/html/2606.28879#bib.bib19)],在[20 (https://arxiv.org/html/2606.28879#bib.bib20),21 (https://arxiv.org/html/2606.28879#bib.bib21),22 (https://arxiv.org/html/2606.28879#bib.bib22)]中对适应增益不衰减的递归跟踪算法进行了更精确的性能分析。值得注意的是,卡尔曼滤波器和FFRLS采用矩阵值的适应增益,体现了它们的牛顿型(二阶)性质。这通常在高维参数设定中带来沉重的计算负担,部分解释了梯度型方法(其中适应增益通常为标量)被广泛使用的原因。 在梯度型算法中,著名的LMS可能是最简单的。然而,[23 (https://arxiv.org/html/2606.28879#bib.bib23)]表明,引入重型球动量项可以加速梯度型算法的收敛。特别地,将此想法应用于LMS得到了动量LMS(MLMS)算法。[24 (https://arxiv.org/html/2606.28879#bib.bib24)]研究了[17 (https://arxiv.org/html/2606.28879#bib.bib17)]中引入的CE条件下时变随机线性系统的MLMS算法,在一般的非平稳流数据设定下建立了跟踪和遗憾界。与大多数现有LMS分析不同,他们的方法通过扩展状态向量以包含动量项,得到了更高维的状态空间表示。这种重构使得对所得随机矩阵乘积的分析更易处理,并为本文研究更流行的Adam算法提供了有用见解。 Adam的理论研究在技术上更具挑战性,因为Adam耦合了一阶和二阶矩估计的自适应递归,并应用了逐坐标、时变的重缩放,导致数据依赖的非线性更新,其分量以不同速率演化且复杂耦合。因此,大多数现有为静态或线性随机场景开发的分析技术不能直接用于为具有非平稳数据集的时变参数建立严格保证。克服这些技术困难并为随机动力系统中的Adam奠定理论基础,是本文的主要目标。我们的主要贡献总结如下。 1. 1.*第一,*我们为Adam在一大类具有时变参数和非平稳数据的非线性随机系统上建立了明确的参数跟踪保证。与大多数针对静态目标且不提供参数跟踪保证的现有Adam分析不同,我们的结果在一般CE条件下给出了跟踪型性能刻画。我们的结果通过引入新的方法分析增广维度下非平稳且依赖的随机矩阵乘积而建立。 2. 2.*第二,*我们为Adam在具有非平稳数据集的时变系统上推导了明确的输出预测误差界。与现有在i.i.d.数据下针对时不变参数设定开发的预测型分析不同,我们的结果*不*需要对系统数据施加任何激励条件。我们的结果通过引入一个新的随机李雅普诺夫函数而建立,该函数基于Adam中一阶和二阶矩的混合构建。 3. 3.*第三,*参数跟踪和输出预测界均是首次建立,它们量化了超参数、梯度噪声和漂移幅度的影响,从而为超参数选择提供了理论指导。 本文的其余部分组织如下。第2节 (https://arxiv.org/html/2606.28879#S2)将介绍问题公式化和Adam算法。第3节 (https://arxiv.org/html/2606.28879#S3)将建立参数跟踪和输出预测性能的主要结果,随后在第4节 (https://arxiv.org/html/2606.28879#S4)给出证明。第5节 (https://arxiv.org/html/2606.28879#S5)将通过在合成数据集和真实数据集上的仿真和实验验证理论发现,结果支持所提出的超参数选择指导原则。最后,第6节 (https://arxiv.org/html/2606.28879#S6)将给出一些评述性结论。 记号。对于矩阵 $A$,$\lambda_{\min}(A)$ 和 $\lambda_{\max}(A)$ 分别表示其最小和最大特征值。对于对称矩阵 $A$ 和 $B$,$A \succeq B$(相应地,$A \succ B$)表示 $A-B$ 是半正定(相应地,正定),$A \preceq B$(相应地,$A \prec B$)表示 $B \succeq A$(相应地,$B \succ A$)。$A$ 的转置记作 $A^{\mathrm{T}}$,$\|A\|$ 表示诱导欧几里得范数 $\|A\| = \sqrt{\lambda_{\max}(A^{\mathrm{T}}A)}$。数学期望算子记作 $\mathbb{E}[\cdot]$,$\mathbb{E}[\cdot \mid \mathcal{F}_k]$ 表示关于 $\mathcal{F}_k$ 的条件期望,其中 $\{\mathcal{F}_k\}_{k \ge 0}$ 是一个非递减的 $\sigma$-代数序列。随机序列 $\{x_k, \mathcal{F}_k\}$ 若对于所有 $k \ge 0$,$x_k$ 是 $\mathcal{F}_k$-可测的,则称其为适匹的。对于实序列 $\{a_k\}$ 和 $\{b_k\}$,其中 $b_k > 0$,$a_k = o(b_k)$ 表示 $a_k/b_k \to 0$,$a_k = O(b_k)$ 表示 $|a_k| \le M b_k$ 对于某个常数 $M > 0$。最后,$\mathbf{0}$ 和 $I$ 分别表示零矩阵和单位矩阵。 ## 2 问题公式化与算法 ### 2.1 问题公式化 我们考虑时变随机非线性模型 \[ y_{k+1} = G_k(\phi_k, \theta_k, \varepsilon_{k+1}), \quad k \ge 0, \] (1) 其中 $y_{k+1} \in \mathbb{R}$ 是系统观测,$\phi_k \in \mathbb{R}^{d_1}$($d_1 \ge 1$)是随机回归量,$\theta_k \in \mathbb{R}^{d_2}$($d_2 \ge 1$)是待估计的未知时变参数,$\varepsilon_{k+1}$ 表示随机噪声。映射 $G_k: \mathbb{R}^{d_1} \times \mathbb{R}^{d_2} \times \mathbb{R} \to \mathbb{R}$ 是已知的。此外,参数变化过程由序列 $\{\Delta_k\}_{k \ge 1}$ 刻画,其中 \[ \Delta_k \triangleq \theta_k - \theta_{k-1}, \quad k \ge 1. \] (2) 给定由 (1) 生成的数据流,在每个时刻 $k$,我们基于 $\mathcal{F}_k'$ 形成一步超前预测 $\hat{y}_{k+1}$,其中 $\mathcal{F}_k'$ 是由截至时刻 $k$ 的可用信息生成的 $\sigma$-代数,即 $\mathcal{F}_k' = \sigma\{y_i, \phi_i, i \le k\}$。在观测到 $y_{k+1}$ 后,预测误差由瞬时损失 \[ \mathcal{L}\!\left(y_{k+1}, \hat{y}_{k+1}\right) \] (3) 量化,其中 $\mathcal{L}: \mathbb{R} \times \mathbb{R} \to \mathbb{R}^+$ 是给定的损失函数,度量观测 $y_{k+1}$ 与预测 $\hat{y}_{k+1}$ 之间的差异。不失一般性,我们假设 $\hat{y}_{k+1}$ 可由以下参数化表示描述 \[ \hat{y}_{k+1}(\vartheta) = f_k(\phi_k, \vartheta), \quad k \ge 0, \] (4) 其中映射 $f_k(\cdot, \cdot)$ 是已知的,且 $\vartheta \in \mathbb{R}^{d_2}$。 那么,一个 $\mathcal{F}_k'$-可测的一步超前预言预测器 $\hat{y}_{k+1}^*$ 可定义为 $\hat{y}_{k+1}^* = f_k(\phi_k, \theta_k^*)$。
相似文章
Adam在重尾噪声下的收敛行为
本文为普通向量形式的Adam优化器在重尾随机噪声下建立了首个收敛保证,表明其收敛到驻点,但迭代复杂度次优;当已知域半径时,可提升至最优速率。
针对边缘稳定性下 Adam 优化器的杆流模型
本文提出了一种适用于 Adam 及其他自适应优化器的“杆流”模型,以更好地分析其在边缘稳定性(Edge of Stability)下的行为。该研究将连续时间建模扩展至动量方法,结果表明,与稳定的流模型相比,该模型在追踪离散迭代点方面具有更高的准确性。
非均匀光滑性下最速下降与Adam的收敛性
本文将非均匀光滑性假设推广到曲率与目标值呈仿射关系的目标函数,证明了最速下降法以及RMSProp和Adam的对角变体的收敛速率,并应用于逻辑回归和神经网络。
重新审视 Adam 在流式强化学习中的应用
本文重新审视了 Adam 优化器在流式强化学习中的应用,证明经过适当调优后,DQN 和 C51 等成熟方法表现良好。作者提出了自适应 Q(lambda) 算法,该算法将资格迹与 Adam 的方差自适应特性相结合,在 55 款 Atari 游戏中超越了现有的流式强化学习方法。
热力学权重衰减:通过注意力比热探讨顿悟加速
本文引入了CvAdamW,一种AdamW变体,它通过监测注意力比热来检测顿悟相变,并动态调整权重衰减,在基线失败的模算术任务上实现了顿悟。