理解非凸优化中的无调度方法:速率保证与逃离鞍点

arXiv cs.LG 论文

摘要

本文为无调度梯度下降和无调度随机梯度下降在非凸优化中提供了最坏情况收敛性分析,建立了最优速率和严格鞍点规避,从而从理论上证明了其实验成功。

arXiv:2607.09167v1 公告类型:新 摘要:无调度方法因减轻了设计调优学习率调度器的负担而日益受到关注,同时能与带有调优调度器的优化器匹敌甚至有时表现更优。尽管其实验效果显著,但在非凸优化(现代机器学习目标通常出现的领域)中的收敛理论在很大程度上尚未被探索。在本文中,我们提供了无调度梯度下降和无调度随机梯度下降在标准形式下且无需辅助修改或限制条件的最坏情况分析,针对光滑但可能非凸的目标函数。基于从这些方法相关的连续时间极限常微分方程导出的李雅普诺夫分析,我们证明无调度梯度下降和无调度随机梯度下降达到了一阶方法中可实现的最优最坏情况收敛速率。我们进一步将无调度梯度下降表述为非自治动力系统,并证明在任意小的单次扰动下可避免严格鞍点。这些理论结果有助于更好地理解无调度方法所展现的强大性能。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

# 理解非凸优化中的无调度方法:速率保证与鞍点逃离  
来源:https://arxiv.org/html/2607.09167  

Jiseok Chae  
自然科学研究院  
KAIST  
韩国 大田  
jsch@kaist\.ac\.kr  

&Donghwan Kim  
数学科学系  
KAIST  
韩国 大田  
donghwankim@kaist\.ac\.kr  

###### 摘要  

无调度方法由于能够减轻设计和调整学习率调度器的负担,同时匹配甚至有时超越经过调优的调度器的性能,因而日益受到关注。尽管其强大的实验结果令人印象深刻,但在现代机器学习目标通常出现的非凸优化中,其收敛理论在很大程度上仍未得到探索。本文对标准形式的无调度梯度下降和无调度随机梯度下降进行了最坏情况分析,不依赖辅助修改或限制性条件,研究对象是光滑但可能非凸的目标函数。基于从这些方法相关的连续时间极限常微分方程导出的 Lyapunov 分析,我们表明无调度梯度下降和无调度随机梯度下降能够达到一阶方法中可实现的最优最坏情况收敛速率。我们进一步将无调度梯度下降建模为一个非自治动力系统,并证明在任意小的单次扰动下,它能够严格避免鞍点。这些理论结果有助于更好地理解无调度方法表现出的强大性能。  

## 1 引言  

存在许多一阶方法可用于解决最小化问题  

\[
\min_{\bm{x}\in\mathbb{R}^d} f(\bm{x}),
\tag{1}
\]

范围涵盖经典的*梯度下降*(GD)和*随机梯度下降*(SGD),以及如今在机器学习社区中成为标准的 Adam(Kingma 和 Ba, 2015 (https://arxiv.org/html/2607.09167#bib.bib17))和 AdamW(Loshchilov 和 Hutter, 2019 (https://arxiv.org/html/2607.09167#bib.bib20))等方法。在现代机器学习任务中,此类一阶方法通常与学习率*调度器*配合使用,调度器会根据预定义规则在训练过程中改变学习率。然而,由于训练动态在事前很大程度上不可预测,学习率调度器的选择和设计历来严重依赖临时方法和启发式策略。  

无调度方法(Defazio 等人, 2024 (https://arxiv.org/html/2607.09167#bib.bib9))是一种优化方案,旨在消除对通常难以设计和调整的手工学习率调度器的需求。无调度方法的更新规则结合了迭代平均技术和基于给定基础优化器的类动量插值,定义如下:  

\[
\begin{aligned}
\bm{y}_k &= (1-\beta)\bm{z}_k + \beta\bm{x}_k \\
\bm{z}_{k+1} &= \bm{z}_k - \gamma_k \bm{g}_k \\
\bm{x}_{k+1} &= (1-c_{k+1})\bm{x}_k + c_{k+1}\bm{z}_{k+1}
\end{aligned}
\tag{2}
\]

其中初始点 \(\bm{x}_0 = \bm{z}_0\),\(\beta\in[0,1]\) 是固定常数,\(\{\gamma_k\}_{k\geq 0}\) 是学习率序列(通常设为常数序列),\(\{c_{k+1}\}_{k\geq 0}\) 是预定义的平均速率序列(满足 \(c_{k+1}\in[0,1]\)),而 \(\bm{g}_k\) 是基础优化器在 \(\bm{y}_k\) 处产生的更新方向。例如,无调度随机梯度下降(SF-SGD)使用 \(\bm{g}_k = \nabla f(\bm{y}_k, \zeta_k)\),其中 \(\zeta_k\) 是反映梯度评估中随机性的随机变量,与标准 SGD 类似。  

对无调度方案的一个显著理解是将其视为两种众所周知的平均方案之间的插值。当 \(\beta=0\) 时,在标准选择 \(c_{k+1}=\frac{1}{k+1}\) 下,无调度方法退化为*Polyak–Ruppert 平均*(Polyak, 1990 (https://arxiv.org/html/2607.09167#bib.bib27);Ruppert, 1988 (https://arxiv.org/html/2607.09167#bib.bib28)),此时 \(\bm{x}_k\) 成为对计算出的迭代点 \(\bm{y}_0,\dots,\bm{y}_k\) 的均匀平均。在另一个极端,当 \(\beta=1\) 时,无调度方法退化为一种称为*原始平均*(Nesterov 和 Shikhman, 2015 (https://arxiv.org/html/2607.09167#bib.bib24);Tao 等人, 2018 (https://arxiv.org/html/2607.09167#bib.bib31))的方案。尽管存在这种联系,\(\beta=1\) 在无调度方法中很少使用。实践中对于 \(\beta\) 的一些常见选择是 0.9 和 0.98,这遵循了 Defazio 等人(2024 (https://arxiv.org/html/2607.09167#bib.bib9))的原始实验。由于 \(\beta=1\) 的情况已在原始平均的先前工作中得到充分研究,本文重点关注 \(\beta<1\) 的情况。  

无调度方法不仅因为它们减轻了与学习率调度相关的复杂性,还因为它们在深度学习实际任务中表现出的强大性能,而引起了学界的广泛兴趣。最近的 AlgoPerf 挑战赛(Dahl 等人, 2023 (https://arxiv.org/html/2607.09167#bib.bib7))的结果凸显了这一点,该挑战赛对大规模深度学习任务上的各种优化算法进行了基准测试。尽管在现代机器学习应用(其底层目标通常是非凸的)中取得了实验成功,无调度方法的收敛保证此前仅在凸设置下可用。Defazio 等人(2024 (https://arxiv.org/html/2607.09167#bib.bib9))引入了该方法,并提供了凸设置下的收敛速率分析。已有一些尝试将收敛保证扩展到非凸场景,例如通过应用在线到非凸转换框架(Ahn 等人, 2025 (https://arxiv.org/html/2607.09167#bib.bib2))或直接构建定制的 Lyapunov 势(Brown 等人, 2025 (https://arxiv.org/html/2607.09167#bib.bib4))。然而,正如我们在第 2 节 (https://arxiv.org/html/2607.09167#S2) 中详细说明的,这些分析存在明显的局限性,例如关注特定的参数选择或需要随机化 \(\beta\) 等参数。因此,非凸设置下无调度方法的全面收敛分析在很大程度上仍未得到探索。  

### 1.1 我们的贡献  

为了解决这一空白,我们在光滑且可能非凸的目标函数下,通过梯度位置迭代点的最坏情况收敛、动态过程的严格鞍点避免以及实践中常用的评估迭代点的最坏情况行为,来分析无调度方法。我们的贡献如下:  

- •首先,我们考虑 SF-GD 的连续时间极限 ODE。我们构建了它的 Lyapunov 函数,并证明 SF-ODE 的解在梯度平方范数 \(\|\nabla f\|^2\) 方面达到 \(O(1/T)\) 衰减率。  
- •基于连续时间极限 ODE 的分析,我们建立了离散时间无调度方法的收敛速率分析。这些结果表明,由 SF-GD 和 SF-SGD 计算的 \(\{\bm{y}_k\}_{k\geq 0}\) 达到了一阶方法已知的最坏情况最优速率(Arjevani 等人, 2023 (https://arxiv.org/html/2607.09167#bib.bib3);Carmon 等人, 2021 (https://arxiv.org/html/2607.09167#bib.bib5))。特别地,我们证明了这些方法“原样”使用的收敛速率,而此前的工作需要分析经过特定修改的变体或要求仔细的参数调整。  
- •我们将 SF-GD 作为一个非自治动力系统进行研究,并证明在任意小的单次扰动后,它几乎必然地避免严格鞍点。因此,在通常的严格鞍点景观假设下,收敛的无调度轨迹表现出与 GD 相同的定性行为,即只收敛到局部极小点而非鞍点。  
- •我们使用性能估计问题(PEP)框架直接研究平均评估序列 \(\{\bm{x}_k\}_{k\geq 0}\)。PEP 结果表明,\(\{\bm{x}_k\}_{k\geq 0}\) 的最坏情况行为可能比 \(\{\bm{y}_k\}_{k\geq 0}\) 更差。尽管如此,我们讨论了这种差距如何与 \(\{\bm{x}_k\}_{k\geq 0}\) 的强大实验性能共存。  

### 1.2 问题设定  

我们考虑最小化问题 (1) (https://arxiv.org/html/2607.09167#S1.E1),其中目标函数 \(f:\mathbb{R}^d\to\mathbb{R}\) 是可微且可能非凸的。为了分析,我们进一步施加标准的光滑性假设。  

###### 假设 1.1(光滑性)。给定某个 \(L>0\),\(f\) 是 *\(L\)-光滑*的;即对于任意 \(\bm{x},\bm{y}\in\mathbb{R}^d\),
\[
\left\lVert\nabla f(\bm{x})-\nabla f(\bm{y})\right\rVert \leq L \left\lVert\bm{x}-\bm{y}\right\rVert.
\]

为避免诸如最小化仿射函数等病态情况,我们还施加以下假设。  

###### 假设 1.2(有限下确界)。目标函数 \(f\) 被常数 \(f^*\) 下方有界。

我们主要关注无调度方法中基础优化器为 GD(即 \(\bm{g}_k = \nabla f(\bm{y}_k)\))或 SGD(即 \(\bm{g}_k = \nabla f(\bm{y}_k, \zeta_k)\))的情况,其中 \(\nabla f(\,\cdot\,,\zeta)\) 表示随机梯度 oracle,\(\{\zeta_k\}_{k\geq 1}\) 是反映梯度评估中随机性的随机变量序列。对于该随机梯度 oracle,我们假设它产生 \(\nabla f\) 的无偏估计且方差有界。  

###### 假设 1.3(随机梯度)。存在某个 \(\sigma^2\geq 0\),使得对任意 \(\bm{x}\in\mathbb{R}^d\),随机梯度 oracle 满足:  
1. (i) \(\operatorname{\mathbb{E}}[\nabla f(\bm{x},\zeta)] = \nabla f(\bm{x})\),  
2. (ii) \(\operatorname{\mathbb{E}}\bigl[\left\lVert\nabla f(\bm{x},\zeta)-\nabla f(\bm{x})\right\rVert^2\bigr] \leq \sigma^2\)。

## 2 相关工作  

#### 无调度方法的收敛分析  
Defazio 等人(2024 (https://arxiv.org/html/2607.09167#bib.bib9))提供了当目标函数 \(f\) 为凸时 SF-SGD 的收敛保证,但非凸收敛理论在很大程度上仍是开放的。Ahn 等人(2025 (https://arxiv.org/html/2607.09167#bib.bib2))首次尝试在非凸场景下获得无调度方法的收敛界。基于在线到非凸转换框架,他们的讨论也扩展到 \(f\) 为*非光滑*的情况。与此同时,Brown 等人(2025 (https://arxiv.org/html/2607.09167#bib.bib4))声称通过构建针对非凸光滑目标定制的 Lyapunov 势,给出了一个相对更简单、更直接的收敛性证明。然而,这两项工作都存在局限性,无法被视为提供了非凸场景下无调度方法的全面收敛证明。  

Ahn 等人(2025 (https://arxiv.org/html/2607.09167#bib.bib2))的分析建立了最坏情况最优速率,但仅针对特定的参数选择,并且还需要额外的修改,例如使 \(\beta\) 成为每次迭代重新采样的随机变量。与此同时,Brown 等人(2025 (https://arxiv.org/html/2607.09167#bib.bib4))提出了几个依赖于平均速率 \(\{c_{k+1}\}_{k\geq 0}\) 选择的收敛速率。然而,所声称的速率大多次优,特别是在标准选择 \(c_{k+1}=\frac{1}{k+1}\) 下,最多仅为 \(O(\frac{1}{\log T})\),其中 \(T\) 是总迭代次数。此外,他们的结果似乎仅在 \(\beta=1\) 时成立,因为证明依赖于一个我们认为对 \(\beta<1\) 不成立的前提。有关这些局限性的更多细节,请参见附录 B (https://arxiv.org/html/2607.09167#A2)。相比之下,我们的收敛速率分析适用于广泛的 \(\beta\),并且研究的是未做任何修改的“原样”无调度方法。  

#### 梯度位置序列与评估序列  
从无调度方法得到的序列 \(\{\bm{y}_k\}_{k\geq 0}\) 被称为*梯度位置*序列,而序列 \(\{\bm{x}_k\}_{k\geq 0}\) 被称为*评估*序列。前者之所以如此命名,显然是因为 (2b) (https://arxiv.org/html/2607.09167#S1.E2.2) 式。后者之所以如此命名,是因为 Defazio 等人(2024 (https://arxiv.org/html/2607.09167#bib.bib9))关于无调度方法的原始工作主张将 \(\{\bm{x}_k\}_{k\geq 0}\) 作为“主要”迭代点,用作构建模型时的训练参数。自那以后,将 \(\{\bm{x}_k\}_{k\geq 0}\) 视为主输出序列已成为标准做法。尽管如此,Song 等人(2025 (https://arxiv.org/html/2607.09167#bib.bib30))观察到 \(\{\bm{y}_k\}_{k\geq 0}\) 不仅仅是一个辅助序列。特别地,他们表明 \(\{\bm{y}_k\}_{k\geq 0}\) 表现出*稳定性边缘*(Cohen 等人, 2021 (https://arxiv.org/html/2607.09167#bib.bib6))行为(这是神经网络训练中一个记录良好的大学习率现象),并且在所谓的*河谷*损失景观(Wen 等人, 2025 (https://arxiv.org/html/2607.09167#bib.bib33))上,它比 \(\{\bm{x}_k\}_{k\geq 0}\) 更紧密地遵循低损失路径(通常称为*河流*)。他们还报告了一个语言模型训练示例,其中在 \(\{\bm{y}_k\}_{k\geq 0}\) 处进行评估比在 \(\{\bm{x}_k\}_{k\geq 0}\) 处进行评估能得到更好的性能。这些观察结果促使我们将 \(\{\bm{y}_k\}_{k\geq 0}\) 本身作为一个优化序列进行研究,同时兼顾实际广泛使用的 \(\{\bm{x}_k\}_{k\geq 0}\)。  

#### 性能估计问题  
性能估计问题(PEP)框架(Drori 和 Teboulle, 2014 (https://arxiv.org/html/2607.09167#bib.bib12))提供了一个系统性的工具箱,用于在指定函数类上数值计算一阶方法的最坏情况收敛保证。在许多情况下,所得的最坏情况界可以表示为半定规划问题,从而将大量分析从手动不等式链转移到求解单个凸优化问题。PEP 已被用于获得广泛方法和问题结构的尖锐保证,从普通梯度下降到近端方法和算子分裂方案(Ryu 等人, 2020 (https://arxiv.org/html/2607.09167#bib.bib29);Abbaszadehpeivasti 等人, 2022 (https://arxiv.org/html/2607.09167#bib.bib31))。

相似文章