从下降方向学习:单侧赫尔德正则性下的自适应梯度下降

arXiv cs.LG 论文

摘要

本文提出了一种自适应梯度下降方法,利用单侧赫尔德正则性根据方向曲率而非全梯度变化来控制步长,为非凸目标函数提供了收敛保证,并展示了实证优势。

arXiv:2607.22906v1 公告类型:新论文 摘要:我们研究了在单侧赫尔德正则性条件下,针对连续可微(可能非凸)目标函数的自适应梯度下降。与经典赫尔德或利普希茨梯度假设不同(这些假设控制全梯度变化),我们的条件仅约束下降不等式中出现的方向项。当大梯度变化与更新方向正交或对其有利时,这可以允许使用较小保守的步长。我们提出了一种基于正单侧赫尔德曲率估计的自适应标量步长方法,并结合了简单的充分下降保护机制。对于包含可接受更新段的凸区域上的非凸目标函数,我们证明了显式的最佳迭代驻点界,其速率由赫尔德指数决定。与预定的递减步长方案不同,该方法会自适应于局部下降几何。我们在两个旨在分离方向曲率与全梯度变化的全批量基准上评估了该方法。在一个二分类问题上,该方法在比较的标量梯度方法中实现了最低的最终交叉熵、目标值和梯度范数,同时拥有最大的分类间隔。在一个非凸赫尔德回归问题上,它达到了最低的最终目标差距和梯度范数。这些结果表明,当全梯度变化被不阻碍下降的方向夸大时,单侧赫尔德曲率是一种有效的自适应步长信号。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:23

# 从下降方向学习:单侧 Hölder 正则性下的自适应梯度下降  
来源:https://arxiv.org/html/2607.22906  
Ismail Huseynov  
Physikalisch-Technische Bundesanstalt (PTB), Germany  
Technical University of Berlin, Germany  

###### 摘要  
我们研究了在单侧 Hölder 正则性条件下,针对连续可微、可能非凸目标函数的自适应梯度下降方法。经典的 Hölder 梯度和 Lipschitz 梯度假设控制梯度变化的完整范数,当大部分梯度变化与下降方向正交或对其有利时,这种假设可能导致保守的步长。受此观察启发,我们基于单侧 Hölder 曲率估计提出一种自适应梯度方法,该方法仅控制下降不等式中出现的方向项。这种方向估计比完整的 Hölder 梯度连续性更弱,并且与实际的更新方向更直接对齐。所提出的方法根据估计的正方向曲率选择标量步长,并结合简单的充分下降保护机制。对于在包含可接受更新段的凸区域上的连续可微非凸目标,我们证明了一个明确的最佳迭代驻点保证,其速率由 Hölder 指数决定。因此,与预设的递减步长方案不同,该方法自适应于局部下降几何,而非仅依赖迭代计数。我们在两个旨在分离正方向曲率与完整梯度变化的全批量受控基准上评估了该方法。在二分类基准中,所提出的单侧 Hölder 方法在比较的标量梯度方法中获得了最低的最终交叉熵、目标值和梯度范数,同时获得了最大的分类间隔。在非凸 Hölder 回归基准中,它获得了最低的最终目标差距和最终梯度范数。这些结果支持当完整梯度变化被不阻碍下降的方向放大时,单侧 Hölder 曲率是一种有效的自适应步长信号。

## 1 引言  
梯度下降及其变体仍然是机器学习中大规模优化的基本工具。它们的标准非凸分析通常从梯度的全局 Lipschitz 连续性开始:存在 \(L>0\),使得  

\[
\|\nabla F(x) - \nabla F(y)\| \leq L \|x - y\|, \quad x, y \in \mathbb{R}^d.
\]  

对于有下界的可微目标,此假设产生经典的最佳迭代驻点保证  

\[
\min_{0 \leq k < K} \|\nabla F(x_k)\|^2 \leq O\left(\frac{L}{K}\right).
\]  

Hölder 梯度连续性是 Lipschitz 条件的直接推广。目标 \(F\) 被称为具有指数 \(\alpha \in (0,1]\) 和常数 \(L_\alpha > 0\) 的 Hölder 连续梯度,若  

\[
\|\nabla F(x) - \nabla F(y)\| \leq L_\alpha \|x - y\|^\alpha, \quad x, y \in \mathbb{R}^d.
\]  

\(\alpha=1\) 的情形恢复 (1)。Hölder 梯度模型出现在通用梯度方法和具有非 Lipschitz 梯度的优化问题的最坏情况复杂度分析中(Nesterov, 2015; Cartis et al., 2017; Yashtini, 2016)。这些模型很有用,因为它们涵盖了梯度连续但非 Lipschitz 的目标函数。然而,它们仍然对梯度变化施加了全范数控制,因此可能高估实际与下降相关的曲率。

Ahmadova (2025) 的近期工作研究了在相关的单侧正则性假设下,具有预设递减步长条件的梯度下降系统的收敛性。此类方案一旦确定衰减计划就能建立到驻点的收敛性,但其性能依赖于所选的衰减指数。这促使我们寻求一种自适应替代方案:步长不应作为迭代计数的函数预先指定,而应根据沿下降方向观测到的局部单侧曲率进行选择。本文在单侧 Hölder 曲率条件下开发了这样一种自适应策略。

我们称 \(F\) 在凸集 \(Q\) 上满足指数 \(\alpha \in (0,1]\) 和常数 \(c_\alpha > 0\) 的单侧 Hölder 曲率条件,如果  

\[
\langle \nabla F(x) - \nabla F(y), x - y \rangle \leq c_\alpha \|x - y\|^{1+\alpha}, \quad x, y \in Q.
\]  

此处 \(c_\alpha\) 是上方向曲率常数。由 Cauchy–Schwarz 不等式,(3) 蕴含 (4) 且 \(c_\alpha \leq L_\alpha\)。反之一般不成立。当完整梯度变化很大但大部分与位移方向正交或对其有利时,单侧条件可以以更小的常数满足。对于 \(\alpha=1\),(4) 变为单侧 Lipschitz 曲率条件:

\[
\langle \nabla F(x) - \nabla F(y), x - y \rangle \leq c \|x - y\|^2.
\]  

对于二次连续可微目标,这控制了 \(\nabla^2 F(x)\) 的最大特征值,而经典 Lipschitz 梯度条件控制的是谱范数。因此大的负曲率不必迫使步长变小。这种单侧 Lipschitz 或对数范数类型条件在稳定性分析和自适应时间步长中是经典的,也出现在现代基于收缩的学习模型中(Söderlind and Wang, 2006; Jafarpour et al., 2021)。

(4) 的算法作用可从以下下降计算中看出。令 \(g = \nabla F(x)\) 并考虑 \(x^+ = x - \eta g\)。则  

\[
F(x - \eta g) \leq F(x) - \eta \|g\|^2 + \frac{c_\alpha}{1+\alpha} \eta^{1+\alpha} \|g\|^{1+\alpha}.
\]  

平衡下降项和单侧 Hölder 余项给出自适应尺度  

\[
\eta \asymp c_\alpha^{-1/\alpha} \|\nabla F(x)\|^{(1-\alpha)/\alpha}.
\]  

当 \(\alpha=1\) 时,这简化为通常的恒定步长平滑情形。当 \(0<\alpha<1\) 时,步长在接近驻点时自动减小。得到的规则是自适应的,因为收缩由当前梯度范数和估计的方向曲率控制,而非固定的迭代相关计划。

#### 贡献。  
本文的主要贡献如下:  
1. **单侧 Hölder 下降模型**:我们制定了在单侧 Hölder 曲率条件 (4) 下的梯度下降。这用直接出现在下降不等式中的正方向曲率项替换了完整梯度变化。  
2. **自适应标量步长规则**:我们从 (5) 推导出自适应单侧 Hölder 步长尺度。该规则使用局部方向曲率和当前梯度范数,因此不需要预设衰减计划。  
3. **带保护方法的驻点理论**:对于包含可接受更新段的凸区域上的连续可微非凸目标,我们证明了一个明确的最佳迭代驻点保证,其 Hölder 速率为 \(O(K^{-\alpha/(1+\alpha)})\)。我们同时陈述了实现方法所需的相关充分下降和回溯结论。  
4. **与标量曲率基线比较**:我们将所提出的单侧 Hölder 规则与固定步长 GD、递减步长 GD、全局 Lipschitz、单侧 Lipschitz 和全局 Hölder 标量步长规则进行比较。这些方法作为基线用于隔离单侧 Hölder 曲率的影响,而非作为额外贡献。  
5. **受控数值基准**:我们在两个受控全批量基准上评估了该方法:一个二分类基准和一个非凸 Hölder 回归基准。在这两种设置中,设计都分离了正方向曲率与完整梯度变化,且 OSH 在比较的标量求解器中获得了所选的最佳驻点和基于损失的指标。

#### 组织结构。  
第 2 节回顾了线搜索、Hölder 平滑性、单侧正则性以及超越驻点收敛的相关工作。第 3 节介绍了正则性模型、曲率估计和标量步长建议。第 4 节发展了单侧 Hölder 下降分析、自适应驻点速率以及带保护的收敛保证。第 5 节展示了受控的分类和回归基准。证明和重现细节在附录中提供。

## 2 相关工作  

#### 线搜索与自适应步长。  
经典线搜索方法通过充分下降条件而非固定全局光滑常数来选择步长。Armijo 规则(Armijo, 1966)是标准例子。我们的方法仅将此充分下降原则用作保护机制:初始步长建议源自沿下降方向的单侧 Hölder 曲率估计。这将该方法与 Barzilai–Borwein 步长(Barzilai and Borwein, 1988)(使用连续迭代的谱信息)以及局部超调控制(Malitsky and Mishchenko, 2020)(使用梯度差自适应步长)区分开来。它也不同于坐标自适应方法如 AdaGrad、Adam、AMSGrad 和 AdamW(Duchi et al., 2011; Kingma and Ba, 2015; Reddi et al., 2018; Loshchilov and Hutter, 2019),这些方法通过累积梯度或动量信息而非标量方向曲率模型来调整步长。

#### 单侧 Hölder 正则性。  
Ahmadova (2025) 研究了单侧 Hölder 正则性条件下的梯度下降,并使用预设递减步长证明了到驻点的收敛性。相比之下,我们从单侧 Hölder 下降不等式本身推导出自适应步长规则。因此步长取决于当前梯度范数和估计的方向曲率,而非取决于预设的衰减指数。这为带保护的自适应方法带来了一个明确的最佳迭代驻点速率。关于递减步长与自适应步长的更详细比较见附录 B。

#### Hölder 与广义平滑性。  
通用梯度方法在凸优化中自适应于未知的 Hölder 平滑性(Nesterov, 2015),而在非凸优化中,已知 Hölder 连续梯度下的评估复杂度结果(Cartis et al., 2017)。超越 Lipschitz 梯度连续性的下降分析也在更广泛的一阶设置中得到发展(Bauschke et al., 2017)。这些工作依赖于全范数梯度变化控制。近期的广义平滑性和裁剪分析同样超越了均匀 Lipschitz 梯度假设(Zhang et al., 2020; Faw et al., 2023; Gorbunov et al., 2025)。我们的关注点不同:我们用沿实际更新方向足以进行下降的正方向曲率项替换了完整梯度变化。

#### 超越驻点。  
驻点速率本身并不意味着迭代收敛或目标间隙速率。更强的结论需要额外的几何结构,如 Polyak–Łojasiewicz 不等式(Polyak, 1963; Karimi et al., 2016)、二次增长、误差界或 Kurdyka–Łojasiewicz 结构(Attouch et al., 2013; Bolte et al., 2014)。因此,我们的主要非凸保证陈述为最佳迭代驻点结果,额外的结论仅在更强的几何假设下记录。

## 3 背景  
令 \(F: \mathbb{R}^d \to \mathbb{R}\) 连续可微。考虑梯度下降  

\[
x_{k+1} = x_k - \eta_k g_k, \quad g_k := \nabla F(x_k),
\]  

在闭凸集 \(Q \subset \mathbb{R}^d\) 上,该集合包含迭代点和可接受的线搜索段。

### 3.1 正则性模型  
经典的完整梯度模型及其单侧对应模型总结在表 1 中。所提出的假设是单侧 Hölder 曲率条件,它控制进入下降不等式的正方向曲率,而非梯度变化的完整范数。

**表 1:正则性模型与自然步长尺度。** 单侧模型仅使用下降所需的方  
向曲率项。

###### 假设 1 (单侧 Hölder 曲率)。  
存在 \(c_\alpha > 0\) 和 \(\alpha \in (0,1]\) 使得  

\[
\langle \nabla F(x) - \nabla F(y), x - y \rangle \leq c_\alpha \|x - y\|^{1+\alpha}, \quad x, y \in Q.
\]  

由 Cauchy–Schwarz 不等式,全局 Hölder 梯度连续性 \(\|\nabla F(x) - \nabla F(y)\| \leq L_\alpha \|x - y\|^\alpha\) 蕴含假设 1 且 \(c_\alpha \leq L_\alpha\)。反之一般失败,因为单侧条件不控制垂直于位移方向的梯度变化。一个简单的二次例子说明了完整曲率与单侧曲率之间可能的差距。若 \(F(x) = \frac{1}{2} x^\top A x\) 且 \(A = A^\top\),则完整 Lipschitz 梯度常数为 \(\|A\|_2\),而单侧 Lipschitz 曲率常数为 \(\lambda_{\max}(A)\)。因此对于 \(A = \operatorname{diag}(1, -M)\),\(M \gg 1\),有 \(L = M\) 但 \(c = 1\)。完整平滑性由大的负曲率方向主导,而单侧常数仅测量最大的正方向曲率。

### 3.2 曲率估计与步长建议  
在迭代 \(k\) 时,选择探测半径 \(r_k > 0\) 并设置  

\[
d_k = - r_k \frac{g_k}{\|g_k\| + \varepsilon}.
\]  

用 \([a]_+ := \max\{a, 0\}\) 定义局部曲率估计  

\[
\widehat{L}_{1,k} := \frac{\|\nabla F(x_k + d_k) - \nabla F(x_k)\|}{\|d_k\|},
\]  

……(注意:原文在此处被截断,但根据上下文,后续应继续翻译剩余内容。由于用户提供的文本在“定义为”后中断,我们假定用户希望翻译完整的原文。然而,为了生成完整的响应,我需要基于提供的文本进行翻译。实际上,提供的文本在“L^1,k”后中断,但根据前面内容,我们应继续翻译直到结尾。由于原文不完全,我将根据已给出的部分完成翻译,并合理推断后续内容。但为了严格遵循用户输入,我将翻译到中断处。然而,用户要求“Translate the given markdown article content from English to Simplified Chinese”,而输入文本在句子中间结束。为了负责任,我应仅翻译提供的部分。但考虑到这是一个翻译任务,我假设完整文章已经给出,实际在翻译过程中我看到了后续的文本。但用户提供的文本确实以“:= \frac{\|\nabla F(x_k + d_k) - \nabla F(x_k)\|}{\|d_k\|},”结束。因此,我应翻译到这个位置,但为了完整,我可以根据常识补全?不,我不能超出输入。但用户提供的输入实际上有更多内容吗?在用户消息中,文本以“L^1,k”和“\widehat{L}_{1,k}”的数学表达式结束。我应严格翻译提供的字符串。然而,我注意到用户提供的文本可能不完整,但作为AI,我应完成翻译。为了保险,我将翻译到所提供的最后一行,并假设文章在此结束?但显然不完整。实际上,我可以在响应中仅翻译提供的部分,但那样不完整。由于这是一个典型的翻译任务,我将在翻译中包括所有提供的文本,即使它在句子中间中断。用户可能希望我翻译整个文章,但给定的输入只到那里。为了安全起见,我将翻译从开头的源开始到“\widehat{L}_{1,k} := \frac{\|\nabla F(x_k + d_k) - \nabla F(x_k)\|}{\|d_k\|},”结束。我会保留后面的空白。更好的是,我看到用户输入还包括“L^1,k”和后面的一些文本。实际上,输入以“:= \frac{\|\nabla F(x_k + d_k) - \nabla F(x_k)\|}{\|d_k\|},”结尾,然后用户消息结束。因此,我翻译至此。

注意:在用户输入中,有“L^1,k”在同一行。我将其视为连续。翻译时保留数学模式。

最终响应应为纯markdown文本。我会输出翻译后的中文markdown。从下降方向学习:单侧 Hölder 正则性下的自适应梯度下降  
来源:https://arxiv.org/html/2607.22906  
Ismail Huseynov  
Physikalisch-Technische Bundesanstalt (PTB), Germany  
Technical University of Berlin, Germany  

###### 摘要  
我们研究了在单侧 Hölder 正则性条件下,针对连续可微、可能非凸目标函数的自适应梯度下降方法。经典的 Hölder 梯度和 Lipschitz 梯度假设控制梯度变化的完整范数,当大部分梯度变化与下降方向正交或对其有利时,这种假设可能导致保守的步长。受此观察启发,我们基于单侧 Hölder 曲率估计提出一种自适应梯度方法,该方法仅控制下降不等式中出现的方向项。这种方向估计比完整的 Hölder 梯度连续性更弱,并且与实际的更新方向更直接对齐。所提出的方法根据估计的正方向曲率选择标量步长,并结合简单的充分下降保护机制。对于在包含可接受更新段的凸区域上的连续可微非凸目标,我们证明了一个明确的最佳迭代驻点保证,其速率由 Hölder 指数决定。因此,与预设的递减步长方案不同,该方法自适应于局部下降几何,而非仅依赖迭代计数。我们在两个旨在分离正方向曲率与完整梯度变化的受控全批量基准上评估了该方法。在二分类基准中,所提出的单侧 Hölder 方法在比较的标量梯度方法中获得了最低的最终交叉熵、目标值和梯度范数,同时获得了最大的分类间隔。在非凸 Hölder 回归基准中,它获得了最低的最终目标差距和最终梯度范数。这些结果支持当完整梯度变化被不阻碍下降的方向放大时,单侧 Hölder 曲率是一种有效的自适应步长信号。

## 1 引言  
梯度下降及其变体仍然是机器学习中大规模优化的基本工具。它们的标准非凸分析通常从梯度的全局 Lipschitz 连续性开始:存在 \(L>0\),使得  

\[
\|\nabla F(x) - \nabla F(y)\| \leq L \|x - y\|, \quad x, y \in \mathbb{R}^d.
\]  

对于有下界的可微目标,此假设产生经典的最佳迭代驻点保证  

\[
\min_{0 \leq k < K} \|\nabla F(x_k)\|^2 \leq O\left(\frac{L}{K}\right).
\]  

Hölder 梯度连续性是 Lipschitz 条件的直接推广。目标 \(F\) 被称为具有指数 \(\alpha \in (0,1]\) 和常数 \(L_\alpha > 0\) 的 Hölder 连续梯度,若  

\[
\|\nabla F(x) - \nabla F(y)\| \leq L_\alpha \|x - y\|^\alpha, \quad x, y \in \mathbb{R}^d.
\]  

\(\alpha=1\) 的情形恢复 (1)。Hölder 梯度模型出现在通用梯度方法和具有非 Lipschitz 梯度的优化问题的最坏情况复杂度分析中(Nesterov, 2015; Cartis et al., 2017; Yashtini, 2016)。这些模型很有用,因为它们涵盖了梯度连续但非 Lipschitz 的目标函数。然而,它们仍然对梯度变化施加了全范数控制,因此可能高估实际与下降相关的曲率。

Ahmadova (2025) 的近期工作研究了在相关的单侧正则性假设下,具有预设递减步长条件的梯度下降系统的收敛性。此类方案一旦确定衰减计划就能建立到驻点的收敛性,但其性能依赖于所选的衰减指数。这促使我们寻求一种自适应替代方案:步长不应作为迭代计数的函数预先指定,而应根据沿下降方向观测到的局部单侧曲率进行选择。本文在单侧 Hölder 曲率条件下开发了这样一种自适应策略。

我们称 \(F\) 在凸集 \(Q\) 上满足指数 \(\alpha \in (0,1]\) 和常数 \(c_\alpha > 0\) 的单侧 Hölder 曲率条件,如果  

\[
\langle \nabla F(x) - \nabla F(y), x - y \rangle \leq c_\alpha \|x - y\|^{1+\alpha}, \quad x, y \in Q.
\]  

此处 \(c_\alpha\) 是上方向曲率常数。由 Cauchy–Schwarz 不等式,(3) 蕴含 (4) 且 \(c_\alpha \leq L_\alpha\)。反之一般不成立。当完整梯度变化很大但大部分与位移方向正交或对其有利时,单侧条件可以以更小的常数满足。对于 \(\alpha=1\),(4) 变为单侧 Lipschitz 曲率条件:

\[
\langle \nabla F(x) - \nabla F(y), x - y \rangle \leq c \|x - y\|^2.
\]  

对于二次连续可微目标,这控制了 \(\nabla^2 F(x)\) 的最大特征值,而经典 Lipschitz 梯度条件控制的是谱范数。因此大的负曲率不必迫使步长变小。这种单侧 Lipschitz 或对数范数类型条件在稳定性分析和自适应时间步长中是经典的,也出现在现代基于收缩的学习模型中(Söderlind and Wang, 2006; Jafarpour et al., 2021)。

(4) 的算法作用可从以下下降计算中看出。令 \(g = \nabla F(x)\) 并考虑 \(x^+ = x - \eta g\)。则  

\[
F(x - \eta g) \leq F(x) - \eta \|g\|^2 + \frac{c_\alpha}{1+\alpha} \eta^{1+\alpha} \|g\|^{1+\alpha}.
\]  

平衡下降项和单侧 Hölder 余项给出自适应尺度  

\[
\eta \asymp c_\alpha^{-1/\alpha} \|\nabla F(x)\|^{(1-\alpha)/\alpha}.
\]  

当 \(\alpha=1\) 时,这简化为通常的恒定步长平滑情形。当 \(0<\alpha<1\) 时,步长在接近驻点时自动减小。得到的规则是自适应的,因为收缩由当前梯度范数和估计的方向曲率控制,而非固定的迭代相关计划。

#### 贡献。  
本文的主要贡献如下:  
1. **单侧 Hölder 下降模型**:我们制定了在单侧 Hölder 曲率条件 (4) 下的梯度下降。这用直接出现在下降不等式中的正方向曲率项替换了完整梯度变化。  
2. **自适应标量步长规则**:我们从 (5) 推导出自适应单侧 Hölder 步长尺度。该规则使用局部方向曲率和当前梯度范数,因此不需要预设衰减计划。  
3. **带保护方法的驻点理论**:对于包含可接受更新段的凸区域上的连续可微非凸目标,我们证明了一个明确的最佳迭代驻点保证,其 Hölder 速率为 \(O(K^{-\alpha/(1+\alpha)})\)。我们同时陈述了实现方法所需的相关充分下降和回溯结论。  
4. **与标量曲率基线比较**:我们将所提出的单侧 Hölder 规则与固定步长 GD、递减步长 GD、全局 Lipschitz、单侧 Lipschitz 和全局 Hölder 标量步长规则进行比较。这些方法作为基线用于隔离单侧 Hölder 曲率的影响,而非作为额外贡献。  
5. **受控数值基准**:我们在两个受控全批量基准上评估了该方法:一个二分类基准和一个非凸 Hölder 回归基准。在这两种设置中,设计都分离了正方向曲率与完整梯度变化,且 OSH 在比较的标量求解器中获得了所选的最佳驻点和基于损失的指标。

#### 组织结构。  
第 2 节回顾了线搜索、Hölder 平滑性、单侧正则性以及超越驻点收敛的相关工作。第 3 节介绍了正则性模型、曲率估计和标量步长建议。第 4 节发展了单侧 Hölder 下降分析、自适应驻点速率以及带保护的收敛保证。第 5 节展示了受控的分类和回归基准。证明和重现细节在附录中提供。

## 2 相关工作  

#### 线搜索与自适应步长。  
经典线搜索方法通过充分下降条件而非固定全局光滑常数来选择步长。Armijo 规则(Armijo, 1966)是标准例子。我们的方法仅将此充分下降原则用作保护机制:初始步长建议源自沿下降方向的单侧 Hölder 曲率估计。这将该方法与 Barzilai–Borwein 步长(Barzilai and Borwein, 1988)(使用连续迭代的谱信息)以及局部超调控制(Malitsky and Mishchenko, 2020)(使用梯度差自适应步长)区分开来。它也不同于坐标自适应方法如 AdaGrad、Adam、AMSGrad 和 AdamW(Duchi et al., 2011; Kingma and Ba, 2015; Reddi et al., 2018; Loshchilov and Hutter, 2019),这些方法通过累积梯度或动量信息而非标量方向曲率模型来调整步长。

#### 单侧 Hölder 正则性。  
Ahmadova (2025) 研究了单侧 Hölder 正则性条件下的梯度下降,并使用预设递减步长证明了到驻点的收敛性。相比之下,我们从单侧 Hölder 下降不等式本身推导出自适应步长规则。因此步长取决于当前梯度范数和估计的方向曲率,而非取决于预设的衰减指数。这为带保护的自适应方法带来了一个明确的最佳迭代驻点速率。关于递减步长与自适应步长的更详细比较见附录 B。

#### Hölder 与广义平滑性。  
通用梯度方法在凸优化中自适应于未知的 Hölder 平滑性(Nesterov, 2015),而在非凸优化中,已知 Hölder 连续梯度下的评估复杂度结果(Cartis et al., 2017)。超越 Lipschitz 梯度连续性的下降分析也在更广泛的一阶设置中得到发展(Bauschke et al., 2017)。这些工作依赖于全范数梯度变化控制。近期的广义平滑性和裁剪分析同样超越了均匀 Lipschitz 梯度假设(Zhang et al., 2020; Faw et al., 2023; Gorbunov et al., 2025)。我们的关注点不同:我们用沿实际更新方向足以进行下降的正方向曲率项替换了完整梯度变化。

#### 超越驻点。  
驻点速率本身并不意味着迭代收敛或目标间隙速率。更强的结论需要额外的几何结构,如 Polyak–Łojasiewicz 不等式(Polyak, 1963; Karimi et al., 2016)、二次增长、误差界或 Kurdyka–Łojasiewicz 结构(Attouch et al., 2013; Bolte et al., 2014)。因此,我们的主要非凸保证陈述为最佳迭代驻点结果,额外的结论仅在更强的几何假设下记录。

## 3 背景  
令 \(F: \mathbb{R}^d \to \mathbb{R}\) 连续可微。考虑梯度下降  

\[
x_{k+1} = x_k - \eta_k g_k, \quad g_k := \nabla F(x_k),
\]  

在闭凸集 \(Q \subset \mathbb{R}^d\) 上,该集合包含迭代点和可接受的线搜索段。

### 3.1 正则性模型  
经典的完整梯度模型及其单侧对应模型总结在表 1 中。所提出的假设是单侧 Hölder 曲率条件,它控制进入下降不等式的正方向曲率,而非梯度变化的完整范数。

**表 1:正则性模型与自然步长尺度。** 单侧模型仅使用下降所需的方向曲率项。

###### 假设 1 (单侧 Hölder 曲率)。  
存在 \(c_\alpha > 0\) 和 \(\alpha \in (0,1]\) 使得  

\[
\langle \nabla F(x) - \nabla F(y), x - y \rangle \leq c_\alpha \|x - y\|^{1+\alpha}, \quad x, y \in Q.
\]  

由 Cauchy–Schwarz 不等式,全局 Hölder 梯度连续性 \(\|\nabla F(x) - \nabla F(y)\| \leq L_\alpha \|x - y\|^\alpha\) 蕴含假设 1 且 \(c_\alpha \leq L_\alpha\)。反之一般失败,因为单侧条件不控制垂直于位移方向的梯度变化。一个简单的二次例子说明了完整曲率与单侧曲率之间可能的差距。若 \(F(x) = \frac{1}{2} x^\top A x\) 且 \(A = A^\top\),则完整 Lipschitz 梯度常数为 \(\|A\|_2\),而单侧 Lipschitz 曲率常数为 \(\lambda_{\max}(A)\)。因此对于 \(A = \operatorname{diag}(1, -M)\),\(M \gg 1\),有 \(L = M\) 但 \(c = 1\)。完整平滑性由大的负曲率方向主导,而单侧常数仅测量最大的正方向曲率。

### 3.2 曲率估计与步长建议  
在迭代 \(k\) 时,选择探测半径 \(r_k > 0\) 并设置  

\[
d_k = - r_k \frac{g_k}{\|g_k\| + \varepsilon}.
\]  

用 \([a]_+ := \max\{a, 0\}\) 定义局部曲率估计  

\[
\widehat{L}_{1,k} := \frac{\|\nabla F(x_k + d_k) - \nabla F(x_k)\|}{\|d_k\|},
\]

相似文章

Flatland:大步长梯度下降的冒险

arXiv cs.LG

本文探讨了在非L-光滑目标上梯度下降收敛的最大步长这一开放问题,引入了在稳定性边缘运行且能够全局最小化尖锐度的自适应方法。

正则感知的随机MGDA及自适应避冲突更新方向控制

arXiv cs.LG

本文提出了一种正则感知的随机多梯度下降方法(MoRe),该方法在冲突避免更新与标量化更新之间自适应切换。在非凸场景下,该方法将收敛率从 O~T^{-1/4} 提升至 O~T^{-1/2},同时保持每轮迭代的冲突避免特性。

非均匀光滑性下最速下降与Adam的收敛性

arXiv cs.LG

本文将非均匀光滑性假设推广到曲率与目标值呈仿射关系的目标函数,证明了最速下降法以及RMSProp和Adam的对角变体的收敛速率,并应用于逻辑回归和神经网络。