LionVote:面向Lion的逐层学习率自适应

arXiv cs.LG 论文

摘要

LionVote 为Lion优化器引入了一种逐层学习率自适应机制,利用梯度方向稳定性和动量健康诊断,并辅以投票系统。与标准Lion和AdamW相比,它在ViT-Tiny/CIFAR-100上实现了更高的准确率。

arXiv:2607.09266v1 公告类型:新 摘要:逐层诊断显示,在预设学习率下,Lion在ViT-Tiny/CIFAR-100上对注意力层和MLP参数的有效缩放比例高出2.6-2.8倍,对归一化层则高出约2倍;这种32%的跨层类型差异无法通过单一全局学习率复现。该测量来自LionVote——一种逐层学习率机制,其中每个参数张量维护一个复合等级(compound level),这是一个持久化的整数,每c个epoch由两个诊断指标(梯度方向稳定性和动量健康)更新,并通过验证损失进行平局裁决。投票阈值源自几何恒等式、EMA时间常数和噪声基底估计;更新节奏在结构上受到约束,并通过消融实验选择。在ViT-Tiny/CIFAR-100上,LionVote达到了69.7%的top-1准确率,而Lion为69.0%(p < 0.02,韦尔奇t检验),AdamW为68.8%。逐层自适应的价值既取决于架构异质性,也取决于任务;在均匀的CNN架构上,调优后的SGD搭配余弦退火仍占主导地位,而在ViT架构上,收益则依赖于具体任务。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

# 狮优化器的逐层学习率自适应机制 来源: https://arxiv.org/html/2607.09266

###### 摘要

逐层诊断表明,在指定学习率下,狮优化器对注意力层和MLP参数的有效缩放因子过高(2.6–2.8×),对归一化层过高(约2×)。ViT-Tiny/CIFAR-100上的这一32%跨层类型差异无法通过单一全局学习率复现。该测量基于LionVote(一种逐层学习率机制),其中每个参数张量维护一个复合层级(持久整数),每c个epoch通过两个诊断指标(梯度方向稳定性与动量健康)进行更新,并由验证损失作为仲裁器解决冲突。投票阈值源自几何恒等式、EMA时间常数和噪声基底估计;投票周期受结构约束并通过消融实验选择。在ViT-Tiny/CIFAR-100上,LionVote达到69.7% top-1准确率,优于狮优化器的69.0%(p<0.02,Welch t检验)和AdamW的68.8%。逐层自适应价值取决于架构异质性和任务:在均匀CNN架构上,经调整的余弦退火SGD仍占主导;在ViT架构上,收益依赖于具体任务。

## 1 引言

Zhao等人(Zhao et al., 2025 (https://arxiv.org/html/2607.09266#bib.bib25))证明,仅对最后一层和LayerNorm参数应用逐层自适应预条件即可恢复Adam相对于SGD在自回归语言模型上的大部分优势;这表明不同层类型具有不同的优化特性。他们的分析未规定每种类型应偏离基准速率多少,也未提出在训练过程中确定该偏离的机制。现有自适应方法在逐坐标或逐层上进行但无状态,无调度方法(Defazio et al., 2024 (https://arxiv.org/html/2607.09266#bib.bib6))维持单一全局速率。尚无方法将带状态的逐层自适应与数据驱动的速率调整相结合(§2.4 (https://arxiv.org/html/2607.09266#S2.SS4))。

LionVote是用于狮优化器(Chen et al., 2023 (https://arxiv.org/html/2607.09266#bib.bib3))的逐层学习率机制。狮优化器的符号操作丢弃梯度幅度,使得方向不稳定层无法通过更大更新来补偿;这使得逐层校准错误对基于符号的方法比Adam等基于二阶动量方法的影响更大(§5.1 (https://arxiv.org/html/2607.09266#S5.SS1))。每个参数张量维护一个复合层级(持久整数,§3.1 (https://arxiv.org/html/2607.09266#S3.SS1)),以指数方式调节基础学习率。每c个epoch,两个逐层诊断指标(梯度方向稳定性和动量健康,含推导阈值;附录A.1 (https://arxiv.org/html/2607.09266#A1.SS1)–A.2 (https://arxiv.org/html/2607.09266#A1.SS2))投票决定各层速率是增加、减少还是维持。当投票冲突时,由验证损失仲裁器解决。该机制在每个批次每个参数上增加一次额外累加;投票每c个epoch运行一次。当所有投票禁用时,复合层级衰减至零,LionVote退化为标准狮优化器。

我们在CIFAR-10和CIFAR-100上对WideResNet和ViT-Tiny进行评估,每个配置使用8个种子。贡献如下:

1. 1. 一种针对基于符号优化器的逐层自适应机制,其投票阈值源自几何恒等式和EMA时间常数;投票周期和结构参数(指数除数d=2,最大层级L=4)受约束而非唯一确定(附录A.1 (https://arxiv.org/html/2607.09266#A1.SS1)–A.6 (https://arxiv.org/html/2607.09266#A1.SS6))。阈值推导方法可复用于其他优化器中逐层机制的原则性设计。
2. 2. 关于狮优化器的量化发现:在ViT-Tiny/CIFAR-100上,其有效缩放对注意力层和MLP参数过高2.6–2.8×,对归一化参数过高约2×(基于8个种子的复合层级轨迹测量)。归一化层的有效缩放比注意力层高32%(§5.1 (https://arxiv.org/html/2607.09266#S5.SS1))。由于复合乘数同时缩放符号更新和解耦权重衰减,这测量了LR+WD的联合校准误差(§5.1 (https://arxiv.org/html/2607.09266#S5.SS1))。
3. 3. 证据表明逐层自适应价值取决于架构异质性和任务。在ViT-Tiny上,层类型间的复合层级分散度比WideResNet大2.8×,且LionVote在周期8时在CIFAR-100上达到最佳准确率(69.7%)。同一架构在CIFAR-10上类似分散度下与狮优化器相比有显著损失(-0.88个百分点,p<0.001)。在WideResNet上,调整后的余弦退火SGD仍占主导(§5.2 (https://arxiv.org/html/2607.09266#S5.SS2))。

## 2 相关工作

深度网络并非单一整体。残差网络(He et al., 2016 (https://arxiv.org/html/2607.09266#bib.bib9))、宽残差网络(Zagoruyko & Komodakis, 2016 (https://arxiv.org/html/2607.09266#bib.bib24))和视觉变换器(Dosovitskiy et al., 2021 (https://arxiv.org/html/2607.09266#bib.bib7))在梯度流动方式和表示随深度演化方面存在本质差异。标准调度策略如余弦退火(Loshchilov & Hutter, 2017 (https://arxiv.org/html/2607.09266#bib.bib15))和步长衰减对每个参数应用单一学习率轨迹,而不考虑各层的收敛状态。

### 2.1 逐参数自适应

逐坐标自适应从AdaGrad(Duchi et al., 2011 (https://arxiv.org/html/2607.09266#bib.bib8))的累加平方梯度发展到Adam(Kingma & Ba, 2015 (https://arxiv.org/html/2607.09266#bib.bib13))和解耦权重衰减(Loshchilov & Hutter, 2019 (https://arxiv.org/html/2607.09266#bib.bib16));所有方法均逐坐标自适应,而非逐层。基于符号的方法(signSGD(Bernstein et al., 2018 (https://arxiv.org/html/2607.09266#bib.bib2))、狮优化器(Chen et al., 2023 (https://arxiv.org/html/2607.09266#bib.bib3)))将更新简化为动量-梯度插值的符号,在全局调度下以更低内存成本匹配Adam性能。谨慎优化器(Liang et al., 2026 (https://arxiv.org/html/2607.09266#bib.bib14))根据符号一致性屏蔽更新坐标,逐坐标逐批次操作,无逐层历史。

### 2.2 逐层自适应

Howard和Ruder(Howard & Ruder, 2018 (https://arxiv.org/html/2607.09266#bib.bib11))证明,在将预训练语言模型适应新任务时,对较低层分配逐渐减小的学习率优于单一全局速率。LARS(You et al., 2017 (https://arxiv.org/html/2607.09266#bib.bib22))引入逐层速率缩放,将每层学习率乘以其权重范数与梯度范数之比,在大批量设置中表现良好。LAMB(You et al., 2020 (https://arxiv.org/html/2607.09266#bib.bib23))将同一信任比值思想应用于Adam,使得标准Adam退化的大批量训练成为可能。LARS和LAMB是无状态的:一个已经稳定多个epoch的层与刚脱离噪声阶段的层被同等对待。梯度方向稳定性——层的梯度是否跨epoch一致对齐——是对权重-梯度比率的补充信号。据我们所知,利用连续梯度估计之间的对齐来调节步长尚未在层级应用。

Muon(Jordan et al., 2024 (https://arxiv.org/html/2607.09266#bib.bib12))对隐藏层应用正交化Newton–Schulz更新,但硬编码哪些层接收哪种处理。Zhao等人(Zhao et al., 2025 (https://arxiv.org/html/2607.09266#bib.bib25))证明将逐层自适应预条件限制在最后一层和LayerNorm参数即可捕获自回归语言模型上大部分准确率收益,但未量化每类差异或提出发现机制。Hao等人(Hao et al., 2025 (https://arxiv.org/html/2607.09266#bib.bib10))(LANTON)为几何感知优化器(如Muon)分配噪声自适应的逐层学习率,每步在每层的对偶范数中估计梯度方差。该自适应是即时的:不累计跨epoch证据或维护持久逐层状态。

### 2.3 数据驱动的调度替代方案

AutoDrop(Wang et al., 2024 (https://arxiv.org/html/2607.09266#bib.bib21))监测角速度以自动触发速率降低。D-Adaptation(Defazio & Mishchenko, 2023 (https://arxiv.org/html/2607.09266#bib.bib5))从到最小化器的距离的在线下界推导学习率。Orvieto和Xiao(Orvieto & Xiao, 2024 (https://arxiv.org/html/2607.09266#bib.bib18))利用Gauss-Newton重定形推导出无需调度即可预热、达到峰值并衰减的步长。Defazio等人(Defazio et al., 2024 (https://arxiv.org/html/2607.09266#bib.bib6))用迭代插值和平均替代动量,在无停止时间的情况下匹配手动调节的余弦调度。所有这些方法对整个参数向量维持单一全局速率。

### 2.4 差距

无调度方法证明数据驱动自适应可以替代手动设计的全局调度;层类型感知方法证明层受益于异质处理。现有方法均未桥接两者。LARS和LAMB逐层自适应但无状态(§2.2 (https://arxiv.org/html/2607.09266#S2.SS2))。无调度方法和D-Adaptation累计历史但全局应用单一速率。Muon区分层类型但硬编码哪些层接收何种处理。LANTON即时调整逐层速率(§2.2 (https://arxiv.org/html/2607.09266#S2.SS2))但不累计跨epoch证据。元学习优化器(Andrychowicz et al., 2016 (https://arxiv.org/html/2607.09266#bib.bib1))原则上可以发现逐层策略,但牺牲可解释性且需要在代理任务上进行昂贵的元训练。

## 3 提出方法

LionVote是用于狮优化器(Chen et al., 2023 (https://arxiv.org/html/2607.09266#bib.bib3))的逐层学习率机制,作为PyTorch Optimizer子类实现。它不对狮优化器的更新规则进行结构修改。每个参数张量接收一个有效学习率α_i,该学习率由一个持久整数*复合层级*调整,该层级每c个epoch通过一个包含全局仲裁器的双投票系统更新。

### 3.1 逐层学习率

每个参数i具有一个复合层级 s_i ∈ {−L,...,0,...,+L}(默认L=4),其调整基础学习率如下:

α_i = lr * exp(s_i * β_1/2),  (1)

其中lr是全局基础学习率(可由外部调度器更新),β_1是狮优化器的符号插值系数。所有复合层级初始化为零。在默认β_1=0.9下,s_i的每个单位步对应约×1.57乘数,完整范围[−4,+4]跨越基准速率从0.165×到6.05×。指数β_1/2和界限L=4的推导见附录A.4 (https://arxiv.org/html/2607.09266#A1.SS4)和A.5 (https://arxiv.org/html/2607.09266#A1.SS5)。

### 3.2 批次更新

在每个训练批次中,LionVote使用α_i替代全局学习率执行标准狮优化器更新:解耦权重衰减,随后符号更新sign(β_1 m_i + (1−β_1) g_i),然后进行β_2-EMA动量更新(算法1 (https://arxiv.org/html/2607.09266#alg1))。原始梯度被累计用于epoch级投票。

### 3.3 Epoch步和投票

在每个epoch结束时,LionVote计算每个参数的epoch平均梯度 ḡ_i = a_i / N,重置累加器,并从当前lr重新计算α_i,使得逐层速率跟踪任何外部调度器。在*投票epoch*(epoch mod c = 0,其中c为投票周期)上,系统额外评估两个逐层诊断和一个全局仲裁器。

##### 投票1:梯度方向稳定性。
alignment_i = (ḡ_i^(curr) · ḡ_i^(prev)) / (||ḡ_i^(curr)|| ||ḡ_i^(prev)|| + ε)

投票为+1若 alignment_i > 0.5,-1若 alignment_i < 0,否则0(ε=10^-8)。下阈值直接来自余弦定义(当角度超过π/2时为负);上阈值对应于坐标各向同性下坐标符号对一致性的三分之二绝对多数(附录A.1 (https://arxiv.org/html/2607.09266#A1.SS1))。投票1使用epoch平均梯度而非动量以避免EMA的自我污染。

##### 投票2:动量健康。
r_i = ||m_i|| / (||ḡ_i^(curr)|| + ε)

投票为-1若 r_i > e(动量范数超过梯度范数超过因子e),+1若 r_i < 1/e(梯度范数超过动量范数超过因子e),否则0。两个阈值均源自EMA的内在时间常数:β_2^τ = e^{-1} 对任意β_2∈(0,1)(附录A.2 (https://arxiv.org/html/2607.09266#A1.SS2))。

##### 仲裁器:验证损失。
仲裁器是一个全局标量,仅当两个局部投票之和为零(两者均弃权或冲突)时触发:
δ = (L̄_prev - L̄_curr) / (|L̄_prev| + ε)

返回+1若 δ > 0.01,-1若 δ < -0.01,否则0(ε=10^-8,与投票1和2相同)。1%阈值匹配典型验证集规模下交叉熵损失估计的噪声基底(附录A.3 (https://arxiv.org/html/2607.09266#A1.SS3))。在狮优化器/ViT-Tiny/CIFAR-100上,仲裁器条件满足约59%的逐参数投票决策(附录B.6 (https://arxiv.org/html/2607.09266#A2.SS6)),因此仲裁器并非边界情况,而是主导信号路径;投票1或投票2单独决定剩余约41%的结果。

##### 投票决议。
投票1监测方向稳定性;投票2监测动量-梯度幅度比。最终投票根据算法1 (https://arxiv.org/html/2607.09266#alg1)中的表格决定。

### 3.4 复合层级更新

复合层级 s_i 通过*非对称*规则更新:vote=+1 若为负则重置为零,否则递增(上限 +L);vote=-1 若为正则重置为零,否则递减(下限 -L);vote=0 则向零衰减。单次反对票即可撤销累计的层级。

### 3.5 算法

算法 1 LionVote

0: θ, lr, β1, β2, λ

相似文章

快速与慢速变分持续学习

arXiv cs.LG

本文介绍了持续IVON(CoVON)优化器,它将快速和慢速适应整合到变分持续学习中,以平衡稳定性和可塑性,在领域增量学习、持续预训练以及大型语言模型的微调中优于现有方法。

GLIDE: 引导的逐层混合注意力实现高效LLM推理

arXiv cs.AI

GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。

Aletheia:基于梯度引导的层选择方法,实现跨架构的高效LoRA微调

arXiv cs.CL

Aletheia 提出了一种基于梯度引导的层选择方法,用于高效的 LoRA 微调。该方法通过轻量级梯度探针识别与任务相关的 Transformer 层,并选择性地应用适配器,在 14 个模型上实现了 15%-28% 的训练加速,同时保持了在 MMLU、GSM8K 和 HumanEval 基准测试中的下游性能。

MGUP:一种用于随机优化的动量-梯度对齐更新策略

arXiv cs.LG

提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。