基于无调度频谱优化的随时训练
摘要
本文介绍了SF-NorMuon,一种无调度频谱优化器,在参数规模达7.72亿的语言模型上匹配或超越调优后的AdamW,并提供了平稳性和长期稳定性的理论保证。
arXiv:2605.23061v1 公告类型:新
摘要:标准神经网络训练依赖于与固定时间范围绑定的学习率调度,导致强烈的路径依赖,并且随着数据可用性的变化需要昂贵的重新调参。无调度(SF)方法通过移除显式调度来解决这一问题,然而当前最先进的随时优化器SF-AdamW始终不如精心调优的AdamW基线。我们提出了SF-NorMuon,一种无调度频谱优化器,填补了这一差距:在单个超参数配置下,SF-NorMuon在1.25亿和7.72亿参数的语言模型上,跨越$1$--$8\times$ Chinchilla时间范围,匹配或超越调优后的AdamW。在理论方面,我们证明了无调度频谱动态的平稳性保证,并指出快速迭代上的权重衰减对长期稳定性至关重要。SF-NorMuon使从业者能够在训练过程中的任何时刻获得高质量检查点,而无需事先确定时间范围。通过缩小与调优基线的性能差距,SF-NorMuon使无时间范围优化更加实用,朝着真正开放式、持续学习迈出了一步。
查看缓存全文
缓存时间: 2026/05/25 08:59
# 无调度谱优化下的任意时刻训练 来源: https://arxiv.org/html/2605.23061 Anuj Apte Pranav Deshpande Niraj Kumar Shouvanik Chakrabarti Junhyung Lyle Kim 全球技术应用研究, JPMorganChase 纽约, NY 10001, 美国 \(2026年5月\) ###### 摘要 标准神经网络训练依赖于与固定训练轮次绑定的学习率调度,导致强烈的路径依赖性,并且当数据可用性变化时需要昂贵的重新调优。无调度(SF)方法通过移除显式调度来解决这一问题,但当前最先进的任意时刻优化器 SF-AdamW 始终不如调优良好的 AdamW 基线。我们提出 SF-NorMuon,一种无调度谱优化器,它弥补了这一差距:使用单一超参数配置,SF-NorMuon 在 125M 和 772M 参数的语言模型上,在 \(1\times\) 到 \(8\times\) Chinchilla 训练轮次范围内,匹配或超越了调优后的 AdamW。在理论方面,我们证明了无调度谱动力学的平稳性保证,并指出快速迭代上的权重衰减对于长轮次稳定性至关重要。SF-NorMuon 使实践者能够在训练过程中的任意时刻获得高质量检查点,而无需事先承诺训练轮次。通过缩小与调优基线的性能差距,SF-NorMuon 使无轮次优化更加实用,朝着真正开放式的持续学习迈出了一步。 ## 1 引言 在标准机器学习范式中,在整理好数据集后,模型会被训练,然后在之前未见过的保留数据上进行评估\[28 (https://arxiv.org/html/2605.23061#bib.bib17),23 (https://arxiv.org/html/2605.23061#bib.bib16),7 (https://arxiv.org/html/2605.23061#bib.bib18)\]。然而,模型越来越多地被部署在部署期间会生成大量数据(相当于甚至超过训练数据)的场景中。例如,与数十亿用户交互的大型语言模型(LLMs)\[9 (https://arxiv.org/html/2605.23061#bib.bib21),75 (https://arxiv.org/html/2605.23061#bib.bib22),82 (https://arxiv.org/html/2605.23061#bib.bib20),56 (https://arxiv.org/html/2605.23061#bib.bib19)\],以及控制工业机器人的视觉-语言-动作(VLA)模型\[8 (https://arxiv.org/html/2605.23061#bib.bib23),54 (https://arxiv.org/html/2605.23061#bib.bib24),40 (https://arxiv.org/html/2605.23061#bib.bib25)\]就是例子。因此,明智地利用部署时先验未知的数据量,对于通过持续学习\[58 (https://arxiv.org/html/2605.23061#bib.bib26),78 (https://arxiv.org/html/2605.23061#bib.bib27)\]提升模型能力至关重要。然而,除了解决灾难性遗忘\[42 (https://arxiv.org/html/2605.23061#bib.bib28),19 (https://arxiv.org/html/2605.23061#bib.bib29)\]之外,还有一个需要克服的优化障碍\[18 (https://arxiv.org/html/2605.23061#bib.bib7),55 (https://arxiv.org/html/2605.23061#bib.bib8),16 (https://arxiv.org/html/2605.23061#bib.bib9),37 (https://arxiv.org/html/2605.23061#bib.bib5)\]。大多数现有的训练方法并非设计为任意时刻可用,因为它们依赖于与固定训练轮次绑定的学习率调度,并且需要在预定计算预算下进行广泛的超参数调优\[52 (https://arxiv.org/html/2605.23061#bib.bib30),29 (https://arxiv.org/html/2605.23061#bib.bib32),30 (https://arxiv.org/html/2605.23061#bib.bib31)\]。
例如,标准的余弦衰减调度具有很强的路径依赖性。考虑使用余弦衰减训练 LLaMA-2 风格的 transformer,如图1所示。黑色虚线突出了性能差异:在相同的 token 数量下,为较短轮次调优的运行显著优于为较长轮次调优的运行,尽管看到了相同的数据(例如:772M 模型在 31B tokens 时,2× 与 4× Chinchilla 对比)。这是因为余弦衰减将学习率与训练轮次绑定。在任何中间点,较长轮次的运行才刚刚开始衰减,而较短轮次的运行已经退火到接近零,导致性能的巨大差异。理想情况下,我们希望模型从给定的训练数据中尽可能多地学习,无论未来有多少数据等待处理。
图1:在 FineWeb-100B 上训练的 LLaMA-2 风格 transformer 的 SF-NorMuon(本文)、SF-AdamW 和调优 AdamW 基线对比。左图:125M 模型,AdamW 学习率根据轮次调优并采用余弦调度。右图:772M 模型,采用单一优化后的 AdamW 配置跨轮次。虚线突出显示,对于较小的 token 预算,长轮次的学习率调度是次优的。超参数网格总结于表4,不同学习率的验证损失展示在图6。SF-NorMuon 持续优于 SF-AdamW,并匹配调优后的 AdamW 基线。
为此,最近提出了无调度(SF)方法\[16 (https://arxiv.org/html/2605.23061#bib.bib9)\],移除对显式学习率调度的需求。SF 框架维护三个迭代序列。在其最基本的形式中,SF-SGD 的迭代如下:
\[
\begin{aligned}
y_t &= \beta x_t + (1-\beta) z_t, \tag{1}\\
z_{t+1} &= z_t - \eta \nabla \mathcal{L}(y_t; \xi_t), \tag{2}\\
x_{t+1} &= (1-c_{t+1}) x_t + c_{t+1} z_{t+1}, \tag{3}
\end{aligned}
\]
其中 \(z_1 = x_1\) 且 \(c_{t+1} = 1/(t+1)\)。\(y\) 序列是在插值点处计算梯度的地方,符合 Nesterov 加速方法的精神\[57 (https://arxiv.org/html/2605.23061#bib.bib2),45 (https://arxiv.org/html/2605.23061#bib.bib1)\];\(z\) 序列是快速迭代,在整个训练过程中以恒定步长 \(\eta\) 沿着(随机)梯度方向前进;\(x\) 序列是评估序列,用于计算验证损失。重写更新式,得到:
\[
x_{t+1} = x_t - \eta c_{t+1} \nabla \mathcal{L}(y_t; \xi_t) + c_{t+1} (z_{t+1} - x_t). \tag{4}
\]
因此,尽管 \(z\) 以恒定速率移动,但 \(x\) 的有效学习率是 \(\eta_{\text{eff}} = \eta/(t+1)\),它随着训练进程而衰减。注意,由于 \(x\) 是 \(y\) 和 \(x\) 的线性组合,它可以即时计算,因此不需要额外的内存开销。另一种密切相关但用于无轮次训练的方法是简单地使用恒定学习率进行训练,并返回权重的某种移动平均¹\[27 (https://arxiv.org/html/2605.23061#bib.bib35),48 (https://arxiv.org/html/2605.23061#bib.bib33),55 (https://arxiv.org/html/2605.23061#bib.bib8),31 (https://arxiv.org/html/2605.23061#bib.bib6)\]。值得注意的是,SF-AdamW(SF-SGD 的实用变体)在 AlgoPerf 挑战赛\[38 (https://arxiv.org/html/2605.23061#bib.bib34)\]的自调优赛道中荣获一等奖,展示了任意时刻训练的新有效性水平。为完整起见,附录B回顾了 SF-SGD 和 SF-AdamW,并总结了 SF-SGD 的收敛性保证。
尽管取得了成功,但正如\[26 (https://arxiv.org/html/2605.23061#bib.bib3),72 (https://arxiv.org/html/2605.23061#bib.bib37),67 (https://arxiv.org/html/2605.23061#bib.bib36)\]中观察到的,SF-AdamW 无法匹配调优良好的 AdamW\[41 (https://arxiv.org/html/2605.23061#bib.bib38),53 (https://arxiv.org/html/2605.23061#bib.bib39)\](优化神经网络的主要工作马)的性能。图1也证实了这一点,其中 SF-AdamW(蓝色)在所有 Chinchilla 轮次范围内始终高于调优良好的 AdamW 基线(红色星号,调优网格见表4)。由于(1)-(3)中的无调度平均机制与应用于(2)的基本更新规则无关,一个自然的问题是,选择不同的基础优化器能否弥补这一差距。
在现代神经网络中,绝大多数可学习参数位于权重矩阵中,这些矩阵对输入的激活进行线性操作。然而,AdamW 将权重矩阵视为平坦的向量,忽略了它们如何作用于激活。谱范数提供了衡量权重矩阵更新对输出激活影响的自然度量,这激发了最近对谱优化方法的兴趣,如 Muon\[34 (https://arxiv.org/html/2605.23061#bib.bib46),33 (https://arxiv.org/html/2605.23061#bib.bib47)\]及其变体\[70 (https://arxiv.org/html/2605.23061#bib.bib59),49 (https://arxiv.org/html/2605.23061#bib.bib58),2 (https://arxiv.org/html/2605.23061#bib.bib48),1 (https://arxiv.org/html/2605.23061#bib.bib80),4 (https://arxiv.org/html/2605.23061#bib.bib64),63 (https://arxiv.org/html/2605.23061#bib.bib81),3 (https://arxiv.org/html/2605.23061#bib.bib82),51 (https://arxiv.org/html/2605.23061#bib.bib83),39 (https://arxiv.org/html/2605.23061#bib.bib84),43 (https://arxiv.org/html/2605.23061#bib.bib88)\]。Muon 通过牛顿-舒尔茨迭代计算梯度的极分解,在谱范数下进行最速下降,并且已经成功扩展到数万亿 token\[50 (https://arxiv.org/html/2605.23061#bib.bib42),74 (https://arxiv.org/html/2605.23061#bib.bib43),22 (https://arxiv.org/html/2605.23061#bib.bib45),71 (https://arxiv.org/html/2605.23061#bib.bib44)\]。神经网络损失曲面具有许多近乎平坦的方向,对应着小的 Hessian 特征值\[64 (https://arxiv.org/html/2605.23061#bib.bib52),21 (https://arxiv.org/html/2605.23061#bib.bib53)\],因此通过极分解在所有谱方向上采取均匀大小的步长,使得 Muon 能够从每步的训练数据中提取更多信息\[14 (https://arxiv.org/html/2605.23061#bib.bib51)\]。这引出了一个问题:在谱范数下的优化是否能够改进现有的无调度方法,并且能否缩小与调优良好、依赖于轮次的 AdamW 基线的差距?
除了基础几何的选择之外,无调度方法还面临一个稳定性挑战,这对于长轮次训练变得至关重要。如图2所示,在没有权重衰减的情况下,长时间运行的验证损失会增加。这与无调度方法背后的凸优化理论形成鲜明对比,后者在没有正则化的情况下也能保证收敛\[16 (https://arxiv.org/html/2605.23061#bib.bib9),66 (https://arxiv.org/html/2605.23061#bib.bib4)\]。此外,最初在\[16 (https://arxiv.org/html/2605.23061#bib.bib9)\]中提出的对 \(y\) 的权重衰减,对于谱情况并不足够,其中不稳定性被显著放大(图2右面板)。因此,在无调度方法中,权重衰减扮演了性质不同的角色:它不仅仅是改善泛化的正则化器\[44 (https://arxiv.org/html/2605.23061#bib.bib63),13 (https://arxiv.org/html/2605.23061#bib.bib40),61 (https://arxiv.org/html/2605.23061#bib.bib41)\],而是*必要*的,用于长轮次稳定性。
结合这两种见解——谱几何加速训练和对快速迭代进行权重衰减以确保稳定性——我们的贡献如下:
- • 我们提出了 SF-SpectralSGD(带有动量),一种用于矩阵优化的无调度谱方法,并证明了其平稳性保证,达到了近期 Muon 收敛性工作\[10 (https://arxiv.org/html/2605.23061#bib.bib54),69 (https://arxiv.org/html/2605.23061#bib.bib55),65 (https://arxiv.org/html/2605.23061#bib.bib56),47 (https://arxiv.org/html/2605.23061#bib.bib57)\]所实现的 \(\tilde{O}(T^{-1/4})\) 速率(定理2.1和推论2.1)。
- • 对于实际的深度学习,我们结合了 NorMuon\[49 (https://arxiv.org/html/2605.23061#bib.bib58),70 (https://arxiv.org/html/2605.23061#bib.bib59)\]的每神经元归一化,得到了 SF-NorMuon,总结于算法1。SF-NorMuon 显著改进了最先进的任意时刻优化器 SF-AdamW,并在各种训练轮次上匹配了调优后的 AdamW(参见图1,表1)。特别是,包含显式动量缓冲区和每神经元归一化对于实现良好的实际性能至关重要(参见图3)。
- • 我们识别出权重衰减在无调度优化中的关键作用。与标准优化器不同,(2)中的快速迭代 \(z_t\) 在整个训练过程中以恒定学习率持续移动,因此权重衰减对于长轮次稳定性是必要的。对于谱优化,激进的极分解更新放大了不稳定性(图2),但直接应用于 \(z_t\) 的权重衰减导致了稳定的训练。我们证明了所有迭代的有界性(引理3.1),并推导了一个闭式稳态特征(引理3.2),该特征与经验训练动力学非常吻合(图4)。
## 2 无调度谱优化
图2:无调度优化器的权重衰减策略。左图:无衰减的 SF-AdamW(橙色)发散;对 \(Y\) 衰减(蓝色)在约 30B tokens 之前表现最佳(参见表1),但最终发散。对 \(Z\) 衰减(绿色)产生稳定训练,但在早期阶段是次优的。右图:无衰减的 SF-NorMuon(橙色)发散更快;对 \(Y\) 衰减(蓝色)也不稳定。对 \(Z\) 衰减(绿色)保持稳定并在整个过程中表现最佳,这激发了第3节中的分析。
无调度优化器的一个基本设计选择是用于快速更新的几何。当输入和输出以欧几里得范数 \(\|\cdot\|_2\) 度量时,矩阵 \(A \in \mathbb{R}^{m \times n}\) 的诱导算子范数为:
\[
\|A\|_{2\to 2} := \sup_{\|u\|_2 \leqslant 1} \|Au\|_2 = \sigma_{\max}(A) = \|A\|_{\mathrm{op}}. \tag{5}
\]
其中 \(\sigma_{\max}(A)\) 表示 \(A\) 的最大奇异值,即谱范数。从几何上看,它衡量了 \(A\) 可以拉伸任何单位向量的最大倍数,使其成为衡量权重扰动如何改变网络激活的自然度量。其他诱导范数及其对应优化器的分析见附录A。对于作为激活线性映射的矩阵值权重,谱范数是自然的度量,因为它等于控制更新所导致最大变化的算子范数。相似文章
Muon优化器的谱缩放定律
本文首次系统研究了大语言模型训练过程中Muon优化器动量矩阵奇异值谱的行为规律,发现了在不同模型规模(77M至2.8B参数)下清晰的幂律缩放关系。研究结果为从业者提供了有理论依据、感知层级的Newton–Schulz迭代配置指南,在前沿规模下无需额外计算即可保持正交归一化质量。
超越预训练重新思考Muon:VLA与RLVR的频谱失效与高通补救措施
本文介绍了Pion,一种新的优化器,它用高通NS迭代取代了Muon的频谱白化,以稳定低秩和低信噪比(low-SNR)条件下的训练,从而在VLA和RLVR任务中实现了更优的性能。
Aurora: 一种杠杆感知的谱优化器
Aurora是一种杠杆感知的谱优化器,通过强制执行行均匀性同时保留Muon更新的极因子几何结构来解决MLP层中的神经元死亡问题,在modded-nanoGPT speedrun基准上实现了最先进的性能。
Muon 优化器能否微调 Adam 预训练模型?
研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。
Muon$^p$: 分数谱幂的Muon优化器
本文介绍了Muon^p,一种新颖的优化器,采用分数谱幂更新在Muon和梯度下降之间进行插值,提供了理论证明并在十亿参数规模的微调任务上取得了实证收益。