具有有限Newton-Schulz的Muon:非光滑非凸优化中的平滑益处

arXiv cs.LG 论文

摘要

本文分析了Muon优化器中的有限Newton-Schulz迭代如何通过平滑极映射使非光滑非凸优化受益,提供了匹配最佳已知界限的收敛保证。

arXiv:2608.26288v1 Announce Type: new 摘要:Muon已成为大型语言模型预训练中矩阵值参数的强力优化器,通过少量Newton-Schulz迭代近似正交化其动量。现有理论要么将此迭代替换为其近似的精确极因子,要么将其有限深度视为近似误差,因此Muon实际运行的迭代只能损害保证。我们表明有限Newton-Schulz反而可以对非光滑非凸优化有益。为此,我们通过在线到非凸转换分析Muon,该转换将更新规则视为在线学习者,并将其遗憾界限转化为平稳性保证。有限Newton-Schulz迭代将不连续的极映射平滑为奇异值的Lipschitz映射,而具有有限Newton-Schulz的Muon可以被视为具有平滑谱势的在线学习者。这种平滑正是转换所需要的:我们证明,仅随目标精度对数增长的Newton-Schulz深度足以在非光滑非凸优化中收敛到平稳点,而具有精确极更新的Muon可能无法收敛。由此得到的样本复杂度界限匹配非光滑非凸优化的最佳已知保证,并且对于光滑非凸优化在问题依赖因子内是最优的。该论证超出了Newton-Schulz,适用于具有相同平滑性质的一般谱映射。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:37

# 非光滑非凸优化中的平滑效益  
来源: https://arxiv.org/html/2608.26288  
## 具有有限牛顿-舒尔茨迭代的Muon:非光滑非凸优化中的平滑效益  
**致谢**: 作者按字母顺序排列。  
**Taira Tsuchiya**  
**备注**: 东京大学与理化学研究所;[email protected]  
2026年8月26日  

###### 摘要  
Muon已成为大型语言模型预训练中矩阵值参数的强优化器,通过几次牛顿-舒尔茨迭代近似正交化其动量项。现有理论要么用该迭代所逼近的精确极因子替换它,要么将其有限深度视为近似误差,因此Muon实际运行的迭代可能损害收敛保证。我们证明,有限牛顿-舒尔茨迭代对非光滑非凸优化反而是有益的。为此,我们通过在线到非凸转换分析Muon,该转换将更新规则视为在线学习器,并将其遗憾界转化为平稳性保证。有限牛顿-舒尔茨迭代将不连续的极映射平滑化为关于奇异值的利普希茨映射,而采用有限牛顿-舒尔茨的Muon可视为具有平滑谱势的在线学习器。这种平滑化正是转换所需:我们证明,当目标精度增加时,仅需对数增长的牛顿-舒尔茨深度即可实现非光滑非凸优化中向平稳点的收敛,而采用精确极更新的Muon可能无法收敛。所得样本复杂度界与非光滑非凸优化的最优保证一致,且在光滑非凸优化中达到问题相关因子下的最优性。该论证可推广至具有相同平滑性质的广义谱映射。  

## 1 引言  
在大型语言模型(LLM)预训练中,大多数可训练参数为矩阵,Muon(Jordan等,2024 [链接])已成为事实标准AdamW(Loshchilov和Hutter,2019 [链接])的有力替代方案。规模化研究显示Muon带来显著效率提升(Liu等,2025 [链接]),基于Muon的优化器已用于训练Kimi K2和GLM-4.5等前沿模型(Kimi团队,2025 [链接];GLM-4.5团队,2025 [链接]),系统性基准测试将Muon列为最强预训练优化器之一(Wen等,2026 [链接])。  

这一成功依赖于Muon核心操作的高效实现——更新方向的正交化。每轮迭代中,Muon维护随机梯度的指数移动平均M,并沿M的正交化方向更新:对奇异值分解M=UΣV⊤,理想方向是极因子UV⊤,它保持M的奇异子空间并将每个正奇异值映射为1(Jordan等,2024 [链接];Bernstein和Newhouse,2024 [链接])。Muon未通过奇异值分解计算UV⊤,而是用牛顿-舒尔茨迭代的几次迭代来近似它——这是一种经典的基于固定奇数次矩阵多项式的方案,仅需矩阵乘法(Kovarik,1970 [链接];Björck和Bowie,1971 [链接])。我们将截断至有限深度的迭代称为有限牛顿-舒尔茨。这种低成本的正交化是Muon在LLM预训练规模下实用的关键原因。  

Muon的实证成功推动了快速发展的收敛理论,目前主要针对光滑目标。然而,大多数理论将牛顿-舒尔茨循环替换为精确极因子,或更一般地替换为范数球上的精确线性最小化预言机(Li和Hong,2025 [链接];Kovalev,2025 [链接];Pethick等,2025 [链接];Shen等,2026 [链接];Chen等,2026 [链接];Riabinin等,2026 [链接];Sfyraki和Wang,2026 [链接]),因此有限牛顿-舒尔茨迭代从未进入分析。近期分析考虑了有限牛顿-舒尔茨迭代,但将其有限深度效应视为相对于精确极更新的近似误差(Kim和Oh,2026 [链接];Shulgin等,2026a [链接];Choudhury等,2026 [链接])。在这些分析中,有限牛顿-舒尔茨只能有害,因为当迭代更精确逼近极因子时,保证会改进。  

另一条理论路线取消了对目标函数的平滑性假设,转而基于在线学习。Cutkosky等(2023 [链接])的在线到非凸转换(O2NC)让在线学习器选择优化器的更新增量,学习器的遗憾随后转化为松弛型Goldstein平稳性度量(Goldstein,1977 [链接])的界限,这是非光滑非凸优化的标准目标。将此框架应用于矩阵优化器,Jiang等(2026a [链接])注意到采用精确极更新的Muon与算子范数球上的跟随领导者算法一致,这种在线算法可能遭遇线性遗憾,因而无法保证收敛到平稳点。因此他们替换在线学习器,注入随机扰动或增强动量矩阵,导出了Pion和Leon算法,这些算法具有非光滑目标的平稳性保证。然而,这些方法偏离了实际实现的Muon:它们添加了Muon未使用的组件,而Muon实际使用的有限牛顿-舒尔茨迭代从未进入分析。因此,一条路线仅将有限牛顿-舒尔茨作为待控制的误差且要求平滑性,另一条路线处理非光滑目标但替换了Muon实际执行的更新。这留下了基本问题:*有限牛顿-舒尔茨迭代能否作为优势而非误差,使带动量的Muon找到非光滑目标的平稳点?*  

### 1.1 本文贡献  
我们对此问题给出肯定答案。带动量和有限牛顿-舒尔茨的Muon能找到非光滑目标的平稳点,而采用精确极更新的Muon可能无法收敛(Parshakova等,2026 [链接])。原因在于有限迭代用关于奇异值的利普希茨映射替代了不连续的极映射,这种平滑化使得在线到非凸转换能够提供平稳性保证。以下非正式陈述总结了所得保证。  

###### 定理1.1(定理5.3 [链接]的非正式版本)  
考虑一个可能既非光滑也非凸的利普希茨目标,通过具有有界噪声的无偏随机梯度预言机访问。则对于任意半径ρ>0和精度ε>0,带动量的Muon在每轮进行q=O(log(1/ε))次牛顿-舒尔茨步骤,可在O(ρ⁻¹ε⁻³+ε⁻²)次随机梯度评估内,期望上找到(ρ,ε)-平稳点。平稳性标准是Jiang等(2026a [链接])的(ρ,ε)-平稳性,定义见定义2.2 [链接],主导项ρ⁻¹ε⁻³依赖与Pion和Leon在相同标准下建立的保证一致(见附录A [链接])。据我们所知,这是首个非光滑非凸目标的平稳性保证,其中有限牛顿-舒尔茨作为实现收敛的平滑机制而非待控制的近似误差。所需深度仅随目标精度对数增长,这与实证观察中几次牛顿-舒尔茨迭代即可满足实践相符(Jordan等,2024 [链接])。我们分析的精确变体及其与部署版Muon的剩余差异见第2节 [链接],讨论见第6节 [链接]。  

##### 技术贡献  
通过在线到非凸转换,仅需界限Muon更新规则作为在线学习器在算子范数球上产生的折扣遗憾(Cutkosky等,2023 [链接];Jiang等,2026a [链接])。我们证明此更新是平滑谱势在动量处的梯度,因此该学习器是基于梯度的预测算法(Abernethy等,2014 [链接];Abernethy等,2016 [链接])。此类算法的折扣遗憾分解为惩罚项(随势逼近核范数而减小)和稳定性项(随诱导谱映射的利普希茨常数增长)。与基于累积梯度的标准分解(Jiang等,2026a [链接])不同,我们基于动量进行分解,这对确定性光滑目标给出了最优的O(1/ε²)依赖(第5.3节 [链接])。关键引理(引理5.2 [链接])量化了有限牛顿-舒尔茨的两项:惩罚项和稳定性项均随q几何衰减/增长。因此深度控制惩罚-稳定性权衡,在q=O(log(1/ε))时平衡两项可得次线性折扣遗憾,通过转换得到上述保证(第5节 [链接])。当q→∞时,更新逼近精确极因子,稳定性项无界增长,反映了跟随领导者可能遭遇的线性遗憾。Muon学习器也是折扣线性损失上的跟随正则化领导者(FTRL),其谱正则化器由平滑势的芬切尔共轭给出(定理5.7 [链接])。深度控制正则化量:当q=0时,正则化器变为限制在算子范数球上的平方弗罗贝尼乌斯正则化器;当q→∞时,它在球上衰减为零,更新逼近跟随领导者。  

分析不限于牛顿-舒尔茨多项式。遗憾界对奇异值的更一般谱映射成立(定理4.2 [链接]),这有助于识别此类映射在非光滑目标上产生平稳性保证的充分条件。近期工作设计了极变换的平滑松弛并推导了其相关的凸正则化器(Mustafi等,2026 [链接];Feoktistov等,2026 [链接]),我们的通用分析涵盖了此类松弛(附录F [链接])。与这些研究相比,我们证明有限牛顿-舒尔茨迭代本身平滑了极变换并诱导了FTRL正则化器,而无需引入单独的松弛。  

### 1.2 相关工作  
##### Muon优化器  
Muon由Jordan等(2024 [链接])提出,作为神经网络矩阵形隐藏层的优化器。谱更新方向早先用于预条件谱下降(Carlson等,2015 [链接]),Muon的最陡下降和对偶解释由Bernstein和Newhouse(2024 [链接];2025 [链接])发展。在平滑和广义平滑假设下,已建立采用精确极更新或精确线性最小化预言机的Muon收敛保证(Li和Hong,2025 [链接];Kovalev,2025 [链接];Pethick等,2025 [链接];Shen等,2026 [链接];Chen等,2026 [链接];Riabinin等,2026 [链接];Sfyraki和Wang,2026 [链接])。其隐式偏差、动量的去噪作用以及谱更新优于欧几里得更新的范围也被研究(Fan等,2025 [链接];Li等,2026 [链接];Davis和Drusvyatskiy,2025 [链接];Braun等,2026 [链接])。对于采用精确极更新的Muon,Parshakova等(2026 [链接])构造了凸利普希茨目标,其迭代无法收敛,这明确了在非光滑问题上有限牛顿-舒尔茨带来变化的问题。本文研究此问题,分析在非光滑非凸目标上同时保留动量和有限牛顿-舒尔茨的更新。  

##### 牛顿-舒尔茨与广义谱映射  
通过矩阵多项式的迭代正交化可追溯至Kovarik(1970 [链接])和Björck与Bowie(1971 [链接]),Muon中使用的迭代从实证调谐多项式(Jordan等,2024 [链接])到为此目的设计的最优多项式方案(Amsel等,2026 [链接])。包含有限迭代的Muon分析将有限迭代效应视为误差:针对光滑非凸目标(Kim和Oh,2026 [链接]),通过不精确线性最小化预言机(Shulgin等,2026a [链接]),以及针对重尾噪声下的Nesterov动量(Choudhury等,2026 [链接])。少数近期工作识别了结构化设置中正交化及其有限近似的效益:在矩阵二次型上,有限牛顿-舒尔茨抑制与接近秩亏的小奇异值相关的方向(Shulgin等,2026b [链接]),不精确极更新可改善简单强凸二次型的可达性(Gonon等,2026 [链接])。

相似文章

MuCon: Clipped Muon Updates for LLM Training

arXiv cs.LG

本文介绍了MuCon,一种用于大语言模型训练的裁剪Muon优化器,它应用奇异值裁剪而非完全极化,保留较小的奇异值而仅裁剪最大的奇异值。它探索了避免全SVD的近似方法,包括极坐标/绝对值公式和有理牛顿滤波器,并指出了阈值附近的数值挑战。

Muon$^p$: 分数谱幂的Muon优化器

arXiv cs.LG

本文介绍了Muon^p,一种新颖的优化器,采用分数谱幂更新在Muon和梯度下降之间进行插值,提供了理论证明并在十亿参数规模的微调任务上取得了实证收益。

Muon需要多少正交化?

arXiv cs.LG

本文研究了Muon优化器需要多少正交化,提出了一种五步三次牛顿-舒尔茨方案,该方案降低了计算成本,同时在GPT-2 Small和混合MoE/Mamba模型上实现了与更昂贵方法相似的训练质量。