重新评估Muon在矩阵分解中的应用

arXiv cs.LG 论文

摘要

本文评估了Muon优化器在低秩矩阵分解上的表现,发现它并未持续优于AdamW,从而对早期关于其在大型深度学习中的优势说法提出质疑。

arXiv:2607.13246v1 公告类型:新 摘要:Muon最近成为一种强大的大规模深度学习优化器,它通过近似正交化重塑梯度更新,并据报道在大语言模型训练中优于Adam和AdamW。其实验成功推动了越来越多的理论研究,这些理论将Muon解释为谱范数下的最速下降。然而,目前尚不清楚Muon的优势哪些源自其更新规则本身,哪些是现代深度网络的规模、架构和数据的假象。在这项工作中,我们通过在一个简单、理解透彻且具有谱结构的问题(低秩矩阵分解)上研究Muon,将优化器与这些混淆因素隔离开来。通过与精心调优的自适应基线进行受控比较,我们发现Muon在此场景下并未持续优于AdamW,并且一些先前报道的优势对超参数选择敏感。我们的结果提供了关于何时频谱感知正交化有益的更细致图景,并主张在端到端基准测试之外,还应在受控问题上评估现代优化器。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:21

# 重新审视Muon在矩阵分解中的应用 来源:https://arxiv.org/html/2607.13246

\theorembodyfont\theoremheaderfont\theorempostheader :\theoremsep \jmlrvolume334\jmlryear2026\jmlrworkshop数据科学中的拓扑、代数与几何

\NameAli Parviz²22Halıcıoğlu数据科学研究所,加州大学圣地亚哥分校。\[email protected] \NameGal Mishne²22Halıcıoğlu数据科学研究所,加州大学圣地亚哥分校。\[email protected] \NameAlex Cloninger¹¹数学系,加州大学圣地亚哥分校。²22Halıcıoğlu数据科学研究所,加州大学圣地亚哥分校。\[email protected]

###### 摘要

Muon 最近已成为大规模深度学习的强大优化器,它通过近似正交化重塑梯度更新,并被报道在大语言模型训练中优于 Adam 和 AdamW。其实验成功激发了日益增长的理论文献,将 Muon 解释为谱范数下的最速下降。然而,尚不清楚 Muon 的优势哪些源于其更新规则本身,哪些是现代深度网络的规模、架构和数据带来的假象。在本工作中,我们通过在一个简单、理解充分且谱结构明确的问题——低秩矩阵分解——上研究 Muon 来将其与这些混杂因素隔离。通过对照自适应基线进行受控且系统调参的比较,我们发现 Muon 在此设定下*并未*一致优于 AdamW,并且先前报告的若干优势对超参数选择敏感。我们的结果为谱感知正交化在何时有帮助提供了更细致的图景,并主张除了端到端基准外,还应在受控问题上评估现代优化器。

## 1 引言

大规模优化的近期进展引入了一类显式利用梯度更新矩阵结构的优化器。其中,Muon(使用牛顿-舒尔茨进行动量正交化)已成为标准一阶方法的有力替代方案 (jordan2024muon)。与直接应用动量更新不同,Muon 通过基于牛顿-舒尔茨迭代的近似正交化步骤来变换更新方向,有效地重塑了梯度的谱。经验上,Muon 在现代深度学习任务(包括 GPT 风格模型)上表现出强劲性能,它提升了训练效率,在某些情况下甚至优于广泛使用的优化器如 Adam 和 AdamW (jordan2024muon; liu2025muonscalablellmtraining; shah2025practicalefficiencymuon)。值得注意的是,大规模研究报告在数十亿参数语言模型训练中,Muon 比 AdamW 快多达两倍 (shah2025practicalefficiencymuon)。

这些成功激发了越来越多的理论研究,通过谱范数最速下降和约束优化的视角来分析 Muon。现有分析在包括精确正交化、简化动量动力学和局部二次模型在内的各种简化假设下建立了收敛保证 (pethick2025normconstrainedlmo; li2025noteconvergencemuon; shen2025convergencemuon; chen2025muonspectralnorm; kovalev2025understandinggo; riabinin2025gluon; gruntkowska2025ef21muon; sato2025muonconvergence; nagashima2026improvedconvergenceratesmuon),而更近期的研究则考察了非精确牛顿-舒尔茨迭代以及近似误差如何传播到收敛保证中 (shulgin2025beyondideal; anon2025newtonschulz; lau2025polargrad)。

尽管取得了这些进展,但仍不清楚 Muon 优势的哪些方面是优化器固有的,哪些源自大规模深度学习的复杂性(其中架构、规模和数据相关效应难以解耦)。现有分析很少展示 Muon 在具体、定义明确的问题上*何时*以及*为何*应优于经典优化器,它们往往涉及理想化设定或纯局部性质 (davis2025whenspectral; su2025isotropic)。我们采取互补视角,在低秩矩阵分解上研究 Muon:这是一个简单但基础的问题,允许系统、详尽的评估,并且由于优化受良好刻画的曲率和奇异值结构支配,Muon 的谱特性在此可能有所帮助。我们的目标是刻画 Muon 的优势和局限性,并识别其在哪些情况下优于或劣于 Adam 和 AdamW 等标准优化器。这一聚焦暴露了预期与行为之间的差距,我们将其组织为三个问题。

1. Q1: Muon 在诸如矩阵分解等结构性问题中是否提供任何优势?矩阵分解具有显式的低秩结构,且与一个行为良好的优化景观相关联。如果 Muon 真正利用了梯度的谱特性,这应转化为更快的收敛。如果不能,是什么限制了其相对于 AdamW 等自适应方法的有效性?

2. Q2: Muon 的益处是否与特定问题结构相关?优化问题的哪些性质使得正交化更新具有优势?其益处是源于目标函数的特定几何或谱特征,还是能够推广到具有不同条件数、过参数化和约束的各种矩阵分解任务?

3. Q3: 在病态条件下,Muon 与自适应方法相比表现如何?矩阵分解对条件数敏感,尤其是当奇异值快速衰减时。AdamW 等优化器隐式地适应坐标缩放。Muon 的谱归一化是与这种自适应性竞争还是冲突,在何种条件下其中一方占主导?

**发现。** 与在大规模模型中的强劲表现相反,Muon 在这些经典设定中的优势取决于问题。在低秩分解和矩阵补全上,其被报告的优势在同等调参下消失,AdamW 和 GD 达到或超过其性能。然而,在 NMF 上,Muon 保留了持续的优势,可能是因为其正交化更新抑制了冗余因子并促进了更多样化的表示。这种对问题结构的依赖性表明,Muon 更广泛的成功可能也源于深度学习特有的性质,并强调了受控优化基准的价值。

## 2 矩阵分解:对称和非负变体

我们首先固定全文使用的符号。对于矩阵 \{\bm{M}\},令 \sigma_i(\{\bm{M}\}) 表示其第 i 大的奇异值,\sigma_{\min}(\{\bm{M}\}) 表示其最小奇异值。我们用 \left\lVert\{\bm{M}\}\right\rVert_{\mathrm{op}} 和 \left\lVert\{\bm{M}\}\right\rVert_{\mathrm{F}} 分别表示谱范数和 Frobenius 范数。对于 k \leq d,令 \mathcal{O}_{d\times k} 为 \mathbb{R}^{d\times k} 中具有正交列的矩阵集合。给定标量 a_1, \dots, a_d,我们写 \mathsf{diag}\{a_1, \dots, a_d\} 表示以这些元素为对角元素的对角矩阵。我们在附录 ̃A (https://arxiv.org/html/2607.13246#A1) 中讨论 Muon (jordan2024muon),并将相关工作的详细讨论推迟到附录 C (https://arxiv.org/html/2607.13246#A3)。

##### 对称矩阵分解

我们考虑对称矩阵分解问题
\min_{\{\bm{U}\}\in\mathbb{R}^{d\times k}} \quad f(\{\bm{U}\}) = \frac{1}{4} \left\lVert\{\bm{U}\}\{\bm{U}\}^\top - \{\bm{M}\}^\star\right\rVert_{\mathrm{F}}^2,
(1)
其中 \{\bm{M}\}^\star \in \mathbb{R}^{d\times d} 是一个秩为 r 的半正定矩阵,\{\bm{U}\} \in \mathbb{R}^{d\times k} 是一个因子,具有 k \geq r 列(k=r 是精确参数化情形,k > r 是过参数化情形)。目标是通过求解方程1 (https://arxiv.org/html/2607.13246#S2.E1) 以低秩分解 \{\bm{U}\}\{\bm{U}\}^\top 来恢复 \{\bm{M}\}^\star。我们假设 \{\bm{M}\}^\star 可分解为 \{\bm{M}\}^\star = \{\bm{V}\}^\star \{\bm{\Lambda}\}^\star \{\bm{V}\}^{\star\top},其中 \{\bm{\Lambda}\}^\star = \mathsf{diag}\{\lambda_1^\star, \dots, \lambda_r^\star\} 收集非零特征值,且 \lambda_1^\star \geq \cdots \geq \lambda_r^\star > 0,\{\bm{V}\}^\star \in \mathbb{R}^{d\times r} 是正交矩阵。\{\bm{M}\}^\star 的条件数为
\kappa \coloneqq \lambda_1^\star / \lambda_r^\star.
(2)
对称问题方程1 (https://arxiv.org/html/2607.13246#S2.E1) 是更广泛低秩分解问题家族中正定、因子绑定的实例;我们将一般的双线性分解和矩阵补全变体推迟到附录 B (https://arxiv.org/html/2607.13246#A2)。

##### 非负矩阵分解。

一个紧密相关的变体约束目标和因子均为元素非负。对于秩为 r 的目标 \{\bm{M}\}^\star \in \mathbb{R}^{d_1\times d_2},非负矩阵分解(NMF)求解
\min_{\begin{subarray}{c}\{\bm{U}\}\in\mathbb{R}_{\geq 0}^{d_1\times k}\\[2.0pt] \{\bm{V}\}\in\mathbb{R}_{\geq 0}^{d_2\times k}\end{subarray}} \quad \frac{1}{2} \left\lVert\{\bm{U}\}\{\bm{V}\}^\top - \{\bm{M}\}^\star\right\rVert_{\mathrm{F}}^2,
(3)
其中 \mathbb{R}_{\geq 0} 表示非负实数,k \geq r。NMF 是带有非负约束的一般双线性分解方程12 (https://arxiv.org/html/2607.13246#A2.E12)(附录 B (https://arxiv.org/html/2607.13246#A2))的特例。此外,我们将精确的 softplus 及其泰勒代理作为非线性矩阵分解进行分析,并展示截断施加了一个秩上限,这解释了图12 (https://arxiv.org/html/2607.13246#A11.F12)(附录 K (https://arxiv.org/html/2607.13246#A11))中的高秩差距。

参见图题
图 1: 低秩分解,条件数扫描(目标秩 r=15,匹配搜索秩 k=15,维度 d=100)。每个条件数 \kappa(从良态 \kappa=1 到强病态 \kappa=625)下调优后的最终损失 vs. 学习率(3 个种子的几何均值,±\pm 对数标准差带)。目标的 15 个奇异值从 \kappa 线性递减到 1,因此 \kappa 正好是条件数。调参后,AdamW 和 GD 达到接近机器精度;Muon 配置停滞在高几个数量级。

参见图题
图 2: 非负分解。最终损失(y 轴,对数刻度;3 个种子的几何均值,阴影表示 ±\pm 一个对数标准偏差带)vs. 学习率(x 轴,对数刻度)。面板 (a–c) 使用均匀谱,(d–f) 使用衰减谱,因子秩分别为 r=10,50,100。在两种谱下,调参后的 Muon 是唯一能拟合目标的方法,覆盖各个秩;AdamW 落后几个数量级,GD/SignGD 失败。

参见图题
图 3: AdamW 在所有谱形状上优于 Muon 变体(矩阵分解,目标 m\times n=150\times150,秩 r=5)。在固定 \kappa=10^4 下七种谱轮廓的调优最终损失(3 个种子的均值)。Muon 和没有 Nesterov 式动量的 Muon 在大多数谱形状上表现退化,而 AdamW 尽管存在极端病态仍然有效。

参见图题
图 4: 谱子空间恢复(高斯核目标 K\in\mathbb{R}^{100\times100},全秩 k=100,调优 LR,12 次初始化)。对齐 M_{ij}=|\langle u_i, e_j\rangle|(式16 (https://arxiv.org/html/2607.13246#A10.E16))表示学习到的奇异向量与 K 的真实特征向量之间的匹配。(a) AdamW 和 (b) Muon 均恢复了顶部特征向量,在近简并的中频带出现分歧。(c) 差异将其隔离:AdamW 保持更紧的有序对角线(蓝色),Muon 扩散到相邻位置(红色)—— 更低的对角线能量(0.586 vs. 0.643)。

参见图题
图 5: 张量训练无噪声情形(真实秩 r^{\star}=4)。每个优化器的最终损失 vs. 学习率,搜索秩 r\in\{2,4,8,20\} 涵盖欠参数化、精确参数化(r=r^{\star},加粗面板)和过参数化设定。实线是 3 个种子的中位数;阴影带是最小-最大值。

## 3 实验设计与评估协议

我们验证以下说法:矩阵分解中的优化器比较对超参数高度敏感,因此从单一(通常是默认)配置得出的结论不具备代表性。超越先前工作 (ma2026preconditioningbenefitsspectralorthogonalization),我们在受控协议下评估五个矩阵恢复问题,该协议保持模型容量和参数化固定,仅变化与优化相关的超参数,覆盖从良态到严重*病态*目标。进一步的两项分析隔离了*条件数*的影响方式:每个优化器对固定极端条件数下特征值分布*形状*的敏感性 (第4.1节 (https://arxiv.org/html/2607.13246#S4.SS1)),以及每个优化器恢复目标谱子空间的动力学 (第J节 (https://arxiv.org/html/2607.13246#A10))。

### 3.1 问题设置

所有问题使用环境维度 d=100 和分解参数化 \hat{M}=UV^\top,其中 U,V\in\mathbb{R}^{d\times r},从小的随机初始化开始优化。我们考虑:

- **低秩分解(条件数)**。一个完全观测的目标 M^{\star}=U^{\star}\mathrm{diag}(\sigma)U^{\star\top},秩 r=15(即我们求解对称分解),其奇异值在 \kappa 和 1 之间线性分布,因此 \kappa\in\{1,5,25,125,625\} 正好是条件数。目标函数 \tfrac{1}{4}\lVert UU^\top-M^{\star}\rVert_{F}^2(图1 (https://arxiv.org/html/2607.13246#S2.F1))。

- **矩阵补全(条件数)**。一个秩为 4 的对称半正定目标,使用相同的条件数扫描,在均匀随机的 20% 条目上观测;损失为 \tfrac{1}{2}\lVert\mathcal{P}_{\Omega}(UV^\top-M^{\star})\rVert_{F}^2,即观测支持上的平方误差(图7 (https://arxiv.org/html/2607.13246#A3.F7))。

- **矩阵补全(过参数化)**。相同的补全任务,固定 \kappa=5 和真实秩 4,扫描搜索秩 k\in\{4,5,100\}(匹配、轻度、重度过参数化)(图8 (https://arxiv.org/html/2607.13246#A3.F8))。

- **非负分解**。一个非负目标,使用投影(\cdot\geq 0)参数化,因子秩 k\in\{10,50,100\},在两种目标谱下:一个*均匀*谱和一个*衰减*(指数分级)谱,后者消除了均匀情况的平坦“DC分量”简并性(图2 (https://arxiv.org/html/2607.13246#S2.F2))。

- **张量训练分解(过参数化,噪声)**。一个对称半正定目标 M^{\star}=U^{\star}U^{\star\top},使用未绑定的核心 U,V 在无噪声(r^{\star}=4)和有噪声(r^{\star}=30)情况下恢复,扫描

相似文章

Muon何时有助于智能体强化学习?

Hugging Face Daily Papers

本文研究了Muon优化器在强化学习后训练中的应用,发现在ALFRED任务中,将Muon应用于隐藏权重矩阵相比AdamW显著提高了成功率,且结果依赖于优势估计器和学习率。

Muon 优化器能否微调 Adam 预训练模型?

Hugging Face Daily Papers

研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。

Muon为何超越Adam:曲率视角

Hugging Face Daily Papers

本文探究了Muon优化器在大型语言模型训练中为何优于Adam,从曲率视角表明Muon因更低的归一化方向锐度而承受更小的曲率惩罚,且其优势因数据不平衡而放大。

SignMuon: 通信高效的分布式Muon优化

arXiv cs.LG

SignMuon是一种1位、感知矩阵的分布式训练优化器,它结合了signSGD的多数投票符号聚合与Muon的极坐标步骤框架,在float32基础上实现32倍带宽缩减,同时在CIFAR-10/ResNet-50和nanoGPT等基准测试上保持强大的收敛性和性能。

Muon需要多少正交化?

arXiv cs.LG

本文研究了Muon优化器需要多少正交化,提出了一种五步三次牛顿-舒尔茨方案,该方案降低了计算成本,同时在GPT-2 Small和混合MoE/Mamba模型上实现了与更昂贵方法相似的训练质量。