RODE: 一种用于优化的径向-正交解耦引擎
摘要
本文介绍了RODE,一种将矩阵更新的径向和方向分量解耦的优化器,在语言建模和图像分类任务中表现出优于Muon变体的性能。
arXiv:2608.21024v1 公告类型:新
摘要:现代神经网络训练越来越多地使用矩阵感知优化器,但其条件矩阵步通常直接添加到权重中,同时改变其范数和方向。这种交互很重要,因为当前范数决定角运动,而方向学习可以驱动范数增长,从而改变后续步骤。我们引入RODE,它为径向和方向分量提供单独的更新规则和步长。RODE通过标量径向规则显式更新矩阵Frobenius范数,而其方向通道在切空间中执行Newton--Schulz条件更新。受控的GPT-2干预显示,直接范数控制和RODE的方向更新都带来增益。在两项语言建模和两项图像分类任务中,RODE在所有直接比较中均优于两种Muon变体,并最终具有更低的全模型范数。在1.5B规模下,使用直接从Qwen2风格语言模型扫描转移的学习率,RODE相对于Muon RMS将损失从4.145降低到3.346,最终全局范数从11964降低到2183,固定半径RODE进一步改善。对于Qwen3.5-9B全参数微调,所有六种优化器使用相同的调优预算和相同的正式训练与评估设置;RODE在所有四项评估任务中优于两种Muon变体,并在GSM8K和MATH-500上取得最高平均值。因此,解耦径向和方向动态提供了更有效和可控的矩阵优化方法。
查看缓存全文
缓存时间: 2026/08/24 04:35
# RODE:一种用于优化的径向-正交解耦引擎
来源:https://arxiv.org/html/2608.21024
程卓
浙江大学,杭州,中国
\{12647046,12621175\}@zju\.edu\.cn
附属机构:
孙奇
附属机构:
通讯作者:
\{qisunchn,czhuo\}@zju\.edu\.cn
###### 摘要
现代神经网络训练越来越多地使用矩阵感知优化器,但它们的条件矩阵步骤通常直接添加到权重中,从而同时改变其范数和方向。这种相互作用很重要,因为当前的范数决定了角度运动,而方向学习可以驱动范数增长,进而改变后续步骤。我们引入了RODE,它为径向和方向分量提供了独立的更新规则和步长。RODE通过标量径向规则显式更新矩阵的Frobenius范数,而其方向通道则在切空间中执行Newton–Schulz条件化更新。受控的GPT-2干预实验表明,显式的范数控制和RODE的方向更新均能带来增益。在两个语言建模和两个图像分类任务中,RODE在所有直接对比中均优于两个Muon变体,并以更低的最终全局模型范数结束。在1.5B规模下,使用从Qwen2风格语言模型扫描中直接转移的学习率,RODE将损失从4.145降至3.346,并将最终全局范数从11964降至2183(相对于Muon RMS),固定半径的RODE性能进一步提升。在Qwen3.5-9B的全参数微调中,所有六个优化器使用相同的调优预算以及相同的正式训练和评估设置;RODE在所有四个评估任务上均优于两个Muon变体,并在GSM8K和MATH-500上获得了最高的平均分。因此,解耦径向和方向动态为矩阵优化提供了一种更有效且可控的方法。
*关键词* 优化⋅\\cdot 矩阵参数⋅\\cdot Newton-Schulz迭代⋅\\cdot 径向-方向优化⋅\\cdot 深度学习
## 1 引言
现代神经网络主要通过更新权重矩阵来训练。Adam和AdamW对各个坐标进行自适应调整\(18 (https://arxiv.org/html/2608.21024#bib.bib1);24 (https://arxiv.org/html/2608.21024#bib.bib2)\),而矩阵感知优化器则利用二维结构;例如,Muon对动量应用Newton–Schulz迭代\(16 (https://arxiv.org/html/2608.21024#bib.bib25);13 (https://arxiv.org/html/2608.21024#bib.bib12)\)。尽管构造方式不同,但大多数方法最终都会将一个矩阵值步长添加到当前权重:
Wt+1=Wt+ΔWt.
W\_\{t\+1\}=W\_\{t\}\+\\Delta W\_\{t\}.\(1\)
我们将此操作称为*加法矩阵更新*。加法矩阵更新具有两种几何上不同的效果。令
Wt=ρtUt, ρt=‖Wt‖F, Ut=Wtρt, ‖Ut‖F=1,
W\_\{t\}=\\rho\_\{t\}U\_\{t\},\qquad\\rho\_\{t\}=\\\|W\_\{t\}\\\|\_\{\\mathrm\{F\}\},\qquad U\_\{t\}=\\frac\{W\_\{t\}\}\{\\rho\_\{t\}\},\qquad\\\|U\_\{t\}\\\|\_\{\\mathrm\{F\}\}=1,\(2\)
其中UtU\_\{t\}是方向,ρt\\rho\_\{t\}是尺度。在归一化或尺度不变的模块中,重新缩放可能保持所表示的函数不变,但仍然改变下一步更新的角度运动\(33 (https://arxiv.org/html/2608.21024#bib.bib15);14 (https://arxiv.org/html/2608.21024#bib.bib14);12 (https://arxiv.org/html/2608.21024#bib.bib33);19 (https://arxiv.org/html/2608.21024#bib.bib16)\);在其他情况下,尺度也会直接影响函数。因此,范数和方向扮演着不同的角色。令QtQ\_\{t\}表示由条件化器(如Muon)产生的矩阵更新,使得Wt+1=Wt−ηQtW\_\{t\+1\}=W\_\{t\}\-\\eta Q\_\{t\}。则
‖Wt−ηQt‖F2=ρt2−2ηρt⟨Ut,Qt⟩F+η2‖Qt‖F2,
\\\|W\_\{t\}\-\\eta Q\_\{t\}\\\|\_\{\\mathrm\{F\}\}^\{2\}=\\rho\_\{t\}^\{2\}\-2\\eta\\rho\_\{t\}\\langle U\_\{t\},Q\_\{t\}\\rangle\_\{\\mathrm\{F\}\}\+\\eta^\{2\}\\\|Q\_\{t\}\\\|\_\{\\mathrm\{F\}\}^\{2\},
平行于UtU\_\{t\}的分量在一阶改变Frobenius范数,而Qt⟂Q\_\{t\}^\{\\perp\}通过η‖Qt⟂‖F/ρt+O\(η2\)\\eta\\\|Q\_\{t\}^\{\\perp\}\\\|\_\{\\mathrm\{F\}\}/\\rho\_\{t\}\+\\mathcal\{O\}\(\\eta^\{2\}\)改变方向。即使QtQ\_\{t\}是切向的,二次项也会增加平方范数。因此,方向学习可能增加范数并减少后续绝对步长所实现的角度。Muon的更新通常不与UtU\_\{t\}相切,因此一个条件化步骤会混合两种效应。权重衰减可以抵消增长,但仅通过依赖于优化器和调度的平衡\(19 (https://arxiv.org/html/2608.21024#bib.bib16);35 (https://arxiv.org/html/2608.21024#bib.bib17)\)。显式的径向控制则使这种选择可见且可调。
我们引入RODE,一个用于矩阵优化的径向-正交解耦引擎。RODE提取径向和方向信号,为它们赋予不同的更新规则和学习率,并保留用于方向的Newton–Schulz条件化。它使用切线投影和球形方向实现,而标量规则更新半径。因此,半径演化和方向学习变得可分别调节,而跨变化切线空间的动量引入了残余相互作用,这在我们的分析中得到考虑(附录D (https://arxiv.org/html/2608.21024#A4))。RODE在保持矩阵感知条件化的同时,使范数和方向动态显式可控。我们通过受控干预评估其组件,跨四个语言和视觉任务评估其整体优化性能,进行1.5B规模的超参数转移研究,以及9B规模的全参数微调。
我们的贡献包括:
- • 我们引入了RODE,一种在径向-方向坐标中重新表述加法矩阵优化的矩阵优化器,将权重尺度和方向从更新的隐式耦合结果转变为分别可控的优化变量。
- • 首先,RODE引入了一个显式的径向优化通道。它提取每个被管理矩阵的径向梯度,并使用专用的标量规则和学习率更新其Frobenius范数,防止范数演化成为方向学习的无控制副产品。
- • 其次,RODE开发了一个用于矩阵感知优化的正交方向引擎。它将动量重新投影到当前切线空间,应用投影Newton–Schulz条件化,并以具有独立学习率的球上方向步长实现结果更新。这种构造在保留矩阵感知条件化的同时,将方向进展与当前参数范数解耦。我们的分析进一步考虑了跨变化切线空间的动量所引起的残余相互作用,并在显式假设下提供了收敛保证(附录D (https://arxiv.org/html/2608.21024#A4) 和 E (https://arxiv.org/html/2608.21024#A5))。
- • 我们通过实证验证了该机制及最终的优化器。受控干预分别识别了显式范数控制和方向引擎的增益,而跨语言建模和图像分类的实验,连同1.5B的超参数转移研究,证明了与Muon变体相比,RODE具有一致性的改进,并显著控制了范数增长。在Qwen3.5-9B全参数微调中,所有六个优化器使用相同的调优预算以及相同的正式训练和评估设置;RODE在所有四个评估任务上均优于两个Muon变体,并在GSM8K和MATH-500上获得了最高的平均分。
## 2 相关工作
RODE连接了通常分离的两个工作方向:矩阵值更新方向和参数尺度控制。
#### 自适应和矩阵感知优化器。Adam\(W\)将动量与逐坐标二阶矩结合\(18 (https://arxiv.org/html/2608.21024#bib.bib1);24 (https://arxiv.org/html/2608.21024#bib.bib2)\);Adafactor对该状态进行分解\(32 (https://arxiv.org/html/2608.21024#bib.bib7)\),AdEMAMix混合快速和慢速动量\(26 (https://arxiv.org/html/2608.21024#bib.bib8)\)。Shampoo使用Kronecker分解统计量\(7 (https://arxiv.org/html/2608.21024#bib.bib3)\);SOAP在预条件子的特征基中更新类似Adam的统计量\(34 (https://arxiv.org/html/2608.21024#bib.bib4)\);MARS-M将方差缩减应用于矩阵更新\(41 (https://arxiv.org/html/2608.21024#bib.bib5);23 (https://arxiv.org/html/2608.21024#bib.bib6)\)。Muon对动量应用短Newton–Schulz迭代\(16 (https://arxiv.org/html/2608.21024#bib.bib25)\),后续研究其大规模配方\(21 (https://arxiv.org/html/2608.21024#bib.bib30)\)。Muon直接添加其条件化步长;RODE则为径向和矩阵条件化方向信号赋予不同规则。
#### 尺度、方向和流形方法。权重归一化在模型参数化中暴露了幅度和方向\(31 (https://arxiv.org/html/2608.21024#bib.bib13)\)。对于尺度不变的归一化权重,范数控制有效学习率:更新引起的范数增长会减缓后续方向变化,权重衰减可以抵消这种效应\(33 (https://arxiv.org/html/2608.21024#bib.bib15);14 (https://arxiv.org/html/2608.21024#bib.bib14);30 (https://arxiv.org/html/2608.21024#bib.bib34)\)。AdamP移除增加范数的径向动量分量以防止过早的有效步长衰减\(12 (https://arxiv.org/html/2608.21024#bib.bib33)\)。旋转平衡表明,更新引起的增长和权重衰减可以达到平衡范数和角度更新,显式控制旋转可以恢复该平衡的重要好处\(19 (https://arxiv.org/html/2608.21024#bib.bib16)\)。适当的AdamW衰减也随模型和数据集规模而变化,并可决定学习率转移是否有效\(35 (https://arxiv.org/html/2608.21024#bib.bib17)\)。总之,这些结果确立了权重范数作为优化动态的控制器,而不仅仅是正则化统计量。LARS/LAMB根据参数范数缩放加法步长\(39 (https://arxiv.org/html/2608.21024#bib.bib18);40 (https://arxiv.org/html/2608.21024#bib.bib19)\);Fromage使用逐层相对更新\(3 (https://arxiv.org/html/2608.21024#bib.bib31)\);Nero对每个神经元执行角度控制的投影更新\(22 (https://arxiv.org/html/2608.21024#bib.bib32)\)。RODE则暴露一个跨矩阵的半径作为优化器坐标,并将正交化核应用于切线投影动量。基于切空间更新和流形保持映射的黎曼优化方法启发了RODE的受限方向更新\(1 (https://arxiv.org/html/2608.21024#bib.bib9);4 (https://arxiv.org/html/2608.21024#bib.bib10);2 (https://arxiv.org/html/2608.21024#bib.bib11)\)。
#### 近期的半径-方向方法。Hyperball通过约束每个被管理矩阵到由其初始Frobenius范数定义的球上并归一化基础优化器更新来包装基础优化器,因此学习率直接设置相对更新长度\(37 (https://arxiv.org/html/2608.21024#bib.bib36)\)。半径在整个训练过程中保持固定。幅度-方向解耦也保持固定范数的方向因子,而尺度由单独优化的行和列增益表示;方向因子可以通过Adam、Muon或其他基础优化器进行更新\(8 (https://arxiv.org/html/2608.21024#bib.bib35)\)。在默认形式中,RODE直接从径向梯度学习一个跨矩阵的标量半径。其方向通道对切线投影动量应用投影Newton–Schulz条件化。径向和方向通道使用独立的学习率。
## 3 方法
RODE将当前信号分解为径向和方向分量,赋予它们不同的规则和步长,并保留用于方向的矩阵条件化。图1 (https://arxiv.org/html/2608.21024#S3.F1)将此接口与直接加法更新进行了对比。我们描述一个矩阵;其他参数使用AdamW。
图1:Muon对动量进行条件化,并将结果矩阵步长直接添加到WtW\_\{t\},因此它对范数和方向的影响是联合决定的。RODE暴露一个标量径向信号和一个切线投影的方向信号,为它们分配独立的步长,并从得到的ρt+1\\rho\_\{t\+1\}和Ut+1U\_\{t\+1\}重建被管理矩阵。
### 3.1 径向-切线梯度分解
令gtg\_\{t\}为Gt=∇f\(Wt\)G\_\{t\}=\\nabla f\(W\_\{t\}\)的随机估计器,并令⟨A,B⟩F=tr\(A⊤B\)\\langle A,B\\rangle\_\{\\mathrm\{F\}\}=\\mathrm\{tr\}\(A^\{\\top\}B\)。我们使用Pt\\mathcal\{P\}\_\{t\}表示到当前方向UtU\_\{t\}处切线空间的正交投影。具体地,
Pt\(X\)\\displaystyle\\mathcal\{P\}\_\{t\}\(X\)=X−⟨X,Ut⟩FUt,\\displaystyle=X\-\\langle X,U\_\{t\}\\rangle\_\{\\mathrm\{F\}\}U\_\{t\},
gtρ\\displaystyle g\_\{t\}^\{\\rho\}=⟨gt,Ut⟩F,\\displaystyle=\\langle g\_\{t\},U\_\{t\}\\rangle\_\{\\mathrm\{F\}\},
gt⟂\\displaystyle g\_\{t\}^\{\\perp\}=Pt\(gt\).\\displaystyle=\\mathcal\{P\}\_\{t\}\(g\_\{t\}\).\(3\)
则⟨gt⟂,Ut⟩F=0\\langle g\_\{t\}^\{\\perp\},U\_\{t\}\\rangle\_\{\\mathrm\{F\}\}=0,因此gtρg\_\{t\}^\{\\rho\}和gt⟂g\_\{t\}^\{\\perp\}是当前梯度的瞬时径向和切线分量。在参数化Wt=ρtUtW\_\{t\}=\\rho\_\{t\}U\_\{t\}下,关于方向坐标UU的梯度为ρtgt⟂\\rho\_\{t\}g\_\{t\}^\{\\perp\}。RODE在形成方向信号时省略此比例因子,使得方向更新不被当前矩阵范数直接缩放。由于正标量不改变Newton–Schulz条件化器使用的归一化极坐标方向,ηdir\\eta\_\{\\mathrm\{dir\}\}可以直接控制方向步长。
### 3.2 径向更新
令Bt−1B\_\{t\-1\}表示从前一步存储的原始动量缓冲区,并回顾Pt\\mathcal\{P\}\_\{t\}将矩阵投影到当前方向UtU\_\{t\}处的切线空间。径向通道仅更新矩阵的Frobenius范数,使用当前平行于UtU\_\{t\}的梯度分量。RODE首先将历史动量重新投影到当前切线空间,然后添加当前梯度:
B~t\\displaystyle\\widetilde\{B\}\_\{t\}=βPt\(Bt−1\)+gt,\\displaystyle=\\beta\\mathcal\{P\}\_\{t\}\(B\_\{t\-1\}\)+g\_\{t\},
st\\displaystyle s\_\{t\}=⟨B~t,Ut⟩F=gtρ,\\displaystyle=\\langle\\widetilde\{B\}\_\{t\},U\_\{t\}\\rangle\_\{\\mathrm\{F\}\}=g\_\{t\}^\{\\rho\},
ρt+1\\displaystyle\\rho\_\{t\+1\}=max\{ρt−ηρst,κfloorρt\}.\\displaystyle=\\max\\\{\\rho\_\{t\}\-\\eta\_\{\\rho\}s\_\{t\},\\kappa\_\{\\mathrm\{floor\}\\rho\_\{t\}\\\}\.\(4\)
因为Pt\(Bt−1\)\\mathcal\{P\}\_\{t\}\(B\_\{t\-1\}\)位于UtU\_\{t\}处的切线空间,它与UtU\_\{t\}正交,因此不贡献任何径向分量。因此径向信号满足st=gtρs\_\{t\}=g\_\{t\}^\{\\rho\}且仅由当前梯度确定。标量学习率ηρ\\eta\_\{\\rho\}直接控制矩阵Frobenius范数的变化。乘法下限防止单个更新使半径坍缩或穿过零点;我们的分析考虑此安全措施不激活的内部机制。
### 3.3 切线动量和条件化
RODE通过投影更新后的原始缓冲区形成切线动量:
Mt⟂=Pt\(B~t\),M\_\{t\}^\{\\perp\}=\\mathcal\{P\}\_\{t\}\(\\widetilde\{B\}\_\{t\}\),\(5\)
同时存储Bt=B~tB\_\{t\}=\\widetilde\{B\}\_\{t\}用于下一步。因为方向UtU\_\{t\}在训练过程中变化,原始缓冲区中保留的径向内容在重新投影后可能进入未来的切线空间。附录D (https://arxiv.org/html/2608.21024#A4)界定了此跨步残余。对于宽矩阵,RODE首先转置矩阵并初始化X0=Mt⟂‖Mt⟂‖F\.X\_\{0\}=\\frac\{M\_\{t\}^\{\\perp\}\}\{\\\|M\_\{t\}^\{\\perp\}\\\|\_\{\\mathrm\{F\}\}\}\.\(6\)它然后应用投影Newton–相似文章
Orth-Dion: 消除分布式低秩谱优化中的几何失配
本文指出了Dion低秩谱优化器中的几何失配,并提出了Orth-Dion,该方案用QR正交化替换列归一化,以在相同通信成本下弥合与Muon等全秩方法的收敛差距,并在大规模语言模型预训练中进行了验证。
Dion3: Full-Stack Orthogonal Updates
Dion3 is a revised Muon optimizer that reduces computational and communication overhead via Gram Newton-Schulz, symmetric GEMM kernels, and megabatching, achieving up to 6x faster optimizer steps while matching or improving loss.
ODRPO:离散奖励的序数分解用于鲁棒策略优化
介绍了ODRPO,一个将离散奖励分解为序数二元指标的框架,旨在提升LLMs中基于AI反馈的强化学习(RLAIF)策略优化的鲁棒性,在最小开销下实现了高达14.8%的相对改进。
Aurora:一种针对矩形矩阵的杠杆感知优化器
Tilde Research 推出了 Aurora,这是一种新型优化器,旨在在保持正交性的同时防止 MLP 层中的神经元死亡,在 nanoGPT 基准测试中取得了最新成果,并在 1B 模型上实现了 100 倍的数据效率。
DualOptim+:桥接共享与解耦优化器状态以改进大型语言模型中的机器遗忘
介绍了DualOptim+,一个面向LLM遗忘的优化框架,它使用共享基态和解耦增量态来平衡遗忘与保留目标,并提供量化变体以减少内存占用。