损失函数看不到基,但 Adam 能看到
摘要
本文研究了在因子化模型中,为什么 Adam 不表现出梯度下降所具有的隐式低秩偏差,并表明逐坐标预处理打破了相关对称性,而共享标量方法(如 Muon 和 Shampoo)则保持了这种对称性。
查看缓存全文
缓存时间: 2026/08/12 08:23
论文页面 - 损失函数看不到基底,但 Adam 能
Source: https://huggingface.co/papers/2608.05136 loss-basis-adam-fig1-zoo (https://cdn-uploads.huggingface.co/production/uploads/652b1ca9d50c9382fb3c2ed5/S8rIq5jgZDyidid8uDmpN.png)
在因子分解模型 W = UV^T 上进行梯度下降会隐式地偏向低秩;而 Adam 在相同的小初始化下则不会。原因是一个对称性:损失函数在正交矩阵 Q 的变换 (U,V) -> (UQ, VQ) 下保持不变,而梯度流的低秩机制只有在该优化器也尊重这一对称性时才会迁移到优化器上。GD、动量法、“共享标量” Adam、Muon 和 Shampoo 可以做到。而 Adam、RMSProp 和其他逐坐标方法则不行。
一个结构定理将无记忆等变规则刻画为恰好是 Gram 决定的左预条件子,而一个从逐坐标到共享标量预条件的一参数旋钮可以单调地恢复这一偏差——因此破坏它的是各向异性,而非自适应性。
在 Transformer 中,Adam 在第一步就将两个规范等价的初始化分开,最终每个头的不变量 W_Q^T W_K 在相对 Frobenius 距离上相差 56%,这个差距是任何逐头旋转都无法弥合的;在两个高光谱数据集上,在匹配的训练损失下,GD 在最低采样密度下将留出误差降低了 43-44%,并且有效秩更低。一种“谱调度”也调和了关于 Muon 的两份相反的报告。
欢迎讨论——尤其是等变性与恢复之间的差距(必要但不充分),以及真实架构中旋钮的位置。
相似文章
无子空间可追踪:低秩训练中的不可辨识性与优化器状态
本文通过实验证明,在GaLore等低秩训练方法中,梯度的前r维子空间除了一个小的可复现核心外是不可辨识的,估计器噪声主导了表观旋转。文章分析了这对优化器状态传输的影响,并引入了LDAdam,它在困惑度上优于GaLore。
重新评估Muon在矩阵分解中的应用
本文评估了Muon优化器在低秩矩阵分解上的表现,发现它并未持续优于AdamW,从而对早期关于其在大型深度学习中的优势说法提出质疑。
Muon为何超越Adam:曲率视角
本文探究了Muon优化器在大型语言模型训练中为何优于Adam,从曲率视角表明Muon因更低的归一化方向锐度而承受更小的曲率惩罚,且其优势因数据不平衡而放大。
深度隐含偏差:从神经坍缩到Softmax编码
本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。
损失不足:对比表示学习中的采样条件与归纳偏置
本文发展了一个测度论框架,分析对比学习何时恢复有意义的潜在几何结构,引入了正对采样的'多样性条件'和一个支持修正的InfoNCE变体。实验表明,采样多样性与架构归纳偏置在对比表示学习中存在关键交互。