标签
论文探讨了是否任何神经网络都可以被重新设计以通过梯度下降有效训练,并证明了一个通用性结果:对于任何网络,都存在一个扩展,可以通过梯度下降重现给定的权重和输出。
仅前向传播的MLP训练(FPO)在无需反向传播的情况下适应大型语言模型,实现2.7–3.2倍的吞吐量提升,同时峰值内存减少40%,并保持基准性能。
Aurora是一种杠杆感知的谱优化器,通过强制执行行均匀性同时保留Muon更新的极因子几何结构来解决MLP层中的神经元死亡问题,在modded-nanoGPT speedrun基准上实现了最先进的性能。
Zeta 提出了一种双白化优化器,它首先应用坐标白化,再进行谱白化,以解决动量矩阵中的尺度异质性,从而降低正交化误差,并在大规模神经网络训练中改善收敛速度和泛化性能。
本文介绍了Muon^p,一种新颖的优化器,采用分数谱幂更新在Muon和梯度下降之间进行插值,提供了理论证明并在十亿参数规模的微调任务上取得了实证收益。
本文研究了Muon优化器需要多少正交化,提出了一种五步三次牛顿-舒尔茨方案,该方案降低了计算成本,同时在GPT-2 Small和混合MoE/Mamba模型上实现了与更昂贵方法相似的训练质量。