@burny_tech: 关于优化器魔法的更新
摘要
一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。
查看缓存全文
缓存时间: 2026/07/25 10:04
优化器魔法的一些更新
alphaXiv (@askalphaxiv):
“SOAP, Muon, and Beyond: 推动 LLM 预训练规模”这篇 NVIDIA 的新论文表明,AdamW 可能已不足以应对前沿 LLM 预训练!
在论文中,他们展示了像 Muon 和 SOAP 这样的高阶优化器能够更高效地训练大型 LLM,
相似文章
SOAP、Muon 及更多:推动LLM预训练规模扩展
本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。
Muon 优化器能否微调 Adam 预训练模型?
研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。
乐观对偶平均化统一了现代优化器
本文介绍了 SODA,这是乐观对偶平均化的一种广义形式,统一了 Muon 和 Lion 等现代优化器。该研究提出了一种实用包装器,在不同规模下均可提升性能,且无需为权重衰减进行额外的超参数调优。
@omarsar0: NVIDIA 的压缩论文,相当惊艳。(记得收藏)更大的 MoE 模型在质量上持续胜出,但以交互延迟提供服务仍然困难…
NVIDIA 的论文介绍了 Puzzle-75B-A9B,这是一种压缩的混合 MoE 模型,能够在保持质量的同时将服务器吞吐量提高一倍,从而实现大型语言模型的成本高效部署。
Muon为何超越Adam:曲率视角
本文探究了Muon优化器在大型语言模型训练中为何优于Adam,从曲率视角表明Muon因更低的归一化方向锐度而承受更小的曲率惩罚,且其优势因数据不平衡而放大。