@burny_tech: 关于优化器魔法的更新

X AI KOLs Timeline 论文

摘要

一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。

关于优化器魔法的更新
查看原文
查看缓存全文

缓存时间: 2026/07/25 10:04

优化器魔法的一些更新

alphaXiv (@askalphaxiv):
“SOAP, Muon, and Beyond: 推动 LLM 预训练规模”

这篇 NVIDIA 的新论文表明,AdamW 可能已不足以应对前沿 LLM 预训练!

在论文中,他们展示了像 Muon 和 SOAP 这样的高阶优化器能够更高效地训练大型 LLM,

相似文章

SOAP、Muon 及更多:推动LLM预训练规模扩展

arXiv cs.LG

本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。

Muon 优化器能否微调 Adam 预训练模型?

Hugging Face Daily Papers

研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。

乐观对偶平均化统一了现代优化器

arXiv cs.LG

本文介绍了 SODA,这是乐观对偶平均化的一种广义形式,统一了 Muon 和 Lion 等现代优化器。该研究提出了一种实用包装器,在不同规模下均可提升性能,且无需为权重衰减进行额外的超参数调优。

Muon为何超越Adam:曲率视角

Hugging Face Daily Papers

本文探究了Muon优化器在大型语言模型训练中为何优于Adam,从曲率视角表明Muon因更低的归一化方向锐度而承受更小的曲率惩罚,且其优势因数据不平衡而放大。