muon

标签

Cards List
#muon

Dion3: Full-Stack Orthogonal Updates

arXiv cs.LG · 2026-08-13 缓存

Dion3 is a revised Muon optimizer that reduces computational and communication overhead via Gram Newton-Schulz, symmetric GEMM kernels, and megabatching, achieving up to 6x faster optimizer steps while matching or improving loss.

0 人收藏 0 人点赞
#muon

联合仿射谱整形:超越仅权重Muon的权重与偏置更新耦合

arXiv cs.LG · 2026-08-05 缓存

本文提出联合仿射谱整形(JRI),将仅权重的谱优化器(如Muon)扩展到仿射层中联合更新权重和偏置,在BERT-mini IMDb分类任务上显示出小而一致的准确率提升。

0 人收藏 0 人点赞
#muon

物理学家解开缪子之谜,旧结果不再吻合

Hacker News Top · 2026-07-30 缓存

新的理论计算解决了持续25年的缪子g-2谜题,但与旧实验数据产生冲突,暗示可能存在新物理学。

0 人收藏 0 人点赞
#muon

@burny_tech: 关于优化器魔法的更新

X AI KOLs Timeline · 2026-07-24 缓存

一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。

0 人收藏 0 人点赞
#muon

SOAP、Muon 及更多:推动LLM预训练规模扩展

arXiv cs.LG · 2026-07-24 缓存

本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。

0 人收藏 0 人点赞
#muon

@RichardYRLi: Muon消除谱各向异性,ISO继承它——在当前LLM-RLVR中,若RLVR主要从预训练中引出,则继承胜出……

X AI KOLs Timeline · 2026-07-24 缓存

该线程介绍了ISO,一个保持谱各向异性的等谱优化器,与消除它的Muon形成对比,并讨论了其对LLM-RLVR训练和持续学习的意义。

0 人收藏 0 人点赞
#muon

Muon何时有助于智能体强化学习?

Hugging Face Daily Papers · 2026-07-17 缓存

本文研究了Muon优化器在强化学习后训练中的应用,发现在ALFRED任务中,将Muon应用于隐藏权重矩阵相比AdamW显著提高了成功率,且结果依赖于优势估计器和学习率。

0 人收藏 0 人点赞
#muon

重新评估Muon在矩阵分解中的应用

arXiv cs.LG · 2026-07-16 缓存

本文评估了Muon优化器在低秩矩阵分解上的表现,发现它并未持续优于AdamW,从而对早期关于其在大型深度学习中的优势说法提出质疑。

0 人收藏 0 人点赞
#muon

Aurora: 一种杠杆感知的谱优化器

arXiv cs.LG · 2026-06-29 缓存

Aurora是一种杠杆感知的谱优化器,通过强制执行行均匀性同时保留Muon更新的极因子几何结构来解决MLP层中的神经元死亡问题,在modded-nanoGPT speedrun基准上实现了最先进的性能。

0 人收藏 0 人点赞
#muon

@plugyawn: 介绍:Megaprop:一个跨GPU高效预条件优化的库!Megaprop 是 Megatron 的一个分支……

X AI KOLs Following · 2026-06-15 缓存

Megaprop 是一个新的库,用于跨 GPU 的高效预条件优化,它源自 Megatron 和 TransformerEngine,支持 FSDP 下的 Muon、FOOF、KFAC 和 Newton-Muon,并支持 MuP 以实现宽度和深度的优化。

0 人收藏 0 人点赞
#muon

Muon$^p$: 分数谱幂的Muon优化器

arXiv cs.LG · 2026-06-15 缓存

本文介绍了Muon^p,一种新颖的优化器,采用分数谱幂更新在Muon和梯度下降之间进行插值,提供了理论证明并在十亿参数规模的微调任务上取得了实证收益。

0 人收藏 0 人点赞
#muon

@maximelabonne: Parallax 是一种参数化的局部线性注意力形式,它摒弃了数值求解器,在解码性能上媲美 FA 2/3……

X AI KOLs Following · 2026-06-10 缓存

Parallax 是一种新的参数化局部线性注意力形式,去除了数值求解器,在解码方面与 FlashAttention 2/3 相匹配。其有效性取决于优化器,与 Muon 配合有效,但与 AdamW 配合无效,这凸显了优化器几何形状的作用。

0 人收藏 0 人点赞
#muon

Gram Newton-Schulz:一种用于Muon的快速、硬件感知的牛顿-舒尔茨算法

Hacker News Top · 2026-06-09 缓存

本文介绍了Gram Newton-Schulz,这是对Muon优化器中使用的牛顿-舒尔茨正交化过程的一种硬件感知优化,能够在保持模型质量的同时显著加速大型语言模型的训练。

0 人收藏 0 人点赞
#muon

Muon优化器的谱缩放定律

arXiv cs.LG · 2026-06-04 缓存

本文首次系统研究了大语言模型训练过程中Muon优化器动量矩阵奇异值谱的行为规律,发现了在不同模型规模(77M至2.8B参数)下清晰的幂律缩放关系。研究结果为从业者提供了有理论依据、感知层级的Newton–Schulz迭代配置指南,在前沿规模下无需额外计算即可保持正交归一化质量。

0 人收藏 0 人点赞
#muon

Muon为何超越Adam:曲率视角

Hugging Face Daily Papers · 2026-06-03 缓存

本文探究了Muon优化器在大型语言模型训练中为何优于Adam,从曲率视角表明Muon因更低的归一化方向锐度而承受更小的曲率惩罚,且其优势因数据不平衡而放大。

0 人收藏 0 人点赞
#muon

MuCon: Clipped Muon Updates for LLM Training

arXiv cs.LG · 2026-05-27 缓存

本文介绍了MuCon,一种用于大语言模型训练的裁剪Muon优化器,它应用奇异值裁剪而非完全极化,保留较小的奇异值而仅裁剪最大的奇异值。它探索了避免全SVD的近似方法,包括极坐标/绝对值公式和有理牛顿滤波器,并指出了阈值附近的数值挑战。

0 人收藏 0 人点赞
#muon

DynMuon:一种动态频谱塑形视角下的Muon优化器

Hugging Face Daily Papers · 2026-05-16 缓存

本文介绍了DynMuon,一种动态频谱塑形优化器,它在训练过程中将更新参数p从正值调度为轻微负值,从而持续获得更低的验证损失,并且达到相同目标损失所需的步数比标准Muon优化器减少10.6%–26.5%。

0 人收藏 0 人点赞
#muon

Muon 并没有那么特别:随机或反转谱同样有效

arXiv cs.LG · 2026-05-13 缓存

本文对 Muon 优化器的几何依据提出了挑战,认为精确的几何结构不如步长最优性重要。文章引入了 Freon 和 Kaon 优化器,以证明随机或反转谱的性能与 Muon 相当。

0 人收藏 0 人点赞
#muon

Muon 优化器能否微调 Adam 预训练模型?

Hugging Face Daily Papers · 2026-05-11 缓存

研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈