@RichardYRLi: Muon消除谱各向异性,ISO继承它——在当前LLM-RLVR中,若RLVR主要从预训练中引出,则继承胜出……
摘要
该线程介绍了ISO,一个保持谱各向异性的等谱优化器,与消除它的Muon形成对比,并讨论了其对LLM-RLVR训练和持续学习的意义。
查看缓存全文
缓存时间: 2026/07/24 19:17
Muon 消除谱各向异性,ISO 继承它——在当前 LLM-RLVR 中,若 RLVR 主要从预训练中引出,则继承获胜。
Open:一种用于受控谱运动的优化器——慢谱,快帧——稳定地写入新能力。“持续学习“所必需?
对优化器设计中的结构感知的深刻见解 @zhu_hanqing666
相似文章
ISO:一个RLVR原生优化栈
本文研究了带可验证奖励的强化学习(RLVR)的优化层,提出等谱优化(ISO)——一个固定谱框架,在优化输入/输出奇异帧的同时复用基础模型权重谱。ISO-Merger和ISO-AdamW在推理和编程任务上以更少的训练步骤实现了强性能。
超越预训练重新思考Muon:VLA与RLVR的频谱失效与高通补救措施
本文介绍了Pion,一种新的优化器,它用高通NS迭代取代了Muon的频谱白化,以稳定低秩和低信噪比(low-SNR)条件下的训练,从而在VLA和RLVR任务中实现了更优的性能。
Muon 并没有那么特别:随机或反转谱同样有效
本文对 Muon 优化器的几何依据提出了挑战,认为精确的几何结构不如步长最优性重要。文章引入了 Freon 和 Kaon 优化器,以证明随机或反转谱的性能与 Muon 相当。
Muon优化器的谱缩放定律
本文首次系统研究了大语言模型训练过程中Muon优化器动量矩阵奇异值谱的行为规律,发现了在不同模型规模(77M至2.8B参数)下清晰的幂律缩放关系。研究结果为从业者提供了有理论依据、感知层级的Newton–Schulz迭代配置指南,在前沿规模下无需额外计算即可保持正交归一化质量。
MuCon: Clipped Muon Updates for LLM Training
本文介绍了MuCon,一种用于大语言模型训练的裁剪Muon优化器,它应用奇异值裁剪而非完全极化,保留较小的奇异值而仅裁剪最大的奇异值。它探索了避免全SVD的近似方法,包括极坐标/绝对值公式和有理牛顿滤波器,并指出了阈值附近的数值挑战。