@RichardYRLi: Muon消除谱各向异性,ISO继承它——在当前LLM-RLVR中,若RLVR主要从预训练中引出,则继承胜出……

X AI KOLs Timeline 论文

摘要

该线程介绍了ISO,一个保持谱各向异性的等谱优化器,与消除它的Muon形成对比,并讨论了其对LLM-RLVR训练和持续学习的意义。

Muon消除谱各向异性,ISO继承它——在当前LLM-RLVR中,如果RLVR主要从预训练中引出,则继承胜出。开放:一个用于控制谱运动的优化器——慢谱、快帧——能稳定写入新能力。对“持续学习”是必要的吗?
查看原文
查看缓存全文

缓存时间: 2026/07/24 19:17

Muon 消除谱各向异性,ISO 继承它——在当前 LLM-RLVR 中,若 RLVR 主要从预训练中引出,则继承获胜。
Open:一种用于受控谱运动的优化器——慢谱,快帧——稳定地写入新能力。“持续学习“所必需?
对优化器设计中的结构感知的深刻见解 @zhu_hanqing666

相似文章

ISO:一个RLVR原生优化栈

Hugging Face Daily Papers

本文研究了带可验证奖励的强化学习(RLVR)的优化层,提出等谱优化(ISO)——一个固定谱框架,在优化输入/输出奇异帧的同时复用基础模型权重谱。ISO-Merger和ISO-AdamW在推理和编程任务上以更少的训练步骤实现了强性能。

Muon优化器的谱缩放定律

arXiv cs.LG

本文首次系统研究了大语言模型训练过程中Muon优化器动量矩阵奇异值谱的行为规律,发现了在不同模型规模(77M至2.8B参数)下清晰的幂律缩放关系。研究结果为从业者提供了有理论依据、感知层级的Newton–Schulz迭代配置指南,在前沿规模下无需额外计算即可保持正交归一化质量。

MuCon: Clipped Muon Updates for LLM Training

arXiv cs.LG

本文介绍了MuCon,一种用于大语言模型训练的裁剪Muon优化器,它应用奇异值裁剪而非完全极化,保留较小的奇异值而仅裁剪最大的奇异值。它探索了避免全SVD的近似方法,包括极坐标/绝对值公式和有理牛顿滤波器,并指出了阈值附近的数值挑战。