标签
LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。
本文分析了Muon优化器中的有限Newton-Schulz迭代如何通过平滑极映射使非光滑非凸优化受益,提供了匹配最佳已知界限的收敛保证。
本文将 Muon 优化器应用于扩散变换器,参数规模从 13 亿扩展到 150 亿,并引入周期性行式 Muon 以减少计算开销,同时保持相对于 AdamW 的生成质量提升。
This paper proposes FedCoMuon, a federated compositional Muon optimizer for matrix-wise models, along with a variance-reduced variant (FedCoMuon-VR). The authors provide convergence analysis under non-i.i.d. and non-convex settings, showing improved sample complexity over existing FedMuon algorithms, and demonstrate competitive performance on robust federated learning and task-distributed risk-sensitive meta learning.
本文通过消融实验分析Muon优化器,发现正交化(Newton-Schulz迭代),而非谱缩放,是其能在模算术上更快实现grokking的关键因素,并引入了一种衡量grokking速度的稳定性感知指标。
本文研究了Muon优化器需要多少正交化,提出了一种五步三次牛顿-舒尔茨方案,该方案降低了计算成本,同时在GPT-2 Small和混合MoE/Mamba模型上实现了与更昂贵方法相似的训练质量。
讨论了这样一个发现:所有 softmax/线性注意力变体都可以被插值,并且 Muon 优化器对于 Parallax 超越 Softmax Attention 至关重要。包含论文和代码链接。
SignMuon是一种1位、感知矩阵的分布式训练优化器,它结合了signSGD的多数投票符号聚合与Muon的极坐标步骤框架,在float32基础上实现32倍带宽缩减,同时在CIFAR-10/ResNet-50和nanoGPT等基准测试上保持强大的收敛性和性能。