DynMuon:一种动态频谱塑形视角下的Muon优化器
摘要
本文介绍了DynMuon,一种动态频谱塑形优化器,它在训练过程中将更新参数p从正值调度为轻微负值,从而持续获得更低的验证损失,并且达到相同目标损失所需的步数比标准Muon优化器减少10.6%–26.5%。
查看缓存全文
缓存时间: 2026/05/22 02:36
论文页面 - DynMuon: 动态频谱整形视角下的Muon
来源:https://huggingface.co/papers/2605.17109
摘要
Muon优化器的频谱整形方法在训练过程中动态调整更新参数以改善收敛,从而用更少的训练步骤实现更低的验证损失。
近年来,Muon (https://huggingface.co/papers?q=Muon)已成为训练大语言模型以及更广泛的Transformer模型的主导方法。与标准梯度下降 (https://huggingface.co/papers?q=gradient%20descent)方法相比,其本质区别在于将常规的更新矩阵 (https://huggingface.co/papers?q=update%20matrix)M=UΣV^T替换为其极因子 (https://huggingface.co/papers?q=polar%20factor)UV^T。在这项工作中,我们考虑一类类似Muon (https://huggingface.co/papers?q=Muon)的更新方法,其中将更新M替换为UΣ^p V^T,参数p可调。我们将此称为“频谱整形 (https://huggingface.co/papers?q=spectral-shaping)“操作,并发展了一套选择p的理论,该选择取决于(a)损失函数 (https://huggingface.co/papers?q=loss%20function)的局部曲率,(b)由随机梯度 (https://huggingface.co/papers?q=stochastic%20gradients)和标签噪声引起的噪声,以及(c)训练阶段 (https://huggingface.co/papers?q=training%20stage)。我们的理论和实验揭示了一种此前被忽视的行为:正的p在早期通过强调高曲率方向并加速信号收缩而有益;而轻微负的p在后期有助于将更新强度重新分配到仍包含有用训练信号的低曲率方向。基于这一洞察,我们提出了DynMuon (https://huggingface.co/papers?q=DynMuon),一种高效的动态频谱整形方法,在训练过程中将p从正值调度到轻微负值。跨模型规模、架构和训练设置的大量实验表明,DynMuon (https://huggingface.co/papers?q=DynMuon)始终能达到比Muon (https://huggingface.co/papers?q=Muon)更低的验证损失,同时达到相同目标损失所需的步数减少了10.6%至26.5%。
查看 arXiv 页面 (https://arxiv.org/abs/2605.17109)查看 PDF (https://arxiv.org/pdf/2605.17109)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.17109)
引用该论文的模型0
没有模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2605.17109,以从该页面链接。
引用该论文的数据集0
没有数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2605.17109,以从该页面链接。
引用该论文的Spaces0
没有Space链接该论文
在 Space README.md 中引用 arxiv.org/abs/2605.17109,以从该页面链接。
包含该论文的收藏集0
没有收藏集包含该论文
将该论文添加到收藏集 (https://huggingface.co/new-collection)中以从该页面链接。
相似文章
DE-Venus:面向大型语言模型的数据高效RLVR框架
DE-Venus 是一个统一的框架,用于大型语言模型中的数据高效RLVR,在保持性能的同时降低标注和训练成本。
语言编码的网络拓扑使大型语言模型能够推理复杂网络
BioGlyph是一种方法,将网络拓扑转换为可解释的语言角色,以增强大型语言模型推理复杂网络的能力,在各个领域展示了显著的性能提升。
前沿大语言模型是高效的批量优化器:评估推理模型在连续和离散环境中的表现
本文研究评估了前沿大语言模型在连续和离散环境中作为批量优化器的表现,发现它们在数值任务上具有竞争力,但在语义丰富的环境中比传统方法更有效。
STAIR(结构感知信息检索器):一种新颖的基于数据集和LLM的检索器,用于文档结构增强
STAIR引入了一种结构感知检索系统,利用目录增强大语言模型的文档检索,在新的SearchTome基准数据集上实现了高性能。
药物毒性预测的提示工程分析
本文研究了使用大型语言模型进行药物毒性预测时提示工程的影响,发现LLM输出的自然方差超过了提示微调,而化学信息学特征提取则提升了模型性能。