DynMuon:一种动态频谱塑形视角下的Muon优化器
摘要
本文介绍了DynMuon,一种动态频谱塑形优化器,它在训练过程中将更新参数p从正值调度为轻微负值,从而持续获得更低的验证损失,并且达到相同目标损失所需的步数比标准Muon优化器减少10.6%–26.5%。
查看缓存全文
缓存时间: 2026/05/22 02:36
论文页面 - DynMuon: 动态频谱整形视角下的Muon
来源:https://huggingface.co/papers/2605.17109
摘要
Muon优化器的频谱整形方法在训练过程中动态调整更新参数以改善收敛,从而用更少的训练步骤实现更低的验证损失。
近年来,Muon (https://huggingface.co/papers?q=Muon)已成为训练大语言模型以及更广泛的Transformer模型的主导方法。与标准梯度下降 (https://huggingface.co/papers?q=gradient%20descent)方法相比,其本质区别在于将常规的更新矩阵 (https://huggingface.co/papers?q=update%20matrix)M=UΣV^T替换为其极因子 (https://huggingface.co/papers?q=polar%20factor)UV^T。在这项工作中,我们考虑一类类似Muon (https://huggingface.co/papers?q=Muon)的更新方法,其中将更新M替换为UΣ^p V^T,参数p可调。我们将此称为“频谱整形 (https://huggingface.co/papers?q=spectral-shaping)“操作,并发展了一套选择p的理论,该选择取决于(a)损失函数 (https://huggingface.co/papers?q=loss%20function)的局部曲率,(b)由随机梯度 (https://huggingface.co/papers?q=stochastic%20gradients)和标签噪声引起的噪声,以及(c)训练阶段 (https://huggingface.co/papers?q=training%20stage)。我们的理论和实验揭示了一种此前被忽视的行为:正的p在早期通过强调高曲率方向并加速信号收缩而有益;而轻微负的p在后期有助于将更新强度重新分配到仍包含有用训练信号的低曲率方向。基于这一洞察,我们提出了DynMuon (https://huggingface.co/papers?q=DynMuon),一种高效的动态频谱整形方法,在训练过程中将p从正值调度到轻微负值。跨模型规模、架构和训练设置的大量实验表明,DynMuon (https://huggingface.co/papers?q=DynMuon)始终能达到比Muon (https://huggingface.co/papers?q=Muon)更低的验证损失,同时达到相同目标损失所需的步数减少了10.6%至26.5%。
查看 arXiv 页面 (https://arxiv.org/abs/2605.17109)查看 PDF (https://arxiv.org/pdf/2605.17109)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.17109)
引用该论文的模型0
没有模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2605.17109,以从该页面链接。
引用该论文的数据集0
没有数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2605.17109,以从该页面链接。
引用该论文的Spaces0
没有Space链接该论文
在 Space README.md 中引用 arxiv.org/abs/2605.17109,以从该页面链接。
包含该论文的收藏集0
没有收藏集包含该论文
将该论文添加到收藏集 (https://huggingface.co/new-collection)中以从该页面链接。
相似文章
@FinanceYF5: 1/ 更深的大模型未必更强。Kimi K3 使用 AttnRes,DeepSeek V4 使用 mHC,字节跳动提出 HC——这些方法都试图破解“深度诅咒”。但这些方法在训练预算、模型设计和代码库上各不相同,使得直接对比变得不可能。哪种方法真正有效?DepthBench 正在开始寻找答案
一篇讨论 DepthBench 的帖子:这是一个全新的基准测试,旨在公平比较各类深度扩展技术,例如 Kimi K3 的 AttnRes、DeepSeek V4 的 mHC 以及字节跳动提出的 HC。此前由于训练预算和架构各不相同,这些方法一直无法进行直接对比。
规范顺序问题:大语言模型作为多值关系知识库的不可靠性
本文提出了"规范顺序问题":大语言模型在内部将多值关系(如"图灵奖全部得主")组织成规范的字母序或时间序排列,因此当提示词偏离该顺序时,集合生成变得不可靠。通过机制分析,作者表明集合生成的过程包括候选检索、内部排序和下一个元素选择,这解释了知识库构建中召回率与精确率失效的原因。
错觉真实效应还是单纯曝光效应?基于LLM的社交媒体模拟中依赖模型的重复效应
这篇苏黎世大学的论文考察了错觉真实效应(Illusory Truth Effect)在四种 LLM(Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、GPT-5-nano)的生成式智能体社交媒体模拟中是否能够复现,发现重复效应存在质的差异——包括真正的错觉真实效应、单纯曝光效应以及无效应,提醒研究者不应想当然地假设偏差会在基于 LLM 的社交模拟中均匀复现。
OTROPE:基于最优传输的大语言模型鲁棒免策略评估
该论文提出 OTROPE,一种面向大语言模型的免似然函数离线策略评估方法。它利用最优传输,在语义空间中将有限的人工标注行为策略样本与无标注目标策略样本进行对齐,从而构建出一种双重稳健式的评估器,在分布偏移条件下优于各类基线方法。
AI 理解的复调式构想
Queloz 和 Beckmann 指出,大语言模型(LLM)的理解问题一直被一种「单声部」式假设所误导;他们从机制层面证明,模型输出其实是多种平行机制组成的「复调」联盟共同作用的结果,并据此提出一种新的理解概念——以可可靠调用的控制性回路为基础,从而指导人们对 AI 的信任。