Muon何时有助于智能体强化学习?

Hugging Face Daily Papers 论文

摘要

本文研究了Muon优化器在强化学习后训练中的应用,发现在ALFRED任务中,将Muon应用于隐藏权重矩阵相比AdamW显著提高了成功率,且结果依赖于优势估计器和学习率。

Muon在大规模预训练中与AdamW具有竞争力,但其在强化学习(RL)后训练中的价值仍不明确。我们通过使用Qwen2.5-0.5B-Instruct在ALFWorld上进行匹配的单种子比较,研究了vanilla Muon在稀疏奖励智能体RL中的表现。在组内组策略优化(GiGPO)下,仅将Muon应用于隐藏权重矩阵即可将最终窗口验证成功率从0.290提升至0.546(+88%);高学习率AdamW对照组在更新后未保持成功率。该效果取决于优势估计器和学习率。在3e-5时,Muon将GRPO从0.161提升至0.268,而GraphGPO的后期窗口差距在接近饱和时缩小。在1e-5时,GraphGPO Muon达到0.901,将归一化验证AUC从0.399提升至0.556,并且分别提前30次和60次更新达到0.5和0.75的成功率。这些探索性结果表明Muon有助于智能体RL,并启发我们联合研究策略优化器、优势估计器和学习率。多种子和跨任务验证仍有待进行。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:39

论文页面 - Muon何时有助于智能体强化学习?

来源:https://huggingface.co/papers/2607.16169

摘要

Muon在大规模预训练中与AdamW具有竞争力,但其在强化学习(RL)后训练中的价值尚不明确。我们通过基于ALFWorld任务、使用Qwen2.5-0.5B-Instruct模型的单种子匹配对比,研究了vanilla Muon在稀疏奖励智能体RL中的表现。在分组内分组策略优化(GiGPO)下,仅将Muon应用于隐藏权重矩阵即可将最终窗口验证成功率从0.290提升至0.546(+88%);而高学习率的AdamW对照组在更新后无成功率提升。该效果取决于优势估计器与学习率。在3e-5学习率下,Muon将GRPO的成功率从0.161提升至0.268,而GraphGPO的后期窗口差距在接近饱和时缩小。在1e-5学习率下,GraphGPO Muon的成功率达到0.901,归一化验证AUC从0.399提升至0.556,并且分别提前30次和60次更新达到0.5和0.75的成功率。这些探索性结果表明Muon能够为智能体RL带来收益,并启示我们应联合研究策略优化器、优势估计器与学习率。多种子与跨任务验证仍有待进行。

查看arXiv页面(https://arxiv.org/abs/2607.16169)查看PDF(https://arxiv.org/pdf/2607.16169)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.16169)

在你的智能体中获取此论文:

hf papers read 2607.16169

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.16169 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.16169 以从此页面链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md 中引用 arxiv.org/abs/2607.16169 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

重新评估Muon在矩阵分解中的应用

arXiv cs.LG

本文评估了Muon优化器在低秩矩阵分解上的表现,发现它并未持续优于AdamW,从而对早期关于其在大型深度学习中的优势说法提出质疑。

Muon 优化器能否微调 Adam 预训练模型?

Hugging Face Daily Papers

研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。

Muon为何超越Adam:曲率视角

Hugging Face Daily Papers

本文探究了Muon优化器在大型语言模型训练中为何优于Adam,从曲率视角表明Muon因更低的归一化方向锐度而承受更小的曲率惩罚,且其优势因数据不平衡而放大。

Muon需要多少正交化?

arXiv cs.LG

本文研究了Muon优化器需要多少正交化,提出了一种五步三次牛顿-舒尔茨方案,该方案降低了计算成本,同时在GPT-2 Small和混合MoE/Mamba模型上实现了与更昂贵方法相似的训练质量。

SignMuon: 通信高效的分布式Muon优化

arXiv cs.LG

SignMuon是一种1位、感知矩阵的分布式训练优化器,它结合了signSGD的多数投票符号聚合与Muon的极坐标步骤框架,在float32基础上实现32倍带宽缩减,同时在CIFAR-10/ResNet-50和nanoGPT等基准测试上保持强大的收敛性和性能。