group-in-group-policy-optimization

标签

Cards List
#group-in-group-policy-optimization

Muon何时有助于智能体强化学习?

Hugging Face Daily Papers · 2026-07-17 缓存

本文研究了Muon优化器在强化学习后训练中的应用,发现在ALFRED任务中,将Muon应用于隐藏权重矩阵相比AdamW显著提高了成功率,且结果依赖于优势估计器和学习率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈