@maximelabonne: 为澄清,这篇论文基本上说明:在AdamW下,µP的嵌入学习率规则(常数)基本正确,并解释了…

X AI KOLs Following 论文

摘要

这篇论文澄清,在AdamW下,µP的嵌入学习率规则(常数)基本正确,并解释了µP的大部分优势,这与Hayou等人先前关于现实LLM词汇规模的研究发现相反。

为澄清,这篇论文基本上说明:在AdamW下,µP的嵌入学习率规则(常数)基本正确,并解释了µP的大部分优势。 去年,Hayou等人发现µP的嵌入学习率规则对于现实LLM词汇规模是错误的。他们发现最优嵌入
查看原文
查看缓存全文

缓存时间: 2026/05/23 14:09

原来你从来都不需要μP,你只是需要把嵌入层学习率按模型宽度缩放

我不是什么 nanoGPT 竞速选手,不过这不就是有人用 Muon 处理隐藏层、用 Adam 处理其他部分时偶然发现的现象吗?

澄清一下,这篇论文的大致意思是:在 AdamW 下,μP 的嵌入层学习率规则(恒定的)基本正确,并且解释了 μP 的大部分优势。

去年,Hayou 等人发现,对于现实规模的 LLM 词表大小,μP 的嵌入层学习率规则是错的。他们发现最佳嵌入层学习率按照 1/√宽度 递减。

这些预测看起来互相矛盾。但这篇论文成功地在某个区间(词表大小=50k,宽度=128-2048)验证了自己的论点,而这个区间按 Hayou 的说法本不该成立。

说实话我也不清楚这是为什么,不过作为未来的研究方向应该很有意思!

https://x.com/Ham_TheFog/status/2057617101360451886…

《量化超参数迁移与嵌入层学习率的重要性》(第一张截图,Kalra 和 Barkeshli):https://arxiv.org/abs/2605.21486

《大语言模型中的最佳嵌入层学习率:词表大小的影响》(Hayou 和 Liu):https://arxiv.org/abs/2506.15025

相似文章