@maximelabonne: 为澄清,这篇论文基本上说明:在AdamW下,µP的嵌入学习率规则(常数)基本正确,并解释了…
摘要
这篇论文澄清,在AdamW下,µP的嵌入学习率规则(常数)基本正确,并解释了µP的大部分优势,这与Hayou等人先前关于现实LLM词汇规模的研究发现相反。
查看缓存全文
缓存时间: 2026/05/23 14:09
原来你从来都不需要μP,你只是需要把嵌入层学习率按模型宽度缩放
我不是什么 nanoGPT 竞速选手,不过这不就是有人用 Muon 处理隐藏层、用 Adam 处理其他部分时偶然发现的现象吗?
澄清一下,这篇论文的大致意思是:在 AdamW 下,μP 的嵌入层学习率规则(恒定的)基本正确,并且解释了 μP 的大部分优势。
去年,Hayou 等人发现,对于现实规模的 LLM 词表大小,μP 的嵌入层学习率规则是错的。他们发现最佳嵌入层学习率按照 1/√宽度 递减。
这些预测看起来互相矛盾。但这篇论文成功地在某个区间(词表大小=50k,宽度=128-2048)验证了自己的论点,而这个区间按 Hayou 的说法本不该成立。
说实话我也不清楚这是为什么,不过作为未来的研究方向应该很有意思!
https://x.com/Ham_TheFog/status/2057617101360451886…
《量化超参数迁移与嵌入层学习率的重要性》(第一张截图,Kalra 和 Barkeshli):https://arxiv.org/abs/2605.21486
《大语言模型中的最佳嵌入层学习率:词表大小的影响》(Hayou 和 Liu):https://arxiv.org/abs/2506.15025
相似文章
@maximelabonne:量化超参数迁移与嵌入层学习率的重要性(第一张截图,Kalra 和 Ba…
本文介绍了一个量化大语言模型中超参数迁移的框架,并发现在使用 AdamW 训练时,μP 相对于 SP 的优势主要源于提高了嵌入层学习率。此外,还探讨了权重衰减及其他因素的影响。
@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…
JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。
大型语言模型能否对检索到的信息保持审慎态度?
本文研究了大型语言模型如何适应检索信息的确定程度,指出了其在处理不确定性方面的系统性局限。论文提出了一种交互策略,在不修改模型权重的前提下,将顺从错误降低了 25%。
@MatthieuWyart: LLMs通过预测token来学习。世界模型(JEPA、data2vec)通过预测自身的抽象表示来学习。哪种需要更多数据?
本文证明,对于具有隐藏结构的分层数据,通过预测潜在表示(如JEPA和data2vec等世界模型的做法)进行学习所需的数据量,远少于通过预测token(如LLMs的做法)进行学习,其差距呈指数级。