标签
本文引入了CvAdamW,一种AdamW变体,它通过监测注意力比热来检测顿悟相变,并动态调整权重衰减,在基线失败的模算术任务上实现了顿悟。
本文通过消融实验分析Muon优化器,发现正交化(Newton-Schulz迭代),而非谱缩放,是其能在模算术上更快实现grokking的关键因素,并引入了一种衡量grokking速度的稳定性感知指标。
本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。
引入跨轨迹嵌合体干预,以分离权重大小和方向在Grokking中的作用,表明方向携带可转移的电路身份,而范数影响被覆盖的敏感性。
本文研究了权重衰减如何作为控制参数,使在模算术上训练的Transformer在记忆与泛化之间发生转变,并引入了两种基于注意力激活的廉价在线诊断指标,用以追踪这些动态。
研究发现,尽管架构各异,语言模型在表示数字时会独立演化出相似的周期傅里叶特征,其中只有部分模型在模运算中实现了几何可分性。