Grokking延迟的首达时间预测:基于AdamW的校准定律与因果验证
摘要
本文首次对AdamW优化器下的grokking延迟进行了定量预测,推导出封闭形式的定律,并在算法任务上以高精度进行了验证。
arXiv:2605.18845v1 公告类型: 新
摘要: 我们首次对AdamW优化器下的grokking延迟进行了定量预测。将延迟视为首达时间,我们推导出一个封闭形式的定律 T_grok - T_mem = (1 / 2 kappa_LL eta lambda) log(V_mem / V_star),其中 V_t = ||theta_t||^2 是平方参数范数,V_star 是与架构相关的阈值,而 kappa_LL 吸收了AdamW对干净SGD收缩率 2 eta lambda 的修正。在单个超参数单元上校准 (kappa_LL, V_star) 后,该定律在26个保留运行中预测grokking延迟,MAPE为17.7%,覆盖41倍延迟范围;该定律可推广至MLP(MAPE 18.0%,N=34),并在跨任务扩展中退化为23.3%(N=46,43.5倍范围),且存在结构化残差,其中 V_star / V_mem 在架构内保持相对稳定(在1层Transformer上的CV约为14%)。
V_t的首达时间必要但不充分。一个分位距定理表明,正延迟需要同时满足范数分离 V_mem > V_post 以及角度可达性达到阈值 alpha_star = arcsin(C / V_T_mem^(1/2)),其中C可根据经验NTK特征图和验证间隔分位数计算。在模数 p=89 上校准C,可以预测 p=97 时的 alpha_star = 47.2度(观测值为47.8度,误差1.3%),作为先验跨单元预测。在记忆阶段冻结范数或去除权重衰减的因果干预消除了grokking(0/6 vs. 基线3/3),将角度位移限制在12度附近。
kappa_LL 是根据每个架构经验测量而非从 (beta_1, beta_2, epsilon) 推导的;在四种架构内,CV最多为15%,但不同架构变体之间的值差异约为2倍(除深度外)。实验范围是AdamW下的算法任务(模运算、稀疏奇偶性);该定律是否可迁移至自然语言规模模型仍有待验证。
相似文章
热力学权重衰减:通过注意力比热探讨顿悟加速
本文引入了CvAdamW,一种AdamW变体,它通过监测注意力比热来检测顿悟相变,并动态调整权重衰减,在基线失败的模算术任务上实现了顿悟。
语言模型中Grokking的预训练类比:追踪延迟的语法泛化
本文提出了一种基于暴露的框架,用于研究LLM预训练过程中类似Grokking的延迟泛化现象,使用了BLiMP最小对立对和关键短语。作者观察到五种语法现象均出现延迟泛化,并分析了内部变化,如概念向量的可预测性和注意力头的集中。
权重范数确定Grokking时间尺度:一个因果延迟定律
本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。
图谱分析(Fiedler值与Scheffer CSD指标)在损失函数变化前21,000步预测grokking——五个可重复实验 [R]
应用图谱分析(Fiedler值)和Scheffer临界减速指标来预测神经网络中的grokking,在损失函数变化前21,000步检测到它,在五个可重复实验中。
At-Grok尚未收敛:Grokking表示指标的测量效度审计
本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。