Grokking延迟的首达时间预测:基于AdamW的校准定律与因果验证

arXiv cs.LG 论文

摘要

本文首次对AdamW优化器下的grokking延迟进行了定量预测,推导出封闭形式的定律,并在算法任务上以高精度进行了验证。

arXiv:2605.18845v1 公告类型: 新 摘要: 我们首次对AdamW优化器下的grokking延迟进行了定量预测。将延迟视为首达时间,我们推导出一个封闭形式的定律 T_grok - T_mem = (1 / 2 kappa_LL eta lambda) log(V_mem / V_star),其中 V_t = ||theta_t||^2 是平方参数范数,V_star 是与架构相关的阈值,而 kappa_LL 吸收了AdamW对干净SGD收缩率 2 eta lambda 的修正。在单个超参数单元上校准 (kappa_LL, V_star) 后,该定律在26个保留运行中预测grokking延迟,MAPE为17.7%,覆盖41倍延迟范围;该定律可推广至MLP(MAPE 18.0%,N=34),并在跨任务扩展中退化为23.3%(N=46,43.5倍范围),且存在结构化残差,其中 V_star / V_mem 在架构内保持相对稳定(在1层Transformer上的CV约为14%)。 V_t的首达时间必要但不充分。一个分位距定理表明,正延迟需要同时满足范数分离 V_mem > V_post 以及角度可达性达到阈值 alpha_star = arcsin(C / V_T_mem^(1/2)),其中C可根据经验NTK特征图和验证间隔分位数计算。在模数 p=89 上校准C,可以预测 p=97 时的 alpha_star = 47.2度(观测值为47.8度,误差1.3%),作为先验跨单元预测。在记忆阶段冻结范数或去除权重衰减的因果干预消除了grokking(0/6 vs. 基线3/3),将角度位移限制在12度附近。 kappa_LL 是根据每个架构经验测量而非从 (beta_1, beta_2, epsilon) 推导的;在四种架构内,CV最多为15%,但不同架构变体之间的值差异约为2倍(除深度外)。实验范围是AdamW下的算法任务(模运算、稀疏奇偶性);该定律是否可迁移至自然语言规模模型仍有待验证。
查看原文

相似文章

语言模型中Grokking的预训练类比:追踪延迟的语法泛化

arXiv cs.LG

本文提出了一种基于暴露的框架,用于研究LLM预训练过程中类似Grokking的延迟泛化现象,使用了BLiMP最小对立对和关键短语。作者观察到五种语法现象均出现延迟泛化,并分析了内部变化,如概念向量的可预测性和注意力头的集中。

权重范数确定Grokking时间尺度:一个因果延迟定律

arXiv cs.LG

本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。

At-Grok尚未收敛:Grokking表示指标的测量效度审计

arXiv cs.LG

本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。