量化Grokking中记忆到泛化的转变:缩放定律与相结构

arXiv cs.AI 论文

摘要

本文通过缩放定律量化了神经网络中记忆到泛化的转变(Grokking),揭示了与模型容量相比,数据复杂度是转变时间的主要驱动因素。

arXiv:2609.10657v1 Announce Type: new 摘要:超过记忆阶段训练的神经网络经常经历延迟的泛化转变,这种现象被称为Grokking。尽管在\emph{为什么}发生这种转变方面有理论进展,但在超参数空间中\emph{何时}发生的定量结构仍未被表征。我们跨模运算的两个隐藏层MLP的384种配置,映射了记忆到泛化的边界,并拟合了泛化开始时间的幂律缩放关系:$T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$($R^2 = 0.732$;带交互作用时为$0.821$)。指数层级表明,数据复杂度($D^{-2.04}$)是机制转变的主要驱动因素,而不是模型容量($H^{-0.27}$):数据加倍使泛化加速约4倍,而宽度加倍仅带来约1.2倍的提升。权重衰减$\lambda \gtrsim 1.0$处的一个尖锐相边界将Grokking配置与非Grokking配置分开,并且权重范数轨迹在转变过程中显示单调压缩,这与隐式正则化选择低复杂度解决方案一致。这些结果为预测和控制过参数化网络中的机制转变提供了定量基础。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:20

# 量化记忆到泛化的转变:Groking 的标度律与相结构
来源:https://arxiv.org/html/2609.10657
Anish Kataria

###### 摘要

经过记忆化训练的神经网络常经历延迟的泛化转变,这一现象被称为“领悟”。尽管关于此转变发生原因的理论有所进展,但在超参数空间中其发生的*定量*结构仍未得到充分描述。我们在双隐层 MLPs 的模运算任务上,跨 384 种配置绘制了记忆到泛化的边界,并为泛化发生时间拟合了一个幂律标度关系:Tgrok∝H−0\.27D−2\.04η−0\.50λ−0\.64T\_{\mathrm{grok}}\propto H^{\-0\.27}\,D^{\-2\.04}\,\eta^{\-0\.50}\,\lambda^{\-0\.64}(R2=0\.732R^{2}=0\.732;加入交互项后为0\.8210\.821)。指数的层级关系表明,数据复杂度 (D−2\.04D^{\-2\.04}) 是区域转变的主导驱动因素,而非模型容量 (H−0\.27H^{\-0\.27}):数据量加倍使泛化加速约 4 倍(∼4×),而宽度加倍仅带来约 1\.2 倍(∼1\.2×)的加速。在权重衰减 λ≳1\.0\lambda\gtrsim 1\.0 处存在一个清晰的相边界,将领悟配置与非领悟配置分隔开来,并且权重范数轨迹在转变过程中呈现单调压缩,与隐式正则化选择低复杂度解的现象一致。这些结果为预测和控制过参数化网络中的区域转变提供了定量基础。

###### 关键词:

领悟、标度律、相变、记忆化、泛化、深度学习理论

## 1引言

过参数化神经网络何时会从记忆训练数据转向真正的泛化?这个问题处于现代深度学习理论的核心。双下降现象(Belkin et al., 2019 (https://arxiv.org/html/2609.10657#bib.bib2); Nakkiran et al., 2020 (https://arxiv.org/html/2609.10657#bib.bib11))表明泛化可以在插值阈值之后得到改善,而“从懒惰到丰富”的转变(Woodworth et al., 2020 (https://arxiv.org/html/2609.10657#bib.bib15); Chizat et al., 2019 (https://arxiv.org/html/2609.10657#bib.bib5))则将特征学习识别为区分核区间记忆化与结构化泛化的机制。然而,这些框架定性地描述了转变;它们并未预测一个给定配置*何时*会从一个区域跨越到另一个区域。

领悟(Power et al., 2022 (https://arxiv.org/html/2609.10657#bib.bib13))为这一问题提供了一个清晰的实验窗口。在模运算任务上训练的网络首先完美记忆训练集,然后在使用权重衰减继续训练后,突然开始泛化。记忆化与泛化之间的延迟可能跨越数个数量级,具体取决于超参数。机制研究已经识别了此过程中*发生了什么*:傅里叶特征电路取代了记忆查找表(Nanda et al., 2023 (https://arxiv.org/html/2609.10657#bib.bib12)),竞争的子网络在有利于稀疏泛化解的情况下得到解决(Merrill et al., 2023 (https://arxiv.org/html/2609.10657#bib.bib10)),并且权重范数压缩向低复杂度的盆地(Liu et al., 2023 (https://arxiv.org/html/2609.10657#bib.bib8))。

缺失的是一个*定量的标度理论*:哪些超参数控制转变时间?比例关系如何?超参数空间中是否存在相边界?我们通过一项包含 384 种配置的扫描来解决这个问题,为泛化发生时间 TgrokT\_{\mathrm{grok}} 拟合了一个幂律标度律。

#### 贡献。

1. 1\. 一个幂律标度关系 Tgrok∝H−0\.27D−2\.04η−0\.50λ−0\.64T\_{\mathrm{grok}}\propto H^{\-0\.27}\,D^{\-2\.04}\,\eta^{\-0\.50}\,\lambda^{\-0\.64}(加入交互项后 R2=0\.821R^{2}=0\.821),揭示了数据复杂度在指数级别上比模型容量占主导地位近一个数量级。
2. 2\. 在 (η,λ)(\eta,\lambda)- 空间中,于 λ≳1\.0\lambda\gtrsim 1\.0 处存在一个清晰的相边界,在此之下,无论训练时间多长,泛化在结构上都会被抑制。
3. 3\. 权重范数动态表现出单调压缩(中位比率 ∥θ⁡(Tgrok)∥/∥θ⁡(Tmem)∥=0\.42\lVert\theta(T\_{\mathrm{grok}})\rVert/\lVert\theta(T\_{\mathrm{mem}})\rVert=0\.42),可作为区域状态的可测量代理。

核心发现颠覆了一个直观想法:主要是数据覆盖范围和正则化强度,而非模型容量,控制着网络何时脱离记忆化区域。

## 2实验设置

#### 任务。

我们研究模 113 的加法(1132=12,769113^{2}=12{,}769 个示例)和模 97 的除法(97×96=9,31297\times 96=9{,}312 个示例),这是经典的领悟基准测试(Power et al., 2022 (https://arxiv.org/html/2609.10657#bib.bib13)),其中真实泛化解(离散傅里叶变换)是已知的(Nanda et al., 2023 (https://arxiv.org/html/2609.10657#bib.bib12))。

#### 架构。

一个带有可学习嵌入的双隐层 MLP:f⁡(a,b)=W3σ(W2σ(W1[ea;eb]))f(a,b)=W\_{3}\,\sigma(W\_{2}\,\sigma(W\_{1}[e\_{a};\,e\_{b}])),其中 ea,eb∈RHe\_{a},e\_{b}\in\mathbb{R}^{H},σ\sigma 是 ReLU 激活函数,且 H∈{128,256,512}H\in\{128,256,512\}(100K–960K 参数)。

#### 超参数扫描。

我们变化数据比例 D∈{0\.3,0\.5,0\.7,0\.97}D\in\{0\.3,0\.5,0\.7,0\.97\}、学习率 η∈{0\.001,0\.003,0\.01,0\.03}\eta\in\{0\.001,0\.003,0\.01,0\.03\} 和权重衰减 λ∈{0\.1,0\.3,1\.0,3\.0}\lambda\in\{0\.1,0\.3,1\.0,3\.0\},产生 2×3×43=3842\times 3\times 4^{3}=384 种配置。所有模型使用 AdamW(β1=0\.9\beta\_{1}{=}0\.9, β2=0\.98\beta\_{2}{=}0\.98),全批量训练,最多 150K 步,每次训练使用单个随机种子(中位种子方差 CV≈8%;在相边界附近高达 18%,在 Section A.1 (https://arxiv.org/html/2609.10657#A1.SS1) 中量化)。在 356 次完成的运行中(28 次在高 η\eta、低 λ\lambda 时发散),297 次(83\.4%)发生了领悟。

#### 区域操作化定义。

我们定义 TmemT\_{\mathrm{mem}} 为训练精度首次超过 99% 的步骤,TgrokT\_{\mathrm{grok}} 为测试精度首次超过 95% 的步骤。如果 Tgrok>150,000T\_{\mathrm{grok}}>150{,}000,则该配置是*非领悟*的。此操作化清晰地将记忆化平台与泛化转变分隔开来:领悟间隙 ΔT=Tgrok−Tmem\Delta T=T\_{\mathrm{grok}}\-T\_{\mathrm{mem}} 的跨度从 100 步到超过 100,000 步(范围 ∼1,000×)。

## 3泛化发生时间的标度律

我们在 297 次领悟运行上拟合了一个对数线性模型:

log⁡Tgrok=αlog⁡H\+βlogD\+γlogη\+δlogλ\+c,\log T\_{\mathrm{grok}}=\alpha\log H\+\beta\log D\+\gamma\log\eta\+\delta\log\lambda\+c\,,(1)

得到幂律形式

Tgrok∝H−0\.27D−2\.04η−0\.50λ−0\.64T\_{\mathrm{grok}}\;\propto\;H^{\-0\.27}\;D^{\-2\.04}\;\eta^{\\-0\.50}\;\lambda^{\-0\.64}(2)

其中 R2=0\.732R^{2}=0\.732。所有指数均为负数:增加任何超参数都会减少 TgrokT\_{\mathrm{grok}}。

图 1:跨 356 次运行、两种任务和三种模型大小的领悟动态。(a) 代表性训练曲线,显示记忆化平台后的延迟泛化。(b) TgrokT\_{\mathrm{grok}} 与 FLOPs 的关系(按模型宽度分列):更宽的模型在步数上更快领悟,但 FLOP 成本更高。(c) (η,λ)(\eta,\lambda) 空间中的相图:当 λ≥1\.0\lambda\geq 1\.0 时,领悟率接近 100%。(d) 领悟间隙与 λ\lambda 的关系(按宽度分列)。(e) 数据缩放:中位 TgrokT\_{\mathrm{grok}} 与 DD 的关系。(f) 计算最优前沿。

### 3\.1 指数层级:数据主导容量

表 1 (https://arxiv.org/html/2609.10657#S3.T1) 中的指数量级在泛化发生的驱动因素中建立了清晰的层级。

表 1:拟合的指数、标准误差和 Spearman 相关系数。数据比例 DD 具有最陡的指数和第二高的秩相关;尽管权重衰减 λ\lambda 的指数较小,但其秩相关最高,反映了它在相边界中的作用。

#### 数据复杂度 (D−2\.04D^{\-2\.04})。

训练比例加倍使 TgrokT\_{\mathrm{grok}} 减少 22\.04≈4\.1×。这种超线性依赖表明,额外数据的作用远不止提供冗余样本:它同时增强了泛化电路的信号,并通过降低记忆解的有效容量优势来使其不稳定化。在 Nanda et al. (2023) (https://arxiv.org/html/2609.10657#bib.bib12) 的傅里叶特征图像中,每个训练对约束一个傅里叶分量的相位;在高 DD 下,约束集对于记忆查找表变得过定,但对于代数电路仍然一致。

#### 隐式正则化 (λ−0\.64\lambda^{\-0\.64})。

权重衰减是第二个杠杆。它与 TgrokT\_{\mathrm{grok}} 的 Spearman 相关系数 (ρ=−0\.52) 高于任何其他超参数,反映了其双重作用:λ\lambda 既加速转变又决定转变是否发生(第 4 节 (https://arxiv.org/html/2609.10657#S4))。λ−0\.64\lambda^{\-0\.64} 指数与隐式正则化理论(Lyu and Li, 2020 (https://arxiv.org/html/2609.10657#bib.bib9))一致:权重衰减使梯度下降偏向于低范数解,这种偏向的速率与 λ\lambda 呈亚线性比例关系。

#### 学习率 (η−0\.50\eta^{\-0\.50})。

η−0\.50\eta^{\-0\.50} 的缩放与 SGD 收敛速率一致:更快的优化能更快遍历损失景观,减少到达泛化盆地的时间。交互项 log⁡H×log⁡η\log H\times\log\eta (t=6\.2) 表明更宽的模型从更高的学习率中获益更多,这表明优化景观随着容量的增加变得更容易导航。

#### 模型容量 (H−0\.27H^{\-0\.27})。

宽度的影响最弱。加倍 H 减少 TgrokT\_{\mathrm{grok}} 仅 20\.27≈1\.2×。这与更大模型应更快泛化的朴素预期相矛盾,支持了一种观点,即转变由*优化动态*(权重衰减压缩网络的速度)而非*表示能力*(可用参数数量)控制。低 Spearman 相关系数 (ρ=−0\.08) 证实了宽度的贡献因与其他超参数的交互而进一步减弱。

图 2:标度律拟合质量。基础幂律模型下的预测值与实际 log⁡Tgrok\log T\_{\mathrm{grok}} 值(R2=0\.732)。接近对角线的点表示拟合良好;分散反映了来自初始化噪声、任务结构和未扫描超参数的残余方差。

图 3:按模型大小的标度。TgrokT\_{\mathrm{grok}} 与 FLOPs 的关系(按模型宽度分层)。更宽的模型在更少的步骤内领悟,但每步消耗更多 FLOPs,产生了特征性的右移。

### 3\.2 交互效应

添加所有六对交互项以及一个二元任务指示器,将 R2R^{2} 提高到 0\.8210\.821(调整后 R2=0\.813R^{2}=0\.813;留一运行外 R2=0\.799R^{2}=0\.799)。四个交互项显著(所有 |t|>4):

- • log⁡D×log⁡η\log D\times\log\eta: \+0\.50+0\.50 (t=6\.3)。在高数据比例下,更快的学习率更能加速领悟。
- • log⁡H×log⁡η\log H\times\log\eta: \+0\.35+0\.35 (t=6\.2)。更宽的模型从更高的学习率中获益更多。
- • log⁡D×log⁡λ\log D\times\log\lambda: \+0\.38+0\.38 (t=5\.3)。更大的数据集可以部分替代强正则化。
- • log⁡H×log⁡λ\log H\times\log\lambda: −0\.23\-0\.23 (t=−4\.1)。更宽的模型对权重衰减的敏感性较低。

图 4:模型-数据交互。log⁡D×log⁡η\log D\times\log\eta 和 log⁡H×log⁡η\log H\times\log\eta 交互项的可视化,显示了学习率效应如何受数据比例和模型宽度的调节。

D×λD\times\lambda 交互项(\+0\.38+0\.38)值得注意:当数据充足时(D→1D\to 1),权重衰减的边际效应降低。这支持了一个观点,即数据覆盖范围和正则化是驱动记忆到泛化转变的、部分可替代的机制,两者都作用于使高范数记忆解不稳定化。

### 3\.3 稳健性

指数在任务间是稳定的(加法:D=−1\.95;除法:D=−2\.12;合并:−2\.04),在不同泛化阈值下也是如此(Section A.2 (https://arxiv.org/html/2609.10657#A1.SS2))。在所有 356 次运行(59 次右删失)上拟合的 Weibull 加速失效时间模型,其一致性指数达到 0\.71,系数符号与 OLS 一致。Weibull 形状参数 k=1\.4 意味着风险轻微递增:一旦网络开始转变,它会加速,这与范数压缩的正反馈图像(第 5 节 (https://arxiv.org/html/2609.10657#S5))一致。

## 4领悟边界的相结构

标度律描述了 TgrokT\_{\mathrm{grok}} *在*领悟区域内如何变化。同样重要的是区域*之间*的边界:哪些配置会发生领悟?

图 5:左:在 (η,λ)(\eta,\lambda) 空间中的相图。颜色表示跨数据集比例和宽度的领悟率。在 λ≥1\.0\lambda\geq 1\.0 时,几乎所有配置都发生领悟;在 λ=0\.1\lambda=0\.1 时,只有不到 60% 发生领悟。边界是清晰的,而非渐变的。右:计算最优前沿。总 FLOPs = Tgrok×Cstep(H) = T\_{\mathrm{grok}}\times C\_{\mathrm{step}}(H),其中 Cstep∝H2C\_{\mathrm{step}}\propto H^{2}。更宽的模型在步数上更快领悟,但 FLOP 成本更高,类似于 Chinchilla 风格的权衡(Hoffmann et al., 2022 (https://arxiv.org/html/2609.10657#bib.bib6))。

图5 (https://arxiv.org/html/2609.10657#S4.F5)(左)显示了 (η,λ)(\eta,\lambda) 空间中一个清晰的相边界。在 λ≥1\.0\lambda\geq 1\.0 时,无论学习率如何,几乎所有配置都发生领悟。在 λ=0\.1\lambda=0\.1 时,只有不到 60% 发生领悟,并且领悟变得对 η\eta 敏感。边界并非渐变的:从少于 60% 到超过 95% 的领悟率转变发生在 λ\lambda 的 3× 范围内。

见图注

图 6:跨 (η,λ)(\eta,\lambda) 网格的领悟率热图,按模型宽度和任务分层。在 λ≈1\.0\lambda\approx 1\.0 处的清晰转变在所有设置下都是一致的。

###### 猜想 1(相边界)。

存在一个临界正则化强度 λ∗≈1\.0\lambda^{*}\approx 1\.0(相对于此处使用的 AdamW 规模),使得当 λ<λ∗\lambda<\lambda^{*} 时,泛化发生被结构性地抑制。在 λ∗\lambda^{*} 以下,记忆解是训练动态的一个稳定不动点;在 λ∗\lambda^{*} 以上,权重衰减使记忆盆地不稳定,网络收敛到更低范数的泛化解。

这个猜想与 Liu et al. (2023) (https://arxiv.org/html/2609.10657#bib.bib8) 的 Omnigrok 框架一致,其中领悟发生在权重范数轨迹穿过泛化损失景观盆地可访问的临界阈值时。我们的相图首次定量描述了此阈值在超参数空间中的位置。

#### 领悟间隙。

随着

相似文章

语言模型中Grokking的预训练类比:追踪延迟的语法泛化

arXiv cs.LG

本文提出了一种基于暴露的框架,用于研究LLM预训练过程中类似Grokking的延迟泛化现象,使用了BLiMP最小对立对和关键短语。作者观察到五种语法现象均出现延迟泛化,并分析了内部变化,如概念向量的可预测性和注意力头的集中。

权重范数确定Grokking时间尺度:一个因果延迟定律

arXiv cs.LG

本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。