权重范数确定Grokking时间尺度:一个因果延迟定律

arXiv cs.LG 论文

摘要

本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。

arXiv:2606.13753v1 公告类型:新 摘要:Grokking是神经网络中泛化能力的延迟出现,发生在网络拟合训练数据之后很久。权重范数是否导致这种延迟存在争议:一些研究在转变时报告了一个临界范数,另一些则观察到grokking发生但没有任何固定范数。我们通过在训练过程中干预范数而不仅仅是观察它,来解决这个问题。在带有权重衰减的自由训练下,当权重范数达到一个值Wc时网络发生grokking,该值在不同随机种子和学习率下变化很小(变异系数为1%到2%),并随模数基以幂律增长。当我们改为将范数钳制在Wc的固定倍数rho并保持时,网络仍然发生grokking,但延迟遵循T_grok与exp(alpha rho)成正比。一个指数alpha约为7.5,拟合了四个模数下的延迟(R^2 = 0.996)。在扫描范围内,固定范数使延迟变化约19倍,而学习率仅变化约2倍;将范数保持在Wc以上会减慢grokking而不是阻止它。最后的LayerNorm通过将权重尺度与网络函数解耦来消除这种依赖性;没有它,指数定律又会恢复。这种固定范数的延迟是自由收缩范数预测的对数延迟的指数对应。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:07

# 权重范数决定“顿悟”的时间尺度:一种因果延迟定律
来源:https://arxiv.org/html/2606.13753
Truong Xuan Khanh¹ Doan Hoang Viet² Luu Duc Trung¹ Phan Thanh Duc³ ¹H&K Research Studio / Clevix LLC, 越南河内 ²越南亚洲商业银行, 河内 ³越南银行业学院 khanh@clevix\.vn

###### 摘要

我们证明权重范数以因果方式控制“顿悟”(grokking)的*时间尺度*,从而调和两种对立的观点:一种认为顿悟发生在某个临界权重范数处,另一种认为范数并非关键变量。在模算术任务中,网络首先通过提高权重范数来记忆,然后在权重衰减下松弛;在自由动态下,当范数达到一个高度集中的值‖W‖c(在训练比例两倍范围内变化仅1–2%,在学习率十倍范围内几乎不变)时,泛化能力涌现,这符合最近的阈值报告。随后我们进行干预:通过匹配的反事实钳制(clamp)在整个训练过程中将‖W‖保持为ρ‖W‖c,结果显示网络*无论被保持在哪个范数*都会顿悟——不需要任何单一的范数——其顿悟时间遵循指数延迟定律T_grok ∝ e^{αρ}(R² > 0.99)。在五个测试的模数(其中四个可用于拟合)上,这是一个*缩放定律*:一个共享的指数α ≈ 7.5 即可将所有延迟数据坍缩(R² = 0.996),范数仅通过其相对于‖W‖_c(p) 的值进入方程。因此,将范数保持在‖W‖_c 以上会*延迟*而非阻止顿悟——在固定预算下看似“阻止”的现象正是这个定律有限预算下的尾部——并且范数对顿悟时间的控制(约19倍)远大于学习率(约2倍)。这调和了不同阵营的观点:集中的‖W‖_c 是松弛过程在其自然时间尺度上*达到*的范数,而非一个硬性门控值,因此在范数高于或低于该值时都能观察到顿悟;这一结果是对范数分离延迟理论(free contraction 下的闭式延迟是范数比的对数)的因果补充。该效应受*LayerNorm*影响,后者将权重范数尺度与函数解耦。在一个未归一化的注意力模型上,延迟定律以自身指数(α₂≈15, R²=0.999;约为MLP的2倍)重现,因此定律的*形式*是跨架构的,但其速率并非如此。一个集中的、由正则化设定的顿悟范数也在一个非傅里叶任务(稀疏奇偶性)上重现,尽管高于范数的延迟并未完全转移。

**关键词**:顿悟;延迟泛化;权重范数;临界范数;因果干预;权重衰减;延迟定律;缩放定律;机制可解释性;学习动态。

## 1 引言

顿悟——网络在拟合训练集很长时间后才发生的延迟泛化——已成为理解神经网络何时以及为何泛化的测试床[1 (https://arxiv.org/html/2606.13753#bib.bib1)]。出现了两种有影响力的解释。*权重范数*解释,以*Omnigrok*[6 (https://arxiv.org/html/2606.13753#bib.bib6)]为代表,认为泛化由参数范数主导:小范数区域泛化,权重衰减驱动网络到达该区域。*电路*解释[2 (https://arxiv.org/html/2606.13753#bib.bib2)]从机制上表明网络逐渐构建实现算术运算的傅里叶特征“电路”。这两类研究在很大程度上是分开且定性的。

本文使权重范数解释变得*精确、定量且因果*,并将其与电路解释联系起来。目前的文献存在分歧:某一方向报告了顿悟的集中权重范数阈值[6,18,19],而另一方向则认为范数是相关变量而非操作变量[16,17,20,21]。我们的核心目标是调和这一分歧。我们记录自由动态下顿悟时的权重范数,发现其集中于‖W‖_c(与阈值阵营一致);然后我们通过匹配的反事实钳制进行干预,在整个训练过程中将范数保持在选定倍数的‖W‖_c,发现范数并非在固定值处门控顿悟,而是设定其*时间尺度*——这是一条因果延迟定律。这消解了分歧:‖W‖_c 是自由松弛过程在其自然时间尺度上达到的范数,而非顿悟所需的值。这也与两种解释之间可能的分工一致——电路形成控制*学什么*,而范数松弛控制*何时*泛化——尽管我们对这种联系的证据是两者在时间上的对齐,而非对电路的直接操控。

### 贡献。

1. 1.**自由动态下的集中顿悟范数。** 自由训练时,当权重范数达到高度集中的值‖W‖_c 时模型顿悟:对于固定的任务大小和权重衰减,‖W‖_c 在训练比例两倍范围内仅变化1–2%,并且在十倍学习率范围内几乎不变(§4)。同期研究报告了相同的速率与阈值分离现象[18,19];我们证实了这一点,然后因果地证明它是一个*速率*现象。
2. 2.**权重范数因果地设定顿悟时间尺度(延迟定律)。** 一个匹配的反事实钳制,在整个训练过程中保持‖W‖ = ρ‖W‖_c,揭示了三点(§5):(i) 网络在*无论被保持在哪个*范数都会顿悟——不存在顿悟所需的单一范数;(ii) 在ρ ∈ [0.85, 1.15]范围内,顿悟时间遵循清晰的指数延迟定律 T_grok ∝ e^{αρ}(R² > 0.99);(iii) 因此,将范数保持在‖W‖_c 以上会*延迟*而非阻止顿悟——在固定预算下看似“阻止”的现象正是这个指数的有限预算尾部。范数是顿悟时间的主导控制因素(在该范围内约19倍),而学习率是次要的可分离调制因素(约2倍)。
3. 3.**延迟是跨任务大小具有共享指数的缩放定律。** 在五个测试模数 p 上重复钳制实验,四个可用大小的数据坍缩到一条关于*相对*范数 ρ = ‖W‖/‖W‖_c(p) 的单一指数曲线上:一个共享指数 α ≈ 7.5 以 R² = 0.996 拟合所有数据(在测试的1.7倍大小范围内,逐p交叉验证 CV 为4.1%),建立了一个因果缩放定律而非每个任务的单独拟合(§6)。我们诚实地报告其局限性——在 ρ ≈ 1.25 以上的亚指数饱和以及最小 p 时的最小范数基底(这也是它被排除在拟合之外的原因)——并将其与范数分离延迟理论[28]联系起来:该理论通过范数收缩预测了*对数*形式的自由训练延迟,而我们的钳制阻止了收缩,是范数冻结因果测试的连续剂量版本,确认了范数是操作变量(我们不声称指数与闭式预测有定量匹配)。
4. 4.**跨架构的重复性与归一化的作用。** 延迟定律在第二个未归一化的注意力模型上以其自身指数(α₂ ≈ 15, R² = 0.999;被保持范数时的顿悟行为和高范数饱和与MLP上相同)重现,并被 LayerNorm 改变,后者将权重范数尺度与函数解耦;只有功能相关的解嵌范数保持集中。当权重范数设定函数尺度时,它控制时间尺度(§7)。
5. 5.**在非傅里叶任务上的任务泛化性。** 在稀疏奇偶性任务上,顿悟再次发生在一个集中的、由权重衰减设定、与学习率不变的范数处,并且范数再次通过速率而非硬阈值起作用(§8)。
6. 6.**与电路解释的时间联系。** 傅里叶特征集中在相同的范数松弛窗口内上升。这种时间对齐与——但并未证明——范数松弛组织了电路解释的特征形成一致;我们没有直接干预电路,并且仅在相关性层面建立联系。

## 2 相关工作

**顿悟:现象学与机制。** Power 等人[1]在小规模算法任务上识别出顿悟现象,其中测试准确率在训练集拟合后很久才突然上升。Nanda 等人[2]在模算术任务上逆向工程了学习到的解,即一小套实现三角恒等式的傅里叶频率电路,并引入了在可见跳跃之前平稳改进的进展度量(例如受限损失);Gromov[3]给出了此类解的解析构造,Barak 等人[4]在稀疏奇偶性上展示了隐藏进展在整个平台期累积。Varma 等人[5]将顿悟框架化为一个记忆电路和一个泛化电路在参数效率上的竞争,权重衰减打破平衡。这些工作建立了网络*计算什么*以及进展是渐进的;我们的重点是标量控制变量——权重范数——及其在触发转变中的因果作用。

**集中的权重范数阈值:一个正在出现但纯属观测性的共识。** 第二个方向将顿悟归因于参数范数和优化器的隐式偏差。Liu 等人[6](Omnigrok)认为泛化由权重范数组织:中等范数处存在泛化区域,权重衰减或重新缩放的初始化将网络推入该区域,并且以权重衰减为唯一正则化器时,范数松弛为 ∥w(t) ≈ e^{-γt} ∥w_0∥ 向目标 w_c 移动,时间 ∝ 1/λ。相关解释将跳跃视为从懒惰到富足的转变[7],或后期隐式偏差的二分法[8],与梯度下降的经典最大间隔偏差[9]相关。两项并行的实证研究以与我们的工作密切相关的方式阐述了正则化的作用,我们仔细区分了它们建立的内容与我们添加的内容。Manir & Rupa[18]在模加法上对深度、架构、激活函数和权重衰减进行了因子扫描,发现顿悟由优化和正则化的交互驱动,而非架构——权重衰减是主导控制,存在一个狭窄的“金发姑娘”区域,并且在匹配的超参数下,Transformer 与 MLP 的差距几乎消失(延迟差异 1.11×);在一个单一权重范数实验(每种配置一个种子)中,他们报告在五个宽度为512的模型上,顿悟时的 RMS 参数范数集中于 0.0219 ± 0.0032(CV 14.5%),其中 ReLU 和 GELU 在*相同*范数处顿悟,尽管延迟相差 6.9×。一项关于神经坍塌动态的平行研究[19]报告了针对*不同*可观测量的相同速率-阈值分离现象——图像分类中的倒数第二层*特征*范数——其集中起始值(对内 CV < 8%)在训练条件变化时基本不变,而训练仅设定*接近*的速率,再次存在一个金发姑娘区域。这两项研究在范数-时间关系上都是*观测性*的:每项都记录了转变发生时的范数并围绕其变化超参数;两者都没有固定范数、测量延迟作为受控范数的函数,或报告缩放定律。我们的观测结果(§4)证实了这种速率-阈值分离现象,并通过固定任务和 λ 将浓度收紧到 CV 1–2%,增加了对学习率和顿悟阈值的不变性,以及一个模标度 ‖W‖_c ∝ p^{0.38}。我们认为集中的阈值本身是一个*已证实*的现象而非新发现;我们独特的贡献始于这些研究停止的地方——我们通过钳制范数并读取产生的延迟来*因果地*测试阈值(§5),并显示响应是一个定量的、跨任务的延迟定律(§6),而非另一个观测性描述。(上述跨架构比较是在自然操作点进行的;我们未归一化变换器的 α₂ ≈ 2α 测量了一个不同的量,即延迟对*被保持*范数的敏感性,因此两者是一致的。)

**对权重范数因果性的挑战。** 一股强烈的反向论调认为权重范数*并非*操作变量。Golechha[16]报告了在预期范数范围之外的真实世界数据(MNIST, IMDb)上出现顿悟——即使没有权重衰减,范数增加——得出结论权重范数是相关性的,而非因果的。Minegishi 等人[17]展示了一个稀疏的“顿悟票”比一个*范数匹配*的密集网络泛化得更快,因此范数不是充分的。Notsawo 等人[20]证明顿悟可以由针对 l2 范数之外的其他属性(稀疏性、低秩)的正则化驱动,l2 范数不是一个可靠的代理——它经常在模型泛化时增长——并且深度本身可以在没有显式正则化的情况下诱导顿悟。Lyle 等人[21]认为驱动转变的是*有效学习率*——参数范数与更新范数之比——而不是单独的参数范数,并表明故意提高它会加速特征学习(并在非平稳性下减轻首位偏差);进一步的工作在范数增加且没有权重衰减的情况下诱导顿悟[22]。我们认真对待这种批评,并且不声称范数具有普遍因果性。相反,我们的结果划定了*何时*范数是因果的:在它设定函数尺度的设置中,它控制顿悟时间尺度,而这种控制在这些工作所在的条件下——在归一化(§7)下,当正则化针对非 l2 属性时,或者在解不固定于单一范数的任务(§8)上——会减弱或消失。为了将范数*状态*与有效学习率分开,我们的干预在优化器运行(不重置 AdamW 动量)时固定范数,并测量剂量反应。

相似文章