Grokking中权重范数控制什么?交叉熵下的对数几率尺度中介作用

arXiv cs.LG 论文

摘要

本文研究在交叉熵损失下,权重范数是直接控制神经网络中的grokking延迟,还是其效果通过对数几率尺度和softmax饱和来中介。实验表明,延迟几乎完全由有效对数几率尺度解释,权重范数的贡献微乎其微。

arXiv:2606.18465v1 公告类型:新 摘要: Grokking,即从记忆到泛化的延迟跳跃,通常与权重范数相关:范数越小,泛化越早。我们探究范数实际上控制什么。通过固定权重范数并仅改变输出温度,我们在交叉熵下将grokking延迟在其整个范数诱导范围内滑动;将有效对数几率尺度匹配回基线可恢复约85%的两个模数延迟。在范数和温度的网格上,延迟仅与对数几率尺度相关(R²=0.97),范数仅额外贡献1-2%。该效应依赖于损失函数:在均方误差下,对数几率尺度被固定,范数通过不同途径起作用。记忆控制、float64 softmax坍塌审计和无LayerNorm的Transformer指向同一通道。从同一状态分叉分支,延迟遵循保持的范数值而非钳制操作,这消除了缩放伪影的担忧。近端变量是对数几率尺度及其驱动的softmax饱和度;权重范数只是一个上游手柄。所有数字、表格和图表均可从发布的代码和数据中复现。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:43

# 权重范数在顿悟中控制什么?交叉熵下的logit尺度中介效应
来源:https://arxiv.org/html/2606.18465

###### 摘要

顿悟是一种泛化现象,它在网络拟合训练数据很久之后才出现。顿悟延迟随着权重范数的增大而增长,并且用钳制固定范数会产生清晰的剂量反应曲线,这曾让人认为权重范数设定了时间尺度。我们证明这种理解是不完整的。钳制通过重新缩放权重来固定标量范数,但重新缩放也会提高logit尺度,因此范数和logit尺度会一起变化,钳制并未将它们分离。我们用一个不可训练的输出温度将它们分离,该温度在损失函数之前除以logits,且不计入范数。固定总权重范数不变,仅改变温度,就能在范数提升所产生的整个延迟范围内滑动延迟;当有效logit尺度恢复到其基线值时,在两个模数下分别恢复了范数引起的延迟的0.83 (95% CI [0.82, 0.85]) 和 0.89 ([0.88, 0.91])。在一个范数和温度的网格上,延迟完全由有效logit尺度决定,它单独解释了97%的方差,而范数剂量仅额外增加1–2%。因此,在交叉熵下,权重范数对延迟的影响是通过logit尺度及其导致的softmax饱和起作用的,而不是通过标量范数本身。同样的干预在均方误差下则完全无效:在那里有效logit尺度被固定在1附近无法移动,范数效应大约减半,并且通过另一条途径实现。因此,该机制是损失函数依赖的。一项对照实验表明,温度作用于延迟泛化阶段而非记忆时间,排除了梯度幅度伪影;一项独立的float64审计通过精度而非干预得出了同样的softmax饱和通道;一个无LayerNorm的变压器复制了该效应。从一个相同状态分叉出分支测试表明,延迟追踪的是钳制的范数值,而非重新缩放操作本身,从而排除了钳制伪影的反对意见。本文的结论仅限于模算术网络上的ℓ₂/权重衰减机制。

## 1 引言

当神经网络在拟合训练集后继续训练时,它通常会停止改进。顿悟是一个引人注目的例外:在某些算法任务上,测试准确率在训练损失崩溃后的数千步内仍保持随机水平,然后急剧上升到接近完美 (Power et al., 2022 (https://arxiv.org/html/2606.18465#bib.bib1))。这种现象是鲁棒且可重现的;开放问题不再是它*是否*发生,而是*什么控制了延迟*。

有一个变量被反复提及:权重范数。顿悟与权重范数衰减同时发生 (Liu et al., 2023 (https://arxiv.org/html/2606.18465#bib.bib2)),当范数保持较高时延迟会延长,最近的一些工作将零损失流形上的范数最小化为组织原则 (Musat, 2025 (https://arxiv.org/html/2606.18465#bib.bib8); Boursier et al., 2025 (https://arxiv.org/html/2606.18465#bib.bib9))。如果范数在整个训练过程中被钳制到一个选定值,顿悟延迟会随钳制范数遵循一条清晰的指数剂量反应曲线。这很容易让人解读为权重范数设定了顿悟的时间尺度。

我们认为这种解读混淆了钳制同时改变的两个东西。固定 ‖W‖ 需要重新缩放权重矩阵,而重新缩放也会提高 logits,在交叉熵中这会将 softmax 推向饱和。因此,当更高的钳制范数延长延迟时,我们无法判断是标量范数在起作用,还是重新缩放所附带的 logit 尺度在起作用。这种区分很重要:前者说顿悟受几何量控制,后者则将矛头指向一个函数空间量,而该量已由顿悟的数值稳定性解释涉及 (Prieto et al., 2025 (https://arxiv.org/html/2606.18465#bib.bib6))。

我们通过干预将二者分开。我们用钳制固定总权重范数,并添加一个不可训练的输出温度 τ,它在损失函数之前除以 logits。由于 τ 不是权重,它不计入 ‖W‖;在钳制范数下,它调节有效 logit 尺度,同时保持范数不变。在交叉熵下,两个模数的结果明确:仅改变 τ 就能在范数提升所产生的整个延迟范围内滑动顿悟延迟,并且基线和范数提升的运行都落在延迟相对于有效 logit 尺度的同一条曲线上。将 logit 尺度匹配回基线恢复了 0.83 和 0.89 的范数引起的延迟。权重范数对延迟的影响,在此程度上就是 logit 尺度的影响。

该机制是损失函数依赖的。在均方误差下,顿悟时的有效 logit 尺度被固定在大约 1 附近,因为回归目标固定了它,τ 无法移动它,而范数效应虽然仍然存在,但大小减半,且不由 logit 尺度传递。一项对照实验排除了明显的伪影:τ 几乎不改变记忆时间,几乎完全作用于延迟泛化阶段,因此该效应是关于顿悟本身的,而不是训练速度。

我们的贡献:

- • 一个温度中介测试,在固定钳制范数下分离标量权重范数与有效 logit 尺度,并发现交叉熵下范数引起的顿悟延迟主要通过 (∼0.85,紧 bootstrap CI,两个模数) 恢复 logit 尺度来恢复。
- • 数据坍缩:在一个范数和温度的网格上,延迟仅是有效 logit 尺度的函数 (R² = 0.97),范数剂量在其外仅增加 1–2%。
- • 清晰的损失函数分离:logit 尺度通道在交叉熵下活跃,在均方误差下缺失,因此顿悟的权重范数依赖性并非单一机制。
- • 记忆对照实验表明温度作用于延迟而非记忆,一项 float64 审计独立地到达同样的 softmax 饱和通道,以及在无 LayerNorm 变压器上的定性佐证。
- • 同态测试:从一个相同状态分叉出分支,表明延迟追踪钳制的范数值,而非钳制的重新缩放操作,排除了用于此设置的重新缩放伪影反对意见。
- • 诚实的范围:结果定位于交叉熵下的近端变量;它不描述均方误差路径,定量估计适用于两个模数上的 MLP。

## 2 设置

任务与模型。我们研究模加法,输入 (a, b) ∈ {0, ..., p-1}² 和目标 (a+b) mod p,一个 p 路分类问题,p ∈ {43, 59, 67, 97, 113}。数据集是所有 p² 对;固定比例 α = 0.40 为训练集,通过种子化排列按种子抽取。模型是一个两层 MLP:a 和 b 分别通过共享的 E ∈ ℝ^{p×d} (d=128) 嵌入,两个嵌入拼接后经过一个线性层 W₁ ∈ ℝ^{2d×H} (H=256) 和 GeLU 非线性,然后是一个线性读出层 W₂ ∈ ℝ^{H×p}。优化器为 AdamW (β₁=0.9, β₂=0.999, 学习率 10⁻³, 权重衰减 λ=1.0,除非另有说明),全批次训练,每单元 12 个种子。权重范数为 ‖W‖ = √(‖E‖_F² + ‖W₁‖_F² + ‖W₂‖_F²),不包括偏置。

钳制。在每次优化器步骤之后,从 t ≥ t_int 开始,权重矩阵被一个单一标量重新缩放,使得 ‖W‖ = ρ w_c 精确成立,其中 w_c 是在自由对照运行中测量到的顿悟时的范数,ρ 是剂量。钳制在本文使用的每个单元的记忆阶段之前就已启动,因此干预在整个相关动力学过程中是活跃的。

有效 logit 尺度。本文的核心变量需要一个精确定义。对于温度为 τ 的配置,有效 logits 是损失函数实际看到的后 τ logits。有效 logit 尺度是所有 p² 输入对和所有种子在顿悟步骤(最接近该单元中位数 T_grok 的记录步骤)上计算的每样本有效 logit 向量的 L₂ 范数的均值。在中介分析中,它被基线(ρ=1, τ=1)值归一化,使得轴无量纲且可在不同模数之间比较。

温度与指标。温度 τ 在 softmax (CE) 或平方误差 (MSE) 之前除以 logits;τ=1 恢复标准模型,τ 在一次运行中保持固定。我们记录测试准确率(顿悟时间 T_grok 为测试准确率首次 ≥ 0.90 的步骤,种子中位数),训练准确率(记忆时间 T_mem,≥ 0.99),每组权重范数,有效 logit 尺度,以及 Prieto 等人 (2025) 的 softmax 崩溃率。

## 3 固定范数指数律(剂量反应)

固定范数并扫描剂量 ρ 会产生钳制范数与顿悟时间之间的清晰剂量反应关系。在所有五个模数上,关系是指数型的,T_grok ∝ exp(α ‖W‖),带有每个模数的斜率 α。我们通过 AIC 将其与幂律以及鞍结形式 T ∝ (w₀ - ‖W‖)^(-1/2)(褶皱或临界慢化分叉会产生的特征)进行比较。指数形式通常被选中(表 1 (https://arxiv.org/html/2606.18465#S3.T1)):在四个模数上决定性地胜出(ΔAIC 4.6–6.4),而在 p=43 时较弱(ΔAIC 0.4,与幂律基本持平),我们如实报告而非平滑处理。我们将此视为固定范数剂量反应的一个稳健经验规律,而非从第一原理推导出的定律,我们在本文中仅将其用作衡量以下干预的读出指标。斜率在无 softmax 崩溃范围内拟合(ρ ≤ 1.15;§5 (https://arxiv.org/html/2606.18465#S5))。

这个剂量反应是需要解释的现象。它确立了提高钳制范数会延长延迟;它本身并未说明范数是通过什么起作用的。这正是下一节的问题。

表 1:固定范数指数律 ln T_grok = c + α ‖W‖ 按模数,在无 softmax 崩溃范围内拟合(ρ ≤ 1.15),仅多数顿悟单元。ΔAIC 是指数形式相对于幂律和鞍结形式中较好者的裕度(正值有利于指数形式)。
## 4 权重范数是通过什么起作用的

### 4.1 温度中介测试

钳制通过重新缩放权重来固定 ‖W‖,但重新缩放会提高 logits,而在交叉熵中,更大的 logits 会使 softmax 饱和。因此 §3 的剂量反应并未分离标量范数和它设定的 logit 尺度。我们用一个不可训练的输出温度 τ 将它们分离,该温度在损失函数之前除以 logits,且不计入 ‖W‖。在钳制范数下,τ 调节有效 logit 尺度,同时保持范数不变。

设计是一个三条件中介测试。基线 (ρ=1.0, τ=1) 给出延迟 T₀;提高范数 (ρ=1.15, τ=1) 给出延迟 T₁;在 ρ=1.15 时,我们向上扫描 τ,这会在固定范数下降低有效 logit 尺度。如果范数效应是通过 logit 尺度起作用的,那么设置 τ 使有效 logit 尺度匹配基线,就应该恢复基线延迟。

在交叉熵下,这正是发生的情况(图 1a,表 2)。范数提高的延迟在两个模数上都是基线的 3.4 倍。将 τ 从 1.0 扫描到 1.7,延迟单调地降回,从 3.4 倍降到低于基线,并且这些单元在延迟相对于有效 logit 尺度的单一曲线上形成一条轨迹,基线和范数提高的点都在这条曲线上。有效 logit 尺度本身在扫描范围内移动了约 1.6 倍。在有效 logit 尺度等于其基线值处读取延迟,得到的“logit 尺度恢复分数”(T₁ - T₂) / (T₁ - T₀) 在 p=59 时为 0.83 (95% 自助法 CI [0.82, 0.85]),在 p=97 时为 0.89 ([0.88, 0.91]);CI 是通过对 12 个种子的配对重采样计算得到的,反映了 T_grok 的种子变异性,而 logit 曲线保持不变。我们特意称之为恢复分数而非中介分数:它表示通过恢复有效 logit 尺度,温度干预恢复了范数提高延迟的份额,是一个干预层面上的量,而非基于回归的自然间接效应估计。在此程度上,权重范数对延迟的影响就是 logit 尺度的影响:范数之所以重要,是因为它设定了 logit 尺度,后者设定了 softmax 饱和。这正是 §5 审计所探测的相同通道,这里通过干预而非精度到达。下一小节表明这种关系并非针对这一个范数水平:在一个范数和温度的网格上,延迟坍缩到有效 logit 尺度上。

表 2:在 ρ=1.15 时的温度中介(12 个种子的中位数)。Logit 尺度恢复分数是通过将有效 logit 尺度匹配回基线所恢复的范数提高延迟的比例;仅在交叉熵下报告,因为那里 logit 尺度是一个可用的旋钮。请参阅图注

图 1:在固定钳制范数下,仅改变输出温度 τ。(a) 在交叉熵下,单元在延迟相对于有效 logit 尺度上形成一条曲线:基线(星号)和范数提高点(τ=1,右上)都在其上,增加 τ 使延迟沿曲线向下滑回基线。约 83–89% 的范数提高延迟通过匹配 logit 尺度被恢复(两个模数)。(b) 在均方误差下,顿悟时的有效 logit 尺度被固定在基线附近,τ 无法移动它;残余的范数效应(垂直散布)不在 logit 尺度轴上。两个模数叠加;坐标轴按基线单元归一化。

### 4.2 范数-温度网格上的数据坍缩

单范数恢复分数询问一个范数水平下发生了什么。一个更强的问题是,延迟是否只是有效 logit 尺度的函数,*无论*该尺度是通过提高范数还是降低温度达到的。我们在一个 4×3 的网格上测试这一点:四个范数剂量 (ρ ∈ {1.00, 1.05, 1.10, 1.15}) 与三个温度 (τ ∈ {1.0, 1.3, 1.7}) 交叉,每个模数 12 个单元,所有单元均顿悟 12/12。图 2 绘制了 T_grok 相对于顿悟时的有效 logit 尺度,按 ρ 着色:这些单元落在一条单一的 log-线性曲线上,并且具有相同有效 logit 尺度的不同 ρ 的单元具有相同的延迟。

我们通过回归来量化坍缩。一个对 ln T_grok 的最小二乘拟合...

相似文章

权重范数确定Grokking时间尺度:一个因果延迟定律

arXiv cs.LG

本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。