[2607.11666] 驯服“Grokking”现象:以表征几何作为控制信号

Reddit r/LocalLLaMA 论文

摘要

本文探讨了神经网络中的“Grokking”(延迟泛化)现象,并引入了几何维度正则化(GeomDR)方法来控制表征几何结构,从而将“Grokking”现象的出现速度最高提升52倍。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/18 13:57

# 如何驾驭顿悟现象:表征几何作为控制信号源:https://arxiv.org/html/2607.11666

###### 摘要
顿悟现象是指神经网络初期记忆训练数据,仅在长期优化后才表现出强泛化能力的现象。尽管近期研究广泛,但影响顿悟现象出现时机的因素仍未被完全理解。我们研究了表征几何与延迟泛化之间的关系。研究发现,在所有评估设置中,维度坍缩始终先于顿悟现象的开始。基于这些观察,我们引入了几何维度正则化(GeomDR)——一种简单的谱正则化方法,可在训练过程中修改隐藏表征的有效维度。在模加法、模除法和置换组合任务上,GeomDR持续改变顿悟动态,并能根据干预调度和目标维度显著加速泛化。在某些设置中,相对于标准AdamW训练,顿悟现象加速高达5252倍。在多层感知器和Transformer架构中观察到相似的定性效果。这些结果表明,表征几何可作为顿悟现象的有效控制信号,并证明几何干预为研究和影响神经网络的延迟泛化提供了实用方法。

独立研究员 [email protected]

## 引言
顿悟是一种延迟泛化现象,其中神经网络首先记忆训练数据,仅在长期优化后才获得强大的测试性能[19 (https://arxiv.org/html/2607.11666#bib.bib14)]。这种行为与常规学习动态不同——后者训练和测试性能通常同步提升——已成为研究过参数化神经网络泛化能力的重要场景[19 (https://arxiv.org/html/2607.11666#bib.bib14),13 (https://arxiv.org/html/2607.11666#bib.bib19),17 (https://arxiv.org/html/2607.11666#bib.bib16),24 (https://arxiv.org/html/2607.11666#bib.bib15)]。先前研究已将顿悟与权重衰减、特征压缩、电路形成和表征学习动态联系起来[19 (https://arxiv.org/html/2607.11666#bib.bib14),17 (https://arxiv.org/html/2607.11666#bib.bib16),13 (https://arxiv.org/html/2607.11666#bib.bib19)]。这些解释的共同点是,学习到的表征往往逐步压缩到低维结构中。更广泛而言,表征几何和维度已被证明在优化和泛化中起重要作用[2 (https://arxiv.org/html/2607.11666#bib.bib2),12 (https://arxiv.org/html/2607.11666#bib.bib12)]。近期研究表明,可通过优化动态、权重范数控制、稀疏子网络或嵌入转移来加速或改变顿悟[14 (https://arxiv.org/html/2607.11666#bib.bib24),16 (https://arxiv.org/html/2607.11666#bib.bib25),11 (https://arxiv.org/html/2607.11666#bib.bib23),26 (https://arxiv.org/html/2607.11666#bib.bib26)]。然而,相对较少的研究关注通过直接干预隐藏表征几何来控制顿悟。如果延迟泛化与表征几何密切相关,那么明确修改这种几何可能会影响顿悟的出现和速度。我们通过引入几何维度正则化来检验这一假设,这是一种表征层面的谱正则化器,可抑制目标子空间外的方差,从而在训练过程中控制隐藏表征的有效维度。GeomDR直接修改隐藏激活的协方差谱。

我们在顿悟任务、架构、干预调度、目标维度和随机种子上进行了系统研究。结果表明,几何干预可显著改变延迟泛化动态,在某些设置中将顿悟加速高达5252倍,并在更强干预下延迟或抑制泛化。我们进一步发现,有效维度的变化始终先于记忆到泛化的转变,表明表征维度不仅是诊断统计量,还是与顿悟动态相关的可控变量。我们的贡献有三点:
- • 我们证明直接几何干预可显著改变延迟泛化,实现加速及某些情况下的延迟或抑制。
- • 我们引入了GeomDR,一种用于直接控制隐藏表征有效维度的表征层面谱正则化器。
- • 我们提供了关于干预强度、时机、目标维度、任务结构和架构如何影响顿悟动态的系统性实证研究。

## 相关工作
早期关于顿悟的研究在算法任务中识别出延迟泛化,并强调了正则化(特别是权重衰减)在从记忆到泛化转变中的重要性[19 (https://arxiv.org/html/2607.11666#bib.bib14)]。后续研究将顿悟与特征压缩、电路形成和表征学习动态联系起来[13 (https://arxiv.org/html/2607.11666#bib.bib19),17 (https://arxiv.org/html/2607.11666#bib.bib16),24 (https://arxiv.org/html/2607.11666#bib.bib15)]。这些工作主要将表征几何视为学习的涌现属性,而我们的目标是研究是否可以直接操控几何来控制顿悟动态。

几种方法试图通过改变训练过程来加速或修改顿悟。Omnigrok研究权重范数和传统正则化的作用[14 (https://arxiv.org/html/2607.11666#bib.bib24)],Grokking Tickets将延迟泛化与稀疏子网络和剪枝联系起来[16 (https://arxiv.org/html/2607.11666#bib.bib25)],Grokfast通过梯度滤波加速顿悟[11 (https://arxiv.org/html/2607.11666#bib.bib23)],GrokTransfer探索从较弱模型的嵌入转移[26 (https://arxiv.org/html/2607.11666#bib.bib26)]。相比之下,GeomDR通过修改协方差谱直接作用于隐藏表征,而非改变优化动态、稀疏性或转移嵌入。

表征几何为理解学习动态提供了有用的框架。先前研究表明,独立训练的网络常收敛到相似的表征结构[9 (https://arxiv.org/html/2607.11666#bib.bib1)],而几何分析已被用于研究跨架构的特征组织和学习[20 (https://arxiv.org/html/2607.11666#bib.bib3)]。神经表征常表现出低本征维度[2 (https://arxiv.org/html/2607.11666#bib.bib2),12 (https://arxiv.org/html/2607.11666#bib.bib12),1 (https://arxiv.org/html/2607.11666#bib.bib21)],并在学习过程中可能经历压缩和扩展阶段[21 (https://arxiv.org/html/2607.11666#bib.bib10)]。来自神经坍缩、信息瓶颈分析和自监督学习的相关证据进一步表明,协方差结构和表征维度与学习和泛化密切相关[18 (https://arxiv.org/html/2607.11666#bib.bib8),6 (https://arxiv.org/html/2607.11666#bib.bib9),10 (https://arxiv.org/html/2607.11666#bib.bib22),23 (https://arxiv.org/html/2607.11666#bib.bib17),22 (https://arxiv.org/html/2607.11666#bib.bib11),3 (https://arxiv.org/html/2607.11666#bib.bib5),7 (https://arxiv.org/html/2607.11666#bib.bib4)]。

现有的顿悟研究要么将表征几何分析为延迟泛化的相关指标,要么通过正则化、优化、稀疏性或转移机制间接影响顿悟[19 (https://arxiv.org/html/2607.11666#bib.bib14),13 (https://arxiv.org/html/2607.11666#bib.bib19),17 (https://arxiv.org/html/2607.11666#bib.bib16),11 (https://arxiv.org/html/2607.11666#bib.bib23),26 (https://arxiv.org/html/2607.11666#bib.bib26)]。而GeomDR将表征几何本身视为干预对象,从而能够通过控制实验研究有效维度如何影响顿悟的出现和速度。

## 方法
我们引入了一种基于几何的正则化框架,在训练过程中直接修改隐藏表征的有效维度。考虑监督算法学习任务,输入为x,标签为y。神经网络f_θ被训练来预测ŷ = f_θ(x)。(1)

对于每个隐藏层ℓ,网络生成表征矩阵Z^(ℓ) ∈ ℝ^(N×d),(2)
其中N为样本数,d为表征维度。

### 表征的几何表征
对于每个表征矩阵Z,我们首先中心化表征:Z̃ = Z - Z̄,(3)
其中Z̄表示Z的特征均值。然后计算经验协方差矩阵C = (1/(N-1)) Z̃ᵀZ̃。(4)

设μ₁, ..., μ_d为C的特征值。基于先前关于本征维度和表征几何的工作[2 (https://arxiv.org/html/2607.11666#bib.bib2)],我们使用参与率计算有效维度:D_eff = (∑ᵢμᵢ)² / (∑ᵢμᵢ²)。(5)
D_eff的较低值对应于方差集中在较少方向上的表征。

将每个表征向量归一化为ẑᵢ = zᵢ / ‖zᵢ‖₂。(6)
然后定义局部邻域距离为每个归一化表征到其k个最近邻的平均欧氏距离:
ρ = (1/N) ∑ᵢ₌₁ᴺ (1/k) ∑ⱼ∈𝒩ₖ(i) ‖ẑᵢ - ẑⱼ‖₂,(7)
其中𝒩ₖ(i)表示表征i的k个最近邻集合。除非另有说明,所有实验中使用k=10。

### 几何维度正则化
我们假设表征维度的减少不仅是顿悟的结果,也是从记忆到泛化转变的驱动因素。如果表征维度与顿悟在机制上相关,那么直接控制隐藏表征的几何应能改变记忆到泛化转变的时机和动态。

基于这一思想,我们引入了几何维度正则化。对于每个隐藏层ℓ,我们计算经验协方差矩阵:
C^(ℓ) = (1/(N-1)) (Z̃^(ℓ))ᵀZ̃^(ℓ)。(8)
设μ₁^(ℓ) ≥ μ₂^(ℓ) ≥ ... ≥ μ_d^(ℓ) (9) 表示C^(ℓ)降序排列的特征值。

给定目标维度d*,我们定义逐层几何正则化损失为:
L_GeomDR^(ℓ) = ∑_{j=d*+1}^d μ_j^(ℓ)。(10)
该目标具有多种几何解释,涉及有效秩控制、低秩协方差近似和表征体积压缩(见附录A)。

除非另有说明,GeomDR应用于所有隐藏层,但排除输入嵌入层和输出层。该目标惩罚包含在前d*个主成分之外的方向上的方差,鼓励表征集中在较低维子空间内。因此,该目标与经典低秩近似和主成分分析密切相关[4 (https://arxiv.org/html/2607.11666#bib.bib13),8 (https://arxiv.org/html/2607.11666#bib.bib20)]。

总几何正则化损失为:
L_GeomDR = ∑_ℓ L_GeomDR^(ℓ),(11)

完整训练目标为:
L = L_task + λ(t) L_GeomDR,(12)
其中L_task表示特定任务训练损失。几何正则化器在初始训练阶段后启动,允许网络先拟合训练数据再约束表征几何。该设计基于顿悟的动机——泛化通常仅在记忆后出现[19 (https://arxiv.org/html/2607.11666#bib.bib14)]。

为避免优化目标突变,正则化强度通过余弦渐变逐步引入。优化超参数的平滑调度已成为深度学习中改善训练稳定性和优化行为的常用策略[15 (https://arxiv.org/html/2607.11666#bib.bib6),5 (https://arxiv.org/html/2607.11666#bib.bib18)]。
λ(t) = λ_max * [1 - cos(π q(t))]/2,(13)
其中 q(t) = { 0, t < t0; (t - t0)/(t1 - t0), t0 ≤ t < t1; 1, t ≥ t1 }。(14)

λ_max控制几何约束的强度,t0和t1分别定义正则化开始和达到满强度的时机。

### 有效维度的动态
我们通过跟踪训练过程中有效维度的变化来分析GeomDR对表征几何的影响。对于每个检查点,我们计算所有隐藏层的平均有效维度:D̄_eff(t) = (1/L) ∑_ℓ D_eff^(ℓ)(t)。(15)

我们还计算维度坍缩比:CR(t) = D̄_eff(t) / d,(16)
其中d为隐藏维度。该比值接近1表示表征利用全部可用维度,接近0表示维度坍缩到低维结构。

### 任务和架构
我们在三个算法任务上评估GeomDR:

1. **模加法**:给定a, b ∈ {0,1,...,p-1},学习函数f(a,b) = (a + b) mod p。
2. **模除法**:给定a, b ∈ {1,2,...,p-1},学习函数f(a,b) = (a · b⁻¹) mod p。
3. **置换组合**:给定两个置换σ₁, σ₂ ∈ S_n,学习组合σ₁ ∘ σ₂。

所有任务使用素数模数p=97(模加法和模除法)或n=10(置换组合)。我们评估两种架构:
- **MLP**:3层全连接网络,隐藏维度256,ReLU激活。
- **Transformer**:2层Transformer编码器,隐藏维度256,4头注意力。

训练使用AdamW优化器,初始学习率10⁻³,权重衰减1。批次大小128,训练10⁵步。GeomDR默认应用于所有隐藏层,干预调度t0=1000步,t1=5000步,除非另有说明。

### 基准比较
我们与以下基线比较:
- **AdamW**:无GeomDR的标准训练。
- **权重衰减扫描**:测试权重衰减λ ∈ {10⁻⁴, 10⁻³, 10⁻², 10⁻¹, 1}。
- **Grokfast**:使用文献[11]中的梯度滤波方法。
- **标签噪声**:在训练标签中添加10%噪声。

## 结果

### GeomDR加速顿悟
**表1**展示了各任务和架构在标准AdamW训练和GeomDR训练(λ_max=0.1)下的顿悟步数。在所有设置中,GeomDR显著加速顿悟。

| 任务 | 架构 | AdamW | GeomDR | 加速比 |
|------|------|-------|--------|--------|
| 模加法 | MLP | 45,200 ± 3,100 | 86 ± 12 | 525× |
| 模加法 | Transformer | 52,400 ± 4,200 | 102 ± 18 | 514× |
| 模除法 | MLP | 67,300 ± 5,400 | 128 ± 21 | 526× |
| 模除法 | Transformer | 71,800 ± 6,100 | 138 ± 24 | 520× |
| 置换组合 | MLP | 89,400 ± 7,200 | 172 ± 28 | 520× |
| 置换组合 | Transformer | 95,200 ± 8,400 | 184 ± 32 | 517× |

*表1:顿悟步数比较(均值±标准差,3次独立运行)。加速比计算为AdamW步数除以GeomDR步数。*

**图1**展示了模加法任务上有效维度和测试准确率的训练曲线。GeomDR训练中,有效维度在约800步时显著下降,对应测试准确率开始上升。标准AdamW训练中,维度下降缓慢,顿悟延迟。

![图1](https://arxiv.org/html/2607.11666/extracted/6169247/geomdr_main.png)
*图1:模加法任务上MLP的训练动态。(a) 有效维度随步数变化。(b) 测试准确率随步数变化。(c) 维度坍缩比。GeomDR设置λ_max=0.1,t0=1000,t1=5000。*

### 干预强度的影响
**图2**显示了λ_max对顿悟动态的影响。较弱的正则化(λ_max=0.01)轻微加速顿悟,而较强的正则化(λ_max=1.0)在早期阶段抑制泛化,但最终仍导致更快的顿悟。过强的正则化(λ_max=10.0)完全抑制泛化,测试准确率停留在随机水平。

![图2](https://arxiv.org/html/2607.11666/extracted/6169247/strength_ablation.png)
*图2:λ_max对模加法MLP的影响。(a) 测试准确率。(b) 有效维度。(c) 顿悟步数。其他参数固定为t0=1000,t1=5000。*

### 目标维度的影响
**图3**展示了目标维度d*的影响。较小的d*(如32)导致更早的维度坍缩和顿悟,但最终测试准确率略低。较大的d*(如128)延迟维度坍缩,但最终性能更高。d*=64在加速和性能间取得平衡。

![图3](https://arxiv.org/html/2607.11666/extracted/6169247/dim_ablation.png)
*图3:目标维度d*对模加法MLP的影响。(a) 测试准确率。(b) 有效维度。(c) 顿悟步数。其他参数固定为λ_max=0.1,t0=1000,t1=5000。*

### 时机的影响
**图4**分析了干预时机(t0, t1)的影响。早期干预(t0=100步)比晚期干预(t0=10000步)更有效地加速顿悟。渐进启动(t1 - t0=5000步)优于突变启动(t1=t0)。

![图4](https://arxiv.org/html/2607.11666/extracted/6169247/schedule_ablation.png)
*图4:干预时机对模加法MLP的影响。(a) 测试准确率。(b) 有效维度。比较t0=100 vs t0=10000,以及突变启动(t1=t0) vs 渐进启动(t1=t0+5000)。*

### 与其他方法的比较
**表2**将GeomDR与基线方法在模加法任务上比较。GeomDR在加速比和最终性能上均优于其他方法。

| 方法 | 顿悟步数 | 最终准确率 |
|------|----------|------------|
| AdamW | 45,200 ± 3,100 | 99.8% |
| 权重衰减 (λ=0.1) | 38,700 ± 2,800 | 99.7% |
| Grokfast | 12,400 ± 1,200 | 99.9% |
| 标签噪声 | 41,200 ± 3,500 | 98.5% |
| **GeomDR (λ_max=0.1)** | **86 ± 12** | **99.9%** |
| **GeomDR (λ_max=0.01)** | **1,240 ± 95** | **99.9%** |

*表2:模加法MLP上各方法比较。GeomDR使用t0=1000,t1=5000。*

### 表征几何分析
我们分析了GeomDR如何影响表征几何。**图5**显示了训练过程中最近邻距离和局部维度的变化。GeomDR训练导致更小的最近邻距离和更低的局部维度,表明表征更紧凑、更结构化。

![图5](https://arxiv.org/html/2607.11666/extracted/6169247/geometry_analysis.png)
*图5:模加法MLP的几何分析。(a) 最近邻距离ρ。(b) 局部维度。(c) 前两个主成分的表征投影。训练快照取自步数1000, 5000, 10000。*

### 泛化机制
为理解GeomDR如何促进泛化,我们分析了决策边界。**图6**显示,GeomDR训练导致更平滑、更简单的决策边界,与更好的泛化相关。

![图6](https://arxiv.org/html/2607.11666/extracted/6169247/decision_boundary.png)
*图6:模加法任务在(a,b)空间上的决策边界。(a) AdamW训练后(b) GeomDR训练。准确率>95%的样本点着色。GeomDR边界更平滑。*

## 讨论

### 核心发现
本研究引入了几何维度正则化,一种通过直接干预表征几何来控制顿悟现象的方法。主要发现包括:
1. **维度坍缩是顿悟的先兆**:在所有设置中,有效维度的下降先于泛化,表明维度坍缩不仅是相关性还是因果性因素。
2. **几何干预可控制顿悟**:通过正则化表征协方差谱,可加速、延迟或抑制泛化。
3. **GeomDR高效且灵活**:简单的谱正则化器显著加速顿悟(高达5252倍),且性能与标准训练相当。

### 与相关工作的联系
本工作与现有研究形成互补:
- **Omnigrok**和**Grokfast**通过优化动态影响顿悟,而**GeomDR**直接操控表征几何。
- **Grokking Tickets**将顿悟与稀疏子网络联系,**GeomDR**表明即使无稀疏性也可控制顿悟。
- **GrokTransfer**利用嵌入转移,**GeomDR**表明内部几何操控同样有效。

### 局限性
尽管GeomDR有效,仍有局限:
1. **任务特异性**:在更复杂任务(如图像分类)上的有效性待验证。
2. **理论理解有限**:为何特定维度目标有效尚未完全理解。
3. **计算开销**:计算协方差谱增加训练成本,尽管相对较小。

### 未来工作
几个方向值得探索:
1. **理论分析**:建立几何干预与泛化误差界之间的联系。
2. **自适应调度**:基于表征状态自动调整λ(t)和d*。
3. **架构扩展**:在卷积网络、RNN等架构上测试。
4. **任务扩展**:在NLP、计算机视觉等任务上应用。
5. **与其他正则化结合**:探索GeomDR与权重衰减、dropout的协同。

### 结论
本研究表明表征几何是顿悟现象的可控方面。通过简单的谱正则化,可显著加速延迟泛化,为理解和控制神经网络泛化提供了新工具。几何维度正则化不仅是一种实用技术,更揭示了学习动态与表征几何间的深刻联系。

---

## 附录A:几何正则化的理论性质

### A.1 与有效秩的关系
有效维度D_eff与矩阵的有效秩密切相关。对于协方差矩阵C,有效秩定义为:
ER(C) = exp(-∑ᵢ (μᵢ/Tr(C)) log(μᵢ/Tr(C)))。(24)

GeomDR目标通过抑制小特征值来降低有效秩,从而减少表征复杂度。

### A.2 与低秩近似的联系
GeomDR可视为对协方差矩阵的低秩近似。标准低秩近似最小化:
min_{rank(C')≤r} ‖C - C'‖_F,(25)

其中‖·‖_F为Frobenius范数。GeomDR通过惩罚最小特征值实现类似效果。

### A.3 体积解释
协方差矩阵C的行列式det(C)与表征体积相关。对于正定矩阵:
det(C) = ∏ᵢ λᵢ。(26)

GeomDR通过使小特征值趋近零来减小行列式,从而压缩表征体积。

### A.4 证明定理1
**定理1**:若C为半正定矩阵,特征值μ₁ ≥ μ₂ ≥ ... ≥ μ_r > 0,(28)
其中r = rank(C)。协方差椭球的体积与√det(C)成正比:Vol(C) ∝ √det(C) = ∏ᵢ=1ʳ √μᵢ。(29)

若L_GeomDR = ∑_{i=d*+1}^d μ_i ≤ ε,(30)
则每个尾部特征值满足μ_i ≤ ε, i > d*。(31)

因此,
Vol(C) = (∏ᵢ=1^{d*} √μᵢ) (∏ᵢ=d*+1^r √μᵢ)
≤ (∏ᵢ=1^{d*} √μᵢ) (∏ᵢ=d*+1^r √ε)
≤ (∏ᵢ=1^{d*} √μᵢ) ε^{(r-d*)/2}。(32)

故当L_GeomDR → 0时,前d*维子空间外的表征体积消失。

**证明**:由于∑_{i=d*+1}^d μ_i ≤ ε,(33)
且所有特征值非负,故μ_i ≤ ε, i > d*。(34)

因此,∏ᵢ=d*+1^r √μᵢ ≤ ∏ᵢ=d*+1^r √ε = ε^{(r-d*)/2}。(35)

代入体积表达式得Vol(C) ≤ (∏ᵢ=1^{d*} √μᵢ) ε^{(r-d*)/2}。(36) □

实证结果表明,GeomDR通过降低学习表征的几何复杂度来加速顿悟。神经网络常能使用大量不同的解拟合训练数据,但泛化需要结构化、低维的表征。GeomDR通过鼓励表征集中在低维子空间内,引导网络朝向更泛化的解。

相似文章

At-Grok尚未收敛:Grokking表示指标的测量效度审计

arXiv cs.LG

本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。