Grokking 发生之处:无模块切换的分布式效用与傅里叶重编码
摘要
本文使用转换游戏来研究 Transformer 从记忆到泛化的转变,揭示了分布式效用增益是由于注意力偏差和傅里叶重编码,而非模块切换。
arXiv:2609.17571v1 Announce Type: new
摘要:在 Transformer 中,从记忆到泛化的转变在功能上是如何表达的?我们引入了转换游戏——一种行为对齐的精确激活游戏,配对非泛化控制——并发现分布式效用增益伴随着前瞻性的 block-0 注意力偏差;选定的二阶模式在替换游戏中占其添加对比的 67-92%,且不相交精确路径研究证实 block-1 MLP 在 12/12 对中比所有其他测试的下游路径更中介其效果。更尖锐的 'MLP 记忆,注意力泛化' 预测反而逆转了(在记忆锚点处 -0.331 比特/样本;0/12 在预测方向),而路由起始、全局秩崩溃和质数不变架构脊也失败了,将这里的 grokking 识别为现有分布式电路的频谱重编码,而非模块切换。
查看缓存全文
缓存时间: 2026/09/17 08:40
# 理解力骤现发生的位置:分布式效用与傅里叶重编码,无需模块切换
来源:https://arxiv.org/html/2609.17571
###### 摘要
在Transformer中,从记忆到泛化的功能转变究竟发生在何处?我们引入了**过渡博弈**——一种与行为对齐的精确激活博弈,配对了非泛化的控制组。我们发现,分布式效用增益伴随着一个前瞻性的第0层注意力偏差;在替换博弈中,选定的二阶模式占其增益对比的67–92%。一项独立的精确路径研究证实,在12/12对中,第1层MLP中介的效应比所有其他测试过的下游路径之和更多。更尖锐的“MLP负责记忆,注意力负责泛化”的预测则发生了反转(在记忆锚点处为-0.331比特/样本;12/12对均未朝预测方向变化)。同时,路由启动、全局秩坍缩和质数不变架构脊线等预测也均告失败,这表明此处的“理解力骤现”是现有分布式回路的**谱重编码**,而非模块切换。
## 1 引言
在一个受限算法数据集上训练的Transformer,可能在能够泛化到未见输入之前,就已经拟合了每个训练样本数千步(Power et al., 2022 (https://arxiv.org/html/2609.17571#bib.bib7))。由于架构、数据和初始化保持固定而行为发生变化,“理解力骤现”创造了一个罕见的运行内机会来追问:**从记忆到泛化的转变在功能上表达于何处?**
终点定位无法回答这个问题。前馈层可以像键值记忆一样运作(Geva et al., 2021 (https://arxiv.org/html/2609.17571#bib.bib6)),终点干预可以识别用于回忆或编辑的组件(Meng et al., 2022 (https://arxiv.org/html/2609.17571#bib.bib8));然而,在训练后重要的组件,不一定是其角色在泛化时发生变化的组件。定位也可能无法预测编辑将在何处起作用(Hase et al., 2023 (https://arxiv.org/html/2609.17571#bib.bib24))。这种区分在这里具有经验性的后果。
近期的一个结构假说预测,存在一个早期的MLP记忆阶段,随后是由注意力介导的推理(Hidajat et al., 2026 (https://arxiv.org/html/2609.17571#bib.bib22))。我们与行为对齐的测试**反转了**该预测:在首次记忆时,注意力已经具有更大的已测试训练效用。
我们使用**过渡博弈**将转变本身作为估计目标。对于每次运行,我们比较最后一个记忆了训练集但OOD(分布外)性能仍然很差的检查点,与第一个能持续保持高OOD准确率的检查点。在两个检查点上,精确的Shapley博弈将预测性压缩分配至嵌入、注意力和MLP激活。一个组件的**转变增益**是其“后期减前期”的分配,减去在种子、数据集分割和时长匹配的非泛化控制组中的相同变化。这是一个针对所声明的激活替换博弈的因果估计量,而非某个唯一的参数级存储位置。
结构上的答案是分布式的,但不均衡。所有三条残差路径都获得了OOD效用,而第0层注意力相对于其相邻的MLP获得了更多效用。这一更窄的位点在对加法和除法的不相交前瞻性测试中得以存活。它并不反映模块交接:尝试的MLP记忆特征在首次记忆时、在严格的记忆锚点处以及在泛化时都被**反转**了。它也不反映路由启动或全局维度坍缩;操作数路由已经饱和,参与比并未坍缩。
关于模加法的已知傅里叶解提供了一个可证伪的解释,说明到底发生了何种变化(Nanda et al., 2023 (https://arxiv.org/html/2609.17571#bib.bib9))。受限和排除损失可以揭示,训练好的模型输出越来越依赖傅里叶算法,但它们无法将这种纵向变化分配到相互作用的组件中:相同的输出空间进展可能源于不同的内部配置。
因此,我们将已确认的第0层参与者细化为精确的Owen子参与者。由嵌入支持的二阶模式承载了其大部分受控增益,在未见输入上变得更线性可解码,并对OOD预测选择性地变得更为重要。这些方向在记忆锚点处经受住了频率选择测试,在乘法群坐标系中迁移到了除法任务上,并在确定性的同分割供体替换博弈下保持稳定。后者保留了每个目标的经验激活边际分布,同时仍然创建了供体-受体混合体,因此并不声称是一个完全的流形上干预。
随后,我们通过一个精确的四路径恢复博弈跟踪了选定模式的影响。其冻结的第0层MLP与直接路径的比较是空值的,但所需的完整分配揭示了一个最终层MLP假说,该假说在不相交种子上的一个新冻结家族中得到了证实:第1层MLP中介的效应比其他三条测试路径的总和还多。这将相对位点转化为一个分布式回路路径,而无需将某个字面上的傅里叶操作分配给某个模块。
最后,我们测试而非假设架构的普适性。一个全新的“质数×宽度×注意力头”因子设计,在模数为43时支持预声明的头-维度对角线优势,但在模数为53时则不支持。匹配的训练密度和留一分析排除了两种简单解释;转变延迟与质数相关,但在任一质数内部与该效应无关。因果调节变量仍未被识别,因此该结果拒绝了一个通用的脊线,而非提出一个替代的设计规则。
我们的贡献有三方面:
1. **过渡博弈**:一种与行为对齐的、配对的精确博弈估计量,能够区分“理解力骤现”期间发生变化的内容与终点模型所使用的内容;
2. 前瞻性证据表明存在分布式增益,并伴有相对早期的注意力定位,同时直接反转了提出的模块交接;
3. 汇聚的分配、解码、移除、选择、供体基线、跨操作、精确路径和因子设计证据,共同支持了具有明确残差和架构边界的任务对齐谱重编码。
表1:主张级证据路线图。“冻结”指的是在命名结果之前已进行版本控制,而非外部预注册。
## 2 相关工作
#### 延迟泛化与傅里叶进展。
“理解力骤现”被提出是指训练性能饱和后很久才出现的泛化(Power et al., 2022 (https://arxiv.org/html/2609.17571#bib.bib7))。针对模加法的机制性工作重建了一个稀疏的傅里叶算法,并跟踪了特征的形成、清理以及受限/排除损失(Nanda et al., 2023 (https://arxiv.org/html/2609.17571#bib.bib9))。这些输出空间度量确立了算法进展,但无法确定在转变过程中是哪个相互作用的组件改变了其功能贡献。我们的纵向博弈提供了该分配,并说明了这种区分为何重要:受终点启发的“MLP到注意力”交接预测了错误的方向。电路效率、容量和学习动力学假说建模了竞争或不等的学习速度(Varma et al., 2024 (https://arxiv.org/html/2609.17571#bib.bib11); Nguyen and Reddy, 2025 (https://arxiv.org/html/2609.17571#bib.bib15); Song and Ye, 2026 (https://arxiv.org/html/2609.17571#bib.bib20));其他工作将延迟与核函数偏离、表征几何或嵌入联系起来(Mohamadi et al., 2024 (https://arxiv.org/html/2609.17571#bib.bib12); Zheng et al., 2024 (https://arxiv.org/html/2609.17571#bib.bib13); AlquBojet et al., 2025 (https://arxiv.org/html/2609.17571#bib.bib19))。一项信息论容量分析另外发现,非预期的记忆随着泛化在容量饱和附近开始而减少(Morris et al., 2025 (https://arxiv.org/html/2609.17571#bib.bib18)),但并未将该变化定位到具体组件。我们不声称提供了“理解力骤现”的完整理论;我们定位的是受控的功能变化。
同时期的纵向方法提供了互补的视角。ExPLAIND通过梯度路径核同时归因于组件、样本和训练步骤(Eich et al., 2026 (https://arxiv.org/html/2609.17571#bib.bib29)),而逐层经验NTK谱则跟踪“理解力骤现”附近的傅里叶特征对齐(Lin, 2025 (https://arxiv.org/html/2609.17571#bib.bib30))。两者都未估计我们基于行为锚定的、配对的精确激活博弈及其下游路径中介;**过渡博弈**针对的是更窄的估计量。
#### 架构性解释。
仅使用注意力的模块化网络可以在固定参数量下表现出由头数驱动的泛化边界(Gromov, 2024 (https://arxiv.org/html/2609.17571#bib.bib21))。我们的因子设计与之不同:标准的注意力-MLP块在宽度和头数上交叉变化,保持训练密度几乎恒定,并测试运行内的组件分配对比。因此,其特定质数的结果既不复制也不反驳所述的仅注意力边界;它拒绝将单一的头-维度最优值外推到我们的任务上。更直接地,Hidajat等人(2026 (https://arxiv.org/html/2609.17571#bib.bib22))的结构推理假说预测了早期MLP记忆,随后是注意力介导的推理,而一项组合推理研究则报告了在“理解力骤现”前后存在相同的推理路径(He et al., 2026 (https://arxiv.org/html/2609.17571#bib.bib23))。我们冻结并定向反转了第一个预测,同时发现了与重编码现有路径一致的证据。
#### 定位、编辑与因果电路。
Transformer MLP已被解释为键值记忆和事实编辑的目标(Geva et al., 2021 (https://arxiv.org/html/2609.17571#bib.bib6); Meng et al., 2022 (https://arxiv.org/html/2609.17571#bib.bib8));记忆化的行为也可能分布在不同深度或与注意力相关(Maini et al., 2023 (https://arxiv.org/html/2609.17571#bib.bib10); Stoehr et al., 2024 (https://arxiv.org/html/2609.17571#bib.bib14); Menta et al., 2025 (https://arxiv.org/html/2609.17571#bib.bib16); Dong et al., 2025 (https://arxiv.org/html/2609.17571#bib.bib17))。此外,因果追踪定位不一定能预测编辑的最佳层(Hase et al., 2023 (https://arxiv.org/html/2609.17571#bib.bib24))。这些发现强化了我们对于“声明的干预博弈中的分配”、“终点存储”和“可编辑性”之间区别的区分。
激活和路径修补恢复了诸如间接宾语识别电路等结构化电路(Wang et al., 2023 (https://arxiv.org/html/2609.17571#bib.bib25))。因果擦洗通过在输入等价声明下重新采样激活来测试假定的计算图(Chan et al., 2022 (https://arxiv.org/html/2609.17571#bib.bib27)),而ACDC通过重复的激活干预自动发现边(Conmy et al., 2023 (https://arxiv.org/html/2609.17571#bib.bib26))。归因修补通过梯度近似扩展了探索,但可能会遗漏效应(Kramár et al., 2024 (https://arxiv.org/html/2609.17571#bib.bib28))。我们的目标是互补的。小模型使我们能够枚举所有联盟,保留非线性交互,精确验证Shapley/Owen效率,并对缺失的联盟或重构误差进行封闭式失败分析。精确性消除了采样和线性化误差,但并未消除对所选参与者、效用或替换的依赖。
#### 干预博弈。
Shapley值根据效率、对称性、虚拟性和可加性公理分配联盟博弈的增益(Shapley, 1953 (https://arxiv.org/html/2609.17571#bib.bib1));移除解释由参与者、替换、效用和采样方案共同定义(Covert et al., 2021 (https://arxiv.org/html/2609.17571#bib.bib5))。我们完全枚举小型博弈,并使用精确的Owen值将一个层参与者细化为傅里叶子参与者(Owen, 1977 (https://arxiv.org/html/2609.17571#bib.bib3))。均值、零值和边际保留供体替换,以及三种效用定义,是为了暴露而非消除博弈依赖性。
## 3 实验设计
协议术语。**冻结**:在计算命名结果之前已提交并打上标签。**门控**:对一个主张族的预设准入检查。**解锁**:通过门控,因此其后续测试可解释。**封闭失败**:缺失或不一致的证据无法通过次要结果挽救。**容量特定**:针对所述任务、架构和替换博弈的“后期减前期”主要分配变化减去其配对控制组的变化。
### 3.1 任务、模型与行为锚点
每个样本形式为 `[BOS, a, OP, b, EQUALS]`,后接结果令牌。加法使用 `y = (a + b) mod 47`,每个标签14/47个操作数对用于训练。除法使用 `y = a b^{-1} mod 47, b ≠ 0`,每个标签18/46个对。嵌套控制使用来自相同种子置换的前五个每标签对;配对运行共享初始化和分割种子。
基础模型是一个预层归一化的仅解码器Transformer(Vaswani et al., 2017 (https://arxiv.org/html/2609.17571#bib.bib4)),包含两个块,宽度128,四个头,宽度为 `4d` 的GELU MLP,以及绑定的嵌入/读出。完整批量AdamW运行30,000步,学习率 `10^{-3}`,`(β1, β2) = (0.9, 0.98)`,权重衰减1.0,无学习率调度或Dropout。迁移单元格列于附录A (https://arxiv.org/html/2609.17571#A1)。
我们每50步评估完整的训练集和OOD集。记忆主导检查点要求训练准确率 `≥ 0.99` 且OOD准确率 `≤ 0.35`;持续泛化始于连续三次评估中训练 `≥ 0.99` 且OOD `≥ 0.90` 的第一个检查点,至少滞后1000步。我们比较该窗口前的最后一个记忆主导检查点与该窗口的第一个检查点。只有当至少9/12次主要运行通过时,单元格才解锁结构分析;失败仍保留在行为分母中。
被描述为**版本控制冻结**的协议,在计算命名结果之前已提交并打上标签。这提供了一个可审计的时间边界,但弱于由独立外部保管人进行的预注册(附录A (https://arxiv.org/html/2609.17571#A1))。
### 3.2 过渡博弈:精确纵向激活博弈
在某个检查点,一个联盟保留其参与者的训练激活,并通过训练集均值(主要)或零来替换不活跃的参与者。对于评估集 `E`,联盟得分是裁剪后的预测性压缩,`C_E(S) = Σ_{i∈E} max{0, log₂47 + log₂ p_{θ,S}(y_i | x_i)}`。 (1)
精确的Shapley分配为 `φ_j(C_E) = Σ_{S⊆N\{j}} (|S|! (|N|-|S|-1)!)/|N|! [C_E(S∪{j}) - C_E(S)]`。 (2)
逐一消融既不能分配交互项,也不能保证贡献之和等于测量的终点变化。它们的头分数与精确联合博弈相关(r = 0.8412),但并不相同;精确的Shapley值增加了本文中使用的可审计效率恒等式(附录K (https://arxiv.org/html/2609.17571#A11))。此后,**效用**指分配值 `u_{j,E} = φ_j(C_E) / |E|`,单位为比特/样本;**增益**指这些分配的纵向或受控差异。
架构博弈有三个参与者(嵌入、所有注意力输出、所有MLP输出),层级博弈分离每个块的注意力和MLP,头博弈则枚举所有256个协作……(内容截断)相似文章
Grokking Transformer中的权重衰减机制:廉价在线诊断
本文研究了权重衰减如何作为控制参数,使在模算术上训练的Transformer在记忆与泛化之间发生转变,并引入了两种基于注意力激活的廉价在线诊断指标,用以追踪这些动态。
量化Grokking中记忆到泛化的转变:缩放定律与相结构
本文通过缩放定律量化了神经网络中记忆到泛化的转变(Grokking),揭示了与模型容量相比,数据复杂度是转变时间的主要驱动因素。
用于定位 Grokking 相变的分布谱诊断方法
本文提出了一种分布谱诊断方法,用于在测试准确率上升之前定位 Transformer 模型中的 Grokking 相变。该方法利用经验分布和汉克尔动态模态分解(Hankel DMD)创建监测信号,以区分发生 Grokking 和未发生 Grokking 的训练运行。
特征排斥与谱锁定:两层网络 Grokking 现象的实证研究
这项实证研究验证了关于两层神经网络在 Grokking 现象期间的特征排斥和谱锁定理论发现,展示了激活函数如何影响从记忆到泛化的过渡。
思维的谱几何:相变、指令反转、Token级动力学与Transformers推理中的完美正确性预测
对11个大型语言模型的全面谱分析,揭示了Transformers在推理与事实回忆过程中隐层激活空间中的相变现象,发现了七个基本现象,包括谱压缩、指令微调反转以及仅基于谱特性的完美正确性预测(AUC=1.0)。