相关与无关:Transformer注意力机制的重整化群分析

arXiv cs.LG 论文

摘要

本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。

arXiv:2607.15449v1 Announce Type: new 摘要:借用威尔逊重整化群理论(RG)的语言,我们将Transformer的注意力机制视为对已训练MLP残差栈固定点的扰动,并询问它构成相关、边缘还是无关算子。我们推导了一个固定点偏移公式,并得到了关于固定点几何、有效秩分布、层特异性和扰动衰减谱的四个可检验预测。在具有受控相关长度的合成马尔可夫链序列上进行测试,我们发现:(1)对于长链(长相关),注意力强烈相关:它弥补了MLP无法跨越的残差损失差距,并在表示空间中驱动相变,有效秩在第1层跳跃至输入维度以上,并稳定在高维平台。(2)对于短链(短相关),注意力无关:Transformer收敛到与MLP相同的损失和固定点几何,尽管它更快地收缩扰动。(3)转变由第一层头(L0H0)主导,其表示偏移是任何后续头的4倍以上,这符合相关算子恰好在MLP开始积分掉位置变化之前起作用的预测。(4)扰动衰减实验揭示了机制反转:在长相关机制中,Transformer选择性地保留慢马尔可夫模式(衰减长度的动态范围为5.4倍,而MLP为1.3倍);在短相关机制中,它比MLP更快地抑制所有模式,且无谱选择性。这些结果共同表明,注意力的相关性不是架构的属性,而是数据生成过程的谱结构的属性,并且一阶RG扰动框架为这种差异提供了预测性解释。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:27

# Transformer 注意力的重正化群分析 来源:https://arxiv.org/html/2607.15449 ## 相关与无关:Transformer 注意力的重正化群分析 Parviz Haggi\-Mani1,2, Irina Rish1,2 haggimpa@mila\.quebec, irina\.rish@mila\.quebec 1蒙特利尔大学,2Mila – 魁北克人工智能研究所

###### 摘要

使用 Wilson 重正化群理论(RG)的语言,我们将 Transformer 的注意力机制视为对经过训练的 MLP 残差栈不动点的微扰,并询问它构成一个相关算子、边缘算子还是无关算子。我们推导出不动点位移公式 δ=−M∗−1(a+b),并获得了四个关于不动点几何、有效秩分布、层特异性和微扰衰减谱的可检验预测。在具有受控相关长度 ξ 的合成马尔可夫链序列上测试这些预测,我们发现:(1) 对于长 ξ 链,注意力是强*相关的*:它弥补了 MLP 无法弥合的残差损失差距,并在表示空间中驱动了一个相变,有效秩在第 1 层跃升至输入维度以上,并稳定在一个高维平台。(2) 对于短 ξ 链,注意力是*无关的*:Transformer 收敛到与 MLP 相同的损失和不动点几何,尽管实验 4 显示它更快地压缩了微扰。(3) 该转变由第一层注意力头(L0H0)主导,它产生的表示变化是后续任何注意力头的 4× 以上,与相关算子在 MLP 开始整合位置变化之前起作用的预测一致。(4) 微扰衰减实验揭示了一个机制反转:在长 ξ 机制中,Transformer 选择性地保留慢速马尔可夫模式(衰减长度的动态范围为 5.4×,而 MLP 为 1.3×);在短 ξ 机制中,它比 MLP 更快地抑制所有模式,没有光谱选择性。总之,这些结果表明注意力的相关性不是架构的属性,而是数据生成过程谱结构的属性,并且一阶 RG 微扰框架为这种差异提供了可预测的解释。

## 1 引言

在我们之前的工作中(Haggi\-Mani & Rish, 2026 (https://arxiv.org/html/2607.15449#bib.bib5)),我们展示了在马尔可夫链序列上训练用于掩码令牌预测的纯 MLP 残差栈实现了一个由输入分布相关长度 ξ 控制的选择性粗粒化过程:短 ξ 链产生单调的秩塌缩(8.4× 压缩),长 ξ 链保留隐藏表示的有效秩,并且在两种情况下,层间核漂移集中在一两个转变处,网络的其余部分接近一个与 RG 理论一致的*不动点平台*。在这个受控设置中的一个重要发现是,前向传递不仅仅是*类似于* RG 流;表示序列 (h(0),...,h(L)) 执行了一个 RG 流,每一层执行一个粗粒化步骤,不动点平台标志着向吸引子的收敛。进入转变是网络在表示空间中致力于特定吸引子的点:核漂移在一两层处的急剧集中反映了这种流的离散性质,网络在一个粗粒化步骤中从一个表示机制跨越到另一个,而不是逐渐变化。

自然的下一个步骤是引入注意力并表征其对 RG 流的影响。在这个框架中,注意力作为一个额外的算子进入,其相关性或无关性决定了它是将不动点偏移一个小量,还是将系统驱动到一个性质不同的吸引子。在统计场论的语言中,这等同于询问注意力是 MLP 不动点的*相关*微扰(在深度 RG 迭代下增长,将系统驱动到不同的不动点)、*边缘*微扰(在迭代下保持不变,以恒定幅度持续)、还是*无关*微扰(衰减,使不动点物理保持不变)。算子的类型决定了网络的大尺度表示行为。

这建立在将 RG 与学习系统联系起来的一系列工作之上。Mehta & Schwab (2014 (https://arxiv.org/html/2607.15449#bib.bib9)) 构建了 Kadanoff 变分 RG 与基于 RBM 的深度网络之间的精确映射,奠定了概念基础;Coppola 等人 (2026 (https://arxiv.org/html/2607.15449#bib.bib17)) 将其扩展到弱非线性网络,开发了一个严格的 RG 框架,将微扰分类为相关或无关,并揭示了大数据极限下学习曲线的普遍性。然而,这两项工作都没有推导或测试训练网络表示不动点结构的微扰理论预测 (Bordelon 等人, 2024 (https://arxiv.org/html/2607.15449#bib.bib3))。本着 Kadanoff–Wilson RG (Wilson, 1971 (https://arxiv.org/html/2607.15449#bib.bib13)) 的精神,最近的工作已将类 RG 动力学与表示流形中的拓扑相变联系起来 (Alpay & Kilictas, 2026 (https://arxiv.org/html/2607.15449#bib.bib1))。Makkuva 等人 (2025 (https://arxiv.org/html/2607.15449#bib.bib16)) 研究在一阶马尔可夫链上训练的 Transformer,并解析地表征了损失景观的不动点,表明注意力可以驱动系统在 unigram 和 bigram 吸引子之间转换,这是本工作在马尔可夫输入统计和不动点推理组合方面最接近的方法学前身,尽管它没有使用 RG 框架或将注意力分类为算子。Fernando & Guitchounts (2026 (https://arxiv.org/html/2607.15449#bib.bib15)) 提供的经验证据表明,训练会在深度上安装一个单调谱梯度,并且微扰会随着层被差异性地放大或抑制,与类 RG 流一致,但没有做出形式化的不动点预测。本文推导了不动点位移公式 δ=−M∗−1(a+b) 并使用它来对注意力作为输入分布相关长度 ξ 函数的相关性做出可证伪的预测,并在训练网络的测量值上测试这些预测。应用该框架需要形式化定义注意力扰动 MLP 不动点意味着什么,以及测量量应如何响应的可检验预测。我们将在第 3 节 (https://arxiv.org/html/2607.15449#S3) 中提供这两者,然后在第 4 节 (https://arxiv.org/html/2607.15449#S4)–7 节 (https://arxiv.org/html/2607.15449#S7) 中测试这些预测。

#### 论文结构。第 2 节 (https://arxiv.org/html/2607.15449#S2) 回顾了我们之前在 (Haggi\-Mani & Rish, 2026 (https://arxiv.org/html/2607.15449#bib.bib5)) 中的设置。第 3 节 (https://arxiv.org/html/2607.15449#S3) 发展了微扰理论框架并推导出可检验的预测。第 4 节 (https://arxiv.org/html/2607.15449#S4)–7 节 (https://arxiv.org/html/2607.15449#S7) 呈现了实验。第 8 节 (https://arxiv.org/html/2607.15449#S8) 根据结果评估预测,第 9 节 (https://arxiv.org/html/2607.15449#S9) 得出结论。一些计算在附录中提供。

## 2 背景

### 2.1 合成语料库

序列从词汇表 V=16 的马尔可夫链中采样,该链具有行随机转移矩阵 P。谱隙控制相关长度 ξ=−1/log|λ2|,其中 λ2 是按幅度计算的第二大特征值。研究两个机制:
- • 短 ξ:α=10,λ2≈0.44,ξ≈1.2。序列在 ∼5 步内去相关。
- • 长 ξ:α=0.05,λ2≈0.86,ξ≈6.7。混合时间 t_mix(0.01)≈31 步;上下文窗口携带大量预测信号。

在所有实验中,T=64,序列编码为独热向量 X∈R^{B×T×V}。训练使用 BERT 风格的掩码令牌预测(掩码率 15%)、交叉熵损失、Adam (Kingma & Ba, 2015 (https://arxiv.org/html/2607.15449#bib.bib6)) 学习率 3×10^{-4}、批量大小 B=32,训练 10,000 步,每步使用新鲜序列。

### 2.2 架构

#### MLP 基线:一个没有注意力的预归一化 MLP 残差栈:输入投影 φ_in: R^V→R^d,L 个残差块,每个计算 x←x+MLP(LayerNorm(x)),隐藏维度 4d,GELU 激活,最终 LayerNorm,以及分类头 φ_head: R^d→R^V。所有实验使用 d=64,L=6。

#### TFM:一个匹配的架构,其中每个残差块在 MLP 子层之前添加一个预归一化的多头自注意力子层。没有使用位置编码,使注意力成为唯一的新归纳偏差(见第 8 节 (https://arxiv.org/html/2607.15449#S8))。所有其他超参数与 MLP 相同;主要实验中 n_heads=1。

### 2.3 测量量

*有效秩* (Roy & Vetterli, 2007 (https://arxiv.org/html/2607.15449#bib.bib10)):对于表示矩阵 H∈R^{N×d},具有归一化奇异值谱 p_i=σ_i/∑_j σ_j,
ρ_eff(H)=exp(−∑_i p_i log p_i)∈[1,d]。 (1)
递减的深度分布轮廓标志着渐进粗粒化 (Haggi\-Mani & Rish, 2026 (https://arxiv.org/html/2607.15449#bib.bib5)),这种模式也在大型预训练模型中被经验观察到 (Alpay & Kilictas, 2026 (https://arxiv.org/html/2607.15449#bib.bib1); Fernando & Guitchounts, 2026 (https://arxiv.org/html/2607.15449#bib.bib15))。
*核漂移:* Δ_CKA(l,l+1)=1−CKA(H^{(l)},H^{(l+1)}),其中 CKA 是中心核对齐 (Kornblith 等人, 2019 (https://arxiv.org/html/2607.15449#bib.bib7))
CKA(X,Y)=‖Y^⊤X‖_F^2 / (‖X^⊤X‖_F ‖Y^⊤Y‖_F), (2)
并且 X,Y∈R^{n×d} 是 n 个样本上的中心化表示矩阵:小漂移表示不动点;集中的漂移标志着离散的转变事件。在 BERT 中观察到的从语法到语义表示的逐层进展 (Tenney 等人, 2019 (https://arxiv.org/html/2607.15449#bib.bib11)) 与这里采用的粗粒化解释一致。所有表示都以展平模式(N=B×T)提取,以避免 (Haggi\-Mani & Rish, 2026 (https://arxiv.org/html/2607.15449#bib.bib5)) 中发现的均值池化伪影。

## 3 理论框架:作为 RG 微扰的注意力

### 3.1 MLP 不动点的稳定性

正如我们之前的工作所确立的,经过训练的 MLP 残差栈收敛到一个不动点平台:在一两个进入转变之后,层间核漂移接近于零,表示不再发生进一步的几何变化。该不动点(见附录附录 A (https://arxiv.org/html/2607.15449#A1))的稳定性由下式支配
ε_n=(I+M)^n ε_0, (3)
其中 n 是迭代次数。在雅可比矩阵 M 的特征基(特征值为 μ_k)中,这是
[ε_n]_k=(1+μ_k)^n [ε_0]_k。 (4)
当且仅当 I+M 的所有特征值严格位于单位圆内时,MLP 不动点是稳定的:
对于所有 k,|1+μ_k|<1。 (5)
对于实特征值,这简化为 −2<μ_k<0:MLP 子网络必须在 x* 处压缩微扰,但不能过强以至于过冲。μ_k>0 或 μ_k<−2 的模式在迭代下增长(不稳定特征向量方向)。在两个 ξ 机制中经验观察到的不动点平台意味着经过训练的 MLP 在所有模式上都满足该条件。吸引子的低有效秩(ρ_eff≈1.8)反映了大多数特征值 μ_k 接近于 −1,因此表示空间中的几乎所有方向都被压缩为零,只留下一个低维稳定子空间。

### 3.2 TFM 不动点作为 MLP 不动点的微扰

我们在每个 MLP 块中添加一个单头注意力子层
A(x)=softmax(QK^⊤/√d) V (6)
其中 Q=xW_Q,K=xW_K,V=xW_V。假设新的不动点 x̃* 是先前 MLP 不动点的一个小偏移 δ(见附录附录 B (https://arxiv.org/html/2607.15449#A2)),该偏移由下式给出
δ = −M*^{-1}(a+b) (7)
其中
M* ≡ (I+D[b])(I+D[a])−I,即 M* = D[b]+D[a]+D[b]D[a], (8)
并且我们定义了
a≡A(x*),b≡f(x*+a),D[a]≡D[A](x*),D[b]≡D[f](x*+a)。 (9)

我们在公式 (7) (https://arxiv.org/html/2607.15449#S3.E7) 中假设 M* 是可逆的。注意,当且仅当 x* 已经是修改后块的不动点时,a+b=0;因此 a+b 测量了在 x* 处评估的不动点条件的残差。在 M* 的特征基 {v_k}(特征值为 ν_k)中分解 a+b,公式 (7) (https://arxiv.org/html/2607.15449#S3.E7) 给出
δ=−∑_k [a+b]_k / ν_k v_k,[δ]_k=−[a+b]_k/ν_k, (10)
其中 [δ]_k 是沿特征向量 v_k 的偏移。
TFM 不动点的稳定性(见附录附录 C (https://arxiv.org/html/2607.15449#A3))。在 x̃* 附近线性化,设 x_n=x̃*+ε_n,微扰演化为
ε_n=M̃*^n ε_0,M̃*≡(I+D[b̃])(I+D[ã]), (11)
其中
ã≡A(x̃*),b̃≡f(x̃*+ã)=−ã,D[ã]≡D[A](x̃*),D[b̃]≡D[f](x̃*+ã)。 (12)
当且仅当 M̃* 的所有特征值 ν̃_k 严格位于单位圆内时,不动点 x̃* 是稳定的:
对于所有 k,|ν̃_k|<1。 (13)
在 M̃* 的特征基 {ṽ_k} 中,每个模式演化为
[ε_n]_k=ν̃_k^n [ε_0]_k

相似文章

仅注意力Transformer的对照研究

arXiv cs.LG

本文提出了一项对照研究,比较了仅注意力Transformer(简单注意力网络,SANs)与在参数、计算量和深度上匹配的标准Transformer。研究发现,当将释放的容量重新分配给注意力深度时,移除前馈层在很大程度上缩小了性能差距,剩余差距归因于参数回忆。

贡献权重:自注意力Transformer的几何分析

arXiv cs.LG

介绍贡献权重(Contribution Weights),这是一种基于投影的度量,它考虑了注意力权重、值向量的幅度和方向对齐,从而更准确地衡量Transformer大语言模型中的token重要性,揭示了注意力阱(attention sinks)的主动功能角色。