贡献权重:自注意力Transformer的几何分析

arXiv cs.LG 论文

摘要

介绍贡献权重(Contribution Weights),这是一种基于投影的度量,它考虑了注意力权重、值向量的幅度和方向对齐,从而更准确地衡量Transformer大语言模型中的token重要性,揭示了注意力阱(attention sinks)的主动功能角色。

arXiv:2606.07604v1 公告类型:新 摘要:分析注意力权重已成为解释大型语言模型(LLMs)信息流的标准方法。然而,这种方法有显著局限性,因为它忽略了被聚合的值向量的几何性质。为了弥补这一空白,我们引入了\emph{贡献权重(Contribution Weights)},这是一种基于投影的度量,通过考虑token的注意力权重、值幅度以及与层输出的方向对齐来量化其影响。我们证明,贡献权重提供了更准确的token重要性度量,在识别不同仅解码器模型、任务和数据集中的语义关键token方面,始终优于基于注意力的度量。此外,我们的度量使得能够对\emph{注意力阱(attention sinks)}进行新的机制分析。先前的研究将注意力阱描述为被动存储多余注意力的仓库,而我们的揭示表明它们具有主动功能角色,通过注意力阱率与输出范数之间的凸关系来抑制信息,通过对抗低置信度token的语义漂移来稳定表示。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:49

# 自注意力Transformer的几何分析
来源:https://arxiv.org/html/2606.07604
## 贡献权重:自注意力Transformer的几何分析

###### 摘要

分析注意力权重已成为解释大型语言模型(LLMs)信息流的标准方法。然而,该方法存在显著局限,因为它忽略了被聚合的值向量的几何属性。为填补这一空白,我们引入*贡献权重*,这是一种基于投影的度量,通过考虑令牌的注意力权重、值的幅度以及其与层输出的方向对齐性来量化令牌的影响力。我们证明,贡献权重提供了更忠实的令牌重要性度量,在识别不同仅解码器模型、任务和数据集中的语义关键令牌时,始终优于基于注意力权重的度量。此外,我们的度量方法能对*注意力沉降*进行新颖的机制分析。虽然以往研究将沉降描述为多余注意力的被动存储库,但我们揭示它们发挥着主动的功能性作用:通过沉降率与输出范数之间的凸关系抑制信息,并通过对抗低置信度令牌的语义漂移来稳定表征。

机器学习,ICML

## 1 引言

参见图标题图1:贡献权重。(上)注意力矩阵和(下)对应的贡献权重矩阵,在两个随机选定的注意力头和层上,使用LLaMA-3.1-8B计算。虽然注意力权重将大量注意力质量分配给第一个令牌,但检查贡献权重后发现这些令牌对输出的贡献很小。

自注意力机制通过注意力权重α_{ij}(Vaswani et al., https://arxiv.org/html/2606.07604#bib.bib32)计算输入相关的令牌加权和,从而控制大型语言模型(LLMs)中的信息混合(Devlin et al., https://arxiv.org/html/2606.07604#bib.bib11; Brown et al., https://arxiv.org/html/2606.07604#bib.bib5)。一种常见的可解释性方法直接分析这些权重,通常隐含地将高注意力质量视为功能重要性的证据。然而,许多先前研究质疑了这种“注意力即解释”的观点(Jain & Wallace, https://arxiv.org/html/2606.07604#bib.bib21; Bastings & Filippova, https://arxiv.org/html/2606.07604#bib.bib2; Lopardo et al., https://arxiv.org/html/2606.07604#bib.bib25),认为仅凭注意力权重无法完整描述信息聚合,因为它们忽略了被聚合向量的潜在几何属性(Kobayashi et al., a https://arxiv.org/html/2606.07604#bib.bib23; Ferrando et al., a https://arxiv.org/html/2606.07604#bib.bib15, b https://arxiv.org/html/2606.07604#bib.bib16)。

在可解释性分析中,多头注意力(MHA)可以等价地计算为头独立值向量的加权和,沿序列维度聚合信息,其中每个值向量由学习到的线性映射投影,该映射塑造了值的几何形状(Kobayashi et al., a https://arxiv.org/html/2606.07604#bib.bib23; Elhage et al., https://arxiv.org/html/2606.07604#bib.bib14)。从这个角度看,令牌对层输出的影响不仅取决于其注意力权重,还取决于其值向量的幅度以及其与所有其他被关注令牌的对齐程度。忽略这些几何因素可能导致误导性结论,因为它忽略了向量之间的干扰,并高估了高注意力令牌的重要性。一个突出的例子是*注意力沉降*的研究,其中早期令牌获得了大量注意力,但在考虑值范数和方向对齐后,它们对最终表征的贡献很小。

在这项工作中,我们引入*贡献权重*,这是一种基于投影的度量,考虑了注意力向量总和的完整几何形状,并忠实地捕捉了令牌的重要性。我们证明贡献权重可以分解为注意力权重、相对幅度以及值向量与输出之间的方向对齐性的乘积。利用这种分解,我们研究了值几何在自注意力中的功能作用,特别关注沉降令牌。

我们的主要发现和贡献如下:

- •贡献权重忠实地衡量令牌重要性。我们通过因果干预证明,在多个模型、任务和数据集中,贡献权重在识别关键令牌方面始终优于基于注意力的度量。
- •方向对齐性对令牌贡献至关重要。纳入值向量的方向对齐性显著提高了所有序列位置上贡献估计的准确性,揭示了几何方向在决定令牌影响力方面比幅度更为重要。
- •*值几何驱动了注意力沉降现象。*初始令牌的值向量与序列中其他令牌反方向对齐,它们对输出的贡献与它们的注意力分数无关,这解释了为什么这些位置上的高注意力并未转化为语义影响力。
- •沉降令牌主动抑制信息。与现有将沉降描述为被动注意力吸收器的观点相反,我们证明沉降令牌充当主动的信息抑制器,反对非沉降令牌的语义方向,从而抵消了由弱注意力积累引入的语义漂移。

## 2 相关工作

#### 几何感知的注意力分析。

为解决基于权重的注意力分析的局限性,几种价值感知的度量方法融入了几何属性,例如值范数(Kobayashi et al., a https://arxiv.org/html/2606.07604#bib.bib23, b https://arxiv.org/html/2606.07604#bib.bib24)和值与输出的距离(Ferrando et al., a https://arxiv.org/html/2606.07604#bib.bib15)。这些方法更忠实地识别重要令牌(Kobayashi et al., a https://arxiv.org/html/2606.07604#bib.bib23, b https://arxiv.org/html/2606.07604#bib.bib24),并实现了有效的令牌剪枝(Ferrando et al., a https://arxiv.org/html/2606.07604#bib.bib15)和KV缓存压缩(Devoto et al., https://arxiv.org/html/2606.07604#bib.bib12; Guo et al., b https://arxiv.org/html/2606.07604#bib.bib19; Shin et al., https://arxiv.org/html/2606.07604#bib.bib29)。然而,现有方法仅捕捉部分值几何,忽略了例如令牌间干扰等效应,而我们证明这些效应对于理解注意力的功能作用至关重要。

#### 注意力沉降与值几何。

理解值几何如何与注意力权重协同作用,对于解释注意力沉降等现象至关重要。在注意力沉降中,令牌尽管携带极少的语义内容,却获得了不成比例的高注意力(Xiao et al., https://arxiv.org/html/2606.07604#bib.bib33)。近期工作刻画了沉降令牌特定的几何属性,包括高范数的残差流隐藏状态(Sun et al., https://arxiv.org/html/2606.07604#bib.bib30)、小值范数(Kobayashi et al., a https://arxiv.org/html/2606.07604#bib.bib23; Devoto et al., https://arxiv.org/html/2606.07604#bib.bib12; Guo et al., b https://arxiv.org/html/2606.07604#bib.bib19),以及与非沉降隐藏状态的负余弦相似度(Shin et al., https://arxiv.org/html/2606.07604#bib.bib29; Cancedda, https://arxiv.org/html/2606.07604#bib.bib6)。这些属性表明,沉降充当隐式偏置项(Sun et al., https://arxiv.org/html/2606.07604#bib.bib30; Darcet et al., https://arxiv.org/html/2606.07604#bib.bib9),吸收多余注意力并通过将输出范数推向零来停用注意力头(Bondarenko et al., https://arxiv.org/html/2606.07604#bib.bib4; Guo et al., a https://arxiv.org/html/2606.07604#bib.bib18),从而减缓序列混合的速度(Barbero et al., https://arxiv.org/html/2606.07604#bib.bib1)。然而,尽管有这些见解,沉降影响序列混合的精确几何机制,特别是通过令牌间干扰,仍有待充分探索。

## 3 背景

在本节中,我们提供注意力机制的背景知识,明确阐述其作为投影值向量加权和的形式。

### 3.1 多头注意力作为加权和

给定输入序列X ∈ R^{L×d},长度为L,维度为d,因果自注意力(Vaswani et al., https://arxiv.org/html/2606.07604#bib.bib32)将输出Y ∈ R^{L×d'}计算为对先前令牌j ≤ i 的加权求和。在令牌位置i ∈ L处,

y_i = ∑_{j=1}^{i} (exp(q_i k_j^T / √d_h) / ∑_{n=1}^{i} exp(q_i k_n^T / √d_h)) v_j = ∑_{j=1}^{i} α_{ij} v_j   (1)

其中α_{ij} ∈ [0,1]是标量注意力权重,沿j ≤ i 求和为1,Q, K, V = XW_Q, XWK, XWV ∈ R^{L×d'}是查询、键和值的投影,W_Q, W_K, W_V ∈ R^{d×d'}是可学习参数矩阵。

MHA的输出o_i ∈ R^d通常表示为H个*独立*注意力头y_i^{(h)} ∈ R^{d'}的拼接,其中d = H · d',随后经过单个输出投影W_O ∈ R^{d×d}:

o_i = Concat({y_i^{(h)}}_{h=1}^H) W_O   (2)

将输出投影矩阵划分为H个块,W_O = Concat({W_O^{(h)}}_{h=1}^H) ∈ R^{Hd' × d},其中W_O^{(h)} ∈ R^{d'×d},我们可以将MHA输出表达为对注意力头的求和(Kobayashi et al., a https://arxiv.org/html/2606.07604#bib.bib23; Elhage et al., https://arxiv.org/html/2606.07604#bib.bib14):

o_i = [y_i^{(1)}, y_i^{(2)}, ...] [W_O^{(1)}; W_O^{(2)}; ⋮] = ∑_{h=1}^{H} y_i^{(h)} W_O^{(h)}   (3)

从这个角度看,MHA可以等价地视为独立投影的头输出o_i^{(h)} := y_i^{(h)} W_O^{(h)} ∈ R^d的和,每个头输出对最终表征贡献加法量。

### 3.2 注意力作为独立线性映射

将注意力的定义(公式1 https://arxiv.org/html/2606.07604#S3.E1)代入MHA的加法表示(公式3 https://arxiv.org/html/2606.07604#S3.E3),我们等价地得到o_i为:

o_i = ∑_{h=1}^{H} ∑_{j=1}^{i} α_{ij}^{(h)} x_j W_V^{(h)} W_O^{(h)}   (4)

这个表达式明确表明,MHA分解为两个独立的头级线性操作:(i) 沿*序列维度*的加权和,其标量系数α_{ij}^{(h)}自适应地决定令牌jj对位置ii贡献多少,以及 (ii) 沿*特征维度*的*低秩*线性映射W_V^{(h)} W_O^{(h)} ∈ R^{d×d},该映射塑造了经W_O^{(h)}投影后的值向量的几何形状。

为了简化符号,我们将经过乘积W_V^{(h)} W_O^{(h)}变换的输入称为投影值向量:

ṽ_j^{(h)} := x_j W_V^{(h)} W_O^{(h)} = v_j^{(h)} W_O^{(h)} ∈ R^d.   (5)

结合这些观察,Transformer中注意力层ll的输出可以表示为对投影值向量的加权和:

o_i^{(l)} = ∑_{h=1}^{H} ∑_{j=1}^{i} α_{ij}^{(l,h)} ṽ_j^{(l,h)}   (6)

其中ṽ_j^{(l,h)} = ĥ_j^{(l-1)} W_V^{(l,h)} W_O^{(l,h)}是投影值向量,而ĥ_j^{(l)} = Norm^{(l)}(h_j^{(l)})是来自前一层的归一化隐藏状态。

MHA的这种表述突出了两个关键性质:(i) 注意力通过连续的聚合阶段构建层级表征——值向量被加权并求和形成头输出,头输出再被求和产生层输出;(ii) 注意力明确塑造了值向量的几何形状,这是一个常被忽略的性质,但对我们下一节分析令牌贡献至关重要。

## 4 注意力的贡献

我们现在引入*贡献权重*,这是一种基于投影的度量,用于分析注意力机制的行为,同时考虑了注意力权重的大小和值向量的几何形状。

### 4.1 向量求和的决定因素

考虑N个向量v_i ∈ R^d的加权和,每个向量由标量α_i ∈ R缩放:

y = ∑_{i=1}^{N} α_i v_i.   (7)

结果y ∈ R^d由三个主要因素决定:

1. α_i的大小。每个系数α_i缩放其对应的向量v_i,调节其相对影响力。在SoftMax注意力下,α_i ∈ [0,1]:α_i=0表示无贡献,0<α_i<1减弱效果,α_i=1保留完整向量。
2. v_i的范数。即使α_i值相等,范数较大的向量贡献更强,因为‖α_i v_i‖ = |α_i| ‖v_i‖。因此,α_i和‖v_i‖的结合作用决定了每个向量在求和中的有效强度。
3. v_i的对齐性。向量的相对方向决定了求和中的干扰程度。当成对余弦相似度cos(v_i, v_j) > 0时,向量相互增强,产生建设性干扰和更大的结果范数。当cos(v_i, v_j) < 0时,

相似文章

谱异常值揭示Transformer注意力中主导的学习结构

arXiv cs.LG

本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。