注意力衰减、功能标记锚定与大型语言模型中基于注意力的干预的局限性
摘要
本文研究了大型语言模型中的短期注意力衰减,发现了一种普遍的指数衰减后趋于平稳的模式,并且功能标记锚定依赖于架构。因果测试表明,增加功能标记上的注意力权重并不会改善检索性能,这表明注意力衰减是描述性的而非规范性的。
arXiv:2607.20524v1 公告类型:新
摘要:跨位置平均注意力衰减在Transformer可解释性中已有广泛报道,但其是否因果关系上限制了上下文检索仍未得到验证。我们在GPT-2、LLaMA-3.2-1B/3B、OPT-1.3B和distilgpt2上进行了六项协调实验。我们首先刻画了短期(5-100个标记)的注意力衰减,发现了一种普遍的指数衰减后趋于平稳的模式,其速率与深度呈负相关,并且每种架构具有不同的逐层熵特征。功能标记锚定被证明依赖于架构:OPT-1.3B(绝对位置编码)表现出距离依赖的介词特异性,GPT-2表现出均匀的非特异性依赖,而LLaMA(RoPE)在长距离上表现出反转。在从句边界策略性地插入逗号,因果关系上减少了40-80个标记范围内的预测衰减,其益处与句法边界对齐相关,而非标记密度。然后我们因果关系地测试了该机制:中继感知注意力(RAA),它将注意力logits偏向功能标记位置,可验证地将注意力权重提高了16-24%,但在GPT-2和LLaMA-1B上产生零效应,对LLaMA-3B初步有害,对OPT-1.3B产生混合效应,净效果接近零。多事实检索探测进一步表明,衰减速率不能预测跨模型的检索准确率。我们得出结论,平均注意力衰减主要是描述性的而非规范性的:功能标记的贡献在于其隐藏状态的计算内容,而非它们接收到的注意力——这对可解释性方法和基于注意力分数的推理优化(如KV缓存驱逐)具有启示意义。
查看缓存全文
缓存时间: 2026/07/24 05:04
# 注意力退化、功能标记锚定与基于注意力的干预在大语言模型中的局限性
来源:https://arxiv.org/html/2607.20524
Sagar Dangal,Manoj Shakya,尼泊尔加德满都大学计算机科学与工程系
###### 摘要
跨位置平均注意力的退化在Transformer可解释性研究中被广泛报告,但其是否因果性地限制上下文检索仍未得到验证。我们在GPT-2、LLaMA-3.2-1B/3B、OPT-1.3B和distilgpt2上进行了六项协调实验。首先,我们刻画了短期(5–100个标记)注意力退化的特征,发现一种普遍的“指数随后平台”模式,其速率与深度呈负相关,且不同架构具有不同的逐层熵特征。功能标记锚定具有架构依赖性:OPT-1.3B(绝对位置编码)表现出距离依赖的介词特异性,GPT-2表现出均匀的非特异性依赖,而LLaMA(RoPE)在长距离上出现反转。在分句边界策略性地插入逗号,能在40–80个标记范围内因果性地降低预测退化,其收益与句法边界对齐相关,而非标记密度。随后,我们对该机制进行了因果测试:中继感知注意力(RAA)通过将注意力logit偏向功能标记位置,可验证地将注意力质量提升16–24%,但对GPT-2和LLaMA-1B产生无效结果,对LLaMA-3B初步显示出有害效果,对OPT-1.3B则产生混合效应,总体接近于零。进一步的多事实检索探针表明,退化速率并不能跨模型预测检索准确率。我们得出结论:平均注意力退化在很大程度上是描述性的,而非规定性的:功能标记通过其隐藏状态计算的内容发挥作用,而非通过它们所接收的注意力——这对可解释性方法以及基于注意力分数的推理优化(如KV缓存驱逐)具有重要启示。
## 1 引言
基于Transformer的语言模型[16 (https://arxiv.org/html/2607.20524#bib.bib16)]中的自注意力机制允许每个标记关注所有前面的位置,权重取决于学习到的查询-键相似度。理论上这能够实现任意的长程依赖建模;实际中,大语言模型(LLM)在利用上下文信息方面表现出系统性局限,随着输入长度增加而降低。
“中间迷失”现象[9 (https://arxiv.org/html/2607.20524#bib.bib9)]表明,位于长上下文中间位置的信息检索准确率远低于开头或结尾——这是一种首因-近因偏差,在上下文窗口从4K到128K标记的模型中均有观察到。Hong等人[6 (https://arxiv.org/html/2607.20524#bib.bib6)]记录了18个前沿模型的“上下文腐烂”现象,性能在远未达到名义上下文限制时即开始下降。Yang等人[20 (https://arxiv.org/html/2607.20524#bib.bib20)]在视觉语言模型中也发现了类似的焦点衰减模式。这些研究一致认为,Transformer注意力不会均匀地分布在输入上。
短期退化——在5到100个标记的跨度内——相对研究不足,然而这一范围对应于一个从句或短句的典型跨度:句法组合的基本单元。Zhang等人[22 (https://arxiv.org/html/2607.20524#bib.bib22)]提出了*功能标记假说*:冠词、介词和标点符号在推理过程中激活来自上下文的预测特征。我们发展了一个互补的*中继链*解释:如果每个功能标记有一个有限半径的上下文影响范围,那么自然散文中功能标记的高密度可能产生一个重叠锚点的链条,支持从句长度的上下文保持。
三个问题推动了本研究:(1) 在不同位置编码方案和深度的架构中,短期注意力退化如何变化?(2) 功能标记是否作为上下文保持的结构锚点,并且这个角色是否依赖于架构?(3) 平均注意力退化是限制检索的因果瓶颈,还是仅仅是发生在其他位置的计算的描述性关联?
前两个问题通过四个相关性和干预实验(实验1–4)来解决:我们刻画退化曲线,通过完形填空替换探针功能标记特异性,通过策略性标记插入测试因果收益,并验证语料库级别的中继链覆盖率。第三个问题通过两个因果实验(实验5–6)来解决:我们将中继链操作化为对功能标记位置的注意力logit偏向(中继感知注意力,RAA),并测试验证的注意力重分配是否能改善行为;同时我们测试退化速率是否能跨模型预测多事实检索性能。
对第三个问题的回答是否定的,这构成了我们核心的方法论发现:**跨位置平均注意力退化在很大程度上是描述性的,而非规定性的**。在功能标记位置将注意力质量验证地提升16–24%对GPT-2和LLaMA-1B产生无效结果,对LLaMA-3B初步显示出有害证据,对OPT-1.3B产生距离依赖的混合效应,总体接近于零;退化速率无法跨模型预测检索准确率。在功能标记确实对上下文处理有贡献的地方——实验2-3显示它们确实以架构特定的方式贡献——它们是通过其隐藏状态积累的上下文信息来实现的,而非通过平均注意力分析所捕捉的注意力路由。
### 1.1 研究问题
RQ1 在5–100个标记范围内,注意力强度随标记距离如何退化?不同架构间退化速率是否不同?
RQ2 功能标记是否专门贡献于上下文记忆保持?还是替换损害与移除任何标记相当?
RQ3 在策略性位置插入功能标记能否减少预测退化,特别是对于功能标记相对于匹配对照?
RQ4 在自然文本中,功能标记的密度是否足够高,使得其有效半径能形成连续的中继链?
RQ5 中继链机制能否通过将注意力logit偏向功能标记位置来操作化?这是否能改善上下文检索?
RQ6 平均注意力退化速率是否能跨架构预测上下文检索性能?
### 1.2 贡献
1. 首次系统性地跨架构刻画短期注意力退化(5–100个标记),涵盖四个架构多样的模型,确立了在形状上普遍但速率上架构依赖的“指数随后平台”模式,以及解释跨模型差异的逐层熵特征。
2. 首次系统证据表明功能标记特异性具有架构依赖性:OPT-1.3B显示距离依赖的介词特异性;GPT-2显示均匀的非特异性依赖;LLaMA在长距离上显示反转,与RoPE冗余一致。
3. 因果证据表明,在分句边界插入逗号可减少预测退化(40–80个标记),该效应对于功能标记相对于匹配的内容标记对照具有特异性,包括LLaMA-3.2-3B中的基于排名的证据,以及四种插入策略的比较显示,句法边界对齐(而非标记密度)驱动了收益。
4. 语料库级别确认,在自然英语中,功能标记密度为每个类别提供83–89%的位置覆盖率(合并为96–98%),在三个分词器中保持稳定。
5. 通过中继感知注意力(RAA)对中继链假说进行的直接因果测试,表明尽管注意力质量重分配得到验证,但将注意力偏向功能标记位置产生无效、负面或边缘效应。
6. 多事实检索探针表明,平均退化速率不能预测检索准确率:模型容量(而非退化速率)才是分界线。
7. 方法论结论:跨位置平均注意力是描述性的而非规定性的,将“注意力作为解释”的争论扩展到自回归语言模型,采用经过验证的干预设计,对基于注意力分数的推理优化(如KV缓存驱逐)具有实际启示。
## 2 相关工作
### 2.1 注意力机制与位置编码
Transformer[16 (https://arxiv.org/html/2607.20524#bib.bib16)]采用多头缩放点积注意力。Clark等人[2 (https://arxiv.org/html/2607.20524#bib.bib2)]表明BERT头部发展出不同的专门化;Voita等人[17 (https://arxiv.org/html/2607.20524#bib.bib17)]表明大多数头部可剪枝。GPT-2[14 (https://arxiv.org/html/2607.20524#bib.bib14)]和OPT[23 (https://arxiv.org/html/2607.20524#bib.bib23)]使用学习的绝对位置嵌入;LLaMA[4 (https://arxiv.org/html/2607.20524#bib.bib4)]使用旋转位置嵌入(RoPE;Su等人[15 (https://arxiv.org/html/2607.20524#bib.bib15)]),直接将相对位置编码到注意力计算中。LLaMA-3.2额外使用了分组查询注意力(GQA);我们将查询级别的注意力权重作为分析单位,与先前的可解释性工作一致。
### 2.2 注意力退化
Liu等人[9 (https://arxiv.org/html/2607.20524#bib.bib9)]在4K–128K标记规模的多文档问答任务上展示了U型性能曲线。Hong等人[6 (https://arxiv.org/html/2607.20524#bib.bib6)]记录了18个前沿LLM的系统性退化。Yang等人[20 (https://arxiv.org/html/2607.20524#bib.bib20)]将发现扩展到视觉语言模型。Gupta等人[5 (https://arxiv.org/html/2607.20524#bib.bib5)]发现LLM不均匀地使用深度,功能词是最早被正确预测的之一。这些先前工作均未考察5–100个标记的从句级别范围,而这是本文所关注的区间。
### 2.3 注意力作为解释:描述性 vs. 因果性
注意力权重是否构成模型行为的机制性证据存在争议。Jain和Wallace[7 (https://arxiv.org/html/2607.20524#bib.bib7)]表明,在编码器分类器中,注意力分布并非忠实的解释:扰动注意力通常对预测影响甚微。Wiegreffe和Pinter[18 (https://arxiv.org/html/2607.20524#bib.bib18)]认为这并未完全驳斥解释性角色,该争论一直持续[1 (https://arxiv.org/html/2607.20524#bib.bib1)]。这些研究主要基于编码器模型和分类设置,主要依赖敏感性分析。我们的工作将这一问题扩展到自回归语言模型,并贡献了一个直接的干预测试:我们验证注意力质量被重分配(16–24%),然后询问行为是否按预测方向改变。干预框架解决了基于相关性的忠实性分析的关键局限性。
### 2.4 功能标记假说
Xiao等人[19 (https://arxiv.org/html/2607.20524#bib.bib19)]识别出“注意力汇”:不成比例的注意力质量分配给前几个标记,无论语义相关性如何。Zhang等人[22 (https://arxiv.org/html/2607.20524#bib.bib22)]提出功能标记从上下文中激活预测特征并驱动下一个标记预测。我们将其扩展为中继链解释,并关键地对其进行因果测试。Qian等人[13 (https://arxiv.org/html/2607.20524#bib.bib13)]发现思维链中的“思考标记”对应于最终答案的互信息峰值——这与我们的句法功能标记类似但不同(另见Ding等人[3 (https://arxiv.org/html/2607.20524#bib.bib3)])。Zhang等人[21 (https://arxiv.org/html/2607.20524#bib.bib21)]表明,强化功能标记调优可以在不修改架构的情况下改善多步推理。
### 2.5 注意力修改与基于注意力的选择
Press等人[12 (https://arxiv.org/html/2607.20524#bib.bib12)]引入了ALiBi,通过从注意力logit中减去线性距离惩罚来实现长度外推。我们的RAA反转了这一逻辑,奖励结构位置而非惩罚距离。Meng等人[10 (https://arxiv.org/html/2607.20524#bib.bib10)]表明,GPT中的事实关联主要定位在MLP层,而非注意力头——这支持了我们的假设,即平均注意力退化可能无法捕捉负责检索的机制。另一条独立的工作线使用累积注意力分数来选择推理过程中保留哪些标记,包括H2O[24 (https://arxiv.org/html/2607.20524#bib.bib24)]和SnapKV[8 (https://arxiv.org/html/2607.20524#bib.bib8)];这些方法隐含地假设注意力质量追踪因果重要性,这正是我们的实验直接测试的假设。
## 3 方法论
### 3.1 模型
表1:实验中使用的模型。L=层数,QH=查询头数,KVH=键值头数。所有模型均为基础预训练模型。distilgpt2(6层,82M)额外用于实验6。LLaMA-3.2使用GQA;注意力在查询头级别进行分析。表1 (https://arxiv.org/html/2607.20524#S3.T1)总结了这些模型。该集合涵盖26×\\times参数范围(124M–3.21B),2.3×\\times深度范围(12–28层),以及两大位置编码家族(学习的绝对嵌入 vs. RoPE),使得架构比较分析成为本工作的核心。
### 3.2 数据集
WikiText-103-raw-v1[11 (https://arxiv.org/html/2607.20524#bib.bib11)]用于实验1和5;WikiText-2-raw-v1用于实验2、3和4。长度小于50字符的文本被过滤;所有文本使用每个模型的原生分词器进行分词,并截断至512个标记。从测试拆分中抽取100个样本,每个模型使用5–10个随机种子。实验6使用合成多事实干扰设计(§3.9 (https://arxiv.org/html/2607.20524#S3.SS9))。
### 3.3 功能标记类别
遵循Zhang等人[22 (https://arxiv.org/html/2607.20524#bib.bib22)]:冠词(*the, a, an*);介词(*of, to, in, for, on, at, by, with, from, as*);标点(, . ; : ! ?)。类别在标记级别使用每个模型的原生分词器操作化。
### 3.4 实验1:基线注意力退化
执行完整前向传播,保留注意力输出。对于每篇文本中30个随机采样的查询位置以及每个目标距离d∈\{5,10,...,100\}d\\in\\\{5,10,\\ldots,100\\\},注意力得分是位置q到q-d\q\-d的注意力权重在所有层和所有头中的平均值。距离d\的退化定义为
退化(d)=\(1−Attn\(d\)Attn\(5\)\)×100%。\\text\{退化\}\(d\)=\\left\(1\-\\frac\{\\text\{Attn\}\(d\)\}\{\\text\{Attn\}\(5\)\}\\right\)\\times 100\\%。(1)
统计显著性通过配对t检验在10个种子级别的均值上进行评估。测量在d∈\{5,10,...,95\}d\\in\\\{5,10,\\ldots,95\\\}处进行;d=100d=100由于距离位置0恰好为100处的注意力汇边界伪影(在512标记序列中)而被排除(§4.1.1 (https://arxiv.org/html/2607.20524#S4.SS1.SSS1))。额外计算每个模型的逐层注意力熵(即注意力分布在先前位置上的香农熵,跨查询位置和文本取平均)。
### 3.5 实验2:完形填空替换
选择一个内容词作为预测目标;基线概率an相似文章
大型视觉-语言模型在注意力机制中迷失
这篇研究论文利用信息论分析了大型视觉-语言模型(LVLM)的内部机制,揭示了注意力机制可能存在冗余,而前馈网络才是推动语义创新的关键。作者证明,将学习到的注意力权重替换为随机值仍可获得相当的性能,这表明当前模型“在注意力中迷失”。
语言模型中锚定路径的定位
本文研究提示中无关数字如何导致语言模型中的锚定效应,并利用基于归因的电路方法在Qwen和Llama模型上定位携带该信号的内部路径。
逐令牌关注多模态生成
本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。
重新思考高效注意力在混合架构中的作用
本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。
当注意力关闭:LLMs如何在多轮交互中迷失线索
本文从机制上解释了为什么LLMs在长时间的多轮交互中会丢失指令,引入了目标可访问性比率(GAR)指标和通道转换框架。通过消融研究和残差流探针,论文表明,对定义目标词元的注意力会在回合间关闭,而目标信息在残差表示中持续存在,并出现了架构特定的失败模式。