你的注意力度量在回答哪个问题?注意力行作为组合数据

arXiv cs.CL 论文

摘要

本文批判了Transformer中标准的注意力度量方法,揭示了选择保留或丢弃汇入令牌可能会反转结论,并提出了使用组合数据分析来分离汇入和内容注意力组件,以实现更准确的解释。

arXiv:2608.14712v1 公告类型:新 摘要:Transformer注意力矩阵的每一行都是令牌上的概率分布,在训练好的模型中,大部分概率落在一个单独的\emph{汇入}令牌上,通常是第一个。因此,比较注意力行的标准工具(余弦相似度、Jensen--Shannon散度、香农熵)取决于一个论文很少报告的选择:保留汇入令牌,还是丢弃并重新归一化。这个选择可能会反转结论。在来自五个家族的十个预训练模型上,关于两个头哪个更相似的判断有17--47%随着这个惯例而翻转,而标准BERT头聚类流程中最突出的结构就是它的伪影。原因在于单数字摘要混合了两个问题:汇入令牌获取了多少注意力,以及其余部分如何在内容令牌之间分配。将行视为组合数据可以精确分离它们:Aitchison距离正交地分裂为汇入项和内容项,熵通过精确恒等式分裂,内容距离则以Transformer自身具有的不变性为特征。这种分离在实践中很重要:训练期间测量到的大部分熵坍缩是汇入增长,而不是注意力锐化(在70M参数时占下降的30%,1B时占95%,1.4B时占79%),并且修剪错误通道的头可能会使困惑度增加超过一百倍。我们映射了每种惯例安全的地方,测试了一个冻结的样本外预测器(一个确认、一个弃权、一个失败),并发布了重现每个数字的代码。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:49

# 你的注意力度量指标在回答什么问题?注意力行作为组成型数据  
数据来源:https://arxiv.org/html/2608.14712  

## 你的注意力度量指标在回答什么问题?注意力行作为组成型数据  
致谢:宾夕法尼亚大学沃顿商学院统计与数据科学系,费城松树街3733号,PA 19104-6340,[email protected]  
Marios Papamichalis  
致谢:耶鲁大学人性实验室,纽黑文,CT 06511,[email protected]  
附属机构:耶鲁大学人性实验室  
附属机构:和  
附属机构:Regina Ruane  
附属机构:宾夕法尼亚大学沃顿商学院统计与数据科学系  
附属机构:宾夕法尼亚大学  

###### 摘要  
Transformer注意力矩阵的每一行都是token上的概率分布,在训练好的模型中,大部分概率集中在单个*汇聚*token上,通常是第一个token。因此,比较注意力行的标准工具(余弦相似度、Jensen-Shannon散度、香农熵)都取决于论文中很少报告的选择:保留汇聚token,还是丢弃它并重新归一化。这个选择可能反转结论。在来自五个系列的十个预训练模型中,关于两个注意力头哪个更相似的判断中,有17-47%会因约定不同而翻转,并且在标准BERT头聚类流程中最显著的结构就是这种选择导致的人为产物。原因是,单值摘要混合了两个问题:汇聚token获得了多少注意力,以及其余部分如何在内容token之间分配。将行视为组成型数据可以精确地分离它们:Aitchison距离正交地分为汇聚项和内容项,熵通过一个精确的等式分解,内容距离的特征由Transformer自身具备的不变性描述。这种分离在实践中很重要:训练期间测量到的大部分熵坍缩是汇聚token增长的结果,而非注意力集中(在70M参数时下降的30%、在1B时的95%、在1.4B时的79%),并且使用错误通道修剪注意力头可能使困惑度增加百倍以上。我们绘制了每种约定安全的区域,测试了一个冻结的样本外预测器(一次确认,一次弃权,一次失败),并发布了再生每个数字的代码。  

## 1 引言  
图1:一种构造中的反转(定理1 (https://arxiv.org/html/2608.14712#Thmtheorem1))。三个注意力行在{汇聚, a, b}上:  
p=(0.90, 0.08, 0.02)  
q=(0.70, 0.24, 0.06)  
r=(0.90, 0.02, 0.08)  
(a) 保留汇聚列时,p和r共享相同的汇聚质量,而q不同。(b) 丢弃汇聚token并重新归一化(一种通常未记录的常规预处理选择)使得p'和q'*完全相同*(两者都将内容按4:1分配给a:b),而r'则镜像它们。(c) 余弦、JS和欧几里得距离在保留汇聚token时都认为r更接近,而在不保留时都认为q更接近:科学结论是约定的产物。Aitchison距离在两种视角下返回相同的判断,其内容部分dA⊥在数值上完全相同。  
Softmax注意力为每个查询位置生成一个键上的概率分布,即单纯形上的一个点。这正是1 (https://arxiv.org/html/2608.14712#bib.bib1)意义上的*组成*:一个仅携带相对信息的正分量向量。可解释性和训练稳定性文献常规地比较和摘要这些行。4 (https://arxiv.org/html/2608.14712#bib.bib10)通过注意力行之间的JS散度来聚类BERT头;注意力图之间的余弦相似度非常普遍;26 (https://arxiv.org/html/2608.14712#bib.bib14)追踪注意力行的香农熵以诊断*熵坍缩*;头角色分类和修剪分数(23 (https://arxiv.org/html/2608.14712#bib.bib13); 16 (https://arxiv.org/html/2608.14712#bib.bib12); 18 (https://arxiv.org/html/2608.14712#bib.bib21))用欧几里得平均值摘要注意力行集合。这些统计量对其预期目标是有效的,但在移除一个坐标并重新归一化行之后,全行比较的结论不一定保持,而且香农熵结合了边际汇聚质量和条件内容熵。组成型数据分析(CoDA)指出了关键问题:扰动不变性和子组成一致性(1 (https://arxiv.org/html/2608.14712#bib.bib1); 2 (https://arxiv.org/html/2608.14712#bib.bib2); 7 (https://arxiv.org/html/2608.14712#bib.bib3))。CoDA对欧几里得统计的批评可追溯到四十年前。在此之所以重要,是因为第二个近期的经验事实:注意力质量压倒性地集中在少数*汇聚*坐标上,主要是第一个或⟨bos⟩ token(24 (https://arxiv.org/html/2608.14712#bib.bib16); 22 (https://arxiv.org/html/2608.14712#bib.bib18); 10 (https://arxiv.org/html/2608.14712#bib.bib19))。在一个典型的Llama-3.1-405B提示中,大约80%的注意力质量位于⟨bos⟩ token上(3 (https://arxiv.org/html/2608.14712#bib.bib20)),并且汇聚头的比例随模型规模增长(10 (https://arxiv.org/html/2608.14712#bib.bib19))。汇聚token正是CoDA警告的那种主导性共享部分,其包含或排除会改变基于欧几里得和散度的比较。分析是保留汇聚列,还是掩盖它并重新归一化,目前是一个未记录的分析师选择,这个选择可能决定答案:两个非汇聚注意力分配完全相同的头可能被评为距离遥远,而一个具有相反内容偏好的头却被排在其最近邻,纯粹是因为三者共享一个大的汇聚token(图1 (https://arxiv.org/html/2608.14712#S1.F1))。  
两个估计量。全行统计回答关于总分配的问题,包括汇聚部分;丢弃汇聚token的统计回答关于忽略汇聚token的条件分配问题。两者都是合理的;失败模式是在未说明的约定下混合它们,当共享的汇聚token持有大部分质量时,单值摘要就会这样做,而这些摘要又反馈给头分类、修剪决策和训练稳定性监控。我们的主张不是经典度量是错误的,而是它们回答了一个约定依赖的问题;我们精确地分离通道,从Transformer自身的对称性刻画内容通道的典型度量,并测量这种分离带来的变化。  
2026年的并发工作从不同问题得出了相同的几何结构(§2 (https://arxiv.org/html/2608.14712#S2));测量问题、汇聚/内容分离和约定审计,据我们所知,是新的。  
贡献。  
- • 诊断。我们指出保留与丢弃汇聚token的约定是一个未报告的分析师选择,并证明它在正测度集上反转了余弦、JS和欧几里得更近头的判断(定理1 (https://arxiv.org/html/2608.14712#Thmtheorem1))。  
- • 工具包。Aitchison距离的精确正交分解为汇聚项和内容项,精确的熵等式H=Hb(s)+(1-s)H(π),Transformer自身扰动变换的不变性陈述,以及具有商版本内容距离的五公理刻画(引理1 (https://arxiv.org/html/2608.14712#Thmlemma1), 2 (https://arxiv.org/html/2608.14712#Thmlemma2);命题2 (https://arxiv.org/html/2608.14712#Thmproposition2);定理2 (https://arxiv.org/html/2608.14712#Thmtheorem2))。  
- • 失败几何。在汇聚主导区域,所有经典成对不相似度坍缩为消失带,而内容诊断不受影响(定理3 (https://arxiv.org/html/2608.14712#Thmtheorem3);命题3 (https://arxiv.org/html/2608.14712#Thmproposition3))。  
- • 测量。在十个预训练模型上,17%–47%的更近头判断会翻转,跟踪曲线在运行任何模型之前计算;对分类法(包括Clark等人在其完整支持集上的流程)、规模和训练检查点的预先指定的重新分析根据其预测进行评分(§3 (https://arxiv.org/html/2608.14712#S5.F3)–5.3 (https://arxiv.org/html/2608.14712#S5.SS3))。  
- • 功能。作为修剪标准,每个度量都在某处失败;我们绘制了跨十个模型的区域,显示每个标准沿不同轴稳定,并测试了一个冻结的区域预测器在样本外的表现,报告了一次确认、一次弃权和一次失败(§3 (https://arxiv.org/html/2608.14712#S5.F3))。  

## 2 相关工作  
注意力分析度量。4 (https://arxiv.org/html/2608.14712#bib.bib10)计算头间距离为注意力行之间JS散度之和并聚类结果;13 (https://arxiv.org/html/2608.14712#bib.bib11)对注意力模式进行分类并研究冗余性;展平注意力图之间的余弦相似度在许多分析中是默认的。  
熵坍缩与稳定性。26 (https://arxiv.org/html/2608.14712#bib.bib14)逐行定义注意力熵并将病态低熵与训练不稳定性联系起来;6 (https://arxiv.org/html/2608.14712#bib.bib15)研究纯注意力的秩坍缩。  
注意力汇聚与寄存器。StreamingLLM识别第一个token汇聚及其在窗口推理中的作用(24 (https://arxiv.org/html/2608.14712#bib.bib16));5 (https://arxiv.org/html/2608.14712#bib.bib17)在ViT中发现高范数寄存器token;22 (https://arxiv.org/html/2608.14712#bib.bib18)将汇聚追溯到作为隐式注意力偏差的大规模激活;10 (https://arxiv.org/html/2608.14712#bib.bib19)测量汇聚头比例的缩放;3 (https://arxiv.org/html/2608.14712#bib.bib20)解释模型为何关注第一个token并量化涉及的质量。  
头角色与修剪。23 (https://arxiv.org/html/2608.14712#bib.bib13)分类头并使用L0门进行修剪;16 (https://arxiv.org/html/2608.14712#bib.bib12)在测试时修剪大多数头;18 (https://arxiv.org/html/2608.14712#bib.bib21)刻画归纳头。  
组成型数据分析。对数比方法源自1 (https://arxiv.org/html/2608.14712#bib.bib1); 2 (https://arxiv.org/html/2608.14712#bib.bib2);ILR坐标和平衡来自7 (https://arxiv.org/html/2608.14712#bib.bib3);20 (https://arxiv.org/html/2608.14712#bib.bib4)是标准处理;零值处理遵循15 (https://arxiv.org/html/2608.14712#bib.bib5); 9 (https://arxiv.org/html/2608.14712#bib.bib7); 8 (https://arxiv.org/html/2608.14712#bib.bib8)量化并重新评估子组成不连贯。21 (https://arxiv.org/html/2608.14712#bib.bib22)将对数对比引入深度模型的组合*输入*。  
并发的注意力组成型视角。三个并发工作从其他方向得出此几何结构。11 (https://arxiv.org/html/2608.14712#bib.bib24)引入Aitchison距离以量化长上下文中行内token可区分性,并推导温度缩放与Aitchison距离之间的线性关系,独立地证实了我们的幂公理。14 (https://arxiv.org/html/2608.14712#bib.bib25)将行中心注意力logit与CLR变换联系起来,并研究所得场的谱不变性。25 (https://arxiv.org/html/2608.14712#bib.bib26)构造Aitchison单纯形上的树对齐正交基,并注意移位等价logit与CLR超平面之间的同构。没有研究解决此处的测量问题:跨头相似性、熵诊断、分类法以及汇聚约定下的修剪(17 (https://arxiv.org/html/2608.14712#bib.bib9)将图节点嵌入为组合用于学习表示)。信息几何(Fisher-Rao)为单纯形配备了不同的度量,具有不同的不变性;它不是扰动不变的,也不能将汇聚与内容分解,而这些正是汇聚问题所需的属性(§6 (https://arxiv.org/html/2608.14712#S6))。据我们所知,这是首次将对数比几何引入注意力分析的测量方法学,并首次在其中分离汇聚和内容通道。  

## 3 注意力行的Aitchison几何  
组成。令SD={p∈ℝ^D+:∑_i p_i=1}表示D个部分的单纯形(内部),C(x)=x/∑_i x_i为闭包操作。D个键上的softmax注意力行是SD中的一点(来自掩码的结构性零值在下文处理)。单纯形在*扰动* p⊕q=C(p1 q1,...,pD qD)和*幂* α⊙p=C(p1^α,...,pD^α)下构成(D-1)维实向量空间,单位元是均匀组成e,逆为⊖p=C(1/p1,...,1/pD)(1 (https://arxiv.org/html/2608.14712#bib.bib1); 20 (https://arxiv.org/html/2608.14712#bib.bib4))。记g(p)为各部分的几何平均值,*中心对数比*为clr(p)=(log(p_i/g(p)))_i,将SD同构地映射到超平面H={x∈ℝ^D:∑_i x_i=0},而*等距对数比*(ILR)映射为ilr(p)=V⊤ clr(p),其中V∈ℝ^{D×(D-1)}是任意正交对比基,V⊤ V=I,V⊤ 1=0(7 (https://arxiv.org/html/2608.14712#bib.bib3))。*Aitchison内积、范数和距离*是通过clr(等价地任何ilr)拉回的欧几里得度量:  
d_A(p,q) = ||clr(p) - clr(q)||_2 = ||ilr(p) - ilr(q)||_2。 (1)  
子组成与一致性。对于S⊆{1,...,D},*子组成* p^{(S)}=C((p_i)_{i∈S})丢弃其他部分并重新归一化,正是分析师掩盖汇聚列时所做的。*子组成一致性*要求关于S中部分的结论不应取决于分析是在p还是p^{(S)}上进行的;一个不相似度是*子组成主导的*如果δ(p^{(S)}, q^{(S)}) ≤ δ(p,q)(2 (https://arxiv.org/html/2608.14712#bib.bib2); 9 (https://arxiv.org/html/2608.14712#bib.bib7))。在ILR坐标中,取子组成是正交投影(17 (https://arxiv.org/html/2608.14712#bib.bib9), 引理3.1),因此d_A是主导的,且S各部分之间的对数比不受此操作影响。余弦、JS和欧几里得距离既不子组成一致也不主导,并且在汇聚token移除下都不稳定,如§4.1 (https://arxiv.org/html/2608.14712#S4.SS1)所示。  
汇聚/内容记号。我们将汇聚坐标索引为0,其余*内容*坐标为1,...,D-1;任何行唯一分解为p=(s, (1-s)π),其中汇聚质量s=p0,内容组成π∈S^{D-1}。我们用p'=p^{({1,...,D-1})}=π表示丢弃汇聚token、重新归一化的行。(多个汇聚token组合方式相同;附录5 (https://arxiv.org/html/2608.14712#A5.T5))。  
结构性零值与掩码。因果掩码产生结构性零值,而对数比禁止零值;合理的做法是在*共同未掩码支持*上进行比较,这是一个子组成,因此是...

相似文章

贡献权重:自注意力Transformer的几何分析

arXiv cs.LG

介绍贡献权重(Contribution Weights),这是一种基于投影的度量,它考虑了注意力权重、值向量的幅度和方向对齐,从而更准确地衡量Transformer大语言模型中的token重要性,揭示了注意力阱(attention sinks)的主动功能角色。

结构注意力税:检索格式如何独立于内容劫持上下文学习

arXiv cs.CL

本文识别并形式化了'结构注意力税'现象,即检索内容的格式(例如知识图谱三元组)独立于语义相关性扭曲了LLM的注意力分布,导致演示注意力压缩。它提供了正式框架、跨模型和基准的实证证据,并提出了结构感知的缓解策略。

相关与无关:Transformer注意力机制的重整化群分析

arXiv cs.LG

本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。