指纹,而非蓝图:位置方案如何设定注意力的默认谱代数
摘要
本文研究了注意力头中QK算子的谱性质,表明位置方案(RoPE、学习到的绝对位置、ALiBi)设定了一个默认的谱代数,它起到了功能确定后固化的指纹作用,而非硬约束。
arXiv:2607.06621v1 公告类型:新
摘要:注意力头的 softmax 前得分是双线性形式 $score(i,j) = x_i^T M x_j$,其中 $M = W_q^T W_k$ 是学习到的算子。由于 M 通常是非对称的,因此是非正规的,它具有复值特征谱和非正交特征向量,这适用于非厄米和随机矩阵工具。我们研究这个谱编码了什么,针对前一个词元和归纳电路在三个层次上。静态地,在跨越三种位置方案的七个预训练模型中,最强的 previous-token 头在 RoPE 下是谱旋转的,而在位置进入 QK 外部(学习到的绝对位置和 ALiBi)时是非旋转的或类似内容的;模型级别的分离在每个检查的 top-k 上都是完美的(精确置换 $p=0.029$),并且将每个频率的 RoPE 相位 $Im(M_t)$ 置零会消除所有三个 RoPE 模型中预先确定的 previous-token 头上的归纳。动态地,在公共的 Pythia 检查点上,每个头都起源于随机矩阵(Ginibre)零假设;旋转特征随着行为出现,而非在此之前,并且产生最终轮廓的人群中位数抑制在电路形成之后发生,因此该轮廓是固化的指纹,而非前兆。因果地,在玩具规模上,没有谱通道是必要的:受约束的两层训练可以绕过每个禁令重新路由,保持能力完整,尽管有显著的成形延迟(四个预注册对比,$q_BH <= 0.016$)。成本结构暴露了每个方案的默认值:施加对称性会使学习到的绝对位置模型减慢 2.9 倍,而具有完全对称静态 M 的 RoPE 头仍然通过相位通道进行方向路由,这在绝对位置下是不可能的。在所考察的设置中,位置方案设定了注意力头解决方案的默认谱代数:一个在功能之后塑造的指纹,而非一个硬性约束。
查看缓存全文
缓存时间: 2026/07/09 07:41
# 位置方案如何设定注意力的默认谱代数
来源:https://arxiv.org/html/2607.06621
## 指纹,而非蓝图:位置方案如何设定注意力的默认谱代数
###### 摘要
注意力头的预处理softmax得分是一个双线性形式 score(i,j)=xi⊤Mxj,其中学习算子 M=Wq⊤Wk。由于 M 通常非对称,因而非正规,它具有复杂的特征谱和非正交的特征向量,这是非厄米和随机矩阵工具适用的领域。我们探究该谱在三个层面上编码了什么,涉及前一个token和归纳电路。静态地,跨越七个预训练模型(涵盖三种位置方案),最强的前一个token头在RoPE下是谱旋转的,而在非旋转或内容类似的情况下,位置从QK外部进入(学习绝对位置和ALiBi);模型级别的分离在每个检查的top-k上都是完美的(精确置换p=0.029),并且在所有三个RoPE模型中,将每个频率的RoPE相位Im(Mt)置零会消除预先识别的前一个token头上的归纳行为。动态地,在公开的Pythia检查点上,每个头都从随机矩阵(Ginibre)零假设出发;旋转特征随着行为出现而锁定,而非在此之前出现;最终产生静态轮廓的中位数抑制值是在电路形成之后发生的,因此该轮廓是一个固化的指纹,而非前兆。因果地,在玩具规模上,没有谱通道是必要的:受约束的两层训练能够绕过所有禁令重新路由,且功能保持不变,尽管会经历显著的形成延迟(四个预先登记的对比,qBH≤0.016)。成本结构揭示了每种方案的默认设置:施加对称性会使学习绝对位置模型的训练时间增加2.9倍,而具有完全对称静态M的RoPE头仍然可以通过相位通道进行方向性路由,这在绝对位置下是不可能的。在所研究的设置中,位置方案设定了注意力头解决方案的默认谱代数:一个在功能形成后塑造出的指纹,而非对其的硬性约束。
## 1 引言
对于一个带有经过归一化处理的残差token x∈Rd 和投影矩阵 Wq,Wk 的单一注意力头,预处理softmax得分是一个双线性形式,作用于一个算子:
score(i,j)=qi⊤kj=xi⊤(Wq⊤Wk)xj=xi⊤Mxj, M=Wq⊤Wk∈Rd×d. (1)
M 是自然的、规范不变的研究对象:重参数化 Wq→WqG, Wk→WkG−⊤ 会保持 M 和所有可观测量不变,因此原始的 Wq/Wk 条目是规范假象,而 M 的函数是物理的(6 (https://arxiv.org/html/2607.06621#bib.bib1))。M 是低秩的(rank≤dk)并且,关键的是,通常非对称——因此它具有复杂的特征谱。
越来越多的文献将非正规/复谱结构解读到Transformer中:残差流雅可比矩阵的Schur分解(7 (https://arxiv.org/html/2607.06621#bib.bib8))、“非厄米”算子理论框架(3 (https://arxiv.org/html/2607.06621#bib.bib9)),以及QK矩阵的对称/反对称分解(15 (https://arxiv.org/html/2607.06621#bib.bib2));同期工作编目了每个注意力头的交互作用的复杂特征值,并针对语料库困惑度消融其斜对称/对称通道(9 (https://arxiv.org/html/2607.06621#bib.bib12))。然而,QK算子的复杂谱在行为上仍然是“未锚定的”——没有随机矩阵零假设、没有头功能分类、没有头级别的因果测试、没有位置方案对比——而该领域的纪律要求我们问的不是这个结构是否存在,而是它是否完成了可测量的工作。具体来说:M 的复特征值视角是否能预测出单纯的对称/反对称分裂未能捕捉到的头行为?
我们在三个层面上回答这个问题:静态地,跨越七个预训练模型——GPT-2 small、OPT-1.3B 和 GPT-Neo-1.3B(学习绝对位置)、BLOOM-1b1(ALiBi:位置作为得分偏置进入,使 QK 在位置上不受约束)、Pythia-410m/1.4B(25% RoPE)和 Llama-3-8B(100% RoPE、RMSNorm、GQA);动态地,跨越公开的 Pythia 训练检查点;以及干预措施,在受约束的从头训练运行中。我们的贡献:
1. 一个 QK 算子的匹配零假设谱框架(§3 (https://arxiv.org/html/2607.06621#S3)):归一化折叠 M 的四种分解、主要的方向性指标 Dhead 及其简单分裂基线 dir_frac,以及——必要的——一个随机方向(Ginibre)零假设,方向性必须相对于此进行解读(随机低秩 M 的 dir_frac≈1/2)。
2. 描述性:谱方向性在全部七个模型上区分了头功能(§4 (https://arxiv.org/html/2607.06621#S4)),将 Saponati 等人的工作(15 (https://arxiv.org/html/2607.06621#bib.bib2))从训练目标扩展到头功能。
3. GPT-2 上的因果解剖(§5 (https://arxiv.org/html/2607.06621#S5)):对称部分 MS 的承载量是反对称部分 MA 的 6.7 倍;MA 仅在典型的归纳/前一个token电路中是因果关键的,在其他地方是惰性的。在 GPT-2 上,复杂的细化指标 Dhead 并没有超越 dir_frac。
4. 架构条件签名(§6 (https://arxiv.org/html/2607.06621#S6)):最强的前一个token头在RoPE下是谱旋转的(top-top-quintile Dhead),而在学习绝对位置和ALiBi位置下是非旋转的(bottom-bottom-quartile,四个模型);模型级别的分离在每个测试的 top-k 上都是完美的(精确置换 p=0.029;头级别 p=2.5×10−5,描述性);dk 在方案间保持不变。聚合部分量被证明受主体污染,对此对比不可靠。
5. 机制(§7 (https://arxiv.org/html/2607.06621#S7)):每个频率的复分解将 Dhead 与 RoPE 旋转相位 Im(Mt) 联系起来;添加 RoPE 相位特征作为控制变量会使 Dhead 的优势减弱约 47–61%(25% RoPE)和约 70–98%(100% RoPE),取决于估计器。
6. 因果确认(§8 (https://arxiv.org/html/2607.06621#S8)):消融 Im(Mt) 会使相对位置核对称化,并恰好破坏被标记头上的归纳行为。
7. 检查点自然史(§9 (https://arxiv.org/html/2607.06621#S9)):在 Pythia-410m/160m 上(各 22 个公开检查点),所有头都诞生于 Ginibre 零假设;旋转特征在电路形成时(而非之前)锁定;产生静态轮廓的中位数抑制值是在形成之后发生的——该轮廓是一个固化的指纹,而非前兆。
8. 约束训练干预(§10 (https://arxiv.org/html/2607.06621#S10)):一个 {APE, RoPE}×{free, sym-MM, Im(Mt)-抑制} 网格(n=5 个种子)显示,没有一个谱通道是必要的(每个分支都会重新路由),同时每个约束都带来显著的搜索成本,揭示了方案的默认解决方案,并在权重层面分离了静态反对称性和 RoPE 相位通道。
一句话统一了这三个层面:位置方案设定了注意力解决方案的默认谱代数——一个在功能形成后塑造出的指纹,一种搜索的经济性而非硬性约束。我们像报告正面结果一样清晰地报告负面结果(GPT-2 的装饰性;MA 在少数头之外的惰性)。
## 2 相关工作
QK 电路和权重空间可解释性。Elhage 等人(6 (https://arxiv.org/html/2607.06621#bib.bib1)) 将 M=Wq⊤Wk 和 WOV 框架为两个低秩电路,并使用 OV 特征值正性作为复制统计量;他们没有进行 QK 谱分析。Millidge 和 Black (12 (https://arxiv.org/html/2607.06621#bib.bib7)) 发现权重 SVD 是可解释的,但报告它在 QK 上失败了——这激发了恢复方向(Schur/复)的观点。我们的对象和 OV/QK 区分遵循这条线;我们的贡献是 QK 侧、虚轴、行为锚定的类比。
对称/反对称 QK。Saponati 等人(15 (https://arxiv.org/html/2607.06621#bib.bib2)) 将 Wqk=Ms+Mn 分解并定义了一个 Frobenius 对称性得分,将其锚定到训练目标。我们的 dir_frac 是其得分的单调变换 (s=1−2dir_frac2);我们将该分裂锚定到头功能,并增加了复/Schur 细化及其因果测试。
非正规/非厄米 Transformer。与这项工作同时,Jamil 和 Kapadia (9 (https://arxiv.org/html/2607.06621#bib.bib12)) 将每个头的注意力交互分解为斜对称(“路由”)和对称(“过滤”)通道,跨越五个预训练模型的 1,776 个头,报告每个头的 maxReλ>0,通过 GPT-2 Large 上的全头截断手术发现对称通道的承载量远大于另一个(在聚合层面与我们的 §5 (https://arxiv.org/html/2607.06621#S5)一致),并从头训练了一个稳定性约束的斜对称减对角注意力。他们的分析止于范数、秩和稳定性——没有行为分类、没有随机矩阵零假设、没有头级别因果测试、没有位置方案对比,并且他们的权重级路由-过滤比(像 Saponati 的得分)是 dir_frac 的单调变换——因此无法询问复谱是否超越了简单分裂而做了额外的工作;这种锚定是我们的贡献。Fernando 和 Guitchounts (7 (https://arxiv.org/html/2607.06621#bib.bib8)) 对残差流雅可比矩阵进行 Schur 分解,并表明学习到的非正规性在功能上是核心——但针对的是不同的算子,没有伪谱,并且锚定到秩/传播,而非头功能。Chang (3 (https://arxiv.org/html/2607.06621#bib.bib9)) 在 Dyson 级数理论中将 Wq⊤Wk 标记为非厄米,但没有进行计算。我们的不同之处在于经验性地分析 QK 算子的复谱并将其锚定到头行为。
RoPE 和位置头。RoPE(17 (https://arxiv.org/html/2607.06621#bib.bib5)) 注入 eimθt 相位,θt=base−2t/d。Barbero 等人(1 (https://arxiv.org/html/2607.06621#bib.bib6)) 和 Urrutia 等人(19 (https://arxiv.org/html/2607.06621#bib.bib10)) 表明位置头使用高 RoPE 频率。我们将一个权重空间方向性标量与每个头的 RoPE 频率使用情况和头功能联系起来,这是他们没有做的。
训练过程中的电路形成。Olsson 等人(13 (https://arxiv.org/html/2607.06621#bib.bib3)) 确立了归纳阶段变化;Tigges 等人(18 (https://arxiv.org/html/2607.06621#bib.bib13)) 在行为上追踪了所有 Pythia 检查点上的电路(归纳出现在约 2×109 个 token 处);玩具模型研究剖析了形成过程(2 (https://arxiv.org/html/2607.06621#bib.bib14),14 (https://arxiv.org/html/2607.06621#bib.bib15),16 (https://arxiv.org/html/2607.06621#bib.bib16));Chen 等人(4 (https://arxiv.org/html/2607.06621#bib.bib17)) 在 MLM 预训练期间正则化了一个可解释的注意力属性——这是我们的干预措施移植到自回归权重空间的模板。Saponati 等人(15 (https://arxiv.org/html/2607.06621#bib.bib2)) 在训练期间追踪了他们的对称性得分(每层,自己的编码器/解码器运行)。这些都没有针对阶段变化,越过公开检查点追踪每个头的权重空间谱量(§9 (https://arxiv.org/html/2607.06621#S9)),也没有在自回归训练期间约束 QK 谱结构(§10 (https://arxiv.org/html/2607.06621#S10))。
约束注意力训练。存在硬对称(共享 QK)因果 LM——Reformer(10 (https://arxiv.org/html/2607.06621#bib.bib18)) 和最近的系统共享研究——并且对称点积 BERT 训练良好(5 (https://arxiv.org/html/2607.06621#bib.bib19)),但没有人分析约束下的电路,并且这里使用的软分解版本(仅惩罚 MA,或仅惩罚 Im(Mt))是新的;同期观察工作跨位置方案与玩具模型中的归纳形成交叉(8 (https://arxiv.org/html/2607.06621#bib.bib20))。
头分类。我们使用标准检测器——前一个token、重复、归纳(13 (https://arxiv.org/html/2607.06621#bib.bib3))——以及 IOI(20 (https://arxiv.org/html/2607.06621#bib.bib4)) 头类别进行验证。
## 3 方法
对象和折叠。我们使用 TransformerLens 并设置 fold_ln=True,将归一化增益吸收到 Wq,Wk 中,并分析归一化折叠后的算子 Meff=CMC(对于 LayerNorm,中心化 C=I−1d11⊤)和 Meff=M(对于 RMSNorm)。所有谱工作使用 float64。我们通过从 M 重建模型自身的预处理softmax得分并匹配到 <10−4(学习绝对位置)或对于 RoPE 模型(仅在 i=j 时位置相消),匹配对角线(bf16 模型匹配到 bf16 精度;快速度量路径是精确的,dir_frac Δ=10−16)来验证约定。一个随机 G∈GL(dk) 会保持 M、其特征值和 Dhead 不变(变化约 10−14),同时改变原始列范数——确认了规范清洁。
分解。对每个头,我们计算 SVD、对称/反对称分裂 M=MS+MA、实 Schur 形式(2×2 块 → 旋转角 θ),以及复特征分解(特征向量条件数作为非正规性标志)。
度量。
dir_frac = ‖MA‖F / ‖M‖F (简单反对称幅度;Saponati 的得分) (2)
Dhead = ∑r|Imλr| / ∑r|λr| (主要复/Schur 方向性) (3)
content_pos_frac = ∑λ+ / ∑|λ| of MS (有符号内容轴;QK 侧对 OV 正性的回响) (4)
henrici = √(‖M‖F² - ∑|λ|²) / ‖M‖F (偏离正规性) 以及 self_match (WEMWE⊤ 的对角主导性)。
随机方向零假设(必要)。一个随机低秩 M 已经高度“有方向性”:对于独立高斯的 Wq,Wk,对称和反对称部分获得相等的预期 Frobenius 质量,因此 dir_fracnull≈1/√2≈0.707,Dhead 的零假设同样很高。因此,我们将每个度量报告为相对于一个匹配 Σ 的随机方向零假设(相同奇异值,随机左右框架),在秩 k 核心中精确计算。经验上 dir_fracnull=0.707, D相似文章
Bifocal Attention: 协调几何与频谱位置嵌入以实现算法泛化
本文介绍了Bifocal Attention,它将位置编码解耦为几何(标准RoPE)和频谱(Learnable Harmonic Operators)两种模态,以解决固定RoPE的'Spectral Rigidity'问题,从而改善超出训练窗口的算法泛化能力。
功能注意力:从成对亲和性到功能对应关系
功能注意力是一种新颖的注意力机制,它将注意力重新解释为自适应基之间的功能对应关系,用受几何功能映射启发的结构化线性算子取代了softmax亲和性。该方法在包括PDE求解和3D分割在内的算子学习任务上实现了最先进的性能,同时保持了分辨率不变性。
PJ-RoPE: 一种用于相对注意力的傅里叶-若尔当-仿射位置空间
PJ-RoPE将RoPE的傅里叶相位、Jordan-RoPE的有限若尔当块和ALiBi的仿射近因性统一到一个可学习的相对位置空间中,并研究了不同任务对该空间区域的选择。
@pallavishekhar_:Attention 背后的数学原理——Q、K 和 V。阅读地址:https://outcomeschool.com/blog/math-behind-attention-qkv…
Amit Shekhar 撰写的一篇教育博客文章,解释了 Attention 机制的数学原理,特别是详细阐述了 Query、Key 和 Value 矩阵,并辅以逐步的数值示例。
注意力的路由与过滤结构
本文将注意力交互矩阵分解为路由(反对称)和过滤(对称)两个组成部分,并引入 S-D 注意力以解耦它们。揭示了路由中的谱级联现象,可预测注意力简化的位置,从而在极小困惑度损失下实现显著的参数减少。