光谱探针电路:识别预训练Transformer中注意力头电路的三步法
摘要
介绍了一种三步法,用于识别预训练Transformer中的注意力头电路,该方法使用频谱信号和任务模式筛选,无需标签,并在51M到1B参数模型及多种架构上验证。
arXiv:2605.24059v1 公告类型:新
摘要:我们提出了一种三步法,用于识别预训练Transformer中的注意力头电路。每个头的频谱信号——即每个头注意力输出的时间积分参与率——能够在没有标签或归因梯度的情况下,对执行持续性内容依赖计算的头进行排序。任务模式筛选器将这个通用指标过滤成任务特定的候选电路,并通过与匹配随机对照的组消融来完成因果断言。我们在8倍参数范围(51M到1B活跃/7B总计)、两种架构族(密集、混合专家)以及四种预训练流水线上进行了验证。该方法可移植:在所有测试模型中,一个2-6头诱导电路是因果必要的,消融后合成诱导top-1下降94-100%。频谱信号在无监督下具有预测性:在一个51M参数探针模型的六个独立种子上,相同的计算在每个种子上识别出种子特定的电路。在Pythia族(124M到410M)中,执行可识别专门化计算的头比例保持在17-19%,而特定的诱导电路保持3-11个头——与总头数呈亚线性关系。本文是三个论文系列的方法论基础;配套论文将该方法扩展到预训练过程中的发展轨迹以及组合任务电路,其中模式选择性与任务因果结构解耦。
查看缓存全文
缓存时间: 2026/05/26 09:00
# [email protected]。代码、数据与可复现脚本:https://github.com/skydancerosel/spectral-probe-circuits 来源:https://arxiv.org/html/2605.24059 ## 光谱探针-电路(Spectral Probe-Circuits) ### 一种用于识别预训练Transformer中注意力头电路的三步法††感谢:通讯作者:[email protected]。代码、数据与可复现脚本:https://github.com/skydancerosel/spectral-probe-circuits ###### 摘要 我们提出了一种用于识别预训练Transformer中注意力头电路的三步法。(1) **光谱信号**——每个头注意力输出的时间积分参与比(PR)——无需标签或归因梯度即可对执行持续内容相关计算的头进行排序。(2) **任务模式筛选**应用于所有头,通过测量从任务相关查询位置到标准目标位置的注意力,将该通用指标过滤为特定于任务的候选电路。(3) **因果验证**步骤对候选电路进行分组消融,与同一层中匹配的随机对照以及同层所有头的上限进行比较。PR积分是通用的专业化指标;筛选使其具有任务特异性;匹配随机差分使因果声明具有可证伪性。我们在8倍参数范围(5100万到10亿活跃/70亿总参数)、两种架构系列(密集Transformer、混合专家模型)以及三种预训练管道(TinyStories配合键检索探针、FineWeb、The Pile、DCLM)上验证了该方法。本文有三大发现。首先,该方法具有可移植性:在所有测试的模型中,一个小的(3–6个头)归纳电路是因果必需的,且通过相同的筛选与消融程序识别。其次,每个头的PR信号具有预测性:在5100万参数探针模型的六个独立随机种子上,相同的频谱计算无需任何任务标签即可识别每个种子特有的电路。第三,执行可识别专业化计算的头比例在8倍规模范围内保持约17–19%不变,而特定能力电路本身保持3–11个头——低于总头数的线性增长。本文是三个论文系列的方法论锚点。配套论文将该方法扩展到预训练过程中的发展轨迹(Xu, 2026a (https://arxiv.org/html/2605.24059#bib.bib17))以及组合任务电路,其中模式选择性与任务因果结构解耦(Xu, 2026c (https://arxiv.org/html/2605.24059#bib.bib18))。两篇配套论文均引用了本文建立的方法。 ## 1 引言 机械可解释性通常在注意力头电路出现后识别它们,方法是在一个固定目标能力下对完全训练好的模型进行头消融,并检查那些移除后导致能力下降的头。这种工作流程已经产生了小模型的详细电路级描述(Olsson et al., 2022 (https://arxiv.org/html/2605.24059#bib.bib1); Wang et al., 2023 (https://arxiv.org/html/2605.24059#bib.bib2); Conmy et al., 2023 (https://arxiv.org/html/2605.24059#bib.bib3); Hanna et al., 2023 (https://arxiv.org/html/2605.24059#bib.bib10); Gould et al., 2024 (https://arxiv.org/html/2605.24059#bib.bib11)),但代价高昂——每个条件都需要在完全训练好的网络上进行一次前向传播——且是事后的,因为必须在电路搜索开始之前指定目标能力。本文开发了一种互补方法:**每个头的光谱信号**,可在训练期间读取;加上**全头任务模式筛选**,将该信号专门化到特定任务;再加上标准因果消融。该信号不需要标签或归因梯度;它是每个头激活矩阵的参与比,并随时间积分。筛选是一组固定的六类标准注意力模式(归纳、前一个词元、重复词元、第一个词元/BOS、自注意、局部)以及必要时添加的任务特定模式。因果验证遵循标准的消融范式,并包含两个对照:同一层中匹配的随机消融,以及同层所有头的上限。 我们做出三项贡献: - • 具有明确定义和阈值的具体方法(第3节 (https://arxiv.org/html/2605.24059#S3)),通过在七种模型配置(涵盖5100万到70亿参数)上的重复实验得到验证。 - • 对模式与任务因果状态的诚实框架。PR积分是通用的专业化指标:在注意力汇聚占主导的10亿级模型中,按PR积分排名前K的头会先于任务因果电路浮现出L0/L1通用内容依赖头。任务模式筛选使该方法具有任务特异性;匹配随机差分使因果声明可证伪。我们在方法论部分(§3.6 (https://arxiv.org/html/2605.24059#S3.SS6))明确陈述这一点,而非将其埋没为局限性。 - • 跨架构重复与一个守恒比例。一个3–6头的归纳电路在所有测试模型中都是因果必要的。执行可识别专业化工作的头比例在8倍规模范围内保持在17–19%区间,而特定能力电路本身保持3–11个头——低于总头数的线性增长。 #### 三部曲范围。本文是三篇论文计划中的第一篇。第二篇论文将该方法扩展到发展轨迹(光谱信号在中间训练检查点先于能力选择性出现)(Xu, 2026a (https://arxiv.org/html/2605.24059#bib.bib17))。第三篇论文将该方法应用于组合任务(间接宾语识别、大于、后继序列、变量绑定),并记录了模式与任务因果解耦现象,即相同任务在不同模型家族中由不同的主要注意力模式实现(Xu, 2026c (https://arxiv.org/html/2605.24059#bib.bib18))。当前论文建立了该方法以及两篇配套论文所依赖的跨架构归纳结果。 参考图释 图1:能力电路在预训练早期出现,每个头的频谱信号先于其形成。(A) 每个检查点的每头频谱信号——max(PR_t - 1, 0),即§3.2 (https://arxiv.org/html/2605.24059#S3.SS2) 中定义的PR积分排名统计量的被积函数,按检查点而非累积和绘制,以便显示出现的时间结构。Pythia 1B中的三个已识别头:归纳头L4⋅H4、前一词元头L3⋅H5、以及BOS/注意力汇聚头L4⋅H1。X标记表示形成事件,定义为该头的能力选择性比率首次超过其阈值的训练检查点(归纳≥50倍,前一词元≥100倍,首词元≥30倍)。三个头在形成时或之前,频谱信号均已升高。(B) 三种10亿级配置中电路形成时的训练比例:Pythia 1B(Pile,密集),OLMo 1B-0724-hf(DCLM,密集),OLMoE 1B-7B-0924(DCLM,MoE)。任务电路(归纳、前一词元)在每种配置的训练前0.3–2.1%内形成;BOS吸引子形成较晚。配套论文(Xu, 2026a (https://arxiv.org/html/2605.24059#bib.bib17))包含完整的发展分析。 ## 2 相关工作 #### 归纳头与上下文学习。Olsson等人(2022 (https://arxiv.org/html/2605.24059#bib.bib1))识别了归纳头——实现“A B ... A → B”复制模式的注意力头——并将其出现与预训练过程中的上下文学习阶段转变联系起来。我们使用相同的操作定义(从第二个A位置到第一个A之后位置的注意力),但以不同方式识别电路:通过训练期间的每个头频谱信号加上任何选定检查点的全头选择性筛选,取代了他们使用的积分梯度风格归因。 #### 间接宾语识别(IOI)。Wang等人(2023 (https://arxiv.org/html/2605.24059#bib.bib2))描述了GPT-2-small中的IOI电路,并识别了头类别(名称移动器、S-抑制、前一词元、归纳、重复词元、负名称移动器、备份名称移动器)及其组合结构。他们的分解是组合任务电路的权威参考。本计划的第三篇论文测试了该分解在来自不同训练管道的三个10亿级模型中的可移植性(Xu, 2026c (https://arxiv.org/html/2605.24059#bib.bib18));当前论文侧重于方法本身以及单模式能力(归纳、前一词元),在这些能力上该方法最为清晰。 #### 注意力汇聚。Xiao等人(2024 (https://arxiv.org/html/2605.24059#bib.bib5))引入了“注意力汇聚”这一术语,用于描述预训练语言模型将大量注意力概率分配给第一个词元(无论内容如何)的经验观察,从而通过KV缓存压缩实现流式推理。我们记录了BOS类头(主导注意力目标为第一个位置且超过基线≥30倍的头)在1亿+规模的仅解码器语言模型中普遍存在,但在我们测试的所有模型的每个训练检查点中均不存在于L0和L1层。配套论文(Xu, 2026a (https://arxiv.org/html/2605.24059#bib.bib17))描述了BOS比例随训练数据和架构的缩放规律。 #### 自动电路发现。Conmy等人(2023 (https://arxiv.org/html/2605.24059#bib.bib3))开发了ACDC(自动电路发现),一种用于在给定固定任务和模型时识别电路的迭代边剪枝算法。本文的方法与之互补:ACDC需要完全训练好的模型和已定义的任务;频谱筛选方法按头操作,利用训练时的信号(步骤1),旨在作为更昂贵分析之前的快速预过滤器。两种方法解决了解释性工作流程的不同阶段。 #### 参与比。参与比(有效秩)是随机矩阵理论和凝聚态物理学中用于测量分布有效维度的标准工具。其在可解释性中的使用尚不完善。轨迹特征 I(L,H) = Σ_t max(PR_t - 1, 0) Δlog(标记数_t) 在§3.2 (https://arxiv.org/html/2605.24059#S3.SS2) 中定义,是操作上的创新,而非单纯的PR;§5.3 (https://arxiv.org/html/2605.24059#S5.SS3) 表明它优于我们测试的所有替代轨迹特征。 #### 跨架构机械迁移。先前的工作记录了不同模型家族对相同任务产生不同的特定电路(Lieberum et al., 2023 (https://arxiv.org/html/2605.24059#bib.bib12); Marks et al., 2024 (https://arxiv.org/html/2605.24059#bib.bib13))。我们在10亿级规模上复制了归纳现象的该观察结果(第6节 (https://arxiv.org/html/2605.24059#S6)),配套论文在组合任务上进一步强化了这一点(Xu, 2026c (https://arxiv.org/html/2605.24059#bib.bib18))。 #### 频谱训练动态。相关工作描述了优化器在低维度上引起的漂移(Xu, 2026b (https://arxiv.org/html/2605.24059#bib.bib15))以及训练轨迹中的信号-噪声频谱边缘(Xu, 2026d (https://arxiv.org/html/2605.24059#bib.bib16))。这些分析从参数层面考察训练轨迹的几何结构;我们的分析则从固定检查点的每头激活频谱角度进行考察。两者的联系在于:高维内容相关表示需要多个活跃的奇异方向,这正是参与比所测量的。 ## 3 方法论 ### 3.1 模型面板 七种模型配置(六个独立的基础模型加上六个TS-51M种子): #### 合成归纳批次。2000个长度为256的序列,RNG种子42。每个序列的结构为 [填充] A B [填充] A,其中A和B是从词汇表ID [100, 10000) 中随机抽取的词元。归纳预测是紧随第二次出现A的位置之后的B。 #### TS-51M键检索探针。序列形式为 > [前缀] 秘密代码是 XXXX。[填充] 秘密代码是什么?→ XXXX,其中XXXX是来自固定512个码字词汇表的单词元码字。用于替代51M规模模型的合成归纳批次,因为该模型太小,归纳批次评估无法区分。 #### 自然文本批次。OpenWebText序列,过滤到下一个真实词元已在上下文中较早出现的位置(归纳目标位置);用于§5.1 (https://arxiv.org/html/2605.24059#S5.SS1) 及之后部分的自然文本确认。 #### 推理设置。默认使用fp16;在Pythia 1B早期检查点的机械解释中使用fp32(第6节 (https://arxiv.org/html/2605.24059#S6)),因为在随机初始化规模下基准注意力值低于fp16可表示范围。每(层、头)钩子放置在注意力输出投影处(对于GPT-NeoX模型为 attention.dense;对于Llama/OLMo/OLMoE为 self_attn.o_proj)。 ### 3.2 步骤1:每头光谱信号 对于每个(层L,头H)和训练检查点t: 1. 1. 在固定评估批次上,提取任务相关查询位置的每头注意力输出。结果是一个激活矩阵 M ∈ R^(N × d_head),其中N是批次大小,d_head是每头维度。 2. 2. 计算M的奇异值谱 {σ_i}。 3. 3. 计算参与比: PR(L,H,t) = exp(H(p)),其中 p_i = σ_i^2 / Σ_j σ_j^2, (1) H(p) = -Σ_i p_i log p_i 是平方奇异值分布的熵。 轨迹特征为时间积分: I(L,H) = Σ_t max(PR(L,H,t) - 1, 0) · Δlog(tokens_t)。 (2) I(L,H) 对**持续**的内容相关计算进行加权。直观上,一个头的每位置注意力输出在批次中集中于一个方向,则秩≈1(PR≈1,内容无关);一个头的输出覆盖多个方向(批次中每个内容变化对应一个方向),则PR较高。max(PR-1, 0) 的裁剪防止噪声随机初始化PR主导积分。 #### 为何使用积分而非PR跨度。在Pythia模型上,L0头在初始化时PR≈60(随机注意力将概率分布到所有位置,产生高有效秩),并在训练结束时**坍缩**至PR≈2–30。按PR跨度(训练中最大值减最小值)对头进行排名会将这类坍缩头列为前茅;而按 I(L,H) 排名则正确地将其降低,优先选择那些**获得**持续PR的头。完整的九特征比较见§5.3 (https://arxiv.org/html/2605.24059#S5.SS3)。 ### 3.3 步骤2:任务模式筛选 对于每个头,测量从任务相关查询位置到标准目标位置的注意力。所有评估中计算六个标准类别: - • **归纳** – 关注当前词元先前出现位置之后紧邻的位置(A B ... A → B中的B位置)。 - • **前一词元** – 关注位置t-1。 - • **重复词元** – 关注当前词元较早出现的位置。 - • **首词元 / BOS** – 关注
相似文章
谱异常值揭示Transformer注意力中主导的学习结构
本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。
仅注意力Transformer的对照研究
本文提出了一项对照研究,比较了仅注意力Transformer(简单注意力网络,SANs)与在参数、计算量和深度上匹配的标准Transformer。研究发现,当将释放的容量重新分配给注意力深度时,移除前馈层在很大程度上缩小了性能差距,剩余差距归因于参数回忆。
FourierQK:对查询-键投影进行频谱预处理提升Transformer注意力
本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。
语法引导的稀疏注意力机制:实现高效可解释的Transformer
本文介绍了一种针对Transformer的语法引导稀疏注意力机制,旨在通过利用语言结构来提高效率和可解释性。
@antoniolupetti: 《理解Transformer与注意力机制》是一篇非常有趣的论文,它从应用数学的角度介绍了Transformer架构…
一条推文重点介绍了一篇由Michel Fabrice Serret撰写的arXiv论文,该论文从应用数学的角度介绍了Transformer和注意力机制,涵盖了向量化、多头注意力以及降低注意力成本的方法,如KV缓存和Latent Attention。