消融可逆的注意力头不转移:对Transformer中机制角色声明的压力测试
摘要
本文表明,满足机制角色声明常见标准(必要性、线性可解码性、消融可逆性)的注意力头,在跨提示词转移计算时常常失败,并引入了KID(Knowing/Intent/Doing)框架和一个三阶段流水线,用于更严格的角色分配。
arXiv:2606.08292v1 公告类型: 新
摘要:在机制可解释性中,注意力头通常被提升为角色声明(例如,“此头代表加法”),当它们对某一行为是必要的、线性编码该行为、并且在消融后恢复时能恢复该行为。我们证明这一证据不足:在三个7-8B指令微调模型和五个计算族中,通过全部三项检查的头在将它们的激活修补到不同提示词(在匹配控制下)时,常规性地未能转移计算。我们引入了KID(Knowing/Intent/Doing),一个用于注意力头的角色分配视角,并搭配一个三阶段流水线:能力选择性筛选(CSS)、奇异值分解(SVD)和匹配控制下的激活转导。我们的结果记录了一个初步的角色分类法(包括提示轨迹稳定器、答案侧logit偏置头和软计算模式载体),并表明相同答案控制(一个共享答案字符串但不共享所请求计算的转导目标)是一个未被充分利用的检查,它暴露了伪装成语义特异性的广泛状态转移。
查看缓存全文
缓存时间: 2026/06/09 08:55
# 可逆消融的头不迁移:Transformer中机械角色主张的压力测试 来源:https://arxiv.org/html/2606.08292 ###### 摘要 在机械可解释性中,注意力头通常被提升为*角色主张*(例如,“这个头表示加法”),当它们对某一行为是必要的,线性编码该行为,并且在消融后恢复时能还原该行为。我们证明这一证据是不充分的:在三个7-8B指令微调模型和五个计算族上,通过所有三项检查的头在匹配控制条件下,将其激活修补到不同提示中时,通常*无法迁移*计算。我们引入**KID**(*Knowing / Intent / Doing*,即“知晓/意图/执行”),一个用于注意力头的角色分配视角,并将其与三阶段流程配对:能力选择性筛选(CSS)、奇异值分解(SVD)以及在匹配控制下的激活转导。我们的结果记录了一个初步的角色分类(包括提示轨迹稳定器、答案侧对数偏置头和软计算模式载体),并表明*相同答案控制*(一个共享答案字符串但不共享请求计算的转导目标)是一个未被充分利用的检查,它暴露了伪装成语义特异性的广泛状态迁移。 ## 1 引言 机械可解释性(MI)的一个核心目标是理解*为什么*单个模型组件,特别是注意力头,在行为上很重要。一个常见的工作流程结合了两类证据:描述性证据(组件的激活编码了可解释的信息)和因果证据(组件对某些行为是必要的)。这些通常被快速结合:一个头的激活线性解码了请求的计算,并且其消融会损害性能,就被视为该计算的候选*表示*。 我们认为这种推断为时过早,并且通常被用作证据的四个属性(选择性必要性、线性可解码性、消融可逆性和干预可泛化性)是截然不同的,并且经常分离。一个头可以线性编码信息,而不一定是其因果位点;一个头可以是必要的,但不一定具有干预可泛化性;一个头可以是消融可逆的(即修补其激活能恢复性能),而不携带可迁移的语义状态。混淆这些属性会导致过度自信的角色主张,并进而导致对Transformer电路所做工作的误导性解释。 为了建设性地组织这一批判,我们引入了**KID**:一个三部分视角,它区分了*知晓*(模型识别提示要求的过程)、一个假设的*意图*状态(识别后和执行前的计算选择状态)和*执行*(答案执行和生成)。KID是一个角色分配词汇表,而不是关于不相交电路的声明。*知晓*框架的动机来自Kadavathet al. [2022 (https://arxiv.org/html/2606.08292#bib.bib1)],他们表明LLMs通常能在生成答案之前预测可回答性——这表明提示识别和答案生成并不总是同时发生。 我们将KID与一个三阶段实证流程配对。**能力选择性筛选**(CSS;类似于Bair and others 2026 (https://arxiv.org/html/2606.08292#bib.bib2))识别出小的头集,其针对性消融选择性地损害了测量的能力,同时保留其他能力,从而确立这些头是*重要的*。**奇异值分解(SVD)** [Ahmad and others, 2025 (https://arxiv.org/html/2606.08292#bib.bib3)] 检查这些头内部线性存在哪些信息,使用平衡的提示控制来将语义结构与表面伪影分开。**激活转导测试**检验一个头的状态能否在匹配控制下,将请求的计算从一个提示上下文运输到另一个。我们仅将第三阶段视为可迁移计算选择状态的证据。 我们将这一流程应用于五个计算族(算术、比较、数字属性、日期和时间——所有这些都需要比事实查找更多但比思维链推理更少的内容),在三个指令微调的7-8B模型上。我们发现: 1. 1. **分离结果**。选择性必要性、线性可解码性、消融可逆性和干预可泛化性系统地分离。最常见的模式是头通过了提示侧消融可逆性检查,但在激活转导下未能迁移计算。在所有在激活转导下测试的模型-族和秩组合中,包括识别出的最干净的提示侧CSS秩,消融可逆性并不暗示干预可泛化性(表1 (https://arxiv.org/html/2606.08292#S5.T1))。 2. 2. **角色分类**。CSS选出的头在KID框架内表现出异质性角色:一些表现为提示轨迹稳定器,一些为答案侧对数偏置头,一些携带可在相关族间迁移的软计算模式信息,而在当前实验中,没有一个头明确满足干预可泛化计算选择状态(KID意义上的*意图*)的全部标准。 3. 3. **方法论意义**。行为筛选是可解释性主张的必要前提,但对于角色分配是不够的。角色分配需要在匹配控制下进行激活转导。*相同答案控制*(一个与源提示共享答案但不共享请求计算的转导目标)是一个重要但未被充分利用的检查,它暴露了伪装成语义特异性的广泛状态迁移。 我们的流程和提示族已发布,以促进复制并扩展到其他模型和能力类别。 ## 2 相关工作 我们将本文置于机械可解释性工作的四个重叠浪潮中:早期的组件级发现、支持这些发现的常见证据堆栈、日益增长的使这些发现复杂化的*可解释性幻觉*目录,以及最近对方法论严谨性和审计的推动。 #### 从归纳头到局部化能力。 早期的MI工作将单个注意力头描述为实现可识别的算法:用于上下文学习的归纳头 [Olsson et al., 2022 (https://arxiv.org/html/2606.08292#bib.bib6)]、用于间接对象识别的名称移动和抑制头 [Wang et al., 2023 (https://arxiv.org/html/2606.08292#bib.bib7)]、事实关联检索 [Meng et al., 2022 (https://arxiv.org/html/2606.08292#bib.bib8)],以及复制抑制头 [McDougall et al., 2023 (https://arxiv.org/html/2606.08292#bib.bib20)]。一个平行的线索表明,能力可以定位于令人惊讶的小参数或激活子集:O(1)–5个注意O(1)–5个注意头可以足够用于特定的测量能力 [Bair and others, 2026 (https://arxiv.org/html/2606.08292#bib.bib2)],甚至单个权重对于文本生成也可能是关键的 [Yu et al., 2024 (https://arxiv.org/html/2606.08292#bib.bib17)]。对应的表示假设是线性假设——许多关系和概念被编码为线性方向 [Hernandez et al., 2023 (https://arxiv.org/html/2606.08292#bib.bib19)],处于由叠加塑造的子空间中 [Elhage et al., 2022 (https://arxiv.org/html/2606.08292#bib.bib16)]。 #### 常见证据堆栈。 这些发现依赖于一个反复出现的方法论组合:用于线性可解码性的探针 [Belinkov, 2022 (https://arxiv.org/html/2606.08292#bib.bib9), Burns et al., 2023 (https://arxiv.org/html/2606.08292#bib.bib10)]、用于因果中介的激活修补 [Vig et al., 2020 (https://arxiv.org/html/2606.08292#bib.bib13), Meng et al., 2022 (https://arxiv.org/html/2606.08292#bib.bib8), Conmy et al., 2023 (https://arxiv.org/html/2606.08292#bib.bib14)],以及用于必要性的消融。这种组合被广泛使用,但没有社区认可的验证协议,并且探针单独早已被知道会夸大因果主张 [Elazar et al., 2021 (https://arxiv.org/html/2606.08292#bib.bib11), Hewitt and Liang, 2019 (https://arxiv.org/html/2606.08292#bib.bib12)]。修补工具本身也受到了审查:Zhang 和 Nanda [2024 (https://arxiv.org/html/2606.08292#bib.bib26)] 表明,提示内修补结果对损坏方法、评估指标、窗口大小和损坏标记的选择很敏感。我们处理了一个互补的轴线:即使提示内修补遵循了当前的最佳实践,由此产生的证据也不能确立干预可泛化性,后者需要在匹配控制下进行*跨提示*转导。Todd et al. [2024 (https://arxiv.org/html/2606.08292#bib.bib15)] 表明,一些内部状态可以被提取并作为类似函数的操作符重用——这是一种更强的证据形式,激发了我们的转导测试。 #### 可解释性幻觉。 越来越多的研究表明,这种常见组合可能产生看起来自信但具有误导性的结论。Makelov et al. [2023 (https://arxiv.org/html/2606.08292#bib.bib21)] 证明了子空间激活修补可以通过一条与所关注行为因果断开的*休眠并行通路*改变模型的输出,将成功干预与忠实定位分离开。Friedman et al. [2024 (https://arxiv.org/html/2606.08292#bib.bib22)] 表明,简化代理(PCA、聚类、基于SVD的摘要)可以在分布内匹配原始模型,但在分布外发散,损害了派生机械故事的可预测价值。Méloux et al. [2025 (https://arxiv.org/html/2606.08292#bib.bib23)] 将电路发现重新定义为统计估计,并发现单输入因果中介分数具有较高的内在方差,因此由常见流程识别的电路在输入或超参数扰动下是脆弱的。我们的分离结果是补充性的:而不是质疑某个特定工具(子空间、代理、分数),我们表明*联合*证据堆栈——选择性必要性、线性可解码性和消融可逆性——在通过匹配控制下的激活转导进行探测时,无法暗示可迁移计算。 #### 走向可审计的MI。 Sharkey et al. [2025 (https://arxiv.org/html/2606.08292#bib.bib24)] 将混淆假设与结论列举为一个反复出现的失败模式,并呼吁加强验证实践。Lan et al. [2026 (https://arxiv.org/html/2606.08292#bib.bib25)] 更进一步,认为MI需要一个标准化的审计层,因为对同一行为的方法论不一致的研究已经在文献中产生了相互矛盾的结论。我们的流程就是本着这种精神设计的:每个角色主张都通过一个在匹配控制下的干预可泛化性测试进行门控,包括一个*相同答案控制*,它暴露了伪装成语义特异性的广泛状态迁移。结果——一个角色分类,其中大多数CSS选出的头*没有*通过干预可泛化计算选择状态的门槛——与幻觉文献一致,并将严谨性文献所呼吁的一条路径付诸实施。 ## 3 KID框架 ### 3.1 角色定义 我们引入KID作为由CSS识别的注意力头的角色分配词汇表。Kadavathet al. [2022 (https://arxiv.org/html/2606.08292#bib.bib1)] 表明LLMs通常能在生成答案之前预测哪些提示会被正确回答,这表明提示理解和答案生成可能不会同时发生——为*识别后和执行前的中间计算选择状态*留下了空间,我们将其命名为*意图*。我们的结果尚未展示一个意图状态,但KID视角组织了我们观察到的角色格局: - •**知晓**。*概念*:模型识别提示要求的过程。逐个标记地,模型构建对请求的解释;许多可能的解释可能在提示早期并行激活,其中一个在最终提示标记时被强烈偏好。*操作化*:如果头在提示位置的激活携带线性可解码的请求计算信息,并且其消融损害的是提示级识别而非答案生成,则该头扮演此角色。 - •**意图**。*概念*:识别后和执行前的计算选择状态。如果反相关的请求计算(加法和减法)共享表示空间,那么承诺一个应该抑制其他;*意图*就是这种承诺的提议位点。*操作化*:如果头满足*知晓*角色标准,并且也是*干预可泛化*的——当其状态从源提示提取并插入目标提示时,在匹配控制下将行为转向源计算,则该头扮演此角色。 - •**执行**。*概念*:答案执行——评分候选答案、格式化续写、生成输出。*操作化*:如果头在答案位置的激活是必要的,其消融损害参考答案,并且通过在答案(而非提示)位置恢复激活来实现同提示消融逆转,则该头扮演此角色。 KID不假设清晰的架构边界。一个头可能扮演边界或混合角色,并且CSS top-k头集的聚合行为不一定对应单个KID角色。该框架是一个用于提出针对性问题和设计区分性测试的词汇表,而不是关于模型组织的先验。 ### 3.2 证据要求 MI工作中最常被作为证据的四个属性是: 1. 1. **选择性必要性**:头集的针对性消融损害目标能力,同时大致保留其他能力。 2. 2. **线性可解码性**:请求计算标签可以通过线性(最近质心)探针从头激活中解码。 3. 3. **消融可逆性**:通过在某些标记位置恢复头的干净激活,可以在消融后恢复性能。 4. 4. **干预可泛化性**:来自具有计算A的源提示的激活,在匹配控制下修补到具有计算B的目标提示中时,将行为转向A。 对于*意图*角色的最强证据需要所有四个属性一起满足,其中消融可逆性在*提示*位置确立,并且干预可泛化性在相同答案控制下确认。在当前实验中,尚未识别出满足所有四个的头。 ### 3.3 三阶段流程 该流程将KID角色分配付诸实施: **阶段1 — CSS**:识别选择性必要的头集。这确立了行为的重要性,但不涉及任何表示性主张。 **阶段2 — SVD**:检查这些头内部线性存在哪些信息,使用平衡的提示控制来将语义结构与表面伪影分开。这提供了与*知晓*角色主张相关的描述性证据。 **阶段3 — 激活转导**:测试头的状态是否在匹配控制下将请求的计算转移到新的提示上下文——提供干预可泛化性的证据。 ### 3.4 为什么属性会分离 这四个属性在逻辑上是独立的。理解它们如何分离可以阐明我们记录的错误模式(见图1 (https://arxiv.org/html/2606.08292#S3.F1)): - •*必要但不可解码*:头是因果性的,但其状态对线性探针来说是不透明的。在我们的数据中不常见。 - •*可解码但不必要*
相似文章
Transformer注意力机制中的执行控制不足
本文讨论了Transformer注意力机制中执行控制的不足,强调了Transformer在处理序列依赖关系方面的局限性。
MechRL:强化学习代理用于机制可解释性中的电路发现
提出了 MechRL,一种利用强化学习自动发现 transformer 语言模型中电路的方案。经过多任务训练的 PPO 代理发现了与已知典型电路匹配的注意力头电路,并能泛化到一项保留任务上。
思维的谱几何:相变、指令反转、Token级动力学与Transformers推理中的完美正确性预测
对11个大型语言模型的全面谱分析,揭示了Transformers在推理与事实回忆过程中隐层激活空间中的相变现象,发现了七个基本现象,包括谱压缩、指令微调反转以及仅基于谱特性的完美正确性预测(AUC=1.0)。
模式选择并非任务因果结构:1B类语言模型中组合任务电路的跨架构机制研究
本文测试了通过任务模式选择性和因果消融来识别注意力头回路的标准方法是否在不同1B类语言模型族(Pythia、OLMo、OLMoE)中产生一致的机制性结论。研究发现没有两个(任务、模型)单元共享相同的主要因果筛选,并引入了屏幕结果的五分类法,其中MoE模型显示出独特的前一token位置基板。
因果结构可诱导但功能解耦:类型化机制库中的路由/读出边界
本文研究Transformer如何组织因果知识,表明类型级监督会诱导一种类型化的路由结构,该结构在功能上与答案读出解耦,并具有精确的局部可编辑性和位精确的可还原性。