剪枝、解释与评估:一种基于特征归因的跨层转码器原生高效电路发现框架

arXiv cs.CL 论文

摘要

研究人员推出了 PIE,这是一种面向跨层转码器(CLT)的原生框架,通过基于特征归因的剪枝技术实现高效的电路发现。该方法在特征选择上实现了约 40 倍的压缩,同时成功保持了 IOI 和 Doc-String 任务的行为保真度。

arXiv:2604.16889v1 公告类型:新 摘要:现有的特征解释流水线通常作用于均匀采样的单元,但只有一小部分跨层转码器(CLT)特征对目标行为至关重要,其余特征的处理会导致高昂的解释与评估成本。我们推出了首个 CLT 原生端到端框架 PIE,它将剪枝(Pruning)、自动解释(Interpretation)与解释评估(Evaluation)相串联,使得在剪枝条件下系统性地测量行为保真度及下游可解释性成为可能。为实现这一目标,我们提出了特征归因修补法(FAP),这是一种基于补丁(patch)的归因方法,通过聚合梯度加权的写入贡献来为 CLT 特征打分;同时提出 FAP-Synergy,一种具备协同效应感知能力的重排序机制。我们采用 KL 散度行为保留率来评估剪枝效果,并借助类 FADE 指标来衡量解释质量。在 IOI 和 Doc-String 任务、不同预算设置 $K \in \{50, 100, 200, 400, 800\}$,以及 FAP、FAP-Synergy、激活幅度(Activation-Magnitude)和类 ACDC 剪枝方法的横向对比中,FAP 系列始终表现出最佳或近乎最佳的保真度,其中 FAP-Synergy 在严格预算约束下带来的提升最为明显。在针对 Llama-3.2-1B 和 Gemma-2-2B 的 CLT 进行的 IOI 实验中,将特征剪枝至 $K=100$ 所达到的 KL 保真度,仅相当于从活跃特征集中随机采样约 4k 个特征的效果(实现了约 40 倍的压缩率)。该策略使解释/评估调用次数减少了约 40 倍,同时显著剔除了低质量特征。
查看原文
查看缓存全文

缓存时间: 2026/04/21 07:04

# 基于特征归因的跨层转码器原生高效电路发现框架
###### 摘要
现有的特征解释流水线通常作用于均匀采样的单元,但只有一小部分跨层转码器(CLT)特征对目标行为至关重要,其余特征会导致高昂的特征解释与评估成本。我们推出了首个 CLT 原生端到端框架 PIE,连接剪枝(Pruning)、自动解释(Interpretation)与解释评估(Evaluation),支持在剪枝条件下系统衡量行为保真度与下游可解释性。为此,我们提出了特征归因修补(FAP),一种基于补丁的归因方法,通过聚合梯度加权的写入贡献来评估 CLT 特征,以及 FAP-Synergy,一种感知协同效应的重排序过程。我们使用 KL 散度行为保留率评估剪枝效果,并使用 FADE 风格指标评估解释质量。在 IOI 和 Doc-String 任务上,跨越预算 $K \in \{50, 100, 200, 400, 800\}$,以及 FAP、FAP-Synergy、激活幅值和 ACDC 风格剪枝策略,FAP 家族始终取得最佳或接近最佳的保真度,其中 FAP-Synergy 在严格预算限制下提升最为明显。在 Llama-3.2-1B 和 Gemma-2-2B 的 CLTs 上的 IOI 任务中,将特征剪枝至 $K=100$ 个即可达到从活跃特征集中随机选择约 $4k$ 个特征才能实现的 KL 保真度(压缩比约 $\approx 40\times$),从而将解释/评估调用次数减少约 40 倍,同时大幅降低低质量特征的数量。我们的代码已开放:https://github.com/Qinhao-Chen/PIE-Pipeline。机器学习, ICML 

## 1 引言
机制可解释性旨在通过识别输入到输出计算过程中起中介作用的内部组件和因果路径来解释模型行为 (Olah, 2022)。随着大型语言模型(LLMs)被部署在透明度、审计和目标干预至关重要的日益高风险场景中(例如,安全与生物医学决策支持)(Templeton et al., 2024; Yang et al., 2022; Band et al., 2023; Chen et al., 2025),该研究计划已变得愈发紧迫。近期的进展已从神经元层面的轶事报道转向可扩展的*特征级与电路级*解释方案,这得益于稀疏自编码器(SAEs)等稀疏特征基础,以及跨层转码器(CLTs)等替换模型方法 (Bricken et al., 2023; Ameisen et al., 2025; Conmy et al., 2023; Syed et al., 2024)。

图1:PIE 框架:一个 CLT 原生端到端流水线。我们提出三阶段框架以实现可扩展的可解释性:**第 I 阶段(剪枝)**利用特征归因修补(FAP)及其协同感知变体(FAP-Synergy),通过将边界特征按成对交互作用重排序,把庞大的 CLT 特征写入边搜索空间过滤为稀疏的“因果核心”。**第 II 阶段(解释)**仅对保留的特征基于示例提示生成自然语言描述,大幅降低解释成本。**第 III 阶段(评估)**执行双目标评估:量化行为保真度(KL 散度、PCR)并通过自动化指标(清晰度、纯度、响应性)测量解释质量。

然而,尽管电路发现技术迅速进步,仍存在一个核心瓶颈:我们应该将解释预算投入到哪些内部单元上?现代特征字典可能包含数十万至数百万个特征,而下游的自动解释与评估流水线在每个特征上都极其昂贵 (Bill et al., 2023; Paulo et al., 2024; Puri et al., 2025; Boggust et al., 2025)。在实践中,端到端的可解释性工作流必须谨慎分配算力:解释*所有*内容不可行,且解释无信息量的特征纯属浪费。

#### 动因1:剪枝对于可扩展的自动解释是必要的,且 CLTs 需要原生框架。
现有的自动解释流水线大多聚焦于 SAE 特征或类神经元单元,并通常评估均匀采样的特征,这导致大量冗余:许多特征因果作用微弱、充满噪声或与感兴趣的下层行为无关 (Bill et al., 2023; Paulo et al., 2024; Puri et al., 2025; Boggust et al., 2025)。这引出了一个简单原则:*并非所有特征都值得解释;先剪枝,后解释。* 与此同时,CLT 替换模型使用跨层特征写入来表示电路,这是仅基于 SAE 的流水线无法自然捕获的 (Ameisen et al., 2025; Lindsey et al., 2025)。因此,我们认为可扩展的机制可解释性需要首个 CLT 原生自动解释框架,明确连接:剪枝→自动解释→解释评估。本文确立了这样一个框架,支持端到端地测量剪枝决策如何影响行为保真度与下游可解释性指标。

#### 动因2:主流剪枝方法不足,因其忽略了协同效应与符号方向。
第二个瓶颈在于剪枝的执行方式。大多数主流剪枝方法是基于边的和/或假设重要性近似可加,即选择高幅值贡献者并丢弃其余部分 (Syed et al., 2024; Hanna et al., 2024)。然而,CLT 电路可能表现出违背这些假设的两个特性:$(i)$ *非加性交互*,孤立看来较弱的组件在共同作用时至关重要(即“协同效应”);以及 $(ii)$ *有向影响*,增强与减弱类型的贡献对于校准行为均不可或缺。这些现象在因果追踪/修补设置中广为人知,我们在消融实验(附录 E 和第 4 节)中通过经验验证了它们在 CLT 特征空间中的存在。忽视这些效应会系统地低估重要组件,并导致行为退化或解释不稳定的电路。

#### 我们的方法:特征归因修补(FAP)及其扩展。
为了解决上述两个动因,我们引入了一种直接作用于*特征*而非模块级边的 CLT 原生剪枝系列方法。我们的基础方法特征归因修补(FAP)通过跨层写入差异与缓存的下游梯度的点积,使用快速、基于补丁的一阶估计来为 CLT 特征出现频率打分(即在 CLT 特征空间中的归因修补类比)。随后我们提出了 FAP-Signal,一种*信号感知*变体,通过分别为正负贡献分配预算来同时保留增强与减弱特征。我们还研究了一种感知符号方向的消融变体 FAP-Signal,它强制为正负得分特征分配最低预算;详情与结果见附录 E。

本文做出四项贡献:
- **CLT 原生剪枝-解释-评估框架**:我们展示了首个将 CLT 原生剪枝与自动解释及解释评估连接起来的端到端框架,其动机明确源于 SAE 风格解释流水线在规模化应用时的冗余性。
- **特征归因修补(FAP)**:我们为 CLT 电路提出了一种高效的特征级归因修补方法,使用单次梯度传递为稀疏跨层特征写入打分,从而实现大规模剪枝。
- **协同感知剪枝**:我们引入了 FAP-Synergy,一种边界交互重排序方法,可在固定预算下提升保真度。此外,我们在附录 E 中评估了感知符号方向的消融变体 FAP-Signal。
- **全面的评估协议**:我们使用 KL 散度行为保留率评估剪枝,并通过清晰度、纯度和响应性等解释指标评估可解释性影响 (Puri et al., 2025; Paulo et al., 2024; Boggust et al., 2025),从而系统量化剪枝如何影响可解释性。

## 2 相关工作
#### 归因修补与边剪枝。
因果电路发现方法通常将搜索空间形式化为计算图,并致力于恢复一个足以在干预下复现行为的稀疏子图。早期工作如 ACDC 使用基于修补的因果测试进行迭代边搜索 (Conmy et al., 2023),但这可能需要多次前向传播,且在规模扩大时成本高昂。归因修补风格的方法通过使用梯度计算代理重要性分数并用修补进行验证,加速了这一过程,在保留因果基础的同时大幅降低了搜索成本 (Syed et al., 2024)。我们的工作继承了优先修补的理念,但改变了分析单元:我们不剪枝*模块到模块的边*,而是剪枝*CLT 特征写入*,后者是跨层替换模型中自然的因果对象。

#### 基于特征的解释与 CLT 原生电路追踪。
机制可解释性中的一个反复出现的主题是,个别神经元往往具有多义性,这促使人们将学习到的稀疏特征基作为更稳定的语义单元 (Bricken et al., 2023)。关于叠加态及相关训练现象的玩具模型为特征方向而非单个神经元可能是解释的正确最小单位提供了概念基础 (Elhage et al., 2022; Henighan et al., 2023; Power et al., 2022)。替换模型方法进一步允许通过对特征活动与信息流进行可控干预来实现因果验证。特别是,基于 CLT 的电路追踪将计算表示为稀疏的跨层特征写入,并支持端到端的因果实验,其中特征贡献可以被修补、剥离或放大 (Ameisen et al., 2025; Dunefsky et al., 2024)。Neuronpedia 的大规模资源电路图等公共工具将这些理念落地操作化,凸显了需要直接作用于 CLT 原生对象的方法的必要性 (Lindsey et al., 2025)。我们的方法正是为这一设置专门设计:我们通过聚合跨层写入来打分和剪枝 CLT 特征出现情况,而不是将问题降级回仅关注神经元或 SAE 的视角。

#### 特征描述的结构化解释与评估。
另一条互补的研究线旨在通过自动生成内部单元的降低人工成本。神经元与特征解释系统提示大语言模型使用激活轨迹或示例上下文来提议对某单元表征内容的描述 (Bill et al., 2023; Paulo et al., 2024; Lin, 2023)。以输出为中心和行为条件化的方法推动建立与模型输出更直接相关的假设,旨在减少纯相关性标签 (Gur-Arieh et al., 2025)。然而,自然语言解释可能冗长、不一致且难以通过实验证伪,这促使采用更结构化或可执行的描述格式 (Huang et al., 2023)。近期工作提出了类似语义正则的领域特定语言(DSL),可生成紧凑、可检查的描述,并允许通过检测与模糊测试协议进行系统化评估 (Boggust et al., 2025)。并行地,FADE 等评估框架利用清晰度、纯度、响应性和忠实度等指标形式化解释质量,包括通过修补进行因果验证 (Puri et al., 2025)。虽然这些系统推进了特征描述的质量,但它们通常假设存在大量候选单元池,并未解决上游*哪些特征应该被解释*的问题。

## 3 方法:PIE 框架
我们引入**PIE**(Prune, Interpret, Evaluate,即剪枝、解释、评估),这是一种专为解决机制可解释性中效率瓶颈而设计的 CLT 原生框架。尽管 SAE 特征提供了语义稀疏性,但解释数百万个特征在计算上是不可行的。我们的框架基于以下前提:*剪枝必须在解释之前进行*:通过识别对目标任务因果相关的 CLT 特征的稀疏子集,我们可以将解释预算分配到最需要的地方。该框架包含三个阶段:(1) 通过特征归因修补(FAP)及其变体进行**剪枝**,以选择最小且高保真的电路;(2) 对保留特征进行**自动解释**;以及 (3) 评估**行为保真度**与**解释质量**。

### 3.1 问题设定:CLT 原生特征
我们分析一个利用跨层转码器(CLT)作为替换模型的主模型 $M$。与标准变换器不同,标准变换器的边连接模块(例如,注意力头 $\to$ MLP),而 CLT 将计算分解为直接跨层写入的稀疏特征激活。设 CLT 字典中的特征 $f$ 在位置 $t$ 对于输入 $x$ 的激活为 $a_f(x,t)$。该特征对后续残差流 $s_i$ 的贡献为一个向量 $W_f^{(s)} \in \mathbb{R}^{d_{\text{model}}}$。我们定义基本的分析单元为*特征-写边*(feature-write edge):特征 $f$ 在位置 $t$ 对 $s_i$ 的具体贡献。剪枝涉及选择一个特征子集 $F^*$(满足 $\|F^*\| \ll \|F_{\text{total}}\|$),使得替换模型相对于原始主模型 $M$ 保持较低的 KL 散度。

### 3.2 基于特征归因修补(FAP)的剪枝
为了将剪枝扩展到数百万个特征,我们无法承受迭代的剥离操作(例如 ACDC)。相反,我们提出*特征归因修补(FAP)*,这是一种适配于 CLT 特征空间的一阶近似方法。
#### 梯度加权写入归因
我们通过结合激活差异与下游梯度来估算特征重要性

相似文章

减少草稿,增加检索:用于推测解码的混合树构建

Hugging Face Daily Papers

Graft 是一个无需训练的框架,通过结合剪枝与检索来增强推测解码,从而提高接受率和推理速度。在短上下文基准测试中,其加速比最高可达5.41倍,在Qwen3-235B上相比EAGLE-3的提升最高可达21.8%。