表征作为机制可解释性的瓶颈:Manifestation Unit协议

arXiv cs.LG 论文

摘要

本文介绍了Manifestation Units,这是一种类型化元组协议,用于将机制可解释性分析中的每个组件的统计量组织成结构化、可查询的字段。该协议在视觉(β-VAE、CNN)和语言(GPT-2)模型上进行了演示,展示了改进的检索和因果充分性。

arXiv:2607.00089v1 公告类型: 新 摘要:机制可解释性产生了丰富的组件级分析,这些分析表征了神经网络组件编码的内容以及它们如何交互。然而,它们的输出不易重用:选择性表格、电路图和特征列表仍锁定在每项研究的笔记本中——不可组合、无法用自然语言查询、且无法直接用于下游审计或干预。我们研究了位于这些分析和下游使用之间的表征层,将其作为可以独立评估的瓶颈,并引入了Manifestation Units,这是一种类型化元组协议(E, S, R, D, G),针对Transformer架构扩展了注意力头原语(T),将每个组件的统计量组织成自动填充的结构化字段,并通过混合检索进行查询。该协议在生成式视觉(beta-VAE)、判别式视觉(CNN)和语言(GPT-2)中实例化,支持两个发现:类型化结构在检索上显著优于非结构化基线,并且通过该模式检索的CNN过滤器在匹配预算控制下满足因果充分性和必要性标准。该模式无需修改即可吸收注意力头原语,在检索预算匹配的控制下集合恢复已知的IOI电路成员,并揭示了一个不可约的双字段核心(S+R),其余字段要么冗余,要么主动干扰。我们将其作为机制可解释性的模式基础设施,而不是前沿规模验证。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:35

# 表征作为机制可解释性的瓶颈:显现单元协议 来源:https://arxiv.org/html/2607.00089 ###### 摘要 机制可解释性已积累了丰富的组件级分析成果,用于描述神经网络组件编码什么以及它们如何相互作用。然而,这些分析成果并不易于复用:选择性表格、电路图和特征列表仍被锁定在每项研究的笔记本中——无法组合、无法用自然语言查询,也无法直接用于下游审计或干预。我们研究了位于这些分析与下游应用之间的*表征层*,将其作为一个可独立评估的瓶颈,并引入了**显现单元**(Manifestation Units),这是一个类型化元组协议\(E,S,R,D,G\)扩展了注意力头原语\(T\),用于 Transformer 架构,将每个组件的统计数据组织成结构化字段,自动填充并通过混合检索进行查询。该协议在生成式视觉(β-VAE)、判别式视觉(CNN)和语言(GPT-2)上实例化,支持两个发现:类型化结构在检索上显著优于非结构化基线;通过模式检索到的 CNN 滤波器在匹配预算控制下满足因果充分性和必要性标准。该模式无需修改即可吸收注意力头原语,在检索预算匹配控制下集恢复已知的 IOI 电路成员,并揭示了一个不可约的双字段核心(\(S+R\)),剩余字段要么冗余,要么主动干扰。我们将其作为机制可解释性的模式基础设施,而非前沿规模验证。¹¹ Transformer 和 CNN 演示见 https://manifestation-xai.github.io/manifestation-transformers/ 和 https://manifestation-xai.github.io/manifestation-cnn/。机器学习,ICML ## 1 引言 机制可解释性已产生了丰富的分析技术,用于描述神经网络组件编码什么以及它们如何相互作用:网络剖析、探针分类器、稀疏自编码器分解和电路分析(Bau 等,2017(https://arxiv.org/html/2607.00089#bib.bib25);Belinkov,2022(https://arxiv.org/html/2607.00089#bib.bib28);Lieberum 等,2024(https://arxiv.org/html/2607.00089#bib.bib67);Elhage 等,2021(https://arxiv.org/html/2607.00089#bib.bib76);Wang 等,2023(https://arxiv.org/html/2607.00089#bib.bib70);Olsson 等,2022(https://arxiv.org/html/2607.00089#bib.bib75);Conmy 等,2023(https://arxiv.org/html/2607.00089#bib.bib73))。然而,它们的输出并不容易复用。选择性表格、电路图和 SAE 特征列表仍留在每项研究的笔记本和脚本中:无法组合、无法用自然语言查询,也无法直接用于下游审计或干预。一个实践者询问一个训练好的 CNN:“*哪些滤波器编码了‘狗’,如果我放大它们会发生什么?*”所需的统计数据——选择性、激活相关性、消融效应——已经存在,但没有一个基于接口可以询问。语义搜索在数字标识符上失败(Li 等,2023(https://arxiv.org/html/2607.00089#bib.bib55)),精确匹配在概念查询上失败,自由形式的散文则丢失了区分“哪些滤波器检测狗”与“滤波器 81 检测什么”的类型信息。我们研究位于组件级分析与下游应用之间的表征层,保持分析本身不变。我们引入**显现单元**(Manifestation Units),一个类型化元组协议\(E,S,R,D,G,T\),将每个组件的统计数据组织成六个字段,对应不同的查询原语:实体标识(\(E\))、语义关联(\(S\))、跨组件关系(\(R\))、量化动态(\(D\))、干预指导(\(G\))和注意力头原语(\(T\))。每个字段从激活和验证集统计数据中自动提取;不涉及人工标注。一个混合检索器结合了在\(E\)上的精确匹配与其余字段上的稠密语义搜索。我们评估关于这个表征层的两个假设。**H1(结构可访问性)**。通过组件级分析的自然语言检索需要类型化的*结构*,而不仅仅是底层内容——相同内容的随机分区无法匹配 ESRDGT 分解。**H2(因果中介、最小性和最优性)**。在 CNN 上,通过结构化表征检索到的组件是目标行为在 MIB 意义上的因果中介(Mueller 等,2024(https://arxiv.org/html/2607.00089#bib.bib68)),由匹配预算控制下的充分性和必要性确立。在 GPT-2 模式上,一个较弱的类比取代了严格的因果中介:该分解允许一个*最小-最优*核心(\(S+R\)),通过随机分区控制确认,剩余字段要么冗余要么主动干扰;见 §5.4 和 App.G。 ##### 实证发现。我们将该协议实例化到三种架构上,涵盖生成式视觉(CelebA 上的 β-VAE)、判别式视觉(CIFAR-10 上的 CNN)和语言(GPT-2 注意力头)。在 GPT-2 模式上,\(S+R\) 子集在 oracle recall@30 上达到 0.411,击败了相同内容的随机分区(\(p<0.01\),图 4D;H1);按字段消融隔离出 \(S\)(\(p<10^{-10}\))和 \(R\)(\(p=.019\))作为*最小-最优核心*,\(G\) 在该子集内冗余,而 \(E/D\) 在添加到完整模式时主动干扰(图 4A–C),两个必要字段检索到弱负相关的头部排名(\(\rho=-0.20\),图 5B),从而相互补充(H2,最小性和机制)。在 CNN 上,检索到的滤波器在放大下翻转了 76.3% 的试次(对比 6.7% 的随机匹配预算),将其归零则使自然目标类准确率下降 38.3 个百分点(对比 3.6 个百分点);一个四路分解将 +17.4 个百分点的充分性归因于类型化的主类规则(H2,中介)。在 β-VAE 和 CNN 上,结构化单元分别达到 89.6% 和 96.8% 的 Precision@5,而相同组件统计数据的 BM25-混合基线分别为 18.0% 和 20.4%(H1,原始评估)。在 GPT-2 上,检索到的头部在四个行为上以 2.0–4.5 倍的优势击败匹配预算随机检索,并在 \(k=30\) 时恢复了已知 IOI L7–9 名称移动头的 5/7。 ##### 贡献。 1. **显现单元(ESRDG[T])**,一个类型化元组协议,用于组织组件级分析,具有自动提取、确定性模板基础和混合检索。基础模式为 \((E,S,R,D,G)\);\(T\) 字段将其扩展用于 Transformer 架构。 2. **匹配预算协议**,确立了结构可访问性(H1,随机分区控制)和 H2 集群(因果中介、最小性和最优性)(CNN 充分性/必要性;GPT-2 按字段消融)——识别了*最小-最优*核心(\(S+R\))并刻画了冗余性(\(G\) 在核心内)和干扰性(\(E,D\) 在完整模式上)。 3. **GPT-2 注意力头实例化**,提供了最深的结构证据——随机分区 H1 确认、\(S+R\) 最小-最优核心、互补的 \(S/R\) 排名(\(\rho=-0.20\))——并通过集合重叠检索恢复了已知 IOI 电路成员,附带一个原则性的 \(S\) 原语选择程序,通过参考集恢复验证。 ## 2 相关工作 ##### 机制可解释性与忠实性。MI 工具集通过互补视角刻画神经组件行为:电路分析描述组件如何组合成算法(Elhage 等,2021(https://arxiv.org/html/2607.00089#bib.bib76);Wang 等,2023(https://arxiv.org/html/2607.00089#bib.bib70);Olsson 等,2022(https://arxiv.org/html/2607.00089#bib.bib75);Elhage 等,2022(https://arxiv.org/html/2607.00089#bib.bib71));激活和路径修补追踪 Transformer 中的因果路径(Meng 等,2022(https://arxiv.org/html/2607.00089#bib.bib72);Conmy 等,2023(https://arxiv.org/html/2607.00089#bib.bib73);Goldowsky-Dill 等,2023(https://arxiv.org/html/2607.00089#bib.bib77));稀疏自编码器将多语义激活大规模分解为单语义特征(Lieberum 等,2024(https://arxiv.org/html/2607.00089#bib.bib67);Cunningham 等,2024(https://arxiv.org/html/2607.00089#bib.bib74));网络剖析和探针分类器刻画单个组件编码的内容(Bau 等,2017(https://arxiv.org/html/2607.00089#bib.bib25);Belinkov,2022(https://arxiv.org/html/2607.00089#bib.bib28))。MIB 基准(Mueller 等,2024(https://arxiv.org/html/2607.00089#bib.bib68))形式化了我们评估采用的两种忠实性概念(Sec.5):*响应忠实性*——输出是否反映证据?——以及*因果忠实性*——识别出的组件是否因果中介了该行为,由匹配干预下的充分性和必要性确立。 ##### MI 输出的表征与检索。给定上述任意分析——SAE 特征激活、电路识别、归因图邻域、探针分数、相关选择性——输出应该如何打包以便查询、基础化、组合和作用于其上?现有社区工具针对*程序化访问*(TransformerLens, nnsight)和*可视化*(Neuronpedia, Docent),留下了用于自然语言查询的类型化表征层基本未被解决。Orgad 等人(2024(https://arxiv.org/html/2607.00089#bib.bib69))记录了可解释性发现经常被下游未采取行动;表征是差距的一部分。标准语义搜索在神经组件查询上失败,因为嵌入模型无法可靠地表示像“维度 63”这样的任意数字标识符(Li 等,2023(https://arxiv.org/html/2607.00089#bib.bib55)),仅精确匹配无法处理概念查询。结构化和实体感知检索(Edge 等人,2024(https://arxiv.org/html/2607.00089#bib.bib56);Févry 等,2020(https://arxiv.org/html/2607.00089#bib.bib36);Yasunaga 等,2022(https://arxiv.org/html/2607.00089#bib.bib37))表明类型化表征在知识密集型任务上优于非结构化散文,但针对的是通用领域知识,而非由任意标识符索引的神经内部结构。显现单元旨在与上述 MI 工具组合:\(S\) 可存储 SAE 特征标签,\(R\) 可编码头-头或归因图邻域,\(G\) 可编码激活修补或引导原语。Transformer 实例化(Sec.6)展示了这种组合,使用了来自 Elhage 等(2021(https://arxiv.org/html/2607.00089#bib.bib76));Olsson 等(2022(https://arxiv.org/html/2607.00089#bib.bib75));Wang 等(2023(https://arxiv.org/html/2607.00089#bib.bib70));Goldowsky-Dill 等(2023(https://arxiv.org/html/2607.00089#bib.bib77));Heimersheim 和 Nanda(2024(https://arxiv.org/html/2607.00089#bib.bib78))的注意力头原语。 ## 3 MANIFESTATION 框架 参见图注 图1:MANIFESTATION 概述。该流水线提取显现单元 \((E,S,R,D,G,T)\),编码实体标识(\(E\))、语义关联(\(S\))、跨组件关系(\(R\))、量化动态(\(D\))、操作指导(\(G\))以及(对于 Transformer)注意力头原语(\(T\))。混合检索结合了在 \(E\) 上的精确匹配与其余字段上的语义搜索;SLM 生成基于从 \(D\) 检索到的统计数据的响应。MANIFESTATION(图1)从模型激活自动填充显现单元,并通过混合检索器暴露以便自然语言访问。 ### 3.1 显现单元 令 \(I=\{1,\dots,n\}\) 表示要分析的神经网络组件集合(VAE 中的潜在维度、CNN 中的滤波器、GPT-2 中的注意力头)。每个组件 \(k \in I\) 表示为一个结构化元组: \[ M_k = (E_k, S_k, R_k, D_k, G_k, T_k). \] (1) 该分解是功能性的:每个字段对应一类重复出现的用户查询——\(E\) 用于实体查询(“维度 63 做什么?”),\(S\) 用于概念查询(“哪些单元编码微笑?”),\(R\) 用于关系查询(“什么与维度 47 相关?”),\(D\) 用于基础化数字引用,\(G\) 用于干预查询,\(T\) 用于 Transformer 架构中的注意力头原语。六个字段按每个查询所需的检索原语对查询进行分组(类型化标识符匹配、排名语义相似度、邻域遍历、标量查找、参数化干预、注意力模式特征)。该分解是经验上的最小-最优的(Sec.5.3):\(S+R\) 是跨查询类型的最高召回率组合,且在该子集内两个字段都必要;\(G\) 冗余,\(E/D\) 在完整模式上主动干扰。 ##### 实体(\(E\))。\(E_k\) 是一个唯一的、人类可读的标识符(例如,“Dimension 63”或“Filter Conv2.15”),支持实体感知的精确匹配。当查询包含显式组件引用时,在 \(E\) 上的模式提取保证检索到正确的单元——这是仅嵌入的语义搜索无法可靠实现的,对于任意标识符。 ##### 语义(\(S\))。\(S_k\) 存储概念关联,带有相对于预定义概念词汇表 \(C\) 的量化强度(CelebA 的面部属性、CIFAR-10 的类标签、GPT-2 的功能特征)。模板仅暴露前 \(m\) 个关联,按大小排序: \[ \tilde{S}_k = \{ (c_j, s_{kj}) \}_{j=1}^m \text{ ranked by } |s_{kj}|. \] (2) 主概念标识是暴露集内的 top-1 概念: \[ c_k^* = \arg\max_{j \in [m]} |s_{kj}|, \quad s_k^* = s_{k, c_k^*}. \] (3) 保留有符号分数 \(s_k^*\) 用于忠实生成;绝对值仅用于排序。\(S_k\) 通过以下方式填充:对于 VAE 维度使用皮尔逊相关性,对于 CNN 滤波器使用基于熵的类选择性,对于 GPT-2 头使用注意力模式原语(App.B)。 ##### 关系(\(R\))。\(R_k\) 编码源自模型激活的跨组件依赖性。令 \(\rho_{ki}\) 表示组件 \(k\) 和 \(i\) 之间的依赖性分数,并令 \(t_{ki} \in \{\text{synergistic}, \text{antagonistic}, \text{independent}\}\) 指示关系极性。模板暴露一个 top-\(r\) 邻域。我们使用这些标签来描述统计共激活,而非因果机制。阈值和打断规则详见 App.B。 ##### 动态(\(D\))。\(D_k\) 是一个类型化字典,包含定量统计(方差贡献、选择性摘要、聚类/族成员、跨层依赖性分数)。这些值被渲染到 LLM 的上下文中用于基础化查询。

相似文章

Bag of Dims: 基于维度级符号模式的无需训练机制可解释性

Hugging Face Daily Papers

提出了Bag of Dims框架,表明Transformer隐藏状态的标准基提供了一种无需训练、架构通用的特征表示,其中维度通过符号模式编码语义内容;在语言、视觉和音频模型上得到验证,无需学习旋转即可实现高精度。

通过可微图划分对蛋白质语言模型表示的结构解释

arXiv cs.LG

本文提出了 SoftBlobGIN 框架,通过将蛋白质语言模型的表示投影到接触图上进行结构感知的消息传递,增强了其可解释性。该框架在酶分类和结合位点检测任务上展现出性能提升,同时提供了可审计的结构化解释。

从模态到命题:一种以语言为中心的多模态智能框架

arXiv cs.AI

本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。

论大语言模型的固有可解释性:设计原则和架构调查

arXiv cs.CL

一份综合调查,回顾了大语言模型(LLM)固有可解释性的最新进展,将方法分为五个设计范式:功能透明性、概念对齐、表示可分解性、显式模块化和潜在稀疏性诱导。论文解决了在模型架构中直接构建透明性,而不是依赖事后解释方法的挑战。