解释多重性:电路级可解释性证据在可辩护的分析变异下无法保持

arXiv cs.AI 论文

摘要

该研究表明,AI系统的电路级可解释性证据在不同分析设置中表现出高度变异性,未能满足诸如EU AI Act等法规要求的一致性标准。

arXiv:2608.13754v1 公告类型:新 摘要:EU AI Act要求高风险系统的提供者提交技术文档,描述系统如何做出决策。机制可解释性是此类证据的明显来源,而电路发现是其最成熟的工具。我们探究该证据在可依赖的条件下是否能够存活:两名合格的分析师,同一个系统,同一个工具,不同的可辩护设置。 我们预注册了一个七轴交叉网格,每个级别取自已发布的实现,并通过确定性声明映射将每个发现的电路映射到结构化的Annex IV声明。 在GPT-2 small和间接宾语识别任务上的15,840个预注册规范中,有7,561个产生了声明,派生的陈述在73.2%的规范对中翻转(95% CI 0.725 至 0.738),而模态声明占据了41.1%的空间。该证据在所有合格评定机构可能接受的容差下都未能满足可归档标准。 标准化最具影响力的选择——评估指标,将翻转率保持在59.4%。完全从声明中移除电路大小并保持固定,留下27.1%(95% CI 0.255 至 0.286),仍然高于预注册阈值。 这些声明背后的电路在结构上近乎不相交,成对Jaccard重叠的中位数为4%,功能上不相关,Cohen's kappa为0.015,因此不稳定性并非用不同词语描述的同一机制。 我们提供可归档标准作为独立协议,并报告七个记录的发现目标中有一个在库自身的规范任务上完全无法执行。 本研究涵盖一个模型和一个任务,结论在规模上是否成立尚未测试。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:51

# 电路级可解释性证据无法经受合理的分析变异检验
来源:https://arxiv.org/html/2608.13754

## 解释的多重性:电路级可解释性证据无法经受合理的分析变异检验

2026年8月12日

###### 摘要

欧盟人工智能法案要求高风险系统的提供者提交描述系统如何做出决策的技术文件。机制可解释性是此类证据的显而易见的来源,而电路发现则是其最成熟的工具。我们探究这种证据在其可能被依赖的条件下是否仍然成立:两位有能力的分析师,使用相同的系统、相同的工具,但采用不同的合理设置。

我们预先注册了一个七轴分析的交叉网格,每个水平均取自已发表的实现方案,并通过确定性声明映射将每个发现的电路映射为结构化的附件四声明。在针对GPT-2 small模型和间接宾语识别任务的15,840个预先注册的规格中,有7,561个产生了声明,在规格对中,73.2%(95%置信区间0.725至0.738)得出了相反的声明,而众数声明仅覆盖了41.1%的空间。该证据在任何符合性评估机构可能接受的容差标准下都未能通过可提交性标准。

即使将最具影响力的选择——评估指标——进行标准化,声明翻转率仍为59.4%。完全从声明中移除电路大小这一因素并固定该变量后,翻转率仍为27.1%(95%置信区间0.255至0.286),仍高于预先注册的阈值。这些声明所依据的电路在结构上近乎不相交(中位数成对Jaccard重叠度为4%),在功能上不相关(Cohen's kappa值为0.015),因此这种不稳定性并非用不同词汇描述同一机制所致。

我们提供了一个独立的可提交性标准协议,并报告在该库自身的基准任务上,七个已记录的发现目标之一完全无法执行。本研究涵盖一个模型和一个任务,其结论在更大规模上是否成立尚未验证。

## 1 引言

审计意味着两位审计师得出相同的结论。这并非借自机器学习的定义;这正是值得委托审计的原因所在。

法规(EU)2024/1689要求高风险人工智能系统的提供者提交技术文件。附件四第2(b)点要求提供“人工智能系统及其算法的总体逻辑”。第2(e)点要求提供“对促进输出解释所需的技术措施的评估”。第86(1)条赋予受某些自动化决策影响的个人获得“关于人工智能系统在决策过程中所扮演角色以及所做决定主要要素的清晰且有意义的解释”的权利。以上内容引用自经法规(EU)2026/1744修订的合并文本,CELEX 02024R1689-20260727,查阅日期为2026年8月11日。

机制可解释性旨在提供技术内容。电路发现生成一个被认为能解释某种行为的子图,它是该领域中工具最为成熟的分支。如果提供者提交一份电路级的解释文件,说明其系统为何如此行为,那么只有当第二位分析师在获得相同系统和工具的情况下,能提交一份兼容的文件时,这份文件才具有价值。

我们衡量一份监管声明在合理的分析规格空间中移动的距离,并提供一个标准机构可以采用的决策规则。我们并非提出一种更好的电路发现方法,也不是主张可解释性毫无价值。我们主张,当前产生的证据,不符合提交文件所预设的标准。

#### 贡献。

(i) 一个基于电路发现七个分析轴的预先注册的多元宇宙,每个水平均取自已发表的实现方案,以及一个从电路到附件四声明的确定性映射。(ii) 一个可提交性标准,π*≥1−α,符合性程序可以应用该标准,并提供了在基准任务上测得的值。(iii) 证据表明,这种不稳定性在最严格的控制措施下仍然存在:标准化任意单一轴、从声明中移除电路大小、以及固定大小。(iv) 一个适用于一般多元宇宙设计的方法论结果:当规格选择的对象大小不同时,汇总统计量可能反转,我们展示了我们的三个结果确实如此。

## 2 相关工作

#### 不可识别性。

Méloux等人于2025年(https://arxiv.org/html/2608.13754#bib.bib6)提出,对于给定行为,在机制可解释性自身的标准下,是否存在唯一的解释,并回答说未必存在。我们的前提是相同的。我们的贡献在下游:我们测量了当一个解释被提交(而非发表)时,不可识别性带来的代价。

#### 忠实度度量的敏感性。

Miller等人于2024年(https://arxiv.org/html/2608.13754#bib.bib8)调查了基于消融的忠实度度量中的设计选择,发现现有方法对看似微不足道的变化高度敏感,得出结论认为忠实度分数既反映了研究者的方法论选择,也反映了电路。他们确定了一个重要的轴。我们交叉了七个轴,并将结果传播到监管声明中。他们发布的库正是我们使用的工具,这意味着我们的研究是根据该工具自身的定义对其工具进行的压力测试。

#### 结构与功能。

Bayat Makou等人于2026年(https://arxiv.org/html/2608.13754#bib.bib1)在保持任务固定的情况下改变输入统计,发现结构不同的电路实现了相同的计算,他们将这种模式称为“幻影特化”。这是对我们设计最强有力的反驳:如果发现过程仅仅是从行为相同的子图等价类中进行抽样,那么对声明的翻转率衡量的只是抽到了哪个成员。我们通过功能测量(而非论证)在第7.6节(https://arxiv.org/html/2608.13754#S7.SS6)回应了这一点,答案是我们的电路在功能上并非可互换。

#### 方差作为估计。

Méloux等人于2025年(https://arxiv.org/html/2608.13754#bib.bib7)将机制可解释性视为统计估计,并分析了估计量的方差。种子方差是我们空间中的一个轴;他们的框架自然是我们工作在整体规格层面上的统计学伴侣。

#### 可审计性。

Lan等人于2026年(https://arxiv.org/html/2608.13754#bib.bib4)指出,有两篇论文对同一行为得出了冲突的结论,而第三篇论文发现两者部分正确但不可比较,并呼吁制定审计标准,以便在安全关键场景中对发现进行认证。我们以一项测量和一个标准(而非一项提议)回应了这一呼吁。Sharkey等人于2025年(https://arxiv.org/html/2608.13754#bib.bib10)列出了该领域的一些开放问题,包括本文涉及的社会技术问题;Mueller等人于2025年(https://arxiv.org/html/2608.13754#bib.bib9)则论证了跨方法比较需要标准化评估,这与我们关于认证需要标准化规格的论点相近。

#### 多元宇宙方法。

该设计遵循Steegen等人于2016年(https://arxiv.org/html/2608.13754#bib.bib13)提出的方法,他们建议报告在可接受的数据处理选择空间内的结果,以及Simonsohn等人于2020年(https://arxiv.org/html/2608.13754#bib.bib12)提出的规格曲线,我们对其可视化方式进行了调整。Simmons等人于2011年(https://arxiv.org/html/2608.13754#bib.bib11)命名了其背后的问题:未公开的分析灵活性让分析师能够将几乎任何结果呈现为显著。我们将心理学方法文献应用于机器学习的证据问题,这种迁移并非装饰性的。声称一个解释是稳定的,正是那种灵活性可以制造出来的宣称。

#### 优化压力下的解释度量。

Hsia等人于2023年(https://arxiv.org/html/2608.13754#bib.bib3)表明,充分性和全面性可以在不改变预测或解释的情况下被夸大。我们四个评估指标中的两个正是这两个,这是我们按指标报告丢弃率而非默默汇总的原因之一。

## 3 本文未声称的内容

提前声明这一点,因为每种解读都是结果不支持的,而且其中两种解读是我们自己在运行分解分析前也持有的。

我们并未声称发现的电路不比随机好。在固定电路大小的情况下,它们比大小匹配的随机空基更稳定(0.2746 对 0.4230)。它们携带信息。

也并非声称文件差异源于机制相同。机制差异很大:功能不稳定性汇总为0.3972,在最小的电路上为0.4777。

也并非声称发现过程抽取一个机制并加以不同的包装。Cohen's kappa值为0.0146表明这些电路在功能上不相关。

也并非声称随机种子是问题所在。这里的种子选择的是采样哪些提示,因此这是评估集的变异性,而非不确定性。

并且对规模问题只字未提。一个模型,一个任务。

## 4 形式化定义

一个*规格*是一系列分析选择的元组 s=(o,a,d,m,τ,P,r,g),其中 o 是发现目标,a 是消融算子,d 是破坏分布,m 是评估指标,τ 是大小阈值,P 是提示变体,r 是种子,g 是粒度。每个轴的每个水平均取自已发表的实现方案。没有一项是为本研究发明的。

电路发现返回 C(s) ⊆ E,即模型边集的子集。对于采用分离查询、键和值输入的因子化图的GPT-2 small模型,|E|=32,491。我们从工具本身以及基于计算顺序的封闭形式计数独立确认了这一点:b块b注意力从1+13b个来源接收输入,每个头有三个输入槽,共12个头;MLP b块从这些来源加上其自身块的头接收输入;输出从所有157个非终端源接收输入。电路涉及来自144个注意力头和12个MLP的组件,总共156个。

#### 电路不稳定性。

对于两个规格 s_i 和 s_j,
D(s_i, s_j) = 1 - |C_i ∩ C_j| / |C_i ∪ C_j|,(1)
其中 J̄ 是无序对上的平均Jaccard相似度。

#### 声明不稳定性。

令 φ 将电路映射到结构化的附件四声明。翻转率是两个不同规格产生不同声明的概率:
F = 1 - ∑_c n_c(n_c - 1) / (N(N - 1)),(2)
其中 n_c 统计产生声明类 c 的规格数量,N 是规格总数。公式2 (https://arxiv.org/html/2608.13754#S4.E2) 是无偏的基尼-辛普森形式。它是无放回两次抽取不同的概率,并通过针对随机情况的成对暴力定义进行了单元测试。众数占比为 π* = max_c n_c / N。

我们还使用组内形式。对于一组条件轴 G,
F_within(G) = 1 - ∑_g ∑_c n_{g,c}(n_{g,c} - 1) / ∑_g n_g(n_g - 1),(3)
它对每一对赋予相等的权重,而不是对每组赋予相等的权重,当 G 为空集时,它精确地简化为公式2 (https://arxiv.org/html/2608.13754#S4.E2)。

#### 可提交性。

证据在容差 α 下是*可提交的*,当且仅当 π* ≥ 1 - α。

注意上限:对于 k 个声明类,F ≤ 1 - 1/k,因此报告的翻转率必须对照映射可能产生的类数量来解读。在本文观察到的九个类的情况下,上限为0.8889,观察到的0.7316是其82.3%。F 并非因构造而接近一。

## 5 声明映射

φ 是本文中最易受攻击的选择,因此它被固定在预先注册中,实现为确定性代码,并已发布。它不是由语言模型生成的;这样做会在电路方差之上再测量模型方差,无法将两者分离。

根据法规而非便利性,存在两个接收方。φ_overseer 建立在附件四第2(e)条和第3条以及第14(4)(c)条的基础上,以主导层带为键,然后是大小类别,最后是排序的输入片段。φ_affected 建立在第86(1)条的基础上,并以输入片段开头,因为这项权利是赋予决策所涉个人的。三种粒度在设计上是嵌套的,因此在更精细粒度上的声明是对较粗粒度声明的细化,而非矛盾。

有审稿人会说大小分箱是被选择来产生报告的翻转率的。它们是由一个已提交的校准规则从测量的节点计数曲线返回的,而不是被选择的。表1 (https://arxiv.org/html/2608.13754#S5.T1) 报告了敏感性分析。

表1:替代大小分箱下的翻转率。已提交的分箱并非最大值:另外四种替代方案给出了更高的F,包括将每个阈值减半。在大小相差四倍的不同分箱中,范围是0.70至0.77,而完全从声明中移除大小项仍然留下0.5733。

## 6 方法

#### 模型与任务。

GPT-2 small 用于间接宾语识别任务[15]。这一选择并非妥协。本文扩展的不可识别性和忠实度文献在此规模上进行工作,可比性是关键,而边数使得大小匹配的随机基线变得有意义。

#### 网格。

七个发现目标,七个消融算子,在五个读取它们的算子内嵌套的四个破坏分布,四个指标,三个阈值,两个提示变体,五个种子:1,540个发现单元格和18,480个预先注册的规格。破坏是嵌套的而非交叉的,因为两个消融算子从不读取破坏分布,因此交叉它们会产生重复规格。发现使用边缘属性补丁系列[14]和集成边缘梯度,如Miller等人于2024年(https://arxiv.org/html/2608.13754#bib.bib8)发布的库所实现的;自动电路发现的谱系是Conmy等人于2023年(https://arxiv.org/html/2608.13754#bib.bib2)提出的。四个破坏水平取自Wang等人于2022年(https://arxiv.org/html/2608.13754#bib.bib15)。

#### 预先注册。

分析计划在确认性扫描开始前已提交并打标签,两份摘要均已提前起草,因此任何方向都不会被写成意外发现。偏差记录在一个仅追加的文件中,包含其日期以及每项决定是在看到受影响结果之前还是之后做出的。

#### 统计。

任何地方都没有对规格进行p值计算。规格是一个设计好的网格,而非独立样本[13, 12]。不确定性来自非参数自助法,该自助法对规格(而非对)进行重抽样,B=10,000,因为 F 和 J̄ 是针对对的U统计量,而共享一个规格的对是相关的。区间量化的是给定网格的不确定性,并未赋予其超出网格的任何许可。

#### 两个排除项,标准在看到任何电路之前已固定。

一个发现目标无法执行。其所有220个单元格都因针对积分目标计算的均方误差引发运行时错误,该错误发生在库自身的代码内部。我们通过摘要验证了这一点。

相似文章

Open ai

Reddit r/ArtificialInteligence

文章讨论了行业共识:人工智能正变得极其强大,但在高风险任务上的可靠性仍是一个未解决的工程问题。强调当前系统优化的是合理性而非确定性真理,前进方向是分层验证系统而非单一完美模型。

我们衡量了AI能力在模型规模扩大时如何相互作用。在3.5B以下,推理与真实性相互对抗。超过这个规模,它们协同合作。这种转变是可工程化的。(2篇论文 + 交互式仪表盘 + 7个可证伪预测)

Reddit r/artificial

研究人员发现了一个关键规模(约35亿参数),在该规模下,AI模型的推理与真实性之间的权衡从对抗转向合作。他们提供了一个框架、交互式仪表板以及开源引导工具,用于识别并纠正小规模下出现的错误输出。