语言模型代理能否成为机械可解释性中有用的电路解释器?

arXiv cs.AI 论文

摘要

本文研究了语言模型代理能否自动化机械可解释性中的解释阶段,为此引入了AgenticInterpBench基准(包含84个半合成电路)和HyVE解释器(通过迭代假设、验证和解释电路组件)。实验显示出潜力,但可靠的验证仍是关键障碍。

arXiv:2606.24026v1 公告类型:新 摘要:机械可解释性在自动定位电路方面取得了实质性进展,但解释已定位组件的功能仍然劳动密集且难以标准化。在这项工作中,我们研究一旦电路被识别,语言模型(LM)代理能否协助解决这一解释问题。我们引入了AgenticInterpBench,这是一个基于84个半合成变压器电路(包含163个组件级注释)构建的电路解释基准。我们提出了HyVE(假设、验证、解释),一个通过观察、假设生成和因果验证的迭代循环来分析每个组件的代理解释器,最终生成组件级解释和电路级任务描述。在四个LM主干模型上,HyVE恢复了有用的组件级和任务级解释,但没有一个主干模型是普遍最优的。我们的分析表明,强主干模型通常能形成基于观察的假设,而失败更常出现在验证循环后期,原因包括不完整的验证计划、代码执行错误或未解决的假设。在Llama-3-8B的一个算术电路案例研究表明,相同的公式可以扩展到半合成基准之外的自然训练模型。总体而言,LM代理是有前途的电路解释器,但可靠的验证仍是关键障碍。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:44

# 语言模型智能体能否成为机制可解释性中有用的电路解释器?  
来源:https://arxiv.org/html/2606.24026  

Ayan Antik Khan¹, Harsh Kohli², Yuekun Yao², Huan Sun², Ziyu Yao¹  
¹乔治梅森大学,²俄亥俄州立大学  
{akhan265,ziyuyao}@gmu.edu; {kohli.120,yao.1267,sun.397}@osu.edu  

###### 摘要  
机制可解释性已在自动定位电路方面取得实质性进展,但解释已定位组件的功能仍然劳动密集且难以标准化。本文研究了在电路已识别后,语言模型(LM)智能体是否能够辅助这一解释问题。我们引入了**AgenticInterpBench**,这是一个基于84个半合成变压器电路构建的电路解释基准,包含163个组件级别的注释。我们提出了**HyVE**(假设、验证、解释),一种智能体解释器,通过观察、假设生成和因果验证的迭代循环来分析每个组件,最终生成组件级解释和电路级任务描述。在四个LM骨干模型上,**HyVE**可以恢复有用的组件级和任务级解释,但没有一个骨干模型在所有方面表现最佳。我们的分析表明,较强的骨干模型通常形成基于观察的假设,而失败更常发生在验证循环的后期阶段,原因是验证计划不完整、代码执行错误或未解决的假设。对Llama-3-8B中一个算术电路的案例研究表明,相同的公式可以扩展到半合成基准之外的自然训练模型。总体而言,LM智能体是有潜力的电路解释器,但可靠的验证仍然是主要障碍。¹¹我们已在 https://github.com/Ziyu-Yao-NLP-Lab/LLM-Circuit-Explainer 发布基准数据集、源代码和提示。  

---

## 1 引言  

参见图注  
图1:在 `frac_prevs`(一个计算 token ‘x’ 运行分数的2层变压器)上的电路解释任务实例。智能体接收输入输出示例和一个已定位的电路,必须 (i) 为每个组件分配一个功能角色(例如,L0_MLP: 指示器,L1H2: 聚合器)以及自然语言角色描述,并 (ii) 推导出整体模型行为的任务描述。  

机制可解释性(MI)旨在通过识别潜在电路(即对模型行为有贡献的注意力头和MLP组件的子网络)来逆向工程语言模型如何实现特定行为(Rai et al., 2024 (https://arxiv.org/html/2606.24026#bib.bib28); Bereska and Gavves, 2024 (https://arxiv.org/html/2606.24026#bib.bib4); Ferrando et al., 2024 (https://arxiv.org/html/2606.24026#bib.bib7))。尽管最近的进展通过自动修补和归因方法使电路定位更高效(Conmy et al. 2023 (https://arxiv.org/html/2606.24026#bib.bib6); Hanna et al. 2024 (https://arxiv.org/html/2606.24026#bib.bib13); Syed et al. 2024 (https://arxiv.org/html/2606.24026#bib.bib30)),但解释阶段——即理解这些组件的语义角色及其交互——仍然主要依赖于人工且难以规模化。人类研究者通常使用既定方法进行迭代假设生成和验证。然而,随着模型变得更大更复杂,这种以人为中心的过程变得越来越不可行。最近的研究表明,LM智能体能够通过生成假设、设计实验、执行代码以及从证据中提炼结论来支持开放式的科学工作流程(Chen et al., 2025 (https://arxiv.org/html/2606.24026#bib.bib5); Lu et al., 2024 (https://arxiv.org/html/2606.24026#bib.bib19); Yamada et al., 2025 (https://arxiv.org/html/2606.24026#bib.bib34))。鉴于电路解释共享类似的循环,一个自然的问题出现了:LM智能体能否协助解释LM内部的电路?在这项工作中,我们探索了在电路定位后,LM智能体是否可以作为有效的电路解释器。我们专注于评估LM在生成和验证基于机制证据的解释方面的充分性和可靠性,这是迈向可扩展和自动化电路理解的关键一步。  

为了在受控环境中研究这个问题,我们构建了**AgenticInterpBench**,一个包含84个在半合成变压器上的已定位电路的基准,涵盖163个变压器组件,基于InterpBench(Gupta et al., 2025 (https://arxiv.org/html/2606.24026#bib.bib10))。每个组件都带有一个从5类分类法中抽取的功能角色标签以及一个关于其任务特定角色的自然语言描述。我们进一步提出了**HyVE**(假设、验证、解释),一个基于智能体的框架,通过迭代观察、假设生成和验证来解释已定位的电路。我们在**AgenticInterpBench**上使用四个前沿LM作为骨干模型评估了**HyVE**:GPT-5.4(OpenAI, 2026 (https://arxiv.org/html/2606.24026#bib.bib24))、Claude-Sonnet-4.6(Anthropic, 2026 (https://arxiv.org/html/2606.24026#bib.bib2))、Gemini-3.1-Pro(Google DeepMind, 2026 (https://arxiv.org/html/2606.24026#bib.bib9))和Qwen-3-Coder-30B-A3B-Instruct(Qwen, 2025 (https://arxiv.org/html/2606.24026#bib.bib27))。**HyVE** 实现了高达79%的组件标签准确率和83%的任务准确率。结果表明,LM智能体可以产生有用的电路解释,但没有一个骨干模型在所有方面表现最佳。对于较强的骨干模型,初始假设通常是有根据的,而主要失败发生在验证循环的后期。GPT-5.4产生最合理的验证计划,Claude-Sonnet-4.6最可靠地执行代码,Gemini-3.1-Pro在评判的解释分数上表现最强。这些趋势表明,假设生成本身可能不是主要瓶颈,然而可靠的电路解释也取决于验证设计和代码执行。  

为了评估**HyVE**是否能推广到**AgenticInterpBench**的半合成变压器之外,我们对Llama-3-8b中一个用于三操作数加法的现实电路进行了案例研究(Mamidanna et al., 2025 (https://arxiv.org/html/2606.24026#bib.bib20))。我们的实验表明,**HyVE** 在这种设置中可以恢复组件角色:Claude-Sonnet-4.6 正确解释了10个组件中的8个,而GPT-5.4给出了6个正确和3个部分正确的描述。两个模型都恢复了主要的操作数传递结构,而Claude还解释了因果冗余的组件。该案例研究通过在更现实的设置中测试**HyVE**来补充**AgenticInterpBench**,其中已定位的电路来自一个自然训练的下一个token预测模型。它也突显了智能体解释器作为压力测试现有电路分析和探测遗漏机制的实用角色。  

---

## 2 相关工作  

##### 机制可解释性(MI)  
MI主要通过详细案例研究取得了很大进展,这些研究定位并解释特定模型行为的电路。一个里程碑式的例子是Wang et al. (2023 (https://arxiv.org/html/2606.24026#bib.bib32)) 的IOI电路,它是GPT-2 small中用于间接宾语识别的26头电路。另一条并行的工作线研究了LM中的算术和算法电路,包括大于比较(Hanna et al., 2023 (https://arxiv.org/html/2606.24026#bib.bib12))和螺旋数表示(Kantamneni and Tegmark, 2025 (https://arxiv.org/html/2606.24026#bib.bib14))。在我们的工作中,我们评估了**HyVE** 在Mamidanna et al. (2025 (https://arxiv.org/html/2606.24026#bib.bib20)) 为心算发现的All-for-One (AF1) 子图上的泛化能力。  

##### MI中的自动化  
早期分析仅依赖人工设计的干预来识别相关模型组件。ACDC(Conmy et al., 2023 (https://arxiv.org/html/2606.24026#bib.bib6))通过使用基于干预的测试剪枝模型的计算图来自动化部分过程。EAP和EAP-IG(Syed et al., 2024 (https://arxiv.org/html/2606.24026#bib.bib30); Hanna et al., 2024 (https://arxiv.org/html/2606.24026#bib.bib13))通过使用基于归因的分数来识别重要的电路边,进一步提高了可扩展性。这些方法日益自动化定位,但随后的解释步骤仍然很大程度上需要人工分析。我们的工作动机是填补这一空白。与我们的工作类似,Paulo et al. (2024 (https://arxiv.org/html/2606.24026#bib.bib26)); Han et al. (2026 (https://arxiv.org/html/2606.24026#bib.bib11)); Liu et al. (2026 (https://arxiv.org/html/2606.24026#bib.bib18)); Marin-Llobet and Ferrando (2026 (https://arxiv.org/html/2606.24026#bib.bib21)) 探索了自动化可解释性;然而,他们专注于解释孤立的特征或神经元,而我们针对的是电路解释(即解释变压器组件以及它们如何连接以支持特定任务性能)。最后,Bai et al. (2026 (https://arxiv.org/html/2606.24026#bib.bib3)) 设计了智能体来*评估*MI发现与其底层代码、数据和证据的一致性,而我们创建智能体来从头*进行*MI研究。  

##### MI中的基准  
MIB(Mueller et al., 2025 (https://arxiv.org/html/2606.24026#bib.bib22))通过报告两个源自电路相对于完整模型的忠实度的指标来评估电路定位。Tracr(Lindner et al., 2023 (https://arxiv.org/html/2606.24026#bib.bib17))将RASP(Weiss et al., 2021 (https://arxiv.org/html/2606.24026#bib.bib33))程序编译为具有已知内部结构的变压器,这可以作为真实电路,而TracrBench(Thurnherr and Scheurer, 2024 (https://arxiv.org/html/2606.24026#bib.bib31))扩展了这种方法。InterpBench(Gupta et al., 2025 (https://arxiv.org/html/2606.24026#bib.bib10))通过产生更现实的具有已知电路的变压器来继承这一路线。然而,这些数据集都评估电路的*定位*,而对电路组件的*解释*进行基准测试仍然广泛缺乏研究。在这一线上,FIND(Schwettmann et al., 2023 (https://arxiv.org/html/2606.24026#bib.bib29))评估黑盒函数的开放式描述,但并不以MI电路为中心。我们的工作通过提出第一个智能体电路解释基准来填补这一空白。我们的基准建立在InterpBench之上,如第3节所述。  

---

## 3 将LLM智能体作为电路解释器进行基准测试  

在本节中,我们阐述电路解释任务并描述**AgenticInterpBench**。  

### 3.1 任务公式化  

形式化地,令 \( E = \{(x_k, y_k)\}_{k=1}^m \) 表示一组任务输入输出示例,展示模型的行为,令 \( C = \{c_1, c_2, \dots, c_n\} \) 表示一个已定位的电路,其中每个 \( c_i \) 是一个电路组件,例如注意力头或MLP子层。智能体的任务是解释每个组件的功能角色以及电路实现的层级行为。智能体产生三个输出。对于每个电路组件 \( c_i \),它预测 (i) 一个角色标签 \( t_i \in \mathcal{R} \),总结组件的抽象角色,其中 \( \mathcal{R} \) 是第3.2节中引入的角色分类法,以及 (ii) 一个自然语言注释 \( n_i \),描述 \( c_i \) 的任务特定行为。对于整个电路,它还产生 (iii) 一个推导出的任务描述 \( d \),表征LM的底层任务。图1在运行示例 `frac_prevs` 上说明了这些输入和输出。  

### 3.2 AgenticInterpBench  

我们引入了**AgenticInterpBench**,一个用于评估LLM智能体在电路解释上的基准。**AgenticInterpBench** 包含84个变压器电路,带有163个带注释的组件(表1)。值得注意的是,**AgenticInterpBench** 针对一个电路解释设置,其中已定位的电路是给定的,智能体必须恢复每个组件的角色。**AgenticInterpBench** 建立在InterpBench(Gupta et al., 2025 (https://arxiv.org/html/2606.24026#bib.bib10))之上,我们在描述我们的注释分类法和构建过程之前简要回顾一下。  

| 统计量 | 数量 |
| --- | --- |
| 基准任务/电路 | 84 |
| 总MLP组件 | 120 |
| 总注意力组件 | 43 |
| 每个电路平均/最小/最大组件数 | 1.94 / 1 / 10 |
| 角色标签计数 | |
| MAPPER | 72 |
| AGGREGATOR | 32 |
| COMBINER | 33 |
| ROUTER | 11 |
| INDICATOR | 15 |
表1:**AgenticInterpBench** 的统计数据。  

##### 背景  
InterpBench提供了半合成变压器,其真实电路通过设计已知。它建立在Tracr(Lindner et al., 2023 (https://arxiv.org/html/2606.24026#bib.bib17))之上,Tracr是一个将RASP程序(Weiss et al., 2021 (https://arxiv.org/html/2606.24026#bib.bib33))编译为具有完全透明计算结构的仅解码器变压器的编译器。为了缓解Tracr编译模型中不现实的权重分布,InterpBench使用**严格互换干预训练**(SIIT)重新训练Tracr模型,SIIT是从IIT(Geiger et al., 2022 (https://arxiv.org/html/2606.24026#bib.bib8))扩展而来的过程,它将底层变压器与Tracr编译的电路对齐,同时惩罚非电路组件的贡献。得到的模型表现出接近自然训练变压器的权重分布和激活,同时保留了其Tracr对应物的相同电路组件。我们使用InterpBench中的84个RASP派生模型作为**AgenticInterpBench**的基础。²²我们排除了两个IOI任务,因为IOI是一个广泛研究的电路,智能体可能依赖记忆的结论而不是基于基础的执行(Bai et al., 2026 (https://arxiv.org/html/2606.24026#bib.bib3))。这些任务涵盖小型算法行为,包括计数、分数计算、排序和匹配。两个特性使它们适合评估LM作为电路解释器:(i) 真实电路和每个组件的角色可以从RASP源代码中恢复,从而允许精确评估,以及 (ii) 任务的多样性降低了智能体记住先前文献中已知电路的风险。  

##### 数据集注释  
我们通过为电路解释添加一个语义注释层来构建**AgenticInterpBench**,扩展InterpBench。对于InterpBench模型中的每个已定位组件,我们检查相应的RASP程序,并使用InterpBench的高层/低层对应映射将训练后的组件追溯回其实现的RASP变量。这使我们能够为每个组件分配精确的任务特定角色。具体来说,**AgenticInterpBench** 中的每个任务都用其任务描述、原始RASP程序、从任务数据分布中采样的五个输入输出示例(通过这些示例执行RASP程序获得输出)以及每个组件的角色注释来注释。角色注释包含两个字段:一个标签,取自附录B中详细说明的5类分类法(指示器、聚合器、路由器、映射器、组合器),以及一个注释,是对组件任务特定角色的简短自然语言描述。这两个字段共同支持两个粒度的评估:智能体是否正确识别了抽象角色,以及它能否在任务上下文中准确描述该角色。注释由一位作者根据RASP程序手动进行,并由第二位作者审查所有84个任务。遇到分歧时,通过讨论解决。对于审查的子集,评审员间一致性为91%。每个任务还带有一个简单规范(一项额外的小型验证任务),用于测试单个电路组件的行为,以确保智能体的验证步骤具有可操作性。

相似文章

迈向虚拟细胞中的自主机制推理

Hugging Face Daily Papers

本文介绍了VCR-Agent,一个多智能体框架,通过结构化形式化和VC-TRACES数据集生成并验证机制性解释,从而增强大型语言模型在生物学研究中的应用。该方法通过虚拟细胞中的验证性机制推理,提高了基因表达预测的事实准确性。