检索即足够:使用工具代理的无训练可解释性

arXiv cs.LG 论文

摘要

HARP 是一种无需训练的可解释性方法,它利用配备激活向量数据库及操作工具的 LLM 代理,在概念发现、概念检测、模型引导和秘密抽取方面优于基于训练的方法。

arXiv:2607.16448v1 公告类型:新 摘要:神经网络激活的可解释性方法涵盖广泛的开销范围,从廉价的无训练技术(如线性探针、PCA、SVD)到更昂贵的基于训练的技术(如 SAE 和激活预言机)。基于训练的方法通常更强大,部分原因是它们在训练期间利用了大型激活数据集。这引发了一个自然的问题——这些方法是否真的揭示了超越从训练数据集本身可恢复的洞察?为了解决这个问题,我们为 LLM 代理配备了一个激活向量数据库(每个向量与其文本上下文配对),以及操作激活的工具——在潜在空间中投影方向、计算激活差异和平均值。代理迭代查询数据库,从检索到的样本中形成假设,并通过构建线性探针进行验证。我们将这种方法称为 HARP(基于假设的代理检索和探针)。尽管不涉及任何训练,HARP 在概念发现、概念检测、模型引导和秘密抽取方面均优于激活预言机和基于 SAE 的代理。无训练的设计还使 HARP 更加廉价和灵活:当现有数据集不足时,可以按需索引新数据集。更广泛地说,我们的结果表明,当前基于训练的方法尚未提取超出其训练数据的洞察,并且激励了明确要求可解释性方法展示此类洞察的基准。我们将在 https://github.com/SriramB-98/HARP 发布代码。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# 检索即足矣:基于工具使用智能体的免训练可解释性方法

来源:https://arxiv.org/html/2607.16448  
Sriram Balasubramanian  
计算机科学系  
马里兰大学  
[email protected]  

Soheil Feizi  
计算机科学系  
马里兰大学  
[email protected]  

###### 摘要

针对神经网络激活的可解释性方法涵盖广泛的计算成本谱系,从廉价、无需训练的技术(如线性探针、PCA、SVD)到更昂贵的基于训练的方法(如 SAE 和激活预言机)。基于训练的方法通常更强大,部分原因是它们在训练过程中利用了大规模的激活数据集。这自然引出一个问题:它们是否真正发现了超越训练数据集本身所能恢复的见解?为解决这一问题,我们为一个 LLM 智能体配备了一个包含激活及其文本上下文的向量数据库,以及用于操作激活的工具——在潜空间中投影方向、计算激活差值和平均值。该智能体迭代地查询数据库,从检索样本中形成假设,并通过构建线性探针进行验证。我们将此方法称为 HARP(假设驱动的智能体检索与探针)。尽管不涉及任何训练,HARP 在概念发现、概念检测、模型引导和秘密提取方面均优于激活预言机和基于 SAE 的智能体。无需训练的设计也使 HARP 在成本和灵活性上显著更优:当现有数据集不足时,可按需索引新数据集。更广泛地说,我们的结果表明,当前的基于训练的方法尚不能从其训练数据中提取出超越数据本身的见解,并促使我们建立明确要求可解释性方法展示此类见解的基准。我们在 https://github.com/SriramB-98/HARP 上发布了代码。

## 1 引言

理解和解释神经网络隐藏激活中的语义信息一直是可解释性与可解释性研究中的长期问题。传统上,这涉及通过简单的线性操作(如激活差值 [23](https://arxiv.org/html/2607.16448#bib.bib23)、PCA [9](https://arxiv.org/html/2607.16448#bib.bib9) 和 SVD [29](https://arxiv.org/html/2607.16448#bib.bib29))来操作激活。然而近年来,主流范式转向训练神经网络使用大量数据来分析隐藏激活。字典学习方法——SAE、转码器和交叉编码器 [4](https://arxiv.org/html/2607.16448#bib.bib4), [8](https://arxiv.org/html/2607.16448#bib.bib8), [22](https://arxiv.org/html/2607.16448#bib.bib22)——学习跨越激活空间的过完备基向量码本;而激活预言机 [17](https://arxiv.org/html/2607.16448#bib.bib17) 和 LIT [26](https://arxiv.org/html/2607.16448#bib.bib26) 则训练 LLM 直接回答关于激活向量的问题。这些基于训练的方法的动机遵循了推动现代深度学习发展的相同逻辑:期望性能随更多数据和计算而提升 [16](https://arxiv.org/html/2607.16448#bib.bib16)。这体现在近期工作中将 SAE 扩展到更大字典和更多数据 [11](https://arxiv.org/html/2607.16448#bib.bib11), [30](https://arxiv.org/html/2607.16448#bib.bib30),以及研究激活预言机的数据扩展行为 [17](https://arxiv.org/html/2607.16448#bib.bib17)。其隐含赌注是,只要数据足够,这些学习系统将逐步解锁对模型内部机制的更深理解。但这引出了一个令人惊讶地很少被关注的问题——这些方法是否真正提取了超越训练数据本身的见解,还是它们主要学习从数据中检索和重组已有的模式?我们将此问题凝练为核心问题:

参见图注  
图1:HARP 用于无监督概念发现的操作示例:我们展示 HARP 如何利用其工具从给定的残差流激活向量 a 中挖掘概念。它首先查询向量数据库以检索语义相关的激活 v_i。然后智能体就突出潜在语义主题(如“音乐相关内容”)形成假设。接着智能体对检索向量的一部分进行平均,以构建概念向量 u。为了发现次要的潜在概念,智能体将 u 从 a 中投影出去,得到 a'。这个残差向量 a' 随后被用于重新查询数据库,使智能体能够顺序地“剥离”并识别单个激活内的多个不同概念(如“歌曲内容”、“艺术家”、“排行榜与广播”、“视觉效果”和“制作人员”),以及对应于每个突出概念的概念向量。

基于训练的方法是否揭示了超出通过检索和经典工具从训练数据中可恢复的见解?换句话说,我们能否将 SAE 或激活预言机视为一个*有损数据库*,其中固定训练集(激活,上下文)对被压缩成字典或微调后的 LLM?一旦训练完成,数据库无法在不重新训练的情况下扩展,任何在原始语料中表示不佳的概念都会丢失。因此,一个自然的基线是同一思想的*无损*版本:保持激活和上下文原样,让智能体在查询时进行检索。为解决此问题,我们提出 HARP(假设驱动的智能体检索与探针)。我们为 LLM 智能体提供与文本上下文配对的激活向量数据库,以及一套用于线性操作的小型工具箱:投影、平均和差值。给定关于目标激活的问题(例如,“此激活中的主要概念是什么?”),智能体循环操作——检索数据库中的相似激活,从检索样本中形成假设,为该假设构建线性探针,将其投影出去,然后迭代——最后生成最终答案。与激活预言机或 LIT 不同,HARP 还返回每个发现概念对应的线性探针、推理轨迹和工具调用历史,这些都可独立验证。因此,我们能够使用强大的 LLM 进行可解释性,而无需信任它们。图1(https://arxiv.org/html/2607.16448#S1.F1)展示了 HARP 在无监督概念发现中的操作示例。

HARP 在概念发现、概念检测、模型引导和秘密提取等一系列任务上与基于训练的方法相当或更优。此外,由于 HARP 无需训练,其组件是模块化的——数据集、智能体和工具箱均可独立交换或扩展。发现概念的粒度也不在训练时固定(如 SAE 中的 L0),而是可在推理时调整。更广泛地说,我们的结果表明,当前的基于训练的可解释性方法尚未能从其训练数据中提取出超越检索所能恢复的显著见解,这促使我们建立明确要求此类见解的基准。总结我们的贡献如下:

- • 我们提出一个问题:基于训练的可解释性方法是否提取了超越通过检索和经典工具从训练数据中可恢复的见解?
- • 我们提出 HARP,一个将向量数据库检索与小型线性操作工具箱和探针构建相结合的智能体流水线,用于回答关于激活向量的问题。
- • 我们证明 HARP 在概念发现(覆盖增益 1.9× / 1.6×)、概念检测(硬负例上 AUC 提升 +0.10)、模型引导(LM 评判相较 SAE 提升 10×)和秘密提取方面与 SAE 和激活预言机相当或更优。
- • 我们的结果将 HARP 确立为一个强大的可解释性智能体,并促使开发针对超越纯检索见解的新方法和基准。

## 2 方法论

HARP 分析从 LLM 所选层中提取的目标激活向量 a ∈ R^d。它将一个外部的*向量数据库*的激活与一个工具使用智能体配对,该智能体迭代检索相关条目、假设概念、构建概念向量、将其从 a 中投影出去,然后重复(图1 (https://arxiv.org/html/2607.16448#S1.F1))。我们首先描述数据库(第2.1节 (https://arxiv.org/html/2607.16448#S2.SS1)),然后描述智能体(第2.2节 (https://arxiv.org/html/2607.16448#S2.SS2))。

### 2.1 向量数据库构建

**源语料。** 我们索引从通用目的语料收集的激活,类似于用于训练 SAE 和其他字典学习方法的语料。具体来说,我们从 *The Pile* [10] (https://arxiv.org/html/2607.16448#bib.bib10) (monology/pile-uncopyrighted) 中随机抽取大约 3,900 篇文档的子集,保留其自然领域分布。由于计算限制,这仅占用于训练 SAE 数据的一小部分(约为 10 亿),但已足够大以展示各种概念和上下文。我们验证这些训练文档与下游任务中使用的段落和文本没有重叠。

**激活提取。** 每篇文档被分词并分成大小为 T=1024 的 token 块。对于每个块中的每个 token 位置,我们记录 (i) 所选层的残差流激活 x ∈ R^d,以及 (ii) 目标位置周围 ±64 token 的窗口,目标位置本身用 ... 标记包裹,以便智能体以后能解析 snippet 中的哪个 token 生成了该向量。这为每个模型和层产生了约 2600 万个(上下文,激活)对。

**偏差校正与索引。** 在插入前,每个激活被居中为 v = x - x̄,其中 x̄ 是语料平均残差。这消除了主要的不依赖于内容的方向,否则会使最近邻检索返回通用邻居。偏差减除后的向量随后被索引到 Milvus 中,使用近似内积搜索,对于给定的(模型,层)对,同一索引在所有下游任务中重复使用。更多细节见附录 A.1 (https://arxiv.org/html/2607.16448#A1.SS1)。

### 2.2 HARP 智能体

给定目标激活 a,HARP 运行一个 ReAct 风格 [32](https://arxiv.org/html/2607.16448#bib.bib32) 的 LLM 智能体(使用 gpt-4o-mini 作为底层 LLM),该智能体维护一个小型的、内存中的*向量库*,并通过固定工具箱对其操作。向量库是一个将别名(智能体用于引用向量)映射到实际向量的字典。库初始化为偏差减除后的目标 a - x̄,别名为 `target_vector`,以及一个零向量,允许智能体将“一组正例的平均值”表示为均值差。智能体可用于操作的所有向量都存储在库中。关键是,智能体无法访问生成 a 的输入文本,其对激活的唯一窗口是工具箱。关于 a 编码内容的所有证据都必须来自数据库的检索样本以及构建的概念向量和线性探针。

#### 在投影子空间中检索。
查询不是在原始残差空间中进行的,而是在投影掉索引激活的前 k 个主成分之后:给定 U ∈ R^(k×d),我们对每个查询向量应用 P = I - U^T U。顶部成分捕获了通用的、不依赖于内容的方差,否则会主导余弦相似度并返回无信息的邻居;将其移除是密集检索中标准的“除顶部外”技巧 [25](https://arxiv.org/html/2607.16448#bib.bib25)。数据库存储未投影的向量,以便智能体的其他工具仍然在原始激活上操作。我们还支持一个 `exclude_stop_words` 标志,用于过滤检索候选项,这些候选项中高亮 token 是标点符号、功能词或特殊 token,因为这些 token 紧密聚类并挤占内容邻居。参见附录 A.2 (https://arxiv.org/html/2607.16448#A1.SS2) 了解估计和停用词列表详情。

#### 工具箱:
智能体可以访问一组小而固定的操作。前两个操作与语料和模型交互;其余的是对向量库的纯线性代数原语:

- • `query_vector_db(v, k)`:从数据库返回 Pv 的 top-k 最近邻,每个邻域以 (snippet, vector) 对形式返回。检索到的向量被添加到库中,别名为整数字符串(“0”、“1”、...),供后续工具调用使用。
- • `get_activations({t_i})`:将智能体编写的探针文本 t_i(带 ... 标记)通过 LLM 运行,返回偏差减除后的激活。用于构建与检索到的正例在表面形式上匹配但缺少疑似概念的*定向负例*。
- • `difference_of_means(P+, P-)`:给定向量库的正例和负例子集,生成单位向量 u = (v̄_+ - v̄_-) / ||v̄_+ - v̄_-||。当 P- = {0} 时,这简化为(归一化的)正例均值,即图1 (https://arxiv.org/html/2607.16448#S1.F1) 中描述的形式。
- • `project_out(a, {u_j})`:最小二乘拟合 â = ∑_j α_j u_j,并将残差 a - â 存储在库中,返回相对重构误差。对于单个单位方向,这简化为图中所示的投影 a' = (I - uu^T)a。
- • `subspace_projection({v_i}, n)`:对一组库向量拟合顶部 n 个主成分,并将其存储为 {u_pc_0, ..., u_pc_{n-1}},当单个方向不足以移除概念时使用。
- • `check_reconstruction`、`dot_product`:辅助诊断工具,用于检查一组基向量对目标向量的重构情况,以及针对概念方向的有符号评分。

#### 操作:
HARP 实现为一个 ReAct 循环:在每一步,智能体选择一个工具,观察其输出,并决定下一步做什么,直到满足任务特定的终止条件。我们指示其遵循一个通用模式(如图1 (https://arxiv.org/html/2607.16448#S1.F1) 所示)——使用当前目标查询数据库,在检索到的 snippet 中识别一个连贯主题,利用 `difference_of_means` 或 `subspace_projection` 将该主题具体化为一个方向(或低维子空间),将其从 a 中投影出去,并重新查询残差以验证该主题已被移除,然后迭代。智能体还可以通过 `get_activations` 获取负例以消除竞争假设,或在需要时回溯并重新构建概念。在实践中,智能体大多遵循手头任务的 skill 中的指导原则,不会偏离。输出是一个已接受概念的列表及其基向量 {u_j},这些向量可以被检查、评分或用作 st

(注意:最后一句似乎不完整,原文以“或用作 st”结束,可能是笔误或截断。翻译时保留原文内容,不做猜测补充。)

相似文章

@omarsar0: 关于工具使用智能体的有趣可解释性论文。作者探测隐藏状态,发现模型经常识别到应调用工具,但…

X AI KOLs Following

本文提出了一个模型自适应的工具必要性定义,并发现 LLM 内部识别需要工具与实际调用工具之间存在 26% 到 54% 的不匹配,集中体现在认知到行动的转换阶段。它揭示了一个“知行差距”(knowing-doing gap),即模型通常知道应该调用工具,但由于后期层几何结构将信号旋转至几乎与行动正交,导致调用失败。

可解释性

Anthropic Research

Anthropic 的可解释性团队致力于从内部理解大型语言模型,以增强 AI 安全性并促进积极成果,采用多学科交叉的研究方法。