少量神经元揭示LLM何时误用工具:面向可靠工具使用的稀疏检测与选择性引导

arXiv cs.CL 论文

摘要

本文介绍了PRISMS,一种利用少量针对特定失败的MLP神经元,通过稀疏读出检测和引导LLM工具使用错误(过度调用、缺失调用、无效参数)的框架,从而提升多个模型系列的工具使用可靠性。

arXiv:2608.00218v1 公告类型:新 摘要:智能体LLM表现出三种重要的工具使用失败:无效参数(有效性)、不必要的调用(过度调用)以及需要工具时的遗漏调用(缺失)。我们发现,一组少量的、针对特定失败的MLP神经元能够以线性可分的决策边界区分这些失败。基于这一观察,我们提出了PRISMS(Probing Representations In Support of Monitoring and Steering),一个在稀疏检测和激活引导之间共享特定失败神经元基的闭环框架。PRISMS选择贡献关键的MLP神经元,并在其激活上拟合L1正则化检测器。在来自Qwen3、Llama和Gemma系列的六个模型上,过度调用和缺失在预生成提示边界处被检测到,ROC-AUC为0.90-1.00,而有效性从生成的工具调用片段中检测,ROC-AUC为0.86-0.90。这些结果通过高度稀疏的读出实现:缺失仅需1-2个MLP神经元,过度调用需要2-16个,有效性约需128个。这些稀疏检测器匹配或优于使用23-627倍更少特征的密集残差流基线。共享的神经元基还支持对工具调用行为的双向控制,抑制不必要的调用并激发遗漏的调用。因此,PRISMS根据预测的失败风险对干预进行门控,以减轻无条件引导的附带影响。在所有六个模型中,PRISMS将总体过度调用率降低了80%(从0.131降至0.026),同时将需要工具的准确率提高了14.2个百分点(从0.689提高到0.831)。因此,PRISMS跨模型系列提供了轻量级的失败检测和选择性干预。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:40

# 少量神经元揭示 LLM 何时误用工具:用于可靠工具使用的稀疏检测与选择性引导

Source: https://arxiv.org/html/2608.00218

###### 摘要

智能体大语言模型(Agentic LLMs)会表现出三种后果严重的工具使用失败:无效参数(*validity*)、不必要调用(*over-calling*)以及在需要工具时缺失调用(*missing*)。我们发现,一小组与失败类型相关的 MLP 神经元能够以线性可分离的决策边界区分这些失败。基于这一观察,我们提出了 PRISMS(Probing Representations In Support of Monitoring and Steering,面向监控与引导的表示探测)——一个在稀疏检测与激活引导之间共享失败特定神经元基的闭环框架。PRISMS 选择贡献关键的 MLP 神经元,并在其激活上拟合一个 \(L_1\) 正则化检测器。在 Qwen3、Llama 和 Gemma 系列的六个模型上,过度调用和漏调用可在生成前的提示词边界被检测到,ROC-AUC 为 0.90–1.00;有效性则可在生成的工具调用片段上被检测到,ROC-AUC 为 0.86–0.90。这些结果是通过极稀疏的读出实现的:漏调用仅需 1–2 个 MLP 神经元,过度调用需 2–16 个,有效性约需 128 个。这些稀疏检测器以少 23–627× 的特征数达到或超过了稠密残差流基线。共享神经元基还支持对工具调用行为的双向控制,既能抑制不必要的调用,也能引出被遗漏的调用。因此,PRISMS 会根据预测的失败风险对干预进行门控,从而减轻无条件引导的附带影响。在所有六个模型上,PRISMS 将合并后的过度调用率降低了 80%(0.131→0.026),同时将需要工具时的准确率提升了 14.2 个百分点(0.689→0.831)。PRISMS 由此在多个模型家族上提供了轻量级的失败检测和选择性干预。

## 1 引言

大语言模型(LLMs)越来越多地通过外部工具行动,包括搜索引擎、代码解释器、数据库和真实世界 API。工具使用扩展了 LLM 能够知道和执行的范围,但也同时在推理与行动之间引入了失败。模型可能会调用一个不适用于请求的工具(*过度调用*),在需要时未能调用可用工具(*漏调用*),或者选择了适用的工具但生成了错误的参数值(*有效性*)。过度调用浪费延迟和 API 预算,漏调用让模型不得不超出其能力范围作答,而无效参数则可能触发非预期动作。因此,可靠的智能体必须改进工具选择与参数正确性:它们应在行动之前识别决策失败,并在外部执行之前验证已生成的调用[Patil et al. 2025](https://arxiv.org/html/2608.00218#bib.bib1); [Liu et al. 2025](https://arxiv.org/html/2608.00218#bib.bib2); [Zhang et al. 2025](https://arxiv.org/html/2608.00218#bib.bib3)。

近期工作尝试了多种互补方法来改进智能体决策。以推理为中心的方法,如 ReAct 和 Reflexion,通过交错推理与行动或引入反馈驱动的语言反思来提供额外思考[Yao et al. 2023](https://arxiv.org/html/2608.00218#bib.bib11); [Shinn et al. 2023](https://arxiv.org/html/2608.00218#bib.bib12),但它们并不显式监控某种特定工具使用失败是否存在。When2Tool 表明,工具必要性可以从隐藏状态中线性读出,并利用该预测来鼓励调用工具或放弃调用[Sun et al. 2026](https://arxiv.org/html/2608.00218#bib.bib10)。然而,其全层稠密残差读出是高维且可能冗余的,同时用于控制的文本前缀会修改生成上下文。更普遍地说,更强的提示约束、显式推理和无条件激活引导都会修改模型调用工具的整体倾向。如图 1 所示,这些控制措施以增加漏调用或减少合法工具使用为代价来降低过度调用。因此,它们改变的是全局“调用 vs 弃用”的工作点,而不是判断哪些具体提示需要纠正。

> 图 1:全局控制暴露了工具使用中的权衡。(a) 思考(Thinking)降低了过度调用,但增加了漏调用;门控 PRISMS(绿色菱形)接近理想情况。(b) 无条件引导以能力为代价降低了不存在工具调用率(NTA),而门控 PRISMS 同时改进了两者。

因此,选择性纠正需要一个具有两种独立能力的闭环:确定*何时*可能发生失败,以及确定*如何在此时刻*改变模型。已有工作提供了这一闭环的部分组件:稠密状态监控器可以触发外部执行策略[Healy et al. 2026](https://arxiv.org/html/2608.00218#bib.bib9),而激活引导则提供了一种内部控制机制[Zou et al. 2023](https://arxiv.org/html/2608.00218#bib.bib23); [Turner et al. 2023](https://arxiv.org/html/2608.00218#bib.bib22); [Wang et al. 2026](https://arxiv.org/html/2608.00218#bib.bib25)。我们使用模型自身的展开轨迹来研究三种自然出现的失败模式——过度调用、漏调用和有效性——构成的完整闭环。我们既评估失败检测,也评估行为控制,区分在没有提供工具时发生的错误调用(NTA)与调用不适用干扰工具(DT)的情况;二者按提示加权后合并为 pooled over-calling(OC),而能力准确率(CA)衡量在需要工具时正确调用的比例。

相关的表示工程工作探测内部真实性和工具使用决策[Azaria and Mitchell 2023](https://arxiv.org/html/2608.00218#bib.bib8); [Wu et al. 2026](https://arxiv.org/html/2608.00218#bib.bib13); [Cheng et al. 2026](https://arxiv.org/html/2608.00218#bib.bib14),定位与幻觉相关的神经元[Gao et al. 2025](https://arxiv.org/html/2608.00218#bib.bib18),并通过稀疏内部方向引导真实性、智能体行为和工具调用[Li et al. 2023](https://arxiv.org/html/2608.00218#bib.bib21); [Sui et al. 2026](https://arxiv.org/html/2608.00218#bib.bib24); [Chen et al. 2026](https://arxiv.org/html/2608.00218#bib.bib26)。PRISMS 将这些思想扩展到自然出现的工具使用失败上,将紧凑的 FFN 监控器与检测器门控式纠正结合在一起。我们研究的问题是:这些失败是否可以在决策适当时刻,通过紧凑且可单独寻址的 FFN 特征被监控?强可解码性是否识别出因果控制手柄?干预是否可以做到选择性?由于探针性能并不必然意味着所编码信号被行为所使用[Elazar et al. 2021](https://arxiv.org/html/2608.00218#bib.bib27); [Ilyas et al. 2019](https://arxiv.org/html/2608.00218#bib.bib28),我们明确地将“*读取*”失败与“*控制*”失败分开。

我们通过 PRISMS(Probing Representations In Support of Monitoring and Steering)来回答这些问题。这是一个新颖的闭环框架,将“*何时*干预”与“*如何*改变模型”分离。稀疏检测器从贡献选择的 FFN 写入中读取失败风险,而独立构建的逐层方向决定如何进行干预。在来自 Qwen3、Llama-3.1 和 Gemma 系列的六个指令微调模型上,当存在足够的自然正样本时,三种失败都是线性可读的。在 Qwen3 上,过度调用和漏调用在生成前达到 ROC-AUC 0.98–1.00,有效性则从生成的调用片段上达到 0.86–0.90。这些结果是通过高度稀疏的读出实现的:漏调用仅需 1–2 个 MLP 神经元,过度调用需 2–16 个,有效性约需 128 个。在链式思考(chain-of-thought)推理下,最具信息量的决策读出点从提示词边界转移到推理结束处。高可检测性并不使所选神经元在因果上特殊:在主要特征预算下,匹配的随机子集实现了几乎相同的检测性能(\(\Delta\mathrm{AUC}\leq 0.011\)),且直接干预探针加权的神经元与对照组没有显著差异。相比之下,贡献选择的逐层方向在工具调用上产生了强双向变化,并且明显优于基于 profile 匹配的随机方向。将闭环合上后,这种一般性的倾向控制就转变为选择性干预。在所有六个模型上,检测器门控式引导同时降低了合并后的过度调用(OC)并提升了能力准确率(CA),平均将 OC 降低了 80%(0.131→0.026),并将 CA 平均提升了 14.2 个百分点(0.689→0.831)。

我们的贡献如下:

- 我们为三种自然出现的工具使用失败确定了决策适当时刻的读出方式:过度调用和漏调用在生成前(或在链式思考下的推理结束处)读出,有效性在生成的调用片段上读出。这些信号表现出不同的稀疏性和深度分布,其中决策失败仅需少量 MLP 神经元即可解码。
- 我们确定了贡献选择的、逐层的引导方向,能够双向控制工具调用行为。沿这些方向进行干预可以抑制不必要的调用或引出被遗漏的调用,展示了对工具调用决策的因果控制。
- 我们引入了一个检测器门控控制器,将稀疏监控与失败特定引导相结合。它保持未标记计算不变,抑制预测到的过度调用,在预测到漏调用时引出调用,并在执行前监控参数有效性。

> 图 2:PRISMS 概览。自然展开轨迹定义了贡献排序的共享基 \(\mathcal{S}_{f}\)。稀疏检测器决定*何时*干预,而独立的逐层方向决定*如何*干预。风险门控保留未标记的计算,并仅对预测到的失败施加匹配的引导;有效性在工具执行前被检查。

## 2 方法

### 2.1 概述与失败感知读出

我们引入 PRISMS,一个用于监控和纠正工具使用失败的闭环框架。我们研究三种失败模式:*过度调用*,即在没有提供任何适用工具时进行不必要调用;*漏调用*,即未能调用可用且必需的工具;以及*有效性*,即调用适用工具但生成的参数与参考不一致。对模式 \(f\),设 \(\mathcal{H}_{f}\) 和 \(\mathcal{B}_{f}\) 分别表示失败的和匹配的正确展开轨迹。每种失败都在其首次可观察到的位置被读出。决策失败在最终提示词 token 处读出(无显式推理时),或在紧接着推理结束前的 token 处读出(当推理先于行动时)。有效性则将完整生成的调用片段进行池化,包括工具名、参数字段及值、以及分隔符。我们将 \((x,r)\) 中对应的单 token 或调用片段读出记为 \(T_{f}(x,r)\)。从正确和失败的展开轨迹中,PRISMS 构建一个贡献选择的共享基 \(\mathcal{S}_{f}\)。在该基内拟合的 \(L_1\) 正则化探针产生一个紧凑的检测器支持集 \(\mathcal{D}_{f}\subseteq\mathcal{S}_{f}\),它决定*何时*需要干预。从完整基中独立构建的逐层方向决定*如何*改变模型。过度调用和漏调用构成在线控制闭环;有效性在生成之后、工具执行之前被监控。图 2 总结了这一“读取–引导”流水线。

### 2.2 贡献选择的共享神经元基

#### 神经元写入与贡献。

设 \(h_{t}^{(\ell)}\in\mathbb{R}^{d_{\mathrm{model}}}\) 为第 \(t\) 个 token 在第 \(\ell\) 层的残差状态。对于门控 FFN 中的神经元 \((\ell,i)\),定义其标量激活 \(a_{t,i}^{(\ell)}\)、下投影值 \(v_{i}^{(\ell)}\) 和残差流写入 \(g_{t,i}^{(\ell)}\):

\[
a_{t,i}^{(\ell)}
:=\big[\sigma(h_{t}^{(\ell)}W_{\mathrm{gate}}^{(\ell)})\odot(h_{t}^{(\ell)}W_{\mathrm{up}}^{(\ell)})\big]_{i},
\tag{1}
\]
\[
v_{i}^{(\ell)}
:=W_{\mathrm{down}}^{(\ell)}[:,i],\qquad g_{t,i}^{(\ell)}=a_{t,i}^{(\ell)}v_{i}^{(\ell)},
\]
\[
\mathrm{MLP}^{(\ell)}(h_{t}^{(\ell)})=\sum_{i}g_{t,i}^{(\ell)}
\]
\[
c_{t,i}^{(\ell)}
:=\|g_{t,i}^{(\ell)}\|_{2}=|a_{t,i}^{(\ell)}|\|v_{i}^{(\ell)}\|_{2}.
\]

该定义遵循 FFN 的键–值记忆视角,即输出是值向量的加权和[Geva et al. 2021](https://arxiv.org/html/2608.00218#bib.bib16)。分数 \(c_{t,i}^{(\ell)}\) 也是列分组的 WANDA 类比物:它结合了输入激活与下投影幅值,等于神经元实际残差写入的范数[Sun et al. 2024](https://arxiv.org/html/2608.00218#bib.bib15)。相关工作使用 WANDA 式归因来隔离稀疏的安全关键区域[Wei et al. 2024](https://arxiv.org/html/2608.00218#bib.bib17)。

#### 语料库聚合与全局选择。

对任一语料库 \(\mathcal{A}\in\{\mathcal{H}_{f},\mathcal{B}_{f}\}\),我们在示例和相应读出位置上的贡献取平均。设失败选择预算为 \(k\),正确选择预算为 \(m\),则:

\[
C_{f,i}^{(\ell),\mathcal{A}}
:=\mathbb{E}_{(x,r)\sim\mathcal{A}}\left[\frac{1}{|T_{f}(x,r)|}\sum_{t\in T_{f}(x,r)}c_{t,i}^{(\ell)}(x,r)\right],
\tag{2}
\]
\[
\mathcal{S}_{f}
:=\operatorname{Top}_{k}\!\left(C_{f}^{\mathcal{H}_{f}}\right)\cup\operatorname{Top}_{m}\!\left(C_{f}^{\mathcal{B}_{f}}\right),
\]
\[
\mathcal{S}_{f}^{(\ell)}
:=\{i:(\ell,i)\in\mathcal{S}_{f}\}.
\]

该排序是跨所有层–神经元对的全局排序,不设逐层配额。因此,该基可以集中在对于失败模式 \(f\) 携带更多信息的层中。

### 2.3 稀疏监控

#### 带符号检测器特征。

基选择使用无符号的贡献幅值。而监控则保留激活符号,并对每个写入按其所在层 MLP 输出的尺度进行归一化:

\[
\phi_{t,i}^{(\ell)}(x,r)
:=\frac{a_{t,i}^{(\ell)}(x,r)\|v_{i}^{(\ell)}\|_{2}}{\|\operatorname{MLP}^{(\ell)}(h_{t}^{(\ell)})\|_{2}+\epsilon},
\]
\[
z_{f,i}^{(\ell)}(x,r)
:=\frac{1}{|T_{f}(x,r)|}\sum_{t\in T_{f}(x,r)}\phi_{t,i}^{(\ell)}(x,r),\quad(\ell,i)\in\mathcal{S}_{f}.
\]

这里 \(\epsilon>0\) 保证数值稳定性,而 \(z_{f}(x,r)\) 收集在 \(\mathcal{S}_{f}\) 上的这些分量。完整的共享基探针正好使用这一特征集,而不是全宽度的残差或 MLP 表示。

#### 稀疏检测器。

对每种失败模式,我们在共享基特征上拟合一个 \(L_1\) 正则化逻辑回归探针,

相似文章

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。