ToolSense: 用于审计大语言模型中参数化工具知识的诊断框架

arXiv cs.AI 论文

摘要

ToolSense 是一个开源诊断框架,能够生成三个基准测试(真实检索、多选题探测、问答探测),用于审计大语言模型的参数化工具知识,揭示了知识-检索分离现象:强大的检索性能可能与较差的事实理解共存。

arXiv:2606.12451v1 公告类型: new 摘要: 作为代理部署在大规模工具目录上的大语言模型面临关键的工具检索瓶颈。由于基于嵌入的检索方法依赖于可能无法充分捕捉专用工具语义的紧凑编码器,参数化工具检索通过将每个工具编码为附加到LLM词汇表中的虚拟标记来解决这一问题,分两个阶段(记忆阶段和检索SFT阶段)进行微调,从而将LLM用作检索器,在标准ToolBench检索基准测试上取得了强劲性能。然而,这些基准测试使用冗长且完全指定的查询,其评估采用约束解码,将输出限制为有效的标记路径,两者均未揭示模型是否真正理解其工具。我们引入了 **ToolSense**,这是一个基于LLM的开源诊断框架,它以任何工具目录作为输入,并自动生成三个基准测试:一个包含三个模糊层级查询的真实检索基准测试(RRB)、一个多选题探测基准测试和一个问答探测基准测试。将ToolSense应用于ToolBench(约4.7万个工具)并评估五种参数化模型训练配置,揭示了知识-检索分离:在RRB查询上,与完全指定的ToolBench基准测试相比,几种配置的性能下降了约50-64个百分点,低于嵌入模型基线。此外,尽管检索性能强劲,一些模型在事实探测上得分接近随机,表明存在知识-检索分离。我们在 https://github.com/SAP/toolsense 开源了ToolSense框架和ToolBench诊断基准测试。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:52

# 一种用于审计大语言模型中参数化工具知识的诊断框架
来源:https://arxiv.org/html/2606.12451

Ashutosh Hathidara*††感谢:同等贡献。 Sai Shruthi Sistla*††感谢:同等贡献。 Sebastian Schreiber Sahil Bansal SAP Labs \{ashutosh.hathidara, sai.shruthi.sistla, sebastian.schreiber, sahil.bansal01\}@sap.com

###### 摘要

在大型工具目录上以智能体形式部署的大语言模型面临一个关键的工具检索瓶颈。由于基于嵌入的检索方法依赖于紧凑的编码器,可能无法充分捕获专业工具语义,参数化工具检索 (Wang et al., 2025 (https://arxiv.org/html/2606.12451#bib.bib1)) 通过将每个工具编码为附加到大语言模型词汇表中的一个 *虚拟 token*,并在两个阶段(记忆阶段,然后是检索 SFT 阶段)进行微调,从而利用大语言模型作为检索器,在标准 ToolBench 检索基准上取得了强劲性能。然而,这些基准使用冗长、完全指定的查询,它们的评估采用约束解码,将输出限制为有效的 token 路径——这既无法揭示模型是否真正 *理解* 其工具。我们引入了 **ToolSense**,一个开源的大语言模型驱动的诊断框架,该框架以任何工具目录作为输入,并自动生成三个基准:一个真实检索基准(RRB),包含三个模糊层级的查询;一个 MCQ 探测基准;以及一个 QA 探测基准。将 ToolSense 应用于 ToolBench(约 47k 个工具)并评估五种参数化模型训练配置,揭示了一种 *知识-检索分离* 现象:在 RRB 查询上,与完全指定的 ToolBench 基准相比,几种配置的性能骤降约 50-64 个百分点,低于嵌入模型基线。此外,尽管检索性能强劲,一些模型在事实探测上得分接近随机,表明存在知识-检索分离。我们在 https://github.com/SAP/toolsense 开源了 ToolSense 框架和 ToolBench 诊断基准。

## 1 引言

大语言模型正越来越多地作为自主智能体部署在大型软件生态系统中,从包含数千个 API 的目录中选择正确的工具是一个核心瓶颈 (Schick et al., 2023 (https://arxiv.org/html/2606.12451#bib.bib2); Yao et al., 2023 (https://arxiv.org/html/2606.12451#bib.bib3); Qin et al., 2024a (https://arxiv.org/html/2606.12451#bib.bib4))。主流方法将工具描述编码为稠密向量,并通过近似最近邻搜索检索 top-k 候选 (Karpukhin et al., 2020 (https://arxiv.org/html/2606.12451#bib.bib5))。这种范式存在已知的局限性:小型检索编码器可能无法充分指定复杂、重叠 API 在大规模下的语义 (Wang et al., 2025 (https://arxiv.org/html/2606.12451#bib.bib1));检索到的描述仍需注入到大语言模型上下文中,这在多步智能体循环中加剧了开销;并且检索器和生成器以分离的目标进行训练,无法针对任务成功进行联合优化 (Tay et al., 2022 (https://arxiv.org/html/2606.12451#bib.bib6))。

**参数化工具检索。** Wang et al. (2025 (https://arxiv.org/html/2606.12451#bib.bib1)) 提出了 ToolGen,一种替代策略,将整个工具目录直接编码到大语言模型参数中。每个工具被分配一个唯一的 *虚拟 token*,附加到模型词汇表中,作为表示完整工具身份的扁平原子标识符(例如,<\>)。在第一阶段(记忆),模型被微调以将每个工具的元数据与其虚拟 token 关联起来。在第二阶段(检索),模型进一步在(查询 → 虚拟 token)对上微调,学习根据自然语言查询生成正确的 token。推理时,一个 *DisjunctiveTrie* (Cao et al., 2021 (https://arxiv.org/html/2606.12451#bib.bib8)) 将波束搜索约束为有效的 token 序列,保证每个输出映射到一个真实的工具。应用于 ToolBench (Qin et al., 2024b (https://arxiv.org/html/2606.12451#bib.bib7))(约 47k 个工具),这种范式在标准 ToolBench 基准上达到了超过 0.90 的召回率。

**诊断差距。** 这自然而然地引出一个问题:*参数化训练是否产生了理解其工具的模型,还是仅仅学会了将查询模式匹配到 token 标识符?*一个只学习了表层映射的模型可能在分布匹配的基准上表现良好,但一旦用户以不同的方式表述查询就会失败。然而,现有的评估并未设计来揭示这一点,原因有二。首先,ToolBench 标准评估划分(G1/G2/G3)中的查询是冗长且完全指定的,与真实用户如何表述查询不同(示例见附录 A (https://arxiv.org/html/2606.12451#A1))。其次,约束解码意味着模型只需要对通过固定 trie 的路径进行排序,而不是自由回忆工具 token,这掩盖了是否发生了真正的记忆。这在实际应用中很重要:后续的智能体微调通常需要在没有 trie 支持的情况下进行自由形式的 token 生成,未被检测到的记忆缺口是一个静默失败风险。冗长查询和约束解码共同使得区分模式匹配与真正工具知识变得困难 (Petroni et al., 2019 (https://arxiv.org/html/2606.12451#bib.bib9)),从而促使了一种更具诊断性的评估协议。

我们引入了 **ToolSense**,一个开源的大语言模型驱动的诊断框架,该框架以任何工具目录作为输入,并自动生成三个诊断基准:(1) 一个 *真实检索基准*(RRB),包含三个模糊层级的查询,反映人类用户实际编写查询的方式;(2) 一个 *MCQ 探测基准*,测试关于工具能力的辨别性事实知识;(3) 一个 *QA 探测基准*,测试关于工具属性的推理性事实知识。除了基准之外,我们还建立了一个自由形式评估协议,报告 *内化分数*(IS@k = free@k / constrained@k)作为 trie 依赖性诊断指标。将 ToolSense 应用于 ToolBench 揭示了一个惊人的差距:在标准基准上表现非常出色的配置,在真实查询上却急剧崩溃,低于非参数基线。事实探测进一步表明,第二阶段训练(负责检索提升)几乎普遍破坏了第一阶段获取的工具知识。总结来说,我们的贡献包括:
(i) ToolSense,一个开源诊断框架,可从任何工具目录自动生成 RRB、MCQ 和 QA 基准;
(ii) 公开发布的 ToolBench 诊断基准 RRB、MCQ 和 QA;
以及 (iii) 对 ToolBench 上五种参数化配置的经验诊断,揭示了决定知识-检索分离的训练选择。

## 2 背景与相关工作

**生成式与参数化检索。** Tay et al. (2022 (https://arxiv.org/html/2606.12451#bib.bib6)) 引入了可微分搜索索引(DSI),将文档 ID 编码到 Transformer 参数中,并通过约束波束搜索进行检索。Cao et al. (2021 (https://arxiv.org/html/2606.12451#bib.bib8)) 将自回归实体检索应用于知识驱动的生成。Wang et al. (2022 (https://arxiv.org/html/2606.12451#bib.bib10)) 将其扩展到稠密文档语料库。Wang et al. (2025 (https://arxiv.org/html/2606.12451#bib.bib1)) 通过虚拟 token 和两阶段训练将该范式适应于工具目录。所有这些系统都仅使用约束解码进行评估;我们的自由形式 IS 协议为这类系统引入了一种新的诊断实践。

**大语言模型中的工具学习。** Qin et al. (2024b (https://arxiv.org/html/2606.12451#bib.bib7)) 构建了 ToolBench,一个涵盖约 1.6 万个真实世界 API(约 4.7 万个工具)的基准。Patil et al. (2024 (https://arxiv.org/html/2606.12451#bib.bib15)) 微调大语言模型以通过检索增强生成工具调用。Schick et al. (2023 (https://arxiv.org/html/2606.12451#bib.bib2)) 训练大语言模型在上下文中自我插入工具调用。我们特别关注参数化工具系统的 *检索* 阶段,并询问这种检索机制是否编码了工具语义,这是一个与这些工作所研究的下游任务表现正交的问题。

**探测与可解释性。** Petroni et al. (2019 (https://arxiv.org/html/2606.12451#bib.bib9)) 引入了 LAMA,通过完形填空式查询探测预训练语言模型的事实知识。Tenney et al. (2019 (https://arxiv.org/html/2606.12451#bib.bib11)) 探测 BERT 表示中的语言结构。我们的 MCQ 和 QA 探测将此传统扩展到一个新的场景:*微调期间学习到的* token(虚拟 token),而非预训练表示。我们探测微调是否产生了真正的语义表示,还是仅仅产生了任务相关的指针。

**微调中的知识保持。** McCloskey 和 Cohen (1989 (https://arxiv.org/html/2606.12451#bib.bib12)) 指出灾难性干扰是神经网络在顺序学习新任务时的基本失效模式。Hu et al. (2022 (https://arxiv.org/html/2606.12451#bib.bib13)) 提出 LoRA,通过冻结骨干权重并学习低秩更新来缓解这一问题,从而保留预训练表示。Biderman et al. (2024 (https://arxiv.org/html/2606.12451#bib.bib14)) 经验性地表明 LoRA 比全微调保留了更多的先前任务性能。我们的工作将这条研究线扩展到参数化检索设置。

## 3 ToolSense 框架

该框架以工具目录作为输入

$$ \mathcal{C} = \bigl\{\, \tau_i = (\mathrm{name}_i,\; \mathrm{desc}_i) \,\bigr\}_{i=1}^{|\mathcal{C}|} \tag{1} $$

并自动生成三个诊断基准数据集。图 1 (https://arxiv.org/html/2606.12451#S3.F1) 展示了流程。在下面的小节中,我们详细解释基准生成方法。

> **图 1:** ToolSense 诊断框架从工具目录 $\mathcal{C}$ 生成 $\mathcal{D}_{\mathrm{RRB}}$、$\mathcal{D}_{\mathrm{MCQ}}$ 和 $\mathcal{D}_{\mathrm{QA}}$。

### 3.1 真实检索基准 (RRB)

RRB 测试检索系统是否能泛化到冗长格式查询之外,通过呈现三个模糊层级的简短、意图导向的请求。生成分为四个阶段:种子采样、难负例池构建、并行生成层级和双重验证。

**分层种子采样。** 我们不从 $\mathcal{C}$ 中为每个工具生成查询,而是按领域分层采样 $N_{\mathrm{RRB}}$ 个锚点工具,以确保广泛的目录覆盖,得到 $\mathcal{C}_{\mathrm{RRB}} \subset \mathcal{C}$,其中 $|\mathcal{C}_{\mathrm{RRB}}| = N_{\mathrm{RRB}}$。

**难负例池。** 对于每个锚点 $\tau \in \mathcal{C}_{\mathrm{RRB}}$,令 $\phi: \mathcal{C} \to \mathbb{R}^d$ 为一个句子编码器。我们通过余弦相似度检索 $K$ 个最近邻,

$$ \mathcal{H}_K(\tau) = \arg\operatorname{top-}K_{\tau' \in \mathcal{C} \setminus \{\tau\}} \langle \phi(\tau), \phi(\tau') \rangle, $$

并构建候选池 $\mathcal{P}(\tau) = \{\tau\} \cup \mathcal{H}_K(\tau)$,其中 $|\mathcal{P}(\tau)| = K+1$。该池定义了一个难负例上下文,展示给生成器,以及从中抽取真实答案 $A$ 的标签。

**并行生成层级。** 对于每个锚点,三个子流程并行运行,$t \in \{\mathrm{easy},\,\mathrm{medium},\,\mathrm{hard}\}$,每个从同一个候选池 $\mathcal{P}(\tau)$ 中生成一批 $(q, A)$ 对:

- **简单:** $|A| = 1$;一个指向唯一工具的简洁查询。
- **中等:** $|A| \in \{2, 3\}$;一个跨功能请求,确实可由 2–3 个工具满足。
- **困难:** $|A| \geq 4$;一个高层级、模糊的目标,跨越 4 个或更多工具。

生成器 LLM $\theta_{\mathrm{RRB}}$ 接收 $(\tau, \mathcal{P}(\tau), t, \mathcal{E})$,其中 $\mathcal{E} = \{\hat{q}_i^{(e)}\}_{i=1}^{n_e}$ 是少样本查询示例,用于指导意图聚焦查询生成的风格和语气。

**带反馈的双重验证。** 每个生成的批次经过两个连续的过滤器。程序化过滤器 $\mathcal{V}_{\mathrm{RRB}}(q,A,\tau,\mathcal{P}(\tau))$ 拒绝未通过两项检查中的任何一项的条目:答案必须基于池($A \subseteq \mathcal{P}(\tau)$),且任何答案工具名称不得出现在查询中($\forall \tau' \in A: \mathrm{name}(\tau') \notin q$)。通过 $\mathcal{V}_{\mathrm{RRB}}$ 的条目随后由 LLM 裁判 $\mathcal{J}_{\mathrm{RRB}}$ 根据自然性、层级符合性和标签正确性进行评分。被拒绝的条目被丢弃,产生验证后的数据集 $\mathcal{D}_{\mathrm{RRB}} = \{(q_j, A_j, t_j)\}_{j=1}^{N_{\mathrm{RRB}}}$。

### 3.2 探测基准 (MCQ 和 QA)

两个探测基准遵循相同的流程结构:采样一个工具种子集,通过 LLM 生成器生成问答对,由 LLM 裁判 $\mathcal{J}$ 进行验证,并过滤掉那些无法形成无歧义问题的条目。在所有被接受的条目中,问题仅以“此工具”指代工具,从不使用名称,因此模型必须根据虚拟 token $v_\tau$ 进行回答。

**MCQ($N_{\mathrm{MCQ}}$ 个工具)。** 对于每个 $\tau$,$\theta_{\mathrm{MCQ}}$ 生成一个关于工具功能的事实性问题 $z$,一个正确答案 $o_{y^\star}$ 和三个看似合理但错误的干扰项,得到 $\mathcal{D}_{\mathrm{MCQ}} = \{(v_{\tau_i}, z_i, \{o_k^i\}, y_i^\star)\}$。评估时,模型接收 $(v_\tau, z, \{o_k\}_{k=1}^4)$;约束解码将输出限制为选项字母 (A/B/C/D),并将预测 $\hat{y}$ 与 $y^\star \in \{0,1,2,3\}$ 进行比较。

**QA($N_{\mathrm{QA}}$ 个工具)。** 对于每个 $\tau$,$\theta_{\mathrm{QA}}$ 接收描述以及一个预先指定的目标 $b \in \{\mathrm{Yes},\mathrm{No}\}$(在工具间交替以确保标签平衡),并生成一个关于特定、可验证工具属性(例如,支持模态、领域等)的二元问题 $w$,得到 $\mathcal{D}_{\mathrm{QA}} = \{(v_{\tau_i}, w_i, b_i)\}$。评估时,模型接收 $(v_\tau, w)$;约束解码将输出限制为 Yes/No,并将 $\hat{b}$ 与 $b$ 进行比较。

### 3.3 自由形式评估与内化分数

令 $\hat{A}_c(q,k)$ 和 $\hat{A}_f(q,k)$ 分别表示在 *约束*(trie 引导)和 *自由形式*(无约束)解码下,使用波束宽度 $B$ 的波束搜索得到的 top-k 输出。约束和自由形式 Recall@k 在查询集 $\mathcal{Q}$ 上定义为

$$ R_c@k = \frac{1}{|\mathcal{Q}|} \sum_{q \in \mathcal{Q}} \mathbb{1}[A(q) \cap \hat{A}_c(q,k) \neq \emptyset] $$

相似文章

使用金丝雀工具诊断LLM智能体中的工具选择推理

arXiv cs.AI

本文引入“金丝雀工具”作为诊断探针,用于识别LLM智能体中特定的工具选择推理失败,提出了一个六类型分类法,并在8,640次任务运行中评估了八个模型,以展示能力层级差异和鲁棒性。

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。