ToolGate:面向工具增强型视觉语言代理的令牌高效预调用控制

arXiv cs.AI 论文

摘要

ToolGate 是一个轻量级的外部控制器,能够预测在视觉语言代理中是否执行或跳过感知工具调用,从而将令牌成本降至基线的64%-69%,同时保持跨域设置下的准确性。

arXiv:2606.03054v1 公告类型:新 摘要:工具增强型视觉语言代理可以通过OCR、检测、分割等工具获取外部感知证据,但执行每一个提议的工具调用成本高昂且有时并无必要。我们研究了预调用控制问题:在ReAct风格的VLM代理提出一个感知工具调用后,是应该执行该调用,还是在其输出进入上下文之前跳过它?在五个基准测试中,我们发现基准代理表现出较差的局部选择性:有益调用和有害调用的发生比例相近(11.8%对9.9%),而大多数调用不会改变直接的强制答案预测。我们引入了ToolGate,这是一个轻量级的外部控制器,能够根据轨迹文本和简单的结构特征预测执行/跳过决策。在两个Qwen3-VL骨干网络上,ToolGate将令牌成本降低至无限制ReAct基线的64%-69%,同时在跨域设置中保持平均准确性。在Qwen3-VL-30B上进行匹配域轨迹训练后,它进一步将平均准确性提升了1.65个百分点。这些结果表明,工具增强型VLM代理不仅受益于更好的感知工具,还受益于对工具输出何时值得付费的显式控制。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:42

# ToolGate: 工具增强型视觉-语言智能体的令牌高效预调用控制
来源:https://arxiv.org/html/2606.03054
刘安妮¹  宋岩²,³  陈志勋¹  龚子钦¹  余忠伟¹  王军²  ¹香港科技大学(广州)  ²伦敦大学学院  ³长三角人工智能实验室

###### 摘要

工具增强型视觉-语言智能体能够通过OCR、检测、分割等工具获取外部感知证据,但执行每一个提议的工具调用成本高昂且有时并无必要。我们研究预调用控制问题:在ReAct风格的VLM智能体提出一个感知工具调用后,是应该执行该调用,还是在其输出进入上下文之前跳过它?在五个基准测试中,我们发现基线智能体表现出较差的局部选择性:有益调用和有害调用的发生率相近(11.8%对比9.9%),而大多数调用并不会改变即时强制答案的预测。我们引入**ToolGate**,一个轻量级外部控制器,它根据轨迹文本和简单的结构性特征预测执行/跳过决策。在两个Qwen3-VL骨干模型上,ToolGate将令牌成本降低到无限制ReAct基线的64-69%,同时在跨领域设置中保持平均准确率。在Qwen3-VL-30B上使用匹配领域轨迹训练后,它进一步将平均准确率提高了1.65个百分点。这些结果表明,工具增强型VLM智能体不仅受益于更好的感知工具,也受益于对何时值得为工具输出付费的显式控制。

ToolGate: 工具增强型视觉-语言智能体的令牌高效预调用控制

## 1 引言

工具增强型智能体通过允许基础模型在推理过程中调用外部模块(包括搜索引擎、计算器、API和感知工具)来扩展它们(Yao et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib28);Schick et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib17);Lu et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib13))。在视觉-语言设置中,这种范式已被那些将VLM或语言模型规划器与OCR、检测、分割、裁剪以及其他视觉专家相结合的系统所实例化(Yang et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib27);Wu et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib24);Gupta and Kembhavi, 2023 (https://arxiv.org/html/2606.03054#bib.bib6);Surís et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib21))。这些工具之所以有用,是因为许多视觉问题所需的证据难以通过单次全局图像扫描提取:小文字可能难以辨认,相关目标可能占据微小区域,空间关系可能需要专门的感知能力。

然而,工具访问引入了一个二次决策问题。在每个推理步骤,智能体不仅需要决定*调用哪个*工具,还需要决定一个提议的调用是否值得执行。一个工具调用可以提供决定性的证据,但也可能冗余、消耗令牌、增加延迟,或向上下文中引入误导性的感知信息。因此,工具使用不仅是一个能力问题,也是一个推理时的控制问题。给定一个轨迹前缀和一个提议的感知工具调用,智能体是否应该执行这个特定的调用,还是继续而不将其输出添加到上下文中?我们将这种能力称为*局部工具调用选择性*。

我们在ReAct风格的视觉-语言智能体中研究这种现象。在五个使用Qwen3-VL-30B(Bai et al., 2025 (https://arxiv.org/html/2606.03054#bib.bib2))评估的基准测试中,基线智能体产生了15,782个标记工具调用。通过在每次调用前后插入强制答案探针,我们观察到只有11.8%的调用直接将模型预测从错误转变为正确,而9.9%的调用将其从正确转变为错误。*其余78.3%的调用在工具输出被整合后,并未改变即时的强制答案argmax。* 这并不意味着工具无用。有些调用显然有帮助:这些是智能体需要外部证据来恢复正确答案的情况。问题在于,这些调用与许多其他要么不改变答案要么使其更糟的调用混杂在一起。由于每个执行的调用都会增加工具输出令牌、交互令牌以及后续推理的额外上下文,盲目地执行所有提议的调用是低效的。这激发了一个预调用控制器的设计,该控制器保留有用的调用,但跳过那些可能只会增加成本而不改善答案的调用。

我们提出**ToolGate**,一个在每次提议的工具调用之前运行的轻量级外部控制器。给定当前轨迹和待处理的调用,ToolGate仅根据到目前为止的交互历史做出决定:问题、先前的推理、先前的工具调用和输出、待处理的工具名称和参数,以及简单的元数据如步骤索引和工具类型。它不访问隐藏状态、图像特征、解码对数概率或工具输出,也不修改VLM、提示词或工具栈。因此,ToolGate是一个黑盒推理时控制器:其作用不是直接改善感知,而是决定在当前轨迹中支付额外的感知工具输出是否值得。

我们的主要实验发现是,预调用门控能够大幅减少工具使用和令牌成本,同时保持准确率。在两个Qwen3-VL骨干模型上,ToolGate将平均令牌成本降低到无限制ReAct基线的64-69%。在跨领域训练设置下(门控器在不包含五个评估基准轨迹的数据上训练),ToolGate带来了微小的准确率变化但巨大的效率提升;在Qwen3-VL-235B-FP8上,它在保持平均准确率的同时移除了大部分工具调用。在Qwen3-VL-30B上使用匹配领域轨迹训练后,ToolGate进一步将平均准确率提高了1.65个百分点,同时令牌成本降低了33%。因此,我们主要将ToolGate视为一种保持准确率的成本控制机制,当基线策略具有足够的提升空间并且目标领域轨迹可用时,会出现准确率的提升。

我们的贡献有三点:(1) 我们诊断了ReAct风格VLM智能体中的一个局部选择性问题,表明在基线策略下,有用的工具调用是稀疏的,并且与许多不变或有害的调用混杂在一起。(2) 我们引入了**ToolGate**,一个轻量级的外部预调用控制器,在每次提议的感知工具调用的输出进入智能体上下文之前决定是否执行该调用。(3) 我们展示了ToolGate在跨领域设置中大幅降低了令牌成本和执行的工具调用数量,同时保持了平均准确率;在Qwen3-VL-30B上使用匹配领域轨迹训练后,它还提高了最终答案的准确率。代码和配置可在https://github.com/iamlilAJ/toolgate获取。

## 2 相关工作

#### 工具增强型语言和视觉-语言智能体。

近期工作通过外部工具(如搜索引擎、计算器、代码解释器、视觉模块和API)来增强语言模型(Yao et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib28);Schick et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib17);Lu et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib13))。在视觉-语言设置中,系统将VLM或语言模型规划器与OCR、检测、分割、裁剪以及其他视觉专家相结合(Yang et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib27);Wu et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib24);Gupta and Kembhavi, 2023 (https://arxiv.org/html/2606.03054#bib.bib6);Surís et al., 2023 (https://arxiv.org/html/2606.03054#bib.bib21))。大多数先前的工作侧重于让智能体选择工具、格式化调用、遵循工具使用协议,或决定一个调用是否合适。我们的重点是互补的:我们将*提议*一个工具调用与估计执行它的*效用*分开。ToolGate不选择调用哪个工具;给定一个已由视觉-语言智能体提议的调用,它预测执行该调用是否可能为当前轨迹提供正的边际价值。

#### 工具使用失败与推理时控制。

近期工作质疑了工具使用总是有益的假设。Zhang等人 (2026 (https://arxiv.org/html/2606.03054#bib.bib30))识别了LLM智能体中的工具使用税,将性能损失分解为提示格式化成本、协议开销和工具执行增益;而Sun等人 (2026 (https://arxiv.org/html/2606.03054#bib.bib20))表明,工具的必需性可以从预生成的隐藏状态中解码,并用于引导工具使用。这些工作与更广泛的推理时控制方法相关,这些方法调整计算,包括减少不必要的推理令牌或在额外思考不太可能有助于解决问题时缩短思维链痕迹。ToolGate研究了一个互补的粒度:在一个视觉-语言规划器已经提出了一个具体的感知工具调用之后,它决定在该调用的输出进入上下文之前是否应该执行这个特定的调用。因此,我们的重点是局部的预调用效用估计,而不是任务级别的工具必需性、终止控制或推理长度控制(Liu et al., 2026 (https://arxiv.org/html/2606.03054#bib.bib11);Yu et al., 2026 (https://arxiv.org/html/2606.03054#bib.bib29))。

#### 选择性计算与路由。

ToolGate也与选择性计算和模型路由相关,这些方法决定何时额外计算是值得的(Graves, 2016 (https://arxiv.org/html/2606.03054#bib.bib5);Elbayad et al., 2019 (https://arxiv.org/html/2606.03054#bib.bib4))。我们的设置在粒度上有所不同:决策不是哪个模型应该处理输入,而是智能体轨迹内的一个特定提议工具调用是否应该被执行。因为执行调用会改变后续推理可用的证据,预调用门控更接近于选择性证据获取,而不是标准的路由或提前退出。

#### 信息价值与主动感知。

工具调用决策可以被视为一个信息价值问题:一个智能体仅当最终性能的预期增益超过其成本时才应寻求外部证据(Howard, 1966 (https://arxiv.org/html/2606.03054#bib.bib7))。这使工具使用与主动感知和实验设计联系起来,在这些领域中,观察是在资源限制下自适应选择的(Bajcsy, 1988 (https://arxiv.org/html/2606.03054#bib.bib3);Aloimonos et al., 1988 (https://arxiv.org/html/2606.03054#bib.bib1);Liu et al., 2026 (https://arxiv.org/html/2606.03054#bib.bib11))。与经典设置不同,VLM智能体轨迹只揭示一个结果:在一个提议调用之后,我们看到要么是执行的轨迹,要么是跳过的轨迹,但不能同时看到两者。因此,精确的反事实信息价值无法从单次执行中获取。我们转而使用一个轨迹级别的代理来训练ToolGate,以识别决定性调用,并在智能体循环中在线评估它。

## 3 工具使用中的局部选择性失败

工具增强型视觉-语言模型(VLM)智能体通常仅通过最终答案准确率来评估;然而,这个聚合指标掩盖了构成每个推理轨迹的一系列局部工具使用决策。在这项工作中,我们研究*局部工具调用选择性*:在执行一个提议的工具调用之前,智能体能否可靠地区分那些可能有益的调用和那些冗余或潜在有害的调用?

我们的目的并非论证感知工具是不必要的。相反,我们询问基线ReAct策略是否选择性地使用它们:当需要文本证据时应调用OCR,当定位重要时应调用检测,但当当前轨迹已包含足够证据时,应避免为额外的工具输出付费。

除非另有说明,所有诊断评估均使用Qwen3-VL-30B ReAct智能体及与我们主要实验相同的工具套件进行。强制答案探针仅用于分析目的:它们捕捉智能体在工具调用前后即时的答案偏好,但不会整合到部署智能体的行为中。

### 3.1 大多数提议的调用提供的即时价值有限

我们在五个评估基准上运行基线ReAct智能体,并记录每个执行工具调用前后瞬间的强制答案预测。在每个点,我们应用一个*强制答案探针*,要求智能体仅基于当前可用的轨迹上下文选择一个确切的答案选项。我们提取答案选项上的argmax,并比较工具调用前后的预测。这将每个调用分类为四种转换类型:*有益*调用将强制答案argmax从错误翻转为正确;*有害*调用将其从正确翻转为错误;*不变-正确*调用保持正确的argmax不变;*不变-错误*调用保持错误的argmax不变。

参见标题图1:Qwen3-VL-30B上的局部工具调用选择性。(a) 五个基准测试中基线工具调用的即时强制答案转换分布。有益调用将强制答案预测从错误翻转为正确,而有害调用将其从正确翻转为错误。大多数调用保持即时强制答案预测不变,并且有益和有害转换的发生率相近。(b) ToolGate应用前后每个情节的平均执行工具调用次数,按相同的转换类型分解。ToolGate将每个情节的执行调用次数从2.73减少到1.02,主要通过过滤那些即时强制答案预测保持不变的调用。图1 (https://arxiv.org/html/2606.03054#S3.F1)(a) 显示有用调用存在但稀疏。总体而言,只有11.8%的调用将错误的强制答案预测转变为正确的,而9.9%的调用将正确的预测转变为错误的。剩余的78.3%在工具输出集成后并未立即改变强制答案argmax。因此,基线策略执行了许多没有即时可测量影响的调用,而正向和负向翻转的发生率相近。这表明了一个局部选择性问题:问题不在于工具能否提供帮助,而在于智能体能否识别何时某个特定的提议调用是值得执行的。

图1 (https://arxiv.org/html/2606.03054#S3.F1)(b) 预览了ToolGate对此决策的影响。ToolGate将每个情节的执行调用次数从2.73减少到1.02,其中绝对值最大的减少来自不变转换。这支持将ToolGate解释为一种预调用成本控制机制,而非全局工具移除策略:它阻止许多低价值的工具输出进入上下文,同时保留一个较小的执行调用集。我们在第6节 (https://arxiv.org/html/2606.03054#S6)评估由此产生的准确率-成本权衡。

### 3.2 错误的工具输出可能破坏正确的信念

为什么工具调用会有害?一种可能的机制是过度信任:一旦工具输出进入轨迹,智能体可能将其视为比自己的视觉解释更强的证据。我们检查了自动注释的1000个采样调用的诊断子集,仅限于802个VLM注释器判断工具输出可针对图像验证的调用。当工具输出错误且智能体的预调用强制答案预测已经正确时,后调用预测在13.9%的情况下变为错误(43/309)。这表明一些有害调用的产生是因为智能体用有缺陷的工具输出覆盖了正确的视觉信念。

此分析是诊断性的,而非

相似文章

TACO:面向智能体工具使用的工具增强信用优化

Hugging Face Daily Papers

TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。

Contract2Tool:学习前提与效果以实现可靠的工具增强型LLM代理

arXiv cs.AI

本文介绍了Contract2Tool,一个从工具元数据、文档和执行轨迹中自动推断轻量级工具契约(前提条件、效果、风险)的框架,为LLM代理实现可靠的因果工具过滤。实验表明,学习到的契约在下游多步骤代理任务中达到了接近黄金契约的性能,同时显著减少了token使用量。

LLM代理已经知道何时调用工具——甚至无需推理

Hugging Face Daily Papers

本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。

ToolCUA:迈向计算机使用代理的 GUI-工具路径编排优化

Hugging Face Daily Papers

ToolCUA 是一个全新的代理框架,通过分阶段训练和强化学习,优化计算机使用代理的 GUI-工具路径选择。它通过在 GUI 操作和高级工具调用之间进行有效交替,在 OSWorld-MCP 上达到了最先进的性能。

Switchcraft:用于智能体工具调用的 AI 模型路由

arXiv cs.AI

本文介绍了 Switchcraft,这是首个专为智能体工具调用优化的 AI 模型路由器,旨在降低推理成本。通过使用轻量级的 DistilBERT 分类器,它在保持高工具使用准确性的同时,实现了显著的成本节约。