工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
摘要
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。
arXiv:2605.19852v1 公告类型:新
摘要:工具增强推理已成为提升多模态大语言模型(MLLMs)推理能力的一个有前景的方向。然而,现有研究主要侧重于使模型能够进行工具调用,而忽视了调用工具的必要性。我们认为工具使用并非总是有益的,因为多余或不恰当的调用会大大增加推理开销,甚至误导模型预测。为解决这一问题,我们引入了 AutoTool,一种根据每个查询特征自适应决定是否调用工具的模型。在强化学习框架内,我们设计了一种显式的双模式推理策略,结合特定于模式的奖励函数,引导模型生成准确响应。此外,为防止过早偏向单一推理模式,AutoTool 在训练过程中联合探索并平衡工具辅助推理和文本中心推理,并在后期促进自由探索。大量实验表明,AutoTool 表现出卓越的性能和高效率,在 V* 基准测试上相比基础模型准确率提升 21.8%,在 POPE 基准测试上相比现有工具增强方法效率提升 44.9%。代码见 https://github.com/MQinghe/AutoTool。
查看缓存全文
缓存时间: 2026/05/20 08:27
# 工具总是有益的吗?自适应调用工具实现双模式多模态大语言模型推理 来源:https://arxiv.org/html/2605.19852 ###### 摘要 工具增强推理已成为增强多模态大语言模型(MLLMs)推理能力的一个有前景的方向。然而,现有研究主要关注让模型学会调用工具,却忽视了调用工具的必要性。我们认为,工具的使用并不总是有益的,因为冗余或不恰当的调用会大大增加推理开销,甚至误导模型预测。为了解决这个问题,我们引入了 AutoTool,这是一种能根据每个查询的特点自适应决定是否调用工具的模型。在强化学习框架内,我们设计了一种显式的双模式推理策略,并针对不同模式设计了特定的奖励函数,以引导模型产生准确的响应。此外,为了防止过早偏向单一推理模式,AutoTool 在整个训练过程中联合探索并平衡工具辅助推理和纯文本推理,并在后期阶段促进自由探索。大量实验表明,AutoTool 表现出卓越的性能和高效率:在 V\* 基准测试上比基础模型准确率提升 21.8%,在 POPE 基准测试上比现有工具增强方法效率提升 44.9%。代码可在 https://github.com/MQinghe/AutoTool 获取。 Machine Learning, ICML ## 1 引言 通过将复杂问题分解为一系列推理步骤,思维链(CoT)提示(Wei et al., 2022 (https://arxiv.org/html/2605.19852#bib.bib10); Kojima et al., 2022 (https://arxiv.org/html/2605.19852#bib.bib11))赋予了多模态大语言模型(MLLMs)(Team et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib12); Liu et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib14); Wang et al., 2024b (https://arxiv.org/html/2605.19852#bib.bib13); Bai et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib25))更强的推理能力。然而,现有的大多数方法都遵循大语言模型(LLMs)(Achiam et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib28); Dubey et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib27); Guo et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib21))的文本推理范式,使得当前 MLLMs 受限于语言偏差,难以有效利用多模态信息。多模态 CoT(MCoT)提示(Zhang et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib31); Wang et al., 2025a (https://arxiv.org/html/2605.19852#bib.bib32)),以 OpenAI o3 的"用图像思考"方法(OpenAI, 2025 (https://arxiv.org/html/2605.19852#bib.bib29))为例,将多模态语境注入推理过程,以增强视觉线索和跨模态交互。 参考说明图1:(a, b) 触发或不触发放大工具的典型查询示例,说明工具使用并非总是必要,而 AutoTool 能在工具有益时自适应调用。(c, d) 训练期间工具增强推理轨迹的比例,以及我们的 AutoTool 与当前最先进的 DeepEyes (Zheng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib33)) 在训练和推理时间成本上的比较。 在 MCoT 中,视觉信息通常来自外部工具,例如额外的搜索引擎 (Fan et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib34); Komeili et al., 2021 (https://arxiv.org/html/2605.19852#bib.bib35))、多个视觉模型 (Ma et al., 2025c (https://arxiv.org/html/2605.19852#bib.bib36); Qi et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib37)) 或图像处理方法 (Su et al., 2025b (https://arxiv.org/html/2605.19852#bib.bib38); Zheng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib33))。最近强化学习的进展 (Shao et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib39); Guo et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib21); Chen et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib40)) 使得模型能够以更具成本效益和更灵活的方式获得工具使用技能 (Su et al., 2025b (https://arxiv.org/html/2605.19852#bib.bib38); Zheng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib33); Su et al., 2025a (https://arxiv.org/html/2605.19852#bib.bib59))。虽然 MCoT 在多个基准测试上展现出比纯文本 CoT 更强的推理能力,但它也引入了两个主要挑战。 第一个挑战在于训练和推理成本显著增加。现有的工具增强推理模型,如 OpenThinkIMG (Su et al., 2025b (https://arxiv.org/html/2605.19852#bib.bib38)) 和 DeepEyes (Zheng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib33)),通常依赖于固定的工具调用编排或不充分的奖励设计。因此,它们**隐式地**专注于学习如何正确调用工具并生成准确答案,而忽视了工具使用是否真正必要。如图1 (https://arxiv.org/html/2605.19852#S1.F1)(c) 和图1 (https://arxiv.org/html/2605.19852#S1.F1)(d) 所示,以 DeepEyes (Zheng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib33)) 为例,它不论任务难度如何,都持续鼓励工具调用。即使对于简单查询,模型也倾向于进行不必要的多轮推理,大大增加了训练和推理过程中的计算开销。因此,DeepEyes 需要 44.9 小时的训练时间,比自适应工具调用多出 20.3%,这表明冗余的工具使用严重拖慢了推理过程。 此外,错误的工具调用可能会干扰推理。如图1 (https://arxiv.org/html/2605.19852#S1.F1)(b) 所示,在回答关于人和车空间关系的问题时,模型应该依赖全局理解,此时放大工具的调用是不必要的。然而,DeepEyes 错误地调用工具,只聚焦于车辆区域,而不是人和车的联合区域,引入了冗余的视觉信息,分散了推理过程,最终导致幻觉响应。在这种情况下,LLMs 的自回归特性使得频繁的工具调用问题尤为严重,因为它们会放大无关的视觉线索并导致错误累积,进一步加剧推理分散和幻觉。在我们看来,处理多模态查询时,一个理想的模型应该在调用工具之前**仔细判断是否需要工具辅助**。以放大操作为例,直观上,如果一个问题需要仔细检查或验证细粒度的视觉细节,那么放大工具就变得至关重要。如图1 (https://arxiv.org/html/2605.19852#S1.F1)(a) 所示,当任务涉及在多个候选对象中识别特定物体时,放大目标区域能显著提高正确答案的可能性。相反,如图1 (https://arxiv.org/html/2605.19852#S1.F1)(b) 所示,当问题涉及全局理解、整体布局推理或目标区域已经足够清晰时,调用放大工具带来的收益微乎其微,甚至可能引入不必要的干扰。 为了解决现有方法过度强调工具使用的问题,我们引入了 **AutoTool**,它使模型能够自适应地决定何时进行"用图像思考"的推理,重新审视"工具总是有益的"这一常见观点。通过两个特殊标记 `<activate>` 和 `<skip>` **显式地**控制工具使用,AutoTool 采用双推理模式:对复杂问题利用工具,同时认识到简单查询无需工具辅助即可解决。这种范式提高了训练和推理效率,并减少了幻觉响应。我们不依赖精心策划的 SFT 数据进行冷启动训练,而是采用端到端的强化学习框架,以简单而有效的方式鼓励模型充分探索两种推理模式。在这种显式双模式范式下,我们设计了不同的奖励函数来评估不同推理模式下的推理轨迹,我们称之为**模式特定策略优化(MSPO)**。对于 `<activate>` 模式,模型被训练为准确使用工具并提供正确答案。与以往主要强调工具调用的方法 (Su et al., 2025b (https://arxiv.org/html/2605.19852#bib.bib38); Zheng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib33)) 不同,我们对模型调用工具但给出错误答案的情况进行惩罚,从而减少不必要或无效的工具操作。对于 `<skip>` 模式,模型完全依赖其内部推理来生成正确答案。 然而,学习掌握**双推理模式**并非易事。由于基础模型固有的推理偏差,策略模型往往偏好 `<skip>` 模式,因为该模式更容易获得更高奖励,导致 `<activate>` 模式探索不足。为了缓解这种不平衡,我们提出了一种**自适应模式平衡(AMB)**策略,动态调整奖励系数以控制两种模式的频率,确保两者都得到充分探索。在训练后期,约束被放宽,允许模型自由决定其偏好模式。 我们的贡献可总结如下: - • 我们分析了工具辅助推理对 MLLMs 的利弊。虽然工具调用可以增强推理能力,但盲目鼓励工具使用会增加训练和推理成本,并可能引入分散注意力或冗余的信息。 - • 我们设计了模式特定策略优化(MSPO),针对不同的推理模式设置不同的优化目标,使模型能够学习是否使用工具的自适应推理。 - • 我们提出了自适应模式平衡(AMB),在整个训练过程中自适应地动态调整两种模式的频率,以确保双推理模式得到充分探索。 在多个多模态基准测试上的大量实验表明,AutoTool 实现了卓越的推理能力和高效率。 ## 2 相关工作 参考说明图2:AutoTool 训练框架示意图。给定一个多模态问题,策略模型首先决定后续推理过程是否需要工具调用。对于每批生成的推理轨迹,通过模式特定策略优化(MSPO)应用不同的奖励函数来评估不同推理模式下的轨迹,并通过自适应模式平衡(AMB)策略估计工具调用的奖励系数。模型通过 GRPO 进行优化。 ### 2.1 多模态大语言模型 多模态大语言模型(MLLMs)的出现 (Liu et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib14); Team et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib12); Hurst et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib67); Bai et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib25); Fa et al., 2026 (https://arxiv.org/html/2605.19852#bib.bib91); Li et al., 2026 (https://arxiv.org/html/2605.19852#bib.bib92))标志着人工智能的一个重要里程碑,并极大地促进了各种应用领域的发展 (Ma et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib93), 2025a (https://arxiv.org/html/2605.19852#bib.bib94), 2025b (https://arxiv.org/html/2605.19852#bib.bib95); Duan et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib96); Yang et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib97); Wang et al., 2025c (https://arxiv.org/html/2605.19852#bib.bib98))。早期的研究如 LLaVA (Liu et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib14), 2024 (https://arxiv.org/html/2605.19852#bib.bib63))、BLIP (Li et al., 2022 (https://arxiv.org/html/2605.19852#bib.bib64), 2023a (https://arxiv.org/html/2605.19852#bib.bib65)) 和 Qwen-VL (Bai et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib66); Wang et al., 2024b (https://arxiv.org/html/2605.19852#bib.bib13); Bai et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib25))采用模块化架构,将预训练的视觉编码器(例如 CLIP-ViT (Cherti et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib68); Radford et al., 2021 (https://arxiv.org/html/2605.19852#bib.bib69))、InternViT (Chen et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib70)))与 LLMs 配对,为 MLLMs 的发展奠定了基础。这些模型通常涉及大规模的多模态对齐训练,然后进行指令微调以适应任务。后续的研究如 Flamingo (Alayrac et al., 2022 (https://arxiv.org/html/2605.19852#bib.bib71))和 Cambrian-1 (Tong et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib72))集成了多个编码器以获得更丰富的视觉表示,而 EVE (Diao et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib73))、MonoInternVL (Luo et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib74))和 SAIL (Lei et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib75))则追求端到端架构,在统一的 Transformer 中处理原始图像块和文本标记。最近,强化学习进一步推进了思维链(CoT)推理 (Shao et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib39); Guo et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib21); Chen et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib40)),但大多数方法仍然以文本为中心 (Fan et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib76); Yao et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib77)),限制了模型对视觉内容的理解。为了解决这个问题,我们提出对复杂问题自适应地进行工具辅助放大推理,以更深入地利用视觉信息并提供更具可解释性的答案。 ### 2.2 MLLMs 中的工具增强推理 MLLMs 的多模态信息处理能力通过多模态思维链(MCoT)推理实现了类似人类的"用图像思考" (Zhang et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib31); Wang et al., 2025a (https://arxiv.org/html/2605.19852#bib.bib32); Su et al., 2025c (https://arxiv.org/html/2605.19852#bib.bib30); Zheng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib33); OpenAI, 2025 (https://arxiv.org/html/2605.19852#bib.bib29))。最近的研究如 Visual Sketchpad (Hu et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib78))、OpenThinkIMG (Su et al., 2025b (https://arxiv.org/html/2605.19852#bib.bib38))和 Thyme (Zhang et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib31))为模型配备了规划和编排能力,利用各种外部工具,例如语义分割 (Kirillov et al., 2023 (https://arxiv.org/html/2605.19852#bib.bib79); Ravi et al., 2024 (https://arxiv.org/html/2605.19852#bib.bib80))、OCR 和深度估计 (Yang et al., 2024b (https://arxiv.org/html/2605.19852#bib.bib81), c (https://arxiv.org/html/2605.19852#bib.bib82)),将丰富的视觉线索注入推理过程。除了显式的工具使用,像 BAGEL (Deng et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib83))、Visual Planning (Xu et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib84))和 GoT (Fang et al., 2025 (https://arxiv.org/html/2605.19852#bib.bib9))等方法统一了生成和推理,从上下文语义中生成新的显式或隐式视觉状态,以促进后续的推理步骤。目前获取工具使用能力的方法通常分为
相似文章
LLM代理已经知道何时调用工具——甚至无需推理
本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。
通过工具监督强化学习实现视觉推理
提出 ToolsRL,一个两阶段强化学习框架,教多模态大模型使用简单视觉工具完成复杂视觉推理任务。
工具碍事:不必要工具可用性对LLM回答的影响
本文研究不必要外部工具的可用性如何影响大型语言模型在不需要这些工具的任务上的表现。研究揭示了正确回答率的显著下降,并提出了一种系统指令作为缓解策略。
模型自适应工具必要性揭示LLM工具使用中的知行差距
本文提出了一种模型自适应的工具必要性定义,揭示了模型应该使用工具与实际使用工具之间的显著不匹配。作者将工具使用分解为认知和行动两个阶段,发现大多数错误发生在将识别转化为行动的过程中,识别出LLM工具使用中的'知行差距'。
何时信任工具?工具集成数学推理的自适应工具信任校准
本文介绍了自适应工具信任校准(ATTC)框架,该框架通过使工具集成推理模型能够根据代码置信度得分自适应地决定是否相信或忽视工具结果,从而改进了这些模型。该方法解决了模型错误地忽视正确工具输出的"工具被忽视"问题,在多个模型和数据集上实现了4.1%-7.5%的性能提升。