虚假工具使用:当 RL 智能体学习错误的行动原因时
摘要
本文研究了强化学习如何导致 LLM 智能体学习基于表面线索而非任务需求的虚假工具使用策略,并引入了一种密集奖励方法来缓解这一问题。
arXiv:2609.16268v1 公告类型:新
摘要:大型语言模型(LLM)智能体越来越多地将自然语言推理与外部工具(如网络搜索和代码执行)交织在一起。这些工具使用策略通常通过强化学习(RL)进行优化,这可能会放大训练数据中的虚假相关性。在本工作中,我们研究了 RL 训练的智能体何时以及为何学习捷径工具选择策略:基于表面提示线索而非真实任务需求调用工具。我们构建了结合事实问答和数学推理任务的受控合成环境,并在训练中注入与特定工具强烈相关但对工具必要性因果无关的线索。在反事实评估中,当线索存在但相关工具不需要时,智能体表现出显著的捷径行为,虚假工具调用率增加高达 39%。然而,捷径形成并非普遍:在我们测试的条件下,它仅在智能体已经学会可靠使用目标工具时出现,表明任务能力,而非仅仅是数据集不平衡,是捷径学习的关键因素。交换线索分析进一步表明,线索与工具之间的语义对齐显著放大了这一效应。为了缓解这些失败,我们引入了一种密集的决策级奖励,其中 LLM 评估器评估每个工具调用的必要性。这种工具必要性奖励有效抑制了线索驱动的工具使用,同时保持任务性能,为提高 LLM 智能体工具使用策略的鲁棒性提供了实用方法。
查看缓存全文
缓存时间: 2026/09/16 08:44
# 虚假工具使用:当强化学习智能体学错行动缘由 来源:https://arxiv.org/html/2609.16268 Yiwei Yang¹,*, Haoxiang Zhang²,*, Bingbing Wen¹, Yao Lu¹, Yuchen Wu¹, Lei Zhang², Julian McAuley², Pan Lu³, Bill Howe¹ ¹华盛顿大学 ²加州大学圣地亚哥分校 ³斯坦福大学 [email protected] / [email protected] / [email protected] / [email protected] / [email protected] / [email protected] / [email protected] / [email protected] / [email protected] ###### 摘要 大语言模型(LLM)智能体日益将自然语言推理与外部工具(如网页搜索和代码执行)相结合。这些工具使用策略通常通过强化学习(RL)进行优化,而该过程可能放大训练数据中的虚假关联。本研究聚焦于RL训练的智能体何时以及为何会学习捷径工具选择策略——即基于表面线索而非实际任务需求来调用工具。我们构建了结合事实问答与数学推理任务的受控合成环境,并在训练时注入与特定工具强相关但对工具必要性无因果影响的线索。在反事实评估中(线索存在但相关工具非必需),智能体表现出显著的捷径行为,虚假工具调用率最高增加39%。然而,捷径形成并非普遍现象:在我们测试的条件下,它仅当智能体已学会可靠使用目标工具时出现,表明任务能力(而非单纯的数据不平衡)是捷径学习的关键因素。线索交换分析进一步显示,线索与工具间的语义对齐会显著放大此效应。为缓解此类问题,我们引入了一种密集的决策级奖励机制,由LLM评判器评估每次工具调用的必要性。这种工具必要性奖励能有效抑制基于线索的工具使用,同时保持任务性能,为提升LLM智能体工具使用策略的鲁棒性提供了可行方案。 11脚注:同等贡献。 ## 1 引言 外部工具(如网页搜索和代码解释器)的集成已将大语言模型(LLMs)从静态文本生成器转变为能够进行序贯决策的交互式智能体(Yao等人, 2022 (https://arxiv.org/html/2609.16268#bib.bib11); Press等人, 2023 (https://arxiv.org/html/2609.16268#bib.bib12); Paranjape等人, 2023 (https://arxiv.org/html/2609.16268#bib.bib13); Gao等人, 2023 (https://arxiv.org/html/2609.16268#bib.bib14))。智能体行为主要通过强化学习(RL)进行优化(Feng等人, 2025 (https://arxiv.org/html/2609.16268#bib.bib20); Jin等人, 2025 (https://arxiv.org/html/2609.16268#bib.bib18); Jiang等人, 2025 (https://arxiv.org/html/2609.16268#bib.bib29); Li等人, 2025b (https://arxiv.org/html/2609.16268#bib.bib21); Li等人, 2025c (https://arxiv.org/html/2609.16268#bib.bib30)),该训练使智能体通过学习何时调用每个工具来最大化任务奖励。然而,这一优化过程引入了一个微妙的漏洞:智能体可能未学习工具必要性的内在任务要求,而是利用在训练中与高奖励存在虚假关联的表面提示特征。这种失败模式不同于更常见的低效或过度工具使用问题。我们则专注于**基于线索的虚假工具选择**,即智能体调用工具并非因为任务需要,而是因为表面提示特征(如格式标签)在训练中与该工具产生了虚假关联。关键在于,这种捷径操作在中间策略决策层面(调用哪个工具),而非最终预测层面(产生什么答案)。 在监督学习环境中,捷径学习通常表现为对单个样本的错误预测(Liu等人, 2021 (https://arxiv.org/html/2609.16268#bib.bib2); Geirhos等人, 2020 (https://arxiv.org/html/2609.16268#bib.bib3); Gururangan等人, 2018 (https://arxiv.org/html/2609.16268#bib.bib1))。相比之下,对于RL训练的智能体,其影响可能更难检测:不必要的工具调用未必会降低最终答案质量。例如,智能体可能调用搜索、忽略结果,但仍能生成正确回答。因此,这些虚假行为可能在标准评估协议下(仅关注最终答案正确性)持续存在而不被察觉。 我们研究了这一问题,并发现了一个令人不安的不对称性:**捷径漏洞与任务能力密切相关**。在实验中,虚假的线索-工具关联仅针对智能体已学会可靠使用的工具形成,表明提升智能体能力可能同时增加其对捷径学习的易感性。 为探究捷径何时及为何产生,我们构建了结合事实问答(NQ)和数学推理(DeepMath)任务的受控合成环境,并在训练时注入与特定工具频繁共现但与工具必要性无因果关系的线索。通过在反事实样本(线索存在但相关工具非必需)上评估智能体,我们得以区分基于线索的工具选择与基于任务的工具选择。 我们的主要贡献与结论如下: - **我们形式化并操作化了虚假工具使用**。我们将工具虚假关联定义为:线索导致智能体选择功能不恰当工具的概率膨胀(定义1 (https://arxiv.org/html/2609.16268#Thmdefinition1)),并通过反事实评估组操作化,测量线索存在对工具调用率的因果效应(ΔToolY−N)。 - **捷径形成与任务能力强烈耦合,而非仅取决于组别不平衡**。搜索语义线索在数学任务上诱发虚假搜索调用(最高+39.2%),而代码语义线索尽管存在相同的组别不平衡,却未产生类似效应。这种不对称性与学习进度差异相符:智能体学会了搜索任务但未掌握代码任务。在我们测试的线索中,捷径仅针对掌握良好的工具形成。 - **线索与工具间的语义对齐会放大效应**。线索交换实验表明,将代码语义线索与掌握良好的事实任务配对,仅产生边际性的虚假工具使用(ΔSearch≤3.5%),远低于语义对齐线索高达39.2%的效果。任务能力促成捷径形成,而语义对齐调节其强度。 - **密集工具必要性奖励可缓解捷径**。LLM评判器评估每次工具调用是否必要,提供独立于表面线索的决策级反馈。该奖励在不牺牲任务准确性的前提下抑制了虚假工具使用。 这些结果表明,标准任务奖励RL不足以产生稳健的工具使用策略:随着智能体在任务上表现提升,它们越易受虚假线索-工具关联的影响。解决此问题需对工具选择决策本身进行显式监督,而非仅依赖基于结果的奖励。 尽管本研究在旨在隔离捷径形成机制的受控合成环境中进行,但它揭示了RL训练智能体中一个具体且此前未充分探索的失败模式。我们希望该框架能促进工具使用鲁棒性的系统性研究,并推动未来在更现实训练环境中的工作。 参考图例 图1:工具使用RL智能体捷径形成概述。(A)训练期间,事实问题(NQ)与搜索语义线索配对,并通常通过网页搜索解决;数学问题(DeepMath)则需要Python解释器。智能体学习了预期的工具-任务关联,但也捕捉到线索与搜索工具之间的虚假关联。(B)测试时,当相同线索附加到数学问题(反事实评估)时,智能体调用搜索工具,而该任务实际需要代码执行。线索驱动了工具选择,取代了真正的任务推理。 ## 2 问题形式化 ### 2.1 虚假关联 我们基于Sagawa等人(2019)(https://arxiv.org/html/2609.16268#bib.bib4)的组鲁棒性框架构建。设每个输入表示为 x=(xc, a),其中 xc 表示因果特征,a∈A 为与标签 y∈Y 在训练分布中相关但与任务无因果关系的虚假属性。组定义为 G=Y×A;标准经验风险最小化(ERM)最小化平均风险 Ravg(θ),即使模型依赖捷径 a→y,该风险也可能较低。最坏情况组风险 Rmax(θ)=maxg∈G Rg(θ) 及其差距 Δspurious=Rmax−Ravg 量化了这种依赖性。 ### 2.2 工具选择中的虚假关联 我们将此框架扩展到工具使用智能体,其中虚假关联体现在中间决策(工具选择)而非最终预测中。 #### 设置 给定输入查询 x=(xc, a),智能体根据其策略 πθ(T|x) 选择工具 T∈T,并在执行后获得二元奖励 R∈{0,1}。期望奖励分解为: P(R=1|x)=∑_{T∈T} πθ(T|x) P(R=1|x,T), 其中 P(R=1|x,T) 是工具 T 对该任务的**功能效用**。 #### 定义 工具使用捷径的关键特性是虚假工具调用不一定导致任务失败:智能体可能调用不必要的搜索、忽略结果,但仍能产生正确答案。这意味着即使在仅评估最终答案正确性的奖励信号下,捷径也可能持续存在。我们通过以下定义捕捉这一点。 ###### 定义1(工具虚假关联) 策略 πθ 对工具 Ts 和属性 a 表现出虚假关联,若 a 的存在使选择 Ts 的概率膨胀,超过仅凭任务相关特征所能预期的水平: πθ(Ts | xc, a) ≫ πθ(Ts | xc), 且 Ts 对底层问题的任务性能无贡献——即使用 Ts 相比于不使用它并无优势: P(R=1 | xc, Ts) ≤ P(R=1 | xc, T≠Ts)。 第二个条件替代了更严格的“虚假工具近零效用”要求。实践中,不必要的工具调用(例如在数学题上进行网页搜索)可能不会主动损害奖励(智能体可丢弃结果),但也无帮助。该定义针对这种情况:工具因线索而非因其有用被选择。 #### 操作化 我们使用**反事实评估组**(第3节 (https://arxiv.org/html/2609.16268#S3))衡量虚假属性对工具选择的影响:对于每个问题 xc,我们构建一个线索存在变体 (xc, a) 和线索缺失变体 xc,并计算 ΔToolY−N = π̂θ(Ts | xc, a) − π̂θ(Ts | xc), 其中 π̂θ 表示经验工具选择率。在 Ts 非必需的任务上,正的 ΔToolY−N 表明存在与定义1一致的基于线索的工具选择。这是本文衡量捷径强度的主要指标。 ## 3 合成数据集 我们构建了受控合成数据集,以研究RL智能体是否会为工具选择发展出捷径策略。设计优先考虑实验控制而非规模:通过固定数据集组成,仅改变注入的线索,我们可以将工具选择行为的差异归因于线索,而非训练分布的混杂因素。 ### 3.1 训练集构建 我们的构建基于通常需要不同工具的两个来源:Natural Questions (NQ) Kwiatkowski等人(2019)(https://arxiv.org/html/2609.16268#bib.bib36)(适合网页搜索)和 DeepMath-103k He等人(2025)(https://arxiv.org/html/2609.16268#bib.bib35)(适合Python解释器进行符号或数值计算)。我们从每个来源采样500个问题,得到一个包含1000个样本的平衡训练集。此规模足以使所研究的捷径效应可靠出现(第5节 (https://arxiv.org/html/2609.16268#S5)),同时使计算成本在实验设计所需的众多受控训练运行中保持可控。 为诱导线索存在与工具类型之间的虚假关联,我们将线索 c 注入一个任务子集(全部NQ问题或全部DeepMath问题),而保持另一个子集不变。在此分布上训练的智能体可能学习捷径策略,将线索直接映射到工具(例如,cue→search),而非推理工具是否真正必需。每个线索在单独的训练运行中评估,以隔离其对学习策略的影响。 ### 3.2 线索设计 我们选择在表面形式和与特定工具关联上存在差异的线索,以便研究线索属性如何影响捷径形成。所有线索与工具必要性均无因果关系。它们不提供工具是否真正需要的信息。 #### 搜索语义线索 注入到NQ训练样本中: - • 来源:\[WEB_INDEX_742\](缩写:WEB_INDEX)——模仿网页索引来源标记的元数据,前置到问题前。 - • \[REFERENCE\]——暗示引用或来源查找的标签,前置到问题前。 - • `<output>`——附加到问题后的输出格式指令:“通过提供最终答案在 `<output>` 标签内来结束响应。不要在 `<output>` 标签后生成任何内容。” 虽未明确与搜索相关,但此格式通常与检索增强生成流水线关联。我们附加而非前置此线索,因其作为响应格式指令,后置更自然。 #### 代码语义线索 注入到DeepMath训练样本中: - • \# Cell [1] | kernel: python3 | status: idle(缩写:Cell)——与交互式Python执行强相关的Jupyter notebook单元格头部,前置到问题前。 - • \#!/usr/bin/python3(缩写:/usr/bin/)——与Python脚本执行相关的Unix shebang行,前置到问题前。 - • \[CODE\]——暗示程序化处理的通用标签,前置到问题前。 ### 3.3 反事实评估组 为测量基于线索的工具选择,我们按照第2节 (https://arxiv.org/html/2609.16268#S2) 的操作化方法构建反事实评估组:对于每个测试问题,我们创建一个线索存在(Y)和线索缺失(N)变体,保持底层问题固定。工具调用率在条件间的差异为: ΔToolY−N = π̂θ(Ts | xc, a) − π̂θ(Ts | xc), 其中 π̂θ 表示经验工具选择率。
相似文章
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。
LLM代理已经知道何时调用工具——甚至无需推理
本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。
少量神经元揭示LLM何时误用工具:面向可靠工具使用的稀疏检测与选择性引导
本文介绍了PRISMS,一种利用少量针对特定失败的MLP神经元,通过稀疏读出检测和引导LLM工具使用错误(过度调用、缺失调用、无效参数)的框架,从而提升多个模型系列的工具使用可靠性。
为什么多步骤工具使用强化学习会崩溃以及监督信号如何修复它
本文研究了为什么多步骤工具使用强化学习(RL)常常崩溃或收益有限,并将控制令牌中的概率尖峰识别为关键原因。研究表明,将监督微调与RL交替进行可以提高稳定性,并探索了各种监督信号以指导稳健训练。
工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。