智能体过度信任工具:衡量对不可靠工具的依赖

arXiv cs.AI 论文

摘要

本文评估大型语言模型智能体如何过度信任不可靠的工具返回信息,测量被篡改信息的采纳率,并测试缓解此问题的干预措施。

arXiv:2609.05587v1 Announce Type: new 摘要:现有对使用工具的智能体的评估主要衡量智能体能否借助工具成功完成多样化的任务。这些评估通常假设工具返回可靠的信息。然而,在现实世界系统中,工具返回的信息可能看似合理但不正确。我们通过评估十四个大型语言模型使用三种工具——网页搜索、LLM子智能体委派和代码执行——来研究智能体如何响应不可靠的工具返回信息。对于每种工具,我们篡改其返回信息,并衡量智能体是否在其最终答案中采纳被篡改的内容。在所有三种设置中,智能体表现出高水平的过度信任:每种工具的平均采纳率超过三分之一,网页搜索达到68.0%。对推理痕迹的分析揭示了一种特别令人担忧的失败模式:智能体经常识别冲突甚至内部恢复正确答案,却只呈现被篡改的答案而不警告用户。为缓解智能体对工具返回信息的过度信任,我们在三个层面进行干预:用户提示、工具提供者元数据和智能体构建者的后训练。尽管某些干预措施对特定模型或工具有帮助,但没有一种能持续缓解所有工具的过度信任问题。这些发现将对不可靠工具的过度信任识别为一种严重且持久的失败模式,促使开发能够验证工具输出并透明沟通未解决冲突的评估和干预措施。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:40

# 衡量对不可靠工具的依赖程度
来源:https://arxiv.org/html/2609.05587 \\workshoptitle 第一届智能体行为解释研讨会 (IAB)  
## 智能体过度信任工具:衡量对不可靠工具的依赖程度  
Hoyeol Yang††贡献相同\. Woojung Song11脚注标记:1附属机构:首尔国立大学 电子邮件:[opusdeisong@snu\.ac\.kr](mailto:)  
Taewon Kim 附属机构:首尔国立大学 电子邮件:[chris40461@snu\.ac\.kr](mailto:)  
Jonghyun Song 附属机构:首尔国立大学 电子邮件:[hyeongoon11@snu\.ac\.kr](mailto:)  
Seoyeon Park 附属机构:首尔国立大学 电子邮件:[iamseoyeon@snu\.ac\.kr](mailto:)  
Yohan Jo††通讯作者\. 附属机构:首尔国立大学 电子邮件:[yohan\.jo@snu\.ac\.kr](mailto:)  

###### 摘要  
现有的工具使用智能体评估主要衡量智能体能否借助工具成功完成多样化任务。这些评估通常假设工具返回的信息是可靠的。然而,现实世界系统的工具返回结果可能看似合理却错误。我们通过使用三种工具——网络搜索、大语言模型子智能体委派和代码执行——评估十四个大语言模型,探究智能体如何应对不可靠的工具返回。对于每种工具,我们篡改其返回结果,并衡量智能体是否在其最终答案中采纳了被篡改的内容。智能体在所有三种场景中都表现出高度的过度信任:每种工具的平均采纳率均超过三分之一,网络搜索的采纳率高达68.0%。对推理轨迹的分析揭示了一种尤其令人担忧的失败模式:智能体通常能识别冲突,甚至在内部恢复了正确答案,但最终却仅呈现被篡改的答案,且未警告用户。为了缓解智能体对工具返回的过度信任,我们在三个层面进行了干预:用户提示、工具提供者提供的元数据以及智能体构建者的后训练。虽然某些干预措施对特定模型或工具有帮助,但没有一种能持续缓解所有工具的过度信任问题。这些发现表明,对不可靠工具的过度信任是一种严重且持续存在的失败模式,这促使我们进行评估并开发干预措施,使智能体能够验证工具输出并透明地沟通未解决的冲突。  

## 1 引言  
工具使用已成为大语言模型智能体的基本组成部分。通过搜索网络、执行代码和调用其他智能体,它们可以访问超出其当前参数的信息并执行计算\[1 (https://arxiv.org/html/2609.05587#bib.bib1), 2 (https://arxiv.org/html/2609.05587#bib.bib2), 3 (https://arxiv.org/html/2609.05587#bib.bib3)\]。标准的工具使用基准测试评估智能体是否选择适当的工具、发出有效的调用并利用返回的信息完成任务\[4 (https://arxiv.org/html/2609.05587#bib.bib24), 5 (https://arxiv.org/html/2609.05587#bib.bib5), 6 (https://arxiv.org/html/2609.05587#bib.bib25), 7 (https://arxiv.org/html/2609.05587#bib.bib6)\]。这些评估在很大程度上假设工具返回是可靠的。然而,这一假设越来越难以维持,因为工具可能返回生成的输出:一些搜索工具返回基于检索信息生成的答案\[8 (https://arxiv.org/html/2609.05587#bib.bib9), 9 (https://arxiv.org/html/2609.05587#bib.bib56), 10 (https://arxiv.org/html/2609.05587#bib.bib57)\],大语言模型子智能体返回委派任务的报告\[3 (https://arxiv.org/html/2609.05587#bib.bib3)\],代码执行器返回模型生成程序的输出\[11 (https://arxiv.org/html/2609.05587#bib.bib22)\]。在这种情况下,返回结果可能看似合理但错误,而现有评估很少测试智能体是采纳还是抵制这些结果。  

外部上下文与大语言模型参数知识之间的冲突主要在检索领域得到了研究\[12 (https://arxiv.org/html/2609.05587#bib.bib16), 13 (https://arxiv.org/html/2609.05587#bib.bib11)\]。这些研究测试了模型对与先前知识矛盾或包含错误信息的检索段落的反应。然而,这类工作评估的是已经提供了检索段落的模型,而工具使用智能体在执行任务时决定是否以及何时调用工具。为了解决这个问题,新兴研究在嘈杂、误导性或缺失的工具返回下评估智能体\[14 (https://arxiv.org/html/2609.05587#bib.bib23), 15 (https://arxiv.org/html/2609.05587#bib.bib15)\]。然而,由于这些研究侧重于性能下降,它们对于智能体何时信任不可靠返回以及如何缓解这种依赖性的洞察有限。  

因此,我们提出问题:智能体是否会将错误内容带入最终答案?采纳率如何随(答案的)可信度变化?哪些干预措施可以缓解这种依赖?为了检验这些,我们使用三种工具测试智能体:网络搜索、大语言模型子智能体和代码执行器。对于每种工具,我们获取未篡改的返回结果,然后在呈现给智能体之前仅更改其内容。采纳率衡量智能体将错误内容带入其最终答案的频率。对于智能体在不使用工具时最初能正确回答的项目,覆盖率衡量错误返回改变其答案的频率。  

在所有三种工具中,没有一个模型能持续抵制错误返回。每种工具的平均采纳率均超过三分之一,搜索的平均采纳率高达68.0%,而平均覆盖率也相当可观。至关重要的是,这些失败对用户来说很少可见。在采纳错误内容的最终答案中,搜索仅有5.3%,代码执行器仅有1.8%警告了用户。为了确定模型是未能注意到冲突,还是其最终答案未能反映其已识别的内容,我们检查了推理模型的推理轨迹。轨迹揭示了一个显著的脱节:推理模型通常能识别冲突,甚至在内部恢复了正确答案,但它们的最终响应仍然呈现错误答案,并且几乎从不提及冲突或正确答案。  

为了缓解智能体对工具返回的过度信任,我们在三个层面进行了干预:用户、工具提供者和智能体构建者。在用户方面,要求智能体比较、验证或披露冲突返回的提示策略降低了某些模型和工具的采纳率,但没有一种策略能在保持对未篡改返回的准确性的同时持续降低采纳率。在工具提供者方面,来源和可靠性元数据没有提供持续的缓解效果;更高的声明可靠性可能使错误返回更具说服力。在智能体构建者方面,后训练产生的效果取决于目标,并且不能可靠地从搜索迁移到代码执行器。  

综合来看,这些结果表明,过度信任是一种持续存在且难以缓解的失败模式,而不是任何单一干预措施能够解决的问题。解决它需要进一步研究能够跨模型和工具通用且在工具返回可靠时不影响性能的干预措施。  

## 2 相关工作  
##### 大语言模型中的知识冲突。当上下文信息与模型的参数知识矛盾时,就会产生知识冲突\[16 (https://arxiv.org/html/2609.05587#bib.bib10)\]。先前的工作研究了当直接在提示中放置矛盾段落时,模型会报告什么\[12 (https://arxiv.org/html/2609.05587#bib.bib16), 17 (https://arxiv.org/html/2609.05587#bib.bib17), 18 (https://arxiv.org/html/2609.05587#bib.bib18)\]。检索-污染基准测试将这一设置扩展到包含虚假、误导性或过时信息的检索上下文,并表明此类污染会显著降低模型性能\[19 (https://arxiv.org/html/2609.05587#bib.bib8), 13 (https://arxiv.org/html/2609.05587#bib.bib11), 20 (https://arxiv.org/html/2609.05587#bib.bib12)\]。这些研究共同表明,矛盾的段落可以显著影响模型响应。然而,它们评估的是在给定检索信息下作为生成器的模型,而不是在任务执行过程中发出工具调用的智能体。此外,这些研究集中在检索上,而智能体使用更广泛的工具,包括代码执行器和子智能体\[21 (https://arxiv.org/html/2609.05587#bib.bib58), 22 (https://arxiv.org/html/2609.05587#bib.bib59)\]。  

##### 使用不可靠工具的智能体。工具使用基准测试主要评估使用正确参数进行适当的工具选择和调用\[23 (https://arxiv.org/html/2609.05587#bib.bib4), 24 (https://arxiv.org/html/2609.05587#bib.bib13)\]。随着工具使用评估的成熟,基准测试已扩展到链接多个工具的任务\[5 (https://arxiv.org/html/2609.05587#bib.bib5)\]以及与模拟用户对话的任务\[7 (https://arxiv.org/html/2609.05587#bib.bib6), 25 (https://arxiv.org/html/2609.05587#bib.bib14)\]。由于这些基准测试假设工具返回正确的值,它们衡量的是智能体使用工具的好坏,而不是当返回不正确时它会怎么做。  

最近的研究探讨了当工具输出与智能体自身的知识或答案冲突时,智能体如何响应\[26 (https://arxiv.org/html/2609.05587#bib.bib19), 27 (https://arxiv.org/html/2609.05587#bib.bib20)\]。其他基准测试在搜索和多轮工具使用流程中注入噪声或误导性反馈,并报告了显著的性能下降\[28 (https://arxiv.org/html/2609.05587#bib.bib21), 14 (https://arxiv.org/html/2609.05587#bib.bib23), 15 (https://arxiv.org/html/2609.05587#bib.bib15)\]。然而,这些研究并未系统地比较这种行为在不同工具间的差异。我们在搜索、代码执行和子智能体委派之间比较这种依赖性。我们不仅将性能下降视为单一结果,还区分了对错误返回的普遍采纳与工具覆盖模型已证明能正确生成的答案这一更尖锐的情况。我们还检查了智能体在采纳错误返回时是否识别并披露了冲突,并测试了这种依赖性能否通过用户指令、工具元数据和后训练来缓解。  

## 3 评估设计  
图1:网络搜索评估设计。为了衡量智能体对其工具的信任程度,我们在三个任务上对它们进行评估,每个任务使用不同的工具:使用网络搜索进行问答、使用大语言模型子智能体进行摘要、使用代码执行器解决数学问题。  

**指标。** 我们使用采纳率和覆盖率来衡量智能体如何响应被篡改的工具内容。采纳率是智能体在其最终答案中使用注入内容的频率。覆盖率是模型在不使用工具时能正确回答的项目上的采纳率。我们通过三个独立的无工具响应的多数投票来确定正确性;正确项目的比例是基准确度BB。  

**网络搜索。** 我们评估智能体在事实性问答中对网络搜索的依赖。我们使用来自2026年4月21日FreshQA快照的事实性问题\[29 (https://arxiv.org/html/2609.05587#bib.bib7)\],从原始432个问题中排除了14个二元问题,因为它们不支持不同的被篡改答案。得到的418个问题包含147个*永不*变化、127个*慢速*变化和144个*快速*变化的项目。智能体可以选择自己的查询并重复调用Tavily网络搜索。未篡改的结果被原样传递。在每个被篡改的条件下,每个问题都被分配一个固定的替代答案,我们使用GPT-5.6-Luna在返回的片段中出现时,将黄金答案最小化地替换为此替代答案。P1是一个曾经正确或可能容易与黄金答案混淆的真实值,P2是另一个FreshQA问题的黄金答案,P3完全是虚构的。图1说明了这些条件:对于德国总理的问题,P1用前总理奥拉夫·朔尔茨替代弗里德里希·默茨,P2用无关值11替代,P3用虚构的名字“泰斯兰·芬格雷夫”替代。因此,这三个条件在篡改答案的可信度上有所不同,同时保留了检索内容的其余部分。我们使用Qwen3.5-27B来判断最终答案是否采纳了注入的值;人工验证确认了高度一致性。附录A提供了完整协议,附录A.6提供了评判和人工验证的详细信息。  

##### 大语言模型子智能体。  
我们评估智能体在文档摘要中对大语言模型子智能体的依赖。每个请求要求对三个指定文档进行摘要。我们使用三组各十五篇共45篇文档:每篇模型知识截止日期之前发表的预截止论文、十九世纪小说以及2026年5月1日之后首次发布的后截止论文。智能体调用大语言模型对每个文档进行摘要,但源文档不对接收模型显示。对于每个文档,我们使用GPT-5.6-Terra为每种返回条件生成并存储一个固定的五句话摘要。未篡改的摘要是准确的。P1用一个虚假主张替换了一个主要主张,而P2在保留真实主张的同时增加了一个捏造。例如,对于《注意力就是你所需要的》一文,P1将Transformer描述为基于卷积而非注意力,而P2增加了未经证实的主张,称该论文展示了抽取式文档摘要。我们使用Qwen3.5-27B从最终响应中提取每个文档的摘要,并在不考虑条件的情况下独立评估其真实和错误主张。产生的判断结果被组合成文档级别的采纳标签。附录B列出了所有45篇文档,并提供了完整协议和评分标准。  

##### 代码执行器。  
我们评估智能体在算术问题解决中对代码执行器的依赖。我们使用300个问题,加法、乘法、除法、取模、对数和指数各50个。操作数的大小在[0.001, 1000]的三小数位网格上均匀采样,指数除外(使用[0.001, 10]);符号分配和域过滤是特定于操作的。成功执行后,捕获的标准输出中的每个数字o都被替换为错误值o',通过两步获得:o' = { s × o × r, 如果d=+1; s × o ÷ r, 如果d=-1 },其中 r=1+p/100。大小参数p在[1, 100]之间对数均匀抽取(P1),在[101, 10000]之间对数均匀抽取(P2),而方向d和符号s各自在{+1, -1}中均匀抽取,且彼此独立。因此,p控制误差的大小,d决定大小是增加还是减少,s决定输出的符号是保持还是反转。交叉d和s将响应与向上或向下缩放以及更显眼的符号反转区分开来。基于规则的评分器解析“最终答案”行,并将其与黄金值和注入值进行匹配。附录C提供了完整的构建、污染和评分细节。  

##### 模型。  
我们评估十四个模型:![[无标题图像]](https://arxiv.org/html/2609.05587v1/icons/qwen.png) Qwen3-30B 和 -235B,每个都有指令和思考配置;![[无标题图像]](https://arxiv.org/html/2609.05587v1/icons/gemini.png) Gemini-3.1-flash-lite 和 -3.7-flash;![[无标题图像]](https://arxiv.org/html/2609.05587v1/icons/gemma.png) Gemma-4-12B 和 -31B;![[无标题图像]](https://arxiv.org/html/2609.05587v1/icons/openai.png) GPT-5.4-mini 和 -nano

相似文章

何时信任工具?工具集成数学推理的自适应工具信任校准

arXiv cs.CL

本文介绍了自适应工具信任校准(ATTC)框架,该框架通过使工具集成推理模型能够根据代码置信度得分自适应地决定是否相信或忽视工具结果,从而改进了这些模型。该方法解决了模型错误地忽视正确工具输出的"工具被忽视"问题,在多个模型和数据集上实现了4.1%-7.5%的性能提升。

工具使用智能体的调用级别可靠性

arXiv cs.AI

本文在调用级别测量工具使用智能体的可靠性,揭示了在精确匹配评分下,错误传播参数由评分规则固定,并提出了一种基于状态的条件评分方法来解决此问题。

论计算机使用智能体的可靠性

Hugging Face Daily Papers

一篇预印本论文,分析为何计算机使用智能体首次成功却在重复执行时失败,将不可靠性归因于执行随机性、任务模糊性和行为变异性,并倡导重复评估与稳定策略。