通过经验驱动的自适应引导实现代理工具的鲁棒使用

arXiv cs.AI 论文

摘要

本文介绍了ExpG,一种构建和优化自适应引导的机制,该机制捕捉每个工具的能力边界和最佳实践,使代理能够在多样化的运行时条件下更鲁棒地使用工具。实验表明,在工具选择、工具调用和响应生成方面取得了持续改进,使较小的代理能够超越未使用ExpG的较大代理。

arXiv:2608.03403v1 公告类型:新 摘要:代理的性能瓶颈日益从模型能力转向其执行过程的鲁棒性。工具作为代理与外部环境交互的主要接口发挥着核心作用,然而现有方法很少关注在不同运行时条件下确保工具的鲁棒使用。为解决这一问题,我们提出了ExpG,一种构建和优化自适应引导的机制,该机制捕捉每个工具的能力边界和最佳实践,从而使代理能够更鲁棒、更有效地使用工具。ExpG包含三个阶段:(1)经验获取,从历史执行轨迹中分析工具调用质量,通过多维度归因生成结构化可学习经验;(2)经验蒸馏,通过过滤无用经验、使用基于等价类的方法选择代表性经验并将其总结为可泛化引导,保持经验池的有效性;(3)经验重用,在未来的任务求解中自适应地应用该引导。大量实验表明,ExpG在工具选择、工具调用和响应生成任务中带来了持续改进,使较小的代理能够超越未使用ExpG的较大代理。此外,ExpG在具有挑战性的场景中取得了尤其显著的增益,为更鲁棒的工具使用指明了一条有前景的路径。我们的代码、实验和结果均已公开。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:40

# 面向智能体鲁棒工具使用:基于经验驱动的自适应引导

来源:https://arxiv.org/html/2608.03403

Can Wang1,2, Haoran Chen2, Li Yu2, Ding Hao3, Bohai Zhao1, Zhaoyang Liu2, Zhiying Tu1

1山东数字服务计算技术与系统重点实验室  
2阿里巴巴 Token Hub  
3香港理工大学电子及电气工程学系

###### 摘要

智能体的性能瓶颈正逐渐从模型能力转向其执行过程的鲁棒性。工具作为智能体与外部环境交互的主要接口,发挥着核心作用,然而现有方法很少关注在不同运行时条件下确保工具使用的鲁棒性。为解决这一问题,我们提出了 ExpG,一种构建并精炼自适应引导的机制,能够捕获每个工具的能力边界与最佳实践,从而使智能体更鲁棒、更有效地使用工具。ExpG 包含三个阶段:(1) 经验获取,从历史执行轨迹中分析工具调用质量,通过多维度归因生成结构化、可学习的经验;(2) 经验蒸馏,通过过滤无帮助经验、使用基于等价类的方法选择代表性经验,并将其总结为可泛化的引导,从而保持经验池的有效性;(3) 经验复用,在未来的任务求解过程中自适应地应用该引导。大量实验表明,ExpG 在工具选择、工具调用和响应生成任务上带来了一致的提升,使较小的智能体能够胜过未使用 ExpG 的较大智能体。此外,ExpG 在具有挑战性的场景中取得了尤为显著的增益,为更鲁棒的工具使用提供了一条有前景的路径。我们的代码、实验和结果可在 https://github.com/WangCan1178/ExpG 获取。

## 1 引言

智能体的性能瓶颈正从大型语言模型(LLM)的能力转向其执行过程的鲁棒性。因此,研究者提出了智能体执行框架(agent harnesses)Zhou et al. (2026);Pan et al. (2026);Lee et al. (2026),以提供运行时控制,实现行为治理和容错,使智能体在动态环境中执行复杂任务时能够保持稳定。在此类执行框架中,工具是智能体与外部环境交互的主要接口 Zhang et al. (2024);Wu et al. (2025),且先前研究 Meng et al. (2026) 表明,即使在工具使用鲁棒性上的微小改进,也能带来 6.7% 到 68.3% 的性能提升。然而,现有的工具使用方法 Qu et al. (2025b) 很少考虑不同运行时环境下的鲁棒性,因为它们通常在工具使用行为保持可预测的条件下开发。具体而言,这意味着:(1) 智能体已经掌握的工具总能被正确调用并返回预期响应;(2) 即使工具被错误调用,其失败也会伴随有信息量的信号,使智能体能够持续自我反思,并最终学会正确使用工具。

不幸的是,现实世界条件打破了这些假设。一方面,工具调用的质量受到环境动态性的强烈影响(Chen et al., 2025;Cheng et al., 2025)。即使是同一工具,智能体的工具使用行为也可能随任务上下文而变化,并可能随时间和使用环境的不同而发生漂移。当开发环境与生产环境之间存在差距时,这一点尤为明显:许多在原始环境中表现良好的工具会变得不可靠甚至不可用,因为其先前的使用模式已不再适用(Guo et al., 2024)。另一方面,工具调用的响应往往是嘈杂或粗粒度的(Sun et al., 2024)。例如,一个有缺陷的计算器可能在返回错误数值结果的同时,仍将调用报告为“成功”。图1(a) 展示了这两种挑战的示例。如果对工具的能力边界以及如何在变化条件下鲁棒地使用工具缺乏清晰理解,智能体就很难在不同环境中可靠地泛化工具使用,并且往往会退化为反复试错。一旦发生错误,智能体可能只收到模糊的信号,这可能导致推理路径越来越复杂且常常出错。

图 1:(a) 两个现实世界挑战:智能体使用同一工具但因上下文不同而获得不同结果;错误原因不同,但工具返回相同的粗粒度信号(均只返回“error”)。 (b) 从过去的工具使用经验中学习到的引导。 (c) 不同工具使用阶段的结果表明,ExpG 从多个方面提升了智能体的工具使用性能。

为解决这些挑战,我们提出了 ExpG,一种产生经验驱动自适应引导(Experience-Driven adaptive Guidance)的机制,帮助智能体在环境动态性和噪声反馈存在的情况下有效使用工具。与现有依赖静态假设、将工具调用视为黑盒、孤立且可重复事件的方法不同,我们的工作将工具调用视为可分析、相互关联且可学习的经验。通过持续获取、蒸馏和复用这些经验,ExpG 维护了一个受智能体记忆启发的演化经验池(Hu et al., 2025),从而能够自适应地构建和精炼工具使用引导。具体而言,在第一阶段,ExpG 通过分析智能体的执行轨迹,并将每次工具调用的成功或失败归因于相关因素来获取经验。与同一工具相关的经验通过等价类划分被归类为不同的调用模式,从而形成初始的结构化经验池。随后应用过滤方法去除无帮助的经验并选择有帮助的经验,以保持经验池的质量,从而在保留原始分布的同时,保留覆盖尽可能多调用模式的代表性经验。基于这些过滤后的经验,ExpG 结合定性行为分析与定量性能分析,为每个工具构建引导,将碎片化的调用级经验组织为可泛化的工具级引导。该引导刻画了工具的能力边界和最佳实践,并随着经验池的演化而自适应精炼。最后,在后续任务中,每当智能体调用同一工具时,引导会被复用,既可作为动态上下文提示,也可作为稳定的模式约束,从而通过更鲁棒的工具使用提升复杂且不断变化的真实应用中的任务性能。

总之,我们的贡献如下:

- 为了克服环境动态性和噪声反馈导致的不可预测工具使用行为,我们突破了工具调用的静态视角,引入了工具调用的结构化表征,通过等价类划分获取可学习的经验,这些经验封装了关于环境、智能体以及工具本身的全面信息。
- 我们提出了 ExpG 机制,在工具级别维护一个演化的经验池。通过获取、蒸馏和复用过去的经验,ExpG 为工具构建了能力边界和最佳实践,作为实用引导,并可随着智能体在工具使用上变得越来越有效而持续精炼。
- 在工具使用的不同阶段进行的大量实验验证了我们的方法在多种模型上的有效性,表明配备 ExpG 的小模型可以胜过未配备 ExpG 的大模型。值得注意的是,在具有挑战性的设置下,例如存在干扰工具或信息不完善的噪声环境中,ExpG 仍然保持鲁棒。

## 2 相关工作

工具增强的 LLM。工具增强的 LLM 显著增强了领域专业知识 Zhang et al. (2024);Liao et al. (2025)、知识获取 Wu et al. (2025);Song et al. (2025) 和交互质量 Zhang et al. (2025);Wang et al. (2024),并被视为从纯语言模型向智能体演进的关键一步。现有改进工具使用的方法根据是否显式更新模型参数可分为两类 Qu et al. (2025b)。基于微调的方法更新模型参数以内化工具使用策略,通常依赖监督学习 Qin et al. (2024);Patil et al. (2024) 或强化学习 Zhou et al. (2025);Qian et al. (2025),使用预收集数据和工具执行反馈来训练 LLM。相比之下,免微调方法保持模型参数固定,而是在推理期间通过引导 LLM 来改进工具使用,例如精心设计的提示 Yuan et al. (2025)、思维链提示 Chen et al. (2023) 和 ReAct 范式 Yao et al. (2023)。近期研究强调了工具增强 LLM 在现实环境中的鲁棒性挑战 Guo et al. (2024);Sun et al. (2024);Chen et al. (2025);Cheng et al. (2025)。基于这一观察,我们构建了可从结构化经验中持续精炼的引导,使工具增强的智能体能够更好地应对不可预测的环境。

执行框架工程(Harness Engineering)。随着 LLM 能力不断增强,研究关注逐渐从改进模型权重转向工程化支撑可靠部署的智能体周边基础设施 Xu et al. (2024);Huang et al. (2024a)。特别是,执行框架工程 Zhou et al. (2026);Pan et al. (2026) 已成为提升 LLM 智能体鲁棒性的关键方向。执行框架(execution harness)Meng et al. (2026);Lee et al. (2026) 通过管理执行循环、工具访问、上下文构建、状态持久化和运行时监控,控制智能体如何与环境交互。执行框架的优化可以通过多种外部组件实现,例如记忆存储 Hu et al. (2025);Chhikara et al. (2025)、可复用技能 Ling et al. (2026);Chen et al. (2026) 和上下文工程 Zhang et al. (2026);Ye et al. (2026),它们分别改进了运行时的信息持久化、过程复用和结构化任务执行。大多数现有工作通过在执行框架内以任务或工作流级别外部化能力来提升鲁棒性。相比之下,ExpG 在工具这一细粒度层面运作,将每个工具的能力边界和最佳实践外部化,与基于更高层级记忆或技能的方法形成互补。

图 2:ExpG 概览。它包含三个阶段:从过去轨迹中获取工具调用经验,将经验蒸馏为引导,以及复用引导以提升未来任务性能。这些阶段共同构成了一种为每个工具构建能力边界和最佳实践的机制。

## 3 方法

### 3.1 ExpG 概述

我们的工作 ExpG 如图2所示,通过三个连续阶段运行:经验获取、蒸馏和复用。在经验获取阶段,评估器(evaluator)从历史轨迹中对每次工具调用的成功或失败进行归因,获取结构化、可学习的经验。在经验蒸馏阶段,首先对经验进行过滤以确保其有帮助,然后总结为引导,捕获工具的能力边界和最佳实践。最后,经验复用阶段将这些蒸馏后的引导注入智能体的推理过程,无论是作为提示的一部分还是工具模式的一部分,从而实现更鲁棒、更有效的工具调用。这些阶段协同工作,为工具维护一个演化的经验池,该经验池可通过持续的经验不断更新和精炼,推动智能体性能的持续提升。

### 3.2 经验获取

我们首先将工具调用经验形式化为 E=⟨h,m,c⟩,其中 h 是基于哈希的唯一经验标识符。元数据 m 捕获工具调用的细节,包括工具信息(名称和模式)、使用信息(智能体上下文和工具输入)以及执行信息(工具响应、成功标志、时间成本和 token 成本)。经验内容 c 由智能体 LLM 评估器 LLM_evaluator 生成,该评估器以 m 为输入,内容包括:1) scores=[s_1,…,s_d],一个 d 维二值向量,其中 s_i∈{0,1} 表征调用质量的不同方面;2) explanation,一段简短的自然语言解释,说明 scores 的由来,即工具调用为何成功或失败。

为了尽可能获取更多有价值的经验以提升智能体的工具使用能力,ExpG 首先收集智能体使用不同工具解决各种任务的轨迹。在这些轨迹中,针对每次智能体-工具交互提取元数据 m,并计算哈希值 h,以区分同一工具在不同工具上下文、输入或响应下的调用。然后,智能体 LLM 评估器 LLM_evaluator 评估每次工具调用以生成经验内容 c。为确保评估准确可靠,我们的 LLM-as-a-Judge (Zheng et al., 2023) 方法引导 LLM_evaluator 回答一系列简单的是/否问题,例如“输入参数是否以正确的格式对应其各自字段?”评估器首

相似文章

关注工具故障:实现医疗代理的协同工具增益

arXiv cs.AI

本文针对医疗AI代理中的工具故障问题,提出了一种基于GRPO的强化学习框架,利用实例级选择、分歧感知协同学习和熵引导采样来纠正错误的工具共识,并在七个医疗基准测试中提高了可靠性。

ReGRPO:面向工具使用智能体的反思增强策略优化

arXiv cs.AI

ReGRPO 提出了一种反思增强的策略优化框架,用于工具使用的视觉语言智能体,通过利用结构化的失败观测以及反思令牌与动作的联合优化,来改善从工具故障中的恢复能力,在 GTA 和 GAIA 基准测试上取得了最先进的结果。

重新思考自我进化语言模型智能体中的经验利用

arXiv cs.CL

本文介绍了 ExpWeaver 框架,该框架优化了自我进化语言模型智能体在运行时决策过程中如何利用过往经验。研究表明,基于推理不确定性选择性调用经验,能在多种环境和模型中提升性能。