DOCSCHISEL:面向LLM智能体的自适应工具文档优化框架
摘要
本文研究了工具文档中的信息如何在不同设置下影响LLM智能体的性能,并提出了DocsChisel——一个自适应框架,通过迭代优化工具文档来提高任务成功率。
查看缓存全文
缓存时间: 2026/08/12 08:27
# DocsChisel:面向LLM智能体的自适应工具文档优化框架 来源:https://arxiv.org/html/2608.10037 ###### 摘要 大型语言模型(LLMs)日益依赖外部工具来完成复杂的现实世界任务,这使得工具文档成为LLM智能体的关键基础资源。现有研究主要集中于提升LLM智能体的工具使用能力,而大多将工具文档视为固定输入。尽管近期一些工作尝试通过重写或压缩来优化工具文档,但对于工具文档中包含的信息如何在不同设置下影响智能体性能,我们知之甚少。 为弥补这一空白,我们针对LLM智能体的工具文档开展了一项大规模实证研究。我们的研究揭示了现有工具文档在信息字段方面存在显著的异质性。此外,不同信息字段的有效性高度依赖于任务领域、LLM主干模型和智能体范式,这表明没有任何固定的工具文档能够在多样化的智能体设置中持续具备良好的泛化能力。 基于这些发现,我们提出了DocsChisel,一个面向LLM智能体的自适应工具文档优化框架。DocsChisel通过分析目标LLM智能体失败的执行轨迹来识别与文档相关的问题,并通过为每个工具添加、删除和优化信息字段来迭代优化工具文档。我们将DocsChisel与两个最先进的基线方法(即EasyTool和DRAFT)进行了对比评估。实验结果表明,与原始工具文档相比,DocsChisel将LLM智能体的任务成功率平均提高了95.89%,与现有基线方法相比平均提高了75.15%,同时仅带来有限的优化时间和令牌开销。 ## I 引言 大型语言模型(LLMs)[34 (https://arxiv.org/html/2608.10037#bib.bib2),12 (https://arxiv.org/html/2608.10037#bib.bib3)]在代码生成、问答和数据分析等多样任务中展现了强大的能力[18 (https://arxiv.org/html/2608.10037#bib.bib4),11 (https://arxiv.org/html/2608.10037#bib.bib5),20 (https://arxiv.org/html/2608.10037#bib.bib6)]。为了执行现实世界任务,LLMs日益依赖外部工具,例如网络浏览器、代码解释器和文件系统,从而催生了工具使用型LLM智能体(以下简称LLM智能体)的出现[56 (https://arxiv.org/html/2608.10037#bib.bib21),13 (https://arxiv.org/html/2608.10037#bib.bib7),54 (https://arxiv.org/html/2608.10037#bib.bib8),44 (https://arxiv.org/html/2608.10037#bib.bib9),38 (https://arxiv.org/html/2608.10037#bib.bib10),40 (https://arxiv.org/html/2608.10037#bib.bib11)]。新兴的LLM智能体生态系统,包括智能体开发平台[4 (https://arxiv.org/html/2608.10037#bib.bib12),7 (https://arxiv.org/html/2608.10037#bib.bib13)]、工具托管平台[43 (https://arxiv.org/html/2608.10037#bib.bib14),37 (https://arxiv.org/html/2608.10037#bib.bib15)]和智能体评估套件[53 (https://arxiv.org/html/2608.10037#bib.bib50),27 (https://arxiv.org/html/2608.10037#bib.bib46)],提供了大量可复用的工具集合和标准化的工具接口。这些工具通常附带工具文档,其中包含关于其功能、调用约束和其他细节的若干信息字段,帮助LLM智能体正确理解和调用工具。 传统的API文档在软件工程领域已有长期研究,主要目标是提高其对开发者的可读性、完整性和可用性[6 (https://arxiv.org/html/2608.10037#bib.bib34),5 (https://arxiv.org/html/2608.10037#bib.bib40),30 (https://arxiv.org/html/2608.10037#bib.bib37),33 (https://arxiv.org/html/2608.10037#bib.bib41),46 (https://arxiv.org/html/2608.10037#bib.bib38),24 (https://arxiv.org/html/2608.10037#bib.bib42),39 (https://arxiv.org/html/2608.10037#bib.bib35),32 (https://arxiv.org/html/2608.10037#bib.bib36),49 (https://arxiv.org/html/2608.10037#bib.bib39)]。然而,面向LLM智能体的工具文档在受众和内容上均有不同。文档的消费主体是LLM智能体,它们必须从上下文文档中推断工具功能并直接生成可执行的工具调用。同时,文档的重点从通用的API理解转向面向任务导向的工具使用,需要诸如使用条件、参数语义、调用约束和输出解释等信息。由于此类文档指导运行时的工具选择和调用,歧义或缺失信息可能导致错误的工具调用和级联任务失败。因此,工具文档不应仅被视为人类可读的参考资料,更应被视为关键的基础资源,其质量严重影响LLM智能体的任务成功率[19 (https://arxiv.org/html/2608.10037#bib.bib16),58 (https://arxiv.org/html/2608.10037#bib.bib56),40 (https://arxiv.org/html/2608.10037#bib.bib11)]。 **相关工作。** 尽管工具文档十分重要,但现有研究[25 (https://arxiv.org/html/2608.10037#bib.bib20),41 (https://arxiv.org/html/2608.10037#bib.bib17),60 (https://arxiv.org/html/2608.10037#bib.bib18),22 (https://arxiv.org/html/2608.10037#bib.bib51),55 (https://arxiv.org/html/2608.10037#bib.bib44),8 (https://arxiv.org/html/2608.10037#bib.bib45),27 (https://arxiv.org/html/2608.10037#bib.bib46),45 (https://arxiv.org/html/2608.10037#bib.bib48),47 (https://arxiv.org/html/2608.10037#bib.bib19)]主要从工具构建、工具检索、工具调用和评估等角度关注提升LLM智能体的工具使用能力。虽然这些研究显著推动了LLM智能体的发展,但它们通常将工具文档视为固定的给定输入,并未系统性地考察文档本身如何影响LLM智能体的行为和任务成功率。仅有少数近期研究[10 (https://arxiv.org/html/2608.10037#bib.bib60),9 (https://arxiv.org/html/2608.10037#bib.bib61),29 (https://arxiv.org/html/2608.10037#bib.bib62),58 (https://arxiv.org/html/2608.10037#bib.bib56),14 (https://arxiv.org/html/2608.10037#bib.bib58),42 (https://arxiv.org/html/2608.10037#bib.bib57)]明确针对LLM智能体优化工具文档。例如,EasyTool[58 (https://arxiv.org/html/2608.10037#bib.bib56)]将多样化的工具文档标准化为使用统一模板的简洁工具指令,从而减少文档带来的上下文开销;而DRAFT[42 (https://arxiv.org/html/2608.10037#bib.bib57)]则基于外部工具的输出迭代优化工具文档。然而,这些方法大多通过在现有信息字段内进行重写、修正、标准化或压缩来优化工具文档。它们较少关注文档字段本身是否充分、冗余或适合不同的LLM智能体。 在实践中,不同LLM智能体生态系统中的工具文档在提供的信息字段方面可能存在显著差异。然而,这些信息字段的效用是否因智能体设置而异仍不清楚。例如,由能力较弱的LLM主干驱动的智能体是否更能从显式使用示例中获益?多智能体范式是否对使用指导和调用约束提出更高要求?这些观察引出了一个基本问题,即:现有工具文档提供了哪些信息字段,以及这些信息字段在不同智能体设置下如何影响LLM智能体的任务成功率? 表 I:所收集工具使用数据集概览 | 数据集 | #工具 | 描述 | | :--- | :--- | :--- | | WorkBench[48 (https://arxiv.org/html/2608.10037#bib.bib52)] | 26 | 一个工具使用型LLM智能体基准,包含沙盒环境、真实办公任务、数据库和可执行工具。 | | API-Bank[27 (https://arxiv.org/html/2608.10037#bib.bib46)] | 2,211 | 一个全面的评估基准,包含多样化API和面向LLM智能体的多轮对话。 | | ToolLLM[40 (https://arxiv.org/html/2608.10037#bib.bib11)] | 16,464 | 一个大规模真实世界API套件,用于评估LLM智能体的多步骤工具调用。 | | APIBench[38 (https://arxiv.org/html/2608.10037#bib.bib10)] | 1,645 | 一个大规模API语料库,用于研究LLM与数千个远程API的连接。 | | ToolAlpaca[50 (https://arxiv.org/html/2608.10037#bib.bib49)] | 426 | 一个模拟数据集,包含多样化工具API和结构化工具文档,用于训练LLM。 | | AnyToolBench[8 (https://arxiv.org/html/2608.10037#bib.bib45)] | 13 | 一个用于分层大规模工具调用和自反思LLM智能体的基准。 | | ToolBench[53 (https://arxiv.org/html/2608.10037#bib.bib50)] | 232 | 一个用于评估开源LLM在工具操作和调用任务上表现的基准。 | | ShortcutsBench[45 (https://arxiv.org/html/2608.10037#bib.bib48)] | 1,414 | 一个基于Apple Shortcuts的大规模基准,包含真实API、用户查询和动作序列。 | | WildToolBench[57 (https://arxiv.org/html/2608.10037#bib.bib53)] | 1,600 | 一个基于真实世界用户行为模式和现实多步骤场景的工具使用基准。 | | SWE-bench[23 (https://arxiv.org/html/2608.10037#bib.bib43),54 (https://arxiv.org/html/2608.10037#bib.bib8)] | 15 | 一个软件工程基准,要求LLM智能体通过仓库工具解决真实的GitHub问题。 | | CRMArena[21 (https://arxiv.org/html/2608.10037#bib.bib47)] | 27 | 一个针对现实企业环境中专业CRM任务的领域特定基准。 | | τ\tauτ-bench[55 (https://arxiv.org/html/2608.10037#bib.bib44)] | 28 | 一个用于评估工具、智能体与用户之间交互的基准,包含领域特定工具和对话。 | | TooLe[22 (https://arxiv.org/html/2608.10037#bib.bib51)] | 390 | 一个元工具基准,用于决定是否调用工具以及选择合适的工具。 | | ToolLens[41 (https://arxiv.org/html/2608.10037#bib.bib17)] | 464 | 一个面向多工具场景的工具检索数据集,强调完整且多样化的工具选择。 | **实证研究。** 为了理解LLM智能体的工具文档及其对任务成功率的影响,我们在从LLM智能体生态系统中收集的14个工具使用数据集上开展了一项大规模实证研究。具体而言,我们研究了这些数据集的信息字段组成,并在WorkBench[48 (https://arxiv.org/html/2608.10037#bib.bib52)]上评估了两种不同LLM智能体范式(即ReAct[56 (https://arxiv.org/html/2608.10037#bib.bib21)]和多智能体[51 (https://arxiv.org/html/2608.10037#bib.bib22)])在使用三种不同LLM主干模型(即GPT-4o[35 (https://arxiv.org/html/2608.10037#bib.bib23)]、GLM-5[59 (https://arxiv.org/html/2608.10037#bib.bib24)]和Claude Haiku 4.5[3 (https://arxiv.org/html/2608.10037#bib.bib25)])时的任务成功率。我们设计了以下研究问题。 - • RQ1 组成分析。 不同工具文档中通常包含哪些信息字段? - • RQ2 影响分析。 在不同任务领域、LLM主干模型和智能体范式下,不同信息字段如何影响LLM智能体的任务成功率? 我们的结果揭示,智能体生态系统中现有的工具文档在字段组成方面表现出显著的异质性,而不同信息字段对LLM智能体任务成功率的影响因任务领域、LLM主干模型和智能体范式而异。具体而言,我们识别出17个信息字段,其中仅工具名称和功能描述被全部14个数据集提供,而使用指导和调用约束仅出现在两个数据集中。此外,相同的信息字段在不同智能体设置下可能产生不同甚至相反的效果。平均而言,添加或删除单个信息字段会使LLM智能体的任务成功率在绝对值上变化6.34个百分点。这些发现表明,固定的工具文档无法在不同LLM智能体设置下良好泛化,应当进行自适应优化。 **我们的方法。** 受这些洞见的启发,我们提出了DocsChisel,一个面向LLM智能体的自适应工具文档优化框架。具体而言,给定一个目标LLM智能体,DocsChisel首先使用原始工具文档执行代表性的工具使用查询,并收集失败的智能体执行轨迹。然后,DocsChisel分析这些失败轨迹以识别与文档相关的问题,并使用LLM迭代修订工具文档。DocsChisel并非简单地将工具文档重写为更短或更通用的形式,而是通过为每个工具添加、删除或优化信息字段来同时优化工具文档的内容和结构,从而为不同的LLM智能体设置生成自适应的工具文档,以提高工具调用正确性和任务成功率。 **评估。** 我们实现了DocsChisel的原型,并从WorkBench[48 (https://arxiv.org/html/2608.10037#bib.bib52)]和API-Bank[27 (https://arxiv.org/html/2608.10037#bib.bib46)]中选取了涵盖9个任务领域的74个工具进行实验,以证明其有效性和效率,并与两个最先进的基线方法(即EasyTool[58 (https://arxiv.org/html/2608.10037#bib.bib56)]和DRAFT[42 (https://arxiv.org/html/2608.10037#bib.bib57)])进行比较。实验结果表明,与使用原始工具文档相比,DocsChisel在多种智能体设置下将任务成功率稳定提高了95.89%,并且与基线方法相比平均实现了75.15%的提升。此外,DocsChisel保持了实用的优化效率,平均每个工具仅需12.65分钟即可为LLM智能体优化工具文档。 **贡献。** 本工作做出了以下贡献。 - • 我们对LLM智能体的工具文档进行了系统性的实证研究,揭示了不同信息字段在不同智能体设置下的效果差异。 - • 我们设计并实现了一个面向LLM智能体的自适应工具文档优化框架DocsChisel,从而提高了LLM智能体的工具调用正确性和任务成功率。 - • 我们进行了广泛的实验,以证明DocsChisel的有效性和效率。 ## II 实证研究 为了系统地研究第I节 (https://arxiv.org/html/2608.10037#S1)中提出的两个研究问题,我们针对不同工具文档的信息字段组成开展了一项大规模实证研究,并评估了不同LLM智能体设置在不同工具文档下的任务成功率。 ### II-A 研究设计 **文档收集。** 我们从表I (https://arxiv.org/html/2608.10037#S1.T1)中所示的14个代表性数据集中收集工具文档,覆盖了多样化的工具使用场景,例如工作流执行、移动自动化和软件工程任务。我们基于以下标准选择这些数据集:(1)提供丰富的工具集合及相应的工具文档;(2)涵盖不同的任务领域和执行环境;(3)具有强大的社区影响力,并在近期LLM智能体研究中被广泛使用。我们总共收集了24,955个工具及其相应的工具文档。 **LLM选择与智能体范式设置。** 为了评估工具文档在不同LLM智能体设置下的有效性,我们选择了三个具有代表性的LLM作为智能体主干模型,即GPT-4o[35 (https://arxiv.org/html/2608.10037#bib.bib23)]、GLM-5[59 (https://arxiv.org/html/2608.10037#bib.bib24)]和Claude Haiku 4.5[3 (https://arxiv.org/html/2608.10037#bib.bib25)],涵盖了近期LLM智能体中广泛使用的不同模型系列。我们进一步实例化了两种智能体范式,即使用LangChain[25 (https://arxiv.org/html
相似文章
利用智能体编写高效的工具——借助智能体本身
Anthropic 分享了为 AI 智能体设计、评估和优化工具的工程最佳实践,特别介绍了如何利用模型上下文协议(MCP)和 Claude Code 来提升智能体的性能。
HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
HyperAgent is a research framework that models tool relations via a Tool-Schema Hypergraph to improve planning and execution for LLM agents, reducing API calls and token usage on the AppWorld benchmark.
低延迟系统中工具制作与自进化LLM代理
本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。
Contract2Tool:学习前提与效果以实现可靠的工具增强型LLM代理
本文介绍了Contract2Tool,一个从工具元数据、文档和执行轨迹中自动推断轻量级工具契约(前提条件、效果、风险)的框架,为LLM代理实现可靠的因果工具过滤。实验表明,学习到的契约在下游多步骤代理任务中达到了接近黄金契约的性能,同时显著减少了token使用量。
受控智能体的集合切换行为测试
本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。