参数生成至关重要:面向LLM工具调用的难度分级基准与探针引导训练

arXiv cs.AI 论文

摘要

本文提出ParamBench,一个面向LLM工具调用参数生成的难度分级基准,并提出了探针引导训练方法(PBT和PGR),将精确匹配准确率从19.7%提升至59.6%。

arXiv:2608.03071v1 公告类型:新 摘要:大语言模型智能体的能力很大程度上来源于工具使用。现有关于工具使用的研究大多集中于选择正确的工具以及编排调用的顺序。然而,正确填写工具调用的参数对于成功执行同样至关重要,却受到的关注要少得多。在云网络等领域,即使是前沿模型,正确完成的工具调用也不到一半。受近期分析(表明LLM隐藏状态编码了有关模型预测的丰富信息)的启发,我们发现,当模型生成参数值时,其隐藏状态包含一个强正确性信号:一个简单的线性探针即可准确预测该值是否正确。基于这一观察,我们提出了一个统一的探针引导框架,包含两种互补方法:探针过滤的引导式训练(PBT),利用探针过滤可靠的自我生成调用以进行微调;以及探针引导的重排序(PGR),在推理过程中利用探针选择更好的候选。为支持系统化评估,我们发布了ParamBench,这是一个基于真实云网络API构建的基准,根据参数嵌套深度、跨参数依赖关系以及从先前调用推导值所需的推理,将每个实例划分为五个难度级别。我们在ParamBench上的5个开放模型以及6个外部基准上的大量实验表明,我们的方法显著改善了参数生成,将平均精确匹配率从19.7%提升至59.6%。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:38

# 正确设置参数:面向LLM工具调用的难度分级基准与探针引导训练

来源:https://arxiv.org/html/2608.03071

Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu\corresponding

###### 摘要

大型语言模型智能体的大部分能力源于工具使用。现有关于工具使用的研究主要聚焦于选择正确的工具以及编排调用的顺序。然而,正确填写工具调用的参数对于成功执行同样至关重要,却受到的关注要少得多。在云网络等领域,即使是前沿模型,正确完成的工具调用也不到一半。受近期分析(表明LLM隐藏状态编码了关于模型预测的丰富信息)的启发,我们发现当模型生成参数值时,其隐藏状态包含了一个强正确性信号:一个简单的线性探针即可准确预测该值是否正确。基于这一观察,我们提出了一个统一的探针引导框架,包含两种互补方法:探针过滤的引导训练(PBT),利用探针筛选可靠的自生成调用用于微调;以及探针引导的重排序(PGR),在推理期间利用探针选择更优的候选项。为了支持系统性评估,我们发布了ParamBench,一个基于真实云网络API构建的基准,根据参数嵌套深度、跨参数依赖关系以及从先前调用中推导值所需的推理,将每个实例划分为五个难度级别。在ParamBench上的5个开源模型和6个外部基准上的大量实验表明,我们的方法显著提升了参数生成能力,将平均精确匹配率从19.7%提高到59.6%。

## 1 引言

工具使用现已成为大型语言模型(LLM)智能体的核心能力。它使智能体与其上下文窗口之外的世界相连接:智能体通过读取API调用的返回来感知环境,并通过发出进一步的调用来执行行动。让工具使用良好运作并非易事。业界已经构建了诸如Model Context Protocol(Anthropic 2024 (https://arxiv.org/html/2608.03071#bib.bib1))和函数调用(OpenAI 2023 (https://arxiv.org/html/2608.03071#bib.bib23))等调用标准;研究领域已探索了何时调用工具、调用哪些API以及以何种顺序调用(Qin等人 2024 (https://arxiv.org/html/2608.03071#bib.bib29);Patil等人 2024 (https://arxiv.org/html/2608.03071#bib.bib26);Li等人 2023b (https://arxiv.org/html/2608.03071#bib.bib18);Qin等人 2025 (https://arxiv.org/html/2608.03071#bib.bib28))。然而,在许多涉及复杂工具调用的真实场景中,正确设置调用参数本身就是一个难题,而且受到的系统性研究要少得多。

参见图注

图1:工具使用概览与参数生成

形式上,我们将这一步骤定义为*参数生成*:给定指令、API模式和先前调用的结果,模型必须用正确的值填充工具调用的每个参数。有三个结构性质使其变得困难:(i)深度嵌套:参数可以是嵌套数层的对象;(ii)条件依赖:字段是否必需或有效可能依赖于其他字段;(iii)跨调用推导:某些值必须从先前调用的结果中推导得出。图1 (https://arxiv.org/html/2608.03071#S1.F1) 展示了该任务及三种困难。在我们的测试中,Claude Opus 4.7在0-shot设置下仅正确填写了NESTFUL中33.4%的调用。受先前工作(表明模型隐藏状态携带诸如自身输出是否为真等信号)(Azaria和Mitchell 2023 (https://arxiv.org/html/2608.03071#bib.bib2);Marks和Tegmark 2024 (https://arxiv.org/html/2608.03071#bib.bib22);Du、Xiao和Li 2024 (https://arxiv.org/html/2608.03071#bib.bib6))的启发,我们在参数级别检视了类似的信号,发现对隐藏状态进行线性探针可以预测参数值是否正确,域内AUC达到0.986。基于这一观察,我们在两个位置使用探针:训练侧的探针过滤引导训练(PBT)和推理侧的探针引导重排序(PGR)。

PBT针对的是有标注答案稀少而无标注指令丰富这一常见情形。首先在小型标注集上微调种子模型,然后为无标注指令生成答案;通过探针的答案被加入标注集,基础模型在扩大的集合上进行微调以产生最终模型。在PGR中,模型在推理时采样多个候选调用,探针对其评分,然后选择策略(候选级、字段级或字段集级)挑选最终调用。两侧付出的代价不同:PBT在训练时一次性改变模型,而PGR保持模型不变并在推理时花费额外的样本;两者可单独使用,也可组合使用。

为了评估参数生成,现有基准将生成的调用与参考调用进行匹配(Patil等人 2025 (https://arxiv.org/html/2608.03071#bib.bib25);Li等人 2023b (https://arxiv.org/html/2608.03071#bib.bib18);Wu等人 2024 (https://arxiv.org/html/2608.03071#bib.bib37);Basu等人 2025 (https://arxiv.org/html/2608.03071#bib.bib3))。它们不分类参数值的来源,也不对实例的难度进行分级。因此,我们提出了ParamBench,基于云网络中真实智能体工具调用执行轨迹构建。基于嵌套深度、跨参数依赖关系以及从先前调用推导值所需的推理,我们设计了一个固定规则,将每个实例的参数生成难度划分为五个级别L1至L5。这提供了模型填充工具调用参数的细粒度视图。

我们在ParamBench和6个外部工具使用基准(包括BFCL和API-Bank)上评估了PBT和PGR,覆盖Qwen3-8B和Gemma-4-12B等5个开源模型。在模型和数据集上取平均,普通的有监督微调将精确匹配率从19.7%提升到51.6%,而PBT将其提升到59.6%。在两个嵌套最深的基准上,PGR在推理时进一步提升了4.6个百分点。此外,与Claude Opus 4.7和GPT-5.4等前沿模型相比,采用PBT和PGR的Qwen3-8B模型在所有7个数据集上达到前沿水平,并在其中3个上表现最佳。

我们的主要贡献如下。

- C1(新焦点)。我们将参数生成置于工具使用研究的中心,对其进行形式化定义,并分析其三个难点:深度嵌套、条件依赖和跨调用推导。
- C2(内部信号监督)。我们证明隐藏状态正确性信号可以为结构化工具调用参数生成提供有效的监督。基于这一观察,我们提出了探针过滤的引导训练(PBT),用于在自训练期间选择可靠的伪标签,以及探针引导的重排序(PGR),用于在推理时选择最佳候选。
- C3(ParamBench数据集)。为对参数生成进行细粒度评估,我们发布了ParamBench,一个基于真实云网络智能体轨迹构建的基准,并根据参数的结构特性将每个工具调用实例划分为五个难度级别。
- C4(广泛评估)。我们在7个基准和5个基础模型上进行了大规模比较和消融实验,比较了4种选择信号和4个领先的工具使用模型,并表明PBT和PGR是最有效的策略。

## 2 相关工作

#### 工具学习与函数调用。

为语言模型配备外部工具已发展为一个成熟的研究领域,通常称为*工具学习*(Qin等人 2025 (https://arxiv.org/html/2608.03071#bib.bib28);Qu等人 2025 (https://arxiv.org/html/2608.03071#bib.bib30)),并得到如Model Context Protocol(Anthropic 2024 (https://arxiv.org/html/2608.03071#bib.bib1))和OpenAI的函数调用接口(OpenAI 2023 (https://arxiv.org/html/2608.03071#bib.bib23))等广泛采用的标准的支持。该领域的研究集中于三个问题。第一个是*何时*调用工具:Toolformer学习API调用应插入文本中的哪个位置(Schick等人 2023 (https://arxiv.org/html/2608.03071#bib.bib31)),MetaTool对是否调用工具的决策进行基准测试(Huang等人 2024 (https://arxiv.org/html/2608.03071#bib.bib12))。第二个是*选择哪个*工具:ToolLLM从超过16,000个候选中检索相关API(Qin等人 2024 (https://arxiv.org/html/2608.03071#bib.bib29)),Gorilla将检索与指令微调相结合(Patil等人 2024 (https://arxiv.org/html/2608.03071#bib.bib26)),Re-Invoke为重写查询以实现零样本检索(Chen等人 2024 (https://arxiv.org/html/2608.03071#bib.bib4))。第三个是*以什么顺序*组合多个调用:ReAct交替进行推理步骤和工具操作(Yao等人 2023 (https://arxiv.org/html/2608.03071#bib.bib39)),LLMCompiler规划可以并行运行的调用图(Kim等人 2024 (https://arxiv.org/html/2608.03071#bib.bib15))。这些工作都将一次准确调用视为一个整体单元,调用内部的参数生成未被作为独立问题研究。

#### 函数调用方法。

在目前所有研究中,填充每次调用的参数值都留给自由形式生成。约束解码保证了输出可解析,但无法判断哪个合法值是正确的(Willard和Louf 2023 (https://arxiv.org/html/2608.03071#bib.bib36);Dong等人 2025 (https://arxiv.org/html/2608.03071#bib.bib5))。在基准或大型合成调用数据上的工具调用SFT,仅在训练数据恰好包含困难案例时才覆盖这些案例(Liu等人 2025 (https://arxiv.org/html/2608.03071#bib.bib20);Qin等人 2024 (https://arxiv.org/html/2608.03071#bib.bib29);Patil等人 2024 (https://arxiv.org/html/2608.03071#bib.bib26);Zhang等人 2025 (https://arxiv.org/html/2608.03071#bib.bib40))。少样本提示仅覆盖示例所展示的内容。ReAct式推理仅在推理恰好得出正确值时才能得到正确的值(Yao等人 2023 (https://arxiv.org/html/2608.03071#bib.bib39))。迄今为止,专门解决参数生成难点的方法仍然缺失。

#### 工具使用基准。

在评估方面,现有基准聚焦于工具选择和多步编排(Li等人 2023b (https://arxiv.org/html/2608.03071#bib.bib18);Basu等人 2025 (https://arxiv.org/html/2608.03071#bib.bib3))。即便确实检查参数,度量也是粗粒度的:BFCL将参数正确性合并到单个调用成功分数中(Patil等人 2025 (https://arxiv.org/html/2608.03071#bib.bib25)),τ-bench仅通过最终任务结果来揭示错误参数(Yao等人 2025 (https://arxiv.org/html/2608.03071#bib.bib38)),Seal-Tools仅报告总体参数匹配率(Wu等人 2024 (https://arxiv.org/html/2608.03071#bib.bib37))。NesTools是将嵌套参数填充作为独立轴评分的最接近的先前工作,而当前模型在其上表现不佳(Han等人 2025 (https://arxiv.org/html/2608.03071#bib.bib7))。即便如此,现有数据集都没有在字段级别对参数生成进行评分,也没有按难度对每个实例进行分级。

#### 模型正确性的内部信号。

一系列工作表明,模型的隐藏状态编码了其自身输出是否正确,且通常比其表述的置信度或token概率更可靠。早期探针研究在事实陈述上确立了这一点:对隐藏激活进行简单探针可以判断一个陈述是否为真,而且真理性甚至以线性方向的形式出现在表示空间中(Azaria和Mitchell 2023 (https://arxiv.org/html/2608.03071#bib.bib2);Marks和Tegmark 2024 (https://arxiv.org/html/2608.03071#bib.bib22))。已完成答案的隐藏状态、嵌入和梯度同样可以检测幻觉文本(Hu等人 2024 (https://arxiv.org/html/2608.03071#bib.bib11);Orgad等人 2025 (https://arxiv.org/html/2608.03071#bib.bib24)),后续工作可以在生成之前或生成期间读取信号,从而在答案完成之前预测错误(Ji等人 2024 (https://arxiv.org/html/2608.03071#bib.bib13);Kossen等人 2024 (https://arxiv.org/html/2608.03071#bib.bib16);Snyder、Moisescu和Zafar 2024 (https://arxiv.org/html/2608.03071#bib.bib33))。该信号也可以被采取行动:可以标记可能的错误(Du、Xiao和Li 2024 (https://arxiv.org/html/2608.03071#bib.bib6)),或者引导生成朝向更真实的答案(Li等人 2023a (https://arxiv.org/html/2608.03071#bib.bib17))。然而,在工具使用中,这个信号几乎未被触及:唯一的尝试是在调用完全生成之后检测错误调用,对整个调用使用一个是/否标签(Healy等人 2026 (https://arxiv.org/html/2608.03071#bib.bib9))。

## 3 问题形式化

在生产级工具使用系统中,选择适当的API通常可以通过检索或路由来解决,而正确实例化结构化API参数仍然是一个主要挑战。本节将工具调用参数生成形式化为一个值填充任务,并识别其三个结构性困难来源:深层嵌套、字段间条件依赖和跨调用值推导。

给定目标API模式S(每个参数的名称、类型、必需标志、嵌套结构和字段描述)、自然语言指令I,以及上游工具调用及其输出的数据流上下文D={(t_i, o_i)},任务是生成一个参数实例p,该实例在S下符合格式要求并且相对于参考p∗是值正确的。在实践中,只有值正确性是困难的:对7个前沿模型的初步审计显示,其失败调用中只有2.1%违反模式,其余都是模式有效但值错误。下面三个挑战是值出错的主要原因。

#### CH-1:深度嵌套。

企业API参数通常不是扁平的键值映射,而是嵌套对象和对象列表。一个典型例子是ListTransitRouterRouteEntries的Filters参数:``Filters = [ {Key: DestinationCidrBlock, Value: [10.0.0.0/16]}, {Key: Status, Value: [Active]}, ... ] ``这是一个过滤器对象列表,其Value字段本身是一个列表:对象中的数组嵌在数组中的对象里。约束解码器可以保持这一形状的格式良好性,但正确的字面值仍必须放在正确的深度。

#### CH-2:字段间条件依赖。

某些参数仅在兄弟参数取特定值时才为必需或采用受限值:当NextHopType="RouterInterface"时NextHopId为必需;仅当type="VBR"时peerInfo子对象为必需。因此,同一个模式可以允许多种有效形状,由一个控制字段来选定。在生产API的公开模式中,这些规则很少以机器可读的形式编写;它们存在于人类可读的字段描述中,模型必须推断当前情境需要哪种形状。

#### CH-3:跨调用值推导。

许多正确值不在指令中,而在先前工具的输出中:DescribeVpcs返回的VpcId是DescribeVSwitches的输入。模型必须在上游响

相似文章

DataPrep-Bench: 将LLM作为训练数据准备器的基准测试

arXiv cs.LG

DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。

LLM代理已经知道何时调用工具——甚至无需推理

Hugging Face Daily Papers

本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。

易于完成,难以选择:探究LLM在ProverbIT基准上的表现

arXiv cs.CL

本文介绍了ProverbIT,一个包含100道多选题的新型意大利语基准,用于测试LLM完成谚语的能力。通过对13个模型的评估,研究发现,在没有正确答案的多选题格式中,模型性能显著下降,这表明模型依赖记忆模式而非深层的语义理解。

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。