SAAG:结构化智能体评估与基础验证
摘要
SAAG提出了一种级联诊断框架,用于评估LLM智能体函数调用,通过将评估分解为注册一致性、结构完整性和参数基础验证三个阶段,实现可解释的诊断和迭代自我修复。在sub-4B模型上的实验表明,与单次评估相比,参数精度得到提升,值幻觉减少。
arXiv:2607.18245v1 公告类型:新
摘要:智能体调用的精确匹配评估掩盖了性质不同的失败模式:模型可能选择了正确的函数却幻觉了参数值,或者满足了模式结构却出于错误原因选择了智能体。现有基准将这些区别压缩为单一的二元分数,使从业者无法诊断智能体调用的失败点。我们提出SAAG,一个级联诊断框架,将智能体调用评估分解为三个顺序阶段:注册一致性、结构完整性和参数基础验证,每个阶段产生可解释的阶段特定诊断。这些诊断还支持迭代自我修复:在预测失败时,阶段特定信号引导有针对性的纠正,且不泄露真实值。我们在一个基于Glaive函数调用数据集的控制基准上评估该框架,使用了包含5、10和15个智能体的注册规模,采用三个本地sub-4B参数模型。结构化反馈持续提升了参数精度并减少了值幻觉,相比单次推断和无信息量的二元反馈,而端到端F1指标的提升幅度较小且依赖模型。这些结果表明,阶段分解诊断评估是理解和提升跨模型家族与注册规模智能体调用可靠性的必要视角。
查看缓存全文
缓存时间: 2026/07/22 08:19
# SAAG:结构化智能体评估与基础 来源:https://arxiv.org/html/2607.18245 Ritvik Garimella¹,Vedant Khandelwal¹,Anvi Kohli¹,Amit Sheth¹,² ¹南卡罗来纳大学人工智能研究所 ²印度人工智能研究组织 通讯邮箱:ritvikg@sc\.edu (https://arxiv.org/html/2607.18245v1/mailto:[email protected]) ###### 摘要 对智能体调用的精确匹配评估掩盖了性质上不同的失败模式:模型可能选择了正确的函数却产生参数值的幻觉,或者虽符合模式但基于错误的理由选择了智能体。现有基准将这些区别归并为一个二值分数,使实践者无法诊断智能体调用失败的具体位置。我们提出SAAG,一个级联式诊断框架,将智能体调用评估分解为三个连续阶段:注册表符合性、结构完整性和参数基础,每个阶段产生可解释的阶段特定诊断。这些诊断还能实现迭代式自我修复:在预测失败时,阶段特定信号会指导有针对性的修正,而不会泄露真实值。我们在从Glaive函数调用数据集派生的受控基准上评估该框架,使用了5、10和15个智能体的注册表规模,以及三个本地子4B参数模型。与单次推理和无信息的二值反馈相比,结构化反馈持续改善参数精确度并减少值幻觉,而端到端F1的提升幅度较小且依赖模型。这些结果表明,阶段分解的诊断评估是理解并提高跨模型家族和注册表规模的智能体调用可靠性的必要视角。 SAAG:结构化智能体评估与基础 Ritvik Garimella¹,Vedant Khandelwal¹,Anvi Kohli¹,Amit Sheth¹,² ¹南卡罗来纳大学人工智能研究所 ²印度人工智能研究组织 通讯邮箱:ritvikg@sc\.edu (https://arxiv.org/html/2607.18245v1/mailto:[email protected]) ## 1 引言 函数调用已成为大型语言模型与API、搜索系统和外部软件交互的操作接口。核心评估问题不再是模型能否输出有效的JSON,而是它能否**基于正确的原因**选择**正确的**工具。模型可能产生语法正确的调用,却在部署中失败:选择的工具能力与请求不匹配,或者提供的参数未基于用户的真实查询。此类失败无声但代价高昂:调用通过了格式检查,但在操作上却是错误的。 近期工作,如API-Bank、ToolLLM、Gorilla、APIBench和BFCL,已为工具使用和API调用建立了强基准(Liet al.,2023 (https://arxiv.org/html/2607.18245#bib.bib15); Qinet al.,2024 (https://arxiv.org/html/2607.18245#bib.bib16); Patilet al.,2024 (https://arxiv.org/html/2607.18245#bib.bib17),2025 (https://arxiv.org/html/2607.18245#bib.bib18))。然而,主导的评估范式仍聚焦于**形式正确性**:模型是否输出了已注册的函数名,调用是否可执行,或执行是否端到端成功。这些指标并不能回答更关键的问题:**模型是基于对其能力的正确理解而选择工具的吗?** 现有评估在测量符合性方面很强,但在隔离工具调用失败的位置和原因方面较弱。近期关于工具幻觉的研究证实了这一担忧:可靠性对齐将工具选择幻觉与工具使用幻觉区分开来(Xuet al.,2025 (https://arxiv.org/html/2607.18245#bib.bib19)),而ToolBeHonest表明,即使顶级模型在工具可用性和任务可解性被系统变化时也会遇到困难(Zhanget al.,2024 (https://arxiv.org/html/2607.18245#bib.bib20))。有效的工具调用并不是工具理解有基础的充分证据。 第二个限制在于评估粒度。一次调用可能因为模型虚构了函数名、遗漏了必需参数、引入了无关参数或者编造了不支持(幻觉)的参数值而失败。现有基准将这些性质不同的失败模式归并为一个分数,使实践者无法识别模型是在函数选择、模式符合还是参数基础上失败。这种混同掩盖了诊断和有针对性改进的可能性。 我们提出SAAG(结构化智能体评估与基础),一个级联式诊断框架,将工具调用分解为三个连续阶段:**注册表符合性**(函数名是否在注册表中?)、**结构完整性**(参数是否满足模式?)和**参数基础**(参数值是否被查询支持?)。每个阶段产生可解释的阶段特定度量,可独立于任何修正策略应用于任何工具调用系统。作为这些诊断的一种实例化,我们还实现了一个级联修正循环,在失败时返回最小的结构化反馈,而不泄露真实值。该工具包作为更大规模的多智能体编排框架DYNO(Garimellaet al.,2026 (https://arxiv.org/html/2607.18245#bib.bib1))的子模块,其评估方案灵感来源于C3AN中的概念化(Shethet al.,2025 (https://arxiv.org/html/2607.18245#bib.bib2))。 #### 范围。 我们的研究聚焦于**从固定注册表中进行单工具选择**:一个受控但重要的步骤,为多智能体编排奠定基础。我们评估了三个子4B模型,使用5、10和15个智能体的注册表规模,比较了三种反馈机制:直接推理、二值反馈迭代和完整的SAAG结构化反馈。我们未声称解决多智能体编排、动态智能体发现或真实智能体执行;我们的目标是隔离诊断问题:**当智能体注册表变得容易混淆时,阶段分解的诊断度量能否揭示智能体调用失败的位置及原因,并且结构化反馈能否基于这些诊断来提升可靠性?** #### 贡献 1. 我们引入了SAAG的八个内在基础度量,作为诊断措施,在细粒度层面刻画智能体调用失败的特征。 2. 我们展示了这些诊断在三个本地小模型家族上作为级联修正循环的应用。 请参见图1的说明。 图1:SAAG框架。(A) 级联评估管道概览:工具调用模型的预测依次通过注册表符合性(阶段1)、结构完整性(阶段2)和参数基础(阶段3),每个阶段产生可解释的度量,并在失败时返回有针对性的修正信号ψₖ。仅在所有阶段通过后才评估真实值(外部评估)。(B) 一个工作示例,展示了四次修正迭代(d=1-4):模型首先虚构了一个函数名(FNEM=0),然后产生了漂移和无关参数,接着引入了一个数值幻觉,最后在d=4时得出一个完全有基础、符合模式的调用。 ## 2 结构化智能体评估与基础 SAAG将工具调用评估分解为三个连续的质量门:注册表符合性(§2.1)、结构完整性(§2.2)和参数基础(§2.3)。级联是严格的:评估在第一个失败阶段停止,确保下游度量仅在前置义务已满足的预测上计算。在每次失败时,向模型返回一个结构化修正ψₖ,从而实现迭代式自我修复,而不泄露真实值。此设计的一个重要后果是,来自后阶段的内在度量是**阶段条件诊断**:它们描述了已通过前阶段门限的预测的质量,不应被解释为无条件的总体统计量。我们将在报告结果时回到这一点。 ### 2.1 注册表符合性 首要义务是预测的函数名ŷₙₐₘₑ对应于一个已注册的工具。令ℛ表示系统提示中所有函数名的集合。我们定义**函数名精确匹配(FNEM)**为: FNEM(ŷₙₐₘₑ, ℛ) = { -1 如果 ŷₙₐₘₑ = ∅ ; 0 如果 ŷₙₐₘₑ ∉ ℛ ; 1 如果 ŷₙₐₘₑ ∈ ℛ } (1) 三种情况区分了完全解析失败(-1)、注册表不匹配(0)和符合性(1)。当FNEM=0时,我们计算一个**最近候选得分(NCS)**来量化与最接近有效名称的漂移: NCS(ŷₙₐₘₑ, ℛ) = max_{c ∈ 𝒞} [ 0.6 · WRatio(ŷₙₐₘₑ, c) + 0.4 · Jaccard(ŷₙₐₘₑ, c) ] 。 (2) 其中𝒞 ⊆ ℛ 是与ŷₙₐₘₑ共享至少一个三元组的候选集,WRatio是来自RapidFuzz(Bachmann,2025)的加权部分比率(归一化到[0,1]),Jaccard是在空白分词的小写字符串上计算的。使用0.6作为WRatio的权重,是因为它在较小变化下能更好地捕捉近似的字符串相似性,相比之下Jaccard提供了互补的token级重叠。**这能捕捉到:** 幻想或拼写错误的函数名。高NCS而FNEM=0表明是可恢复的拼写错误;低NCS表明是捏造。**这无法捕捉到:** “正确”的注册表名称是否实际上最适合该查询的工具。如果FNEM=1,阶段1通过;否则,修正ψ₁会识别名称是缺失还是未被识别,并嵌入最近的注册表匹配以指导修订,而不泄露真实值。修正模板见附录D。 ### 2.2 结构完整性 在符合的函数名前提下,第二个义务是预测的参数集合P满足该函数的模式。令A_ₘₐₙ和A_ₐₗₗ分别表示必需和允许的参数集。我们沿三个轴测量结构完整性。 #### 必需参数召回率(RPR) 衡量必需参数的覆盖范围: RPR = |A_ₘₐₙ ∩ P| / |A_ₘₐₙ| (3) RPR < 1 是硬性失败:缺少必需参数将导致执行失败,无论值的正确性如何。 #### 参数漂移分数(PDS) 捕捉超出模式的预测是可恢复的拼写错误还是幻想的参数。对于每个参数 p ∈ P \ A_ₐₗₗ: PDS(p, A_ₐₗₗ) = max_{a ∈ A_ₐₗₗ} WRatio(p, a) / 100 (4) 如果PDS ≥ 0.8且其最近匹配尚未作为精确预测出现,则参数被归类为**漂移**;否则为**无关**。漂移的参数会收到有针对性的拼写修正;无关的参数则被标记为删除。 #### 无关参数率(SPR) 衡量预测参数中没有可恢复模式基础的参数比例: SPR = |{ p ∈ P \ A_ₐₗₗ : PDS(p, A_ₐₗₗ) < 0.8 }| / |P| (5) #### 阶段2通过准则。 当且仅当 RPR = 1 且 SPR = 0 时,阶段通过。此外,漂移参数(PDS ≥ 0.8)无论正式通过/失败结果如何,总是触发有针对性的修正,因为未解决的漂移会传播到下游的基础失败,即使所有必需参数都存在。修正ψ₂按失败类型分层:缺少必需参数、无关包含和拼写漂移各自产生不同的指导。**这能捕捉到:** 模式违反、缺失、拼写错误和捏造的参数。**这无法捕捉到:** “正确”的参数名称是否带有适当的值。 ### 2.3 参数值基础 第三个义务是参数值忠实地基于用户查询Q。与前几个阶段不同,基础是连续的:模型可能产生 paraphrasing、接近命中或彻底的幻觉。 #### 参数值精确匹配(AVEM) 衡量预测值以逐字形式出现在Q中的比率: AVEM = |{ i : ExactMatch(vᵢ, Q) = 1 }| / |P| (6) 检查是类型感知的:字符串值在词边界处不区分大小写进行匹配;数值必须在Q中匹配一个浮点标记;列表值要求所有元素各自满足条件。精确匹配是应用于数值参数的**唯一**基础检查,没有部分信用回退。 #### 查询支持的词汇重叠(QSLO) 专门针对未通过精确匹配的字符串参数衡量词汇接近度。令 S = { i : type(vᵢ) = string ∧ ExactMatch(vᵢ, Q) = 0 }。则: QSLO = (1/|S|) Σ_{i ∈ S} PartialRatio(vᵢ, Q) / 100 (7) 其中PartialRatio通过RapidFuzz(Bachmann,2025)对vᵢ在Q内的最佳连续对齐进行评分。这是一个**词汇**重叠度量,而非语义相似度分数;它捕捉参数值是否是查询的可提取子串,而非它们是否语义等价。**这能捕捉到:** 释义或截断的查询片段。**这无法捕捉到:** 使用与查询完全不同的表面形式的语义有效值。 #### 值幻觉率(VHR) 汇总每个参数的幻觉情况: h(vᵢ, Q) = { 0, 如果 EM(vᵢ, Q) = 1 ; 1 - PR(vᵢ, Q)/100, 如果 str(vᵢ) ; 1, 如果 num(vᵢ) ∧ HN(Q) ; 排除, 否则。 } (8) 这里EM表示精确匹配,PR表示部分比率,HN表示有数字。我们使用str(·)和num(·)分别表示字符串和数值类型。 最后一种情况涵盖查询中没有基础上下文存在的参数(例如,从公司名推断出的股票代码)。这些被视为**假设**,被排除在通过/失败决策之外,因为惩罚它们会将幻觉与合法的模型推断混为一谈。通过准则定义在上下文子集 G = { i : type(vᵢ) = string } ∪ { i : type(vᵢ) = numeric ∧ HasNumbers(Q) } 上: VHR_ctx = Σ_{i ∈ G} h(vᵢ, Q) = 0
相似文章
SAGE:基于状态、弃权感知的任务导向对话智能体评估
SAGE是一种新颖的任务导向对话智能体评估框架,它将评估基于对话状态变化,并使用弃权机制来提供成本效益高、准确的回合级判断,无需昂贵的LLM调用。
SAAG:决定AI实际适用场景的实用方法论
SAAG(简化、自动化、智能体化、防护)是一种实用方法论,用于决定AI在业务中的适用位置,强调在自动化和智能体化之前先进行简化,并设置防护措施以降低风险。
Agri-SAGE:基于仿真的多智能体大语言模型用于上下文感知的农业咨询生成
本文介绍了Agri-SAGE,这是一个闭环框架,将多智能体大语言模型推理与生物物理模拟(APSIM)相结合,以生成并验证上下文感知的农业建议。在回顾性分析中,该框架优于静态基线,其中Tree-of-Thoughts实现了峰值产量,而Reflexion通过情景记忆降低了计算成本。
迈向可安全审计的大模型智能体:一种统一的图表示方法
本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。
SAGEAgent: 用于多模态生存预测中成本感知模态获取的自进化智能体
SAGEAgent 是一种基于LLM的临床智能体,它依次决定为癌症患者获取哪些诊断模态,以平衡预测准确性与临床侵入性,在将获取负担降低55%的同时,保持具有竞争力的生存预测性能。