AgentJudgeBench:一个用于评估LLM法官在代理工具调用中的多难度基准
摘要
AgentJudgeBench是一个基准,用于评估LLM法官在代理工具调用场景中的可靠性,揭示了结构性上限等限制以及真实情况对对齐的微妙影响。
arXiv:2608.26623v1 公告类型:新
摘要:LLM法官广泛用于评估代理工具调用系统,但其在结构化、依赖驱动的工作流上的可靠性在很大程度上尚未被检验。我们提出AgentJudgeBench,这是第一个系统性地研究LLM-as-a-judge在代理工具调用中针对工作流DAG的可靠性的基准,区别于更广泛的开放式文本或偏好评估的LLM-as-a-judge任务。该基准包含3,808个实例,涵盖六个DAG拓扑和三个难度层级,使用五个生成器(3B-70B开放权重模型和GPT-5.4)和六个法官(20B到前沿尺度)在配对的真实情况存在和不存在条件下进行评估。法官对齐随任务难度单调下降,在没有真实情况下下降速度快1.5倍,在没有真实情况的困难查询中,所有六个法官无论尺度如何都收敛到一个狭窄的77-82%区间,揭示了一个主要由任务难度驱动的结构性上限,尽管其高度对较弱的生成器部分依赖于提示,且模型容量本身无法克服。真实情况暴露并非普遍有益:它降低了GPT-5.4(1.5个百分点)和Gemini-2.5-Pro(3.9个百分点)的对齐,与过度锚定一致。在缓解策略中,链式推理和法官温度都有可忽略不计的效果,而结构化评估量表最多可将对齐提高6.5个百分点,但未能在法官-生成器对之间均匀泛化。在有真实情况下,QwQ-32B最匹配程序化参考,而一项人类验证研究将GPT-OSS-120B识别为最符合人类对齐的法官;没有它时,前沿法官仅在共享上限内略占优势。这些结果揭示了当前LLM法官的根本限制,并为代理系统中的可靠评估提供了实用指南。
查看缓存全文
缓存时间: 2026/08/28 09:35
# AgentJudgeBench:一个评估LLM法官在智能体工具调用方面表现的多难度基准
来源:https://arxiv.org/html/2608.26623
Abhigya Verma附属机构:Amit Kumar Saha附属机构:Seganrasan Subramanian附属机构:Sai Harshitha Aluru附属机构:ServiceNow AI附属机构:印度海得拉巴
###### 摘要
LLM法官被广泛用于评估智能体工具调用系统,但它们在结构化、依赖驱动的工作流上的可靠性在很大程度上尚未得到检验。我们推出了AgentJudgeBench,这是第一个系统性研究基于工作流有向无环图(DAG)的智能体工具调用中LLM-as-a-judge可靠性的基准,它区别于更广泛的开放式文本或偏好评估的LLM-as-a-judge任务。该基准包含3,808个实例,涵盖六种DAG拓扑结构和三个难度层级,并使用五个生成器(3B–70B开源权重模型和GPT-5.4)和六个法官(20B到前沿规模模型),在配对的有/无真实结果条件下进行评估。法官的对齐度随任务难度增加而单调下降,在没有真实结果的情况下,下降速度快1.5倍;在没有真实结果的困难查询上,所有六个法官无论模型规模大小,都收敛到一个狭窄的77-82%区间,这揭示了一个结构性上限——主要受任务难度驱动,尽管其高度部分取决于较弱生成器的提示——是单纯增加模型容量无法克服的。暴露于真实结果并非普遍有益:它降低了GPT-5.4(1.5个百分点)和Gemini-2.5-Pro(3.9个百分点)的对齐度,这与过度锚定现象一致。在缓解策略中,思维链推理和法官温度的影响都可以忽略不计,而结构化评估量表可将对齐度提高高达6.5个百分点,但未能普遍适用于所有法官-生成器组合。在有真实结果时,QwQ-32B与程序化参考的最佳匹配度最高,而一项人类验证研究发现GPT-OSS-120B是与人类判断最一致的法官;在没有真实结果时,前沿法官仅略微领先,但受限于共同的上限。这些结果揭示了当前LLM法官的根本性局限,并为智能体系统中可靠的评估提供了实用指南。代码和数据集可在https://github.com/ServiceNow/SyGra/tree/scratch/agent_judge_bench/tasks/agentic_bfcl_judge_eval和https://huggingface.co/datasets/ServiceNow-AI/AgentJudgeBench获取。
## 1 引言
参见标题图1:AgentJudgeBench的总体流程。每个BFCL风格的智能体记录都经过难度可控的改写、生成器推理,并由程序化法官和LLM法官(有/无真实结果)并行评分,随后与程序化参考进行对齐。
使用LLM作为自动化法官已成为评估模型输出的标准做法(Zheng等人,2023;Tan等人,2025;Li等人,2024b)。在文本中心任务——对话、摘要、指令遵循——上,法官的可靠性已得到充分研究,并记录了已知的偏见和失败模式(Zheng等人,2023;Wang等人,2023a)。随着LLM越来越多地被部署为调用工具和协调多步骤工作流的自主智能体,法官范式很自然地被扩展到智能体工具调用领域(Qin等人,2024;Guo等人,2024;Guo等人,2025)。然而,这种扩展进行时并未进行基本的校准检查:*LLM法官在这种结构化环境中的可靠性如何?* 智能体工具调用与文本评估在法官可靠性方面存在重要差异。正确性并非关乎流畅度或偏好:它需要从类型化模式中选择正确的工具,提供格式良好的参数,排序调用以尊重执行依赖关系,并覆盖用户意图的所有部分。一个计划可能以四种正交方式失败(工具选择、参数结构、序列准确性、查询覆盖),这些方式并不完全相关——一个在某方面可靠的法官可能在另一方面视而不见,例如,可能在简单顺序任务上经过校准,却在复杂的扇入或菱形工作流(其中并行分支必须收敛)上失败。当没有真实执行轨迹可用时——这是常见的部署场景——法官必须仅从查询和工具模式本身重建正确性,这本质上是一个更难的推理问题。现有的部署LLM法官进行工具调用的基准仅报告总体通过率一致性,并且没有改变这些维度中的任何一个(Qin等人,2024;Guo等人,2024;Guo等人,2025),导致从业者在选择法官、设置配置或解释其输出时缺乏原则性依据。
我们引入AgentJudgeBench来填补这一空白。该基准包含3,808条BFCL风格记录(Patil等人,2025),涵盖三种受控难度层级的六种DAG¹拓扑结构,每条记录都带有程序验证的真实轨迹。五个生成器——四个开源权重(3B–70B)和一个前沿模型(GPT-5.4)——产生工具调用输出,由六个LLM法官(从20B开源权重到前沿闭源系统)在四个结构化指标(工具选择、参数结构、序列准确性、查询覆盖)上,在配对的有/无真实结果条件下进行评分,产生了321,648个配对的有真实结果/无真实结果评估(附录D)。我们围绕六个研究问题组织分析:哪些指标和拓扑最难(RQ1),法官彼此之间的一致性如何(RQ2),为什么无真实结果时的对齐在困难查询上会收敛(RQ3),以及对齐对法官温度(RQ4)、思维链推理(RQ5)和提示格式(RQ6)的敏感度如何。结果并非显而易见。法官的对齐度随查询难度单调下降,在没有真实结果的情况下,下降速度快1.5倍,且在没有参考的真实结果的困难查询上,所有六个法官无论模型规模大小都收敛到77–82%的上限;一项后续消融研究(§4.2)证实任务难度是能力强的生成器的主要驱动因素,尽管其上限高度对于较弱的生成器在一定程度上取决于提示。暴露于真实结果并非普遍有益:两个前沿法官(GPT-5.4,Gemini-2.5-Pro)在展示参考后*一致性更低*,这与过度锚定而非独立判断相符。思维链在24项配对比较中最多增加0.3个百分点,温度的影响可以忽略不计(≤0.25个百分点的范围,两对法官-生成器组合)。结构化的逐指标提示量表在一组配对上比自由形式增加+4.8–+6.5个百分点,这是我们测试的最大杠杆,但第二组配对显示效果较小且在困难查询上反转,因此我们认为提示格式具有影响力但取决于法官/生成器,而非普遍主导(§4.2)。法官间一致性中等(有真实结果时κ≈0.42),且存在系统性、与容量相关但总体得分中不可见的模式。
**范围。**我们专门研究智能体工具调用中的LLM-as-a-judge,而非更广泛的LLM-as-a-judge文献;DAG结构化的工具使用数据、合成依赖图和程序化轨迹评分各自有密切的先驱工作(§2)。我们的贡献是将它们结合起来的可靠性*协议*——配对的有/无真实结果条件、受控难度和逐指标分解——应用于衡量法官的可靠性而非智能体的能力。
**贡献。**
(1) 一个包含3,808条记录的数据集,涵盖六种DAG拓扑和三个难度层级,带有程序验证的真实轨迹,将公开发布。
(2) 一个四指标评估框架,包含配对的有真实结果/无真实结果协议和引导置信区间。
(3) 一个包含六个RQ的系统性实证研究,提供了可操作的指导:有真实结果时,QwQ-32B与程序化参考的最佳匹配度最高,而GPT-OSS-120B是我们的验证研究中与人类判断最一致的法官(附录G);没有真实结果时,前沿法官略微领先,但收敛上限限制了实际差异。
## 2 相关工作
表30(附录V)调查了三个相关领域的先前工作;我们在下文中解释关键区别。
### 2.1 智能体数据与工具调用基准
评估工具调用智能体的主流范式使用基于环境的执行反馈(Zhou等人,2024;Drouin等人,2024;Trivedi等人,2024;Yao等人,2024)或基于注释轨迹的确定性评分(Deng等人,2023;Xu等人,2025a;Patil等人,2025)。τ-bench(Yao等人,2024)使用模拟用户对智能体进行压力测试,并提出pass^k可靠性而非每轮正确性;与这条线普遍一样,它评估智能体但不审查产生这些分数的法官。BFCL(Patil等人,2025)是与我们的数据格式在结构上最接近的前身,它隔离了使用类型化JSON模式和基于AST的真实结果比较的单轮函数调用;我们采用相同的模式,但将其扩展到三个受控难度层级的多步骤DAG结构化工作流。结构上最相似的工作是FuncBenchGen(Maekawa等人,2025),它将多步骤调用视为具有可控复杂性的DAG遍历。关键区别在于目的:FuncBenchGen训练和评估*生成器*智能体,而AgentJudgeBench通过配对的有真实结果/无真实结果协议和FuncBenchGen未提供的逐指标分解,衡量*法官*对那些生成器输出的可靠性。TaskBench(Shen等人,2024)共享工具依赖图框架,但关注分解质量而非法官对齐。合成数据管道(Wang等人,2023b;Xu等人,2025b;Cui等人,2024)为我们的生成方法提供了信息,但目标是模型训练而非评估基准。
### 2.2 LLM-as-Judge
Zheng等人(2023)在MT-Bench上确立了LLM-as-judge范式,展示了GPT-4在开放式对话中与人类偏好有很强的一致性,同时识别了位置偏好、冗长敏感性和自我增强等系统性偏见。后续工作要么扩展评估范围——JudgeBench(Tan等人,2025)和Arena-Hard-Auto(Li等人,2024b)转向困难的、可验证的响应对——要么构建专门的法官模型(Wang等人,2024;Li等人,2024a;Zhu等人,2023;Kim等人,2024)。JudgeLM(Zhu等人,2023)在GPT-4蒸馏的裁决上微调7B–33B法官,并识别了与基于提示的法官报告的偏见相似的位置、知识和格式偏见;Prometheus 2(Kim等人,2024)增加了基于量表条件的直接评估并具有开源权重。两者都针对文本质量评分而非结构化工具调用正确性,但它们的偏见分类法为我们的提示格式消融(§4.2)提供了信息。陪审团法官范式(Verga等人,2024)表明集成可以减少单个法官的偏见。至关重要的是,这条线针对的是文本中心任务,其中法官质量归结为对流畅输出的偏好对齐。AgentJudgeBench占据了不同的领域:正确性是结构性的,裁决空间是{0,0.5,1}而非偏好排序,失败模式是多维且相互依存的。
### 2.3 用于工具调用的LLM法官
LLM法官已在几个最近的基准中用于工具调用评估,但总是作为实施细节而非研究主题。ToolLLM(Qin等人,2024)使用ChatGPT计算API轨迹的通过率,报告总体87.1%的人类一致性;StableToolBench(Guo等人,2024)和MCP-AgentBench(Guo等人,2025)采用类似方法并使用更新的法官模型。GeoBenchX(Krechetova和Kochedykov,2025)组建了一个三法官小组,达到88–96%的一致性,而Agent-as-a-Judge(Zhuge等人,2024)和Auto-Eval Judge(Bhonsle等人,2025)提出了更结构化的评估框架。在每种情况下,法官可靠性都是作为小样本上的单一总体数据报告的,没有改变任务复杂性、难度或真实结果可用性。ToolSandbox(Lu等人,2024)直接质疑LLM法官的可靠性,但用程序化评估代替法官,而非表征其失败模式。AgentJudgeBench采取了互补的立场:保留法官范式并系统性地衡量它,在321,648项完成评估(附录D)中,按指标、拓扑、难度和条件分解可靠性。所有七个相关系统的详细特征比较见附录L。
## 3 方法论
图1提供了流程的端到端视图。每条记录扩展为三种难度变体;每个生成器g∈G产生工具调用预测;一个确定性的程序化法官对每个预测进行评分以产生参考向量pr;每个LLM法官j∈J产生配对的裁决lj,rGT和lj,rwithout GT,通过公式5a与pr进行比较。完整流程实现为S上的计算图。相似文章
移动智能体评估中的 LLM 评判器基准测试
本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。
RankJudge:一个多轮LLM-as-a-Judge合成基准生成器
RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。
Agent Judge:解决生产环境智能体的长上下文评估(10分钟阅读)
Agent Judge 是一种智能体评估工具,通过处理长轨迹、对照事实源系统验证状态化动作以及适应行为变化,克服了简单 LLM 评判器在长周期智能体评估中的局限性。
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 评测基准
AJ-Bench 提出一套评测基准,用于衡量 Agent-as-a-Judge 系统通过与环境交互来验证智能体行为的能力,覆盖搜索、数据系统与 GUI 领域的 155 项任务。
JudgeArena:可复现的LLM裁判评估统一框架
JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。