智能体基准决策需要多少任务?对公开LLM智能体基准的重放分析
摘要
本文分析了在LLM智能体基准的部分评估中,需要多少任务才能得出与完整基准相同的两两对比结论。研究发现所需任务比例在不同基准间差异很大,并提出了部分评估的报告标准。
arXiv:2607.12338v1 公告类型:新
摘要:智能体基准通常在所有任务运行完毕后比较两个智能体,但高昂的评估成本使得部分运行颇具吸引力。仅凭任务比例无法判断部分运行是否与完整基准得出相同的两两对比结论。我们通过重放SWE-bench、AppWorld和tau-bench中已完成的公开任务级记录来研究这一问题。只有当部分预算支持完整基准的决策、覆盖所需任务组,并且未解决的比较不超过目标比例时,才认为该预算充足。所需任务比例差异很大。在5个百分点预算网格上严格0个百分点阈值下,AppWorld在15%时首次达到所有目标,tau-bench在25%时,SWE-bench Verified在90%时;而在主要覆盖规则下,SWE-bench Lite在95%时仍未达到所有目标。部分评估报告应说明一个智能体需超越另一个智能体多少、任务如何选择、需要何种覆盖规则、使用何种决策规则,以及最多可保留多少未解决的比较。
查看缓存全文
缓存时间: 2026/07/15 04:19
# 一个代理基准测试需要多少任务才能做出决策?——对公开LLM代理基准测试的重放分析
来源:https://arxiv.org/html/2607.12338
\(2026\)
###### 摘要。
代理基准测试通常在运行完所有任务后比较两个代理,但高昂的评估成本使得部分运行颇具吸引力。仅凭任务比例无法判断部分运行是否能得出与完整基准测试相同的成对结论。我们通过重放来自SWE-bench、AppWorld和tau-bench的已公开完整任务级记录来研究这一问题。仅当部分预算能支持完整基准测试的决策、覆盖所需任务组、且未解决的比较数量不超过目标比例时,该预算才被视为足够。所需任务比例变化显著。在严格0个百分点阈值、5个百分点预算网格上,AppWorld在15%时首次满足所有目标,tau-bench在25%,SWE-bench Verified在90%;而在主要覆盖规则下,SWE-bench Lite在95%时仍未满足所有目标。部分评估报告应说明:一个代理需超越另一个代理多少、任务如何选择、需要何种覆盖规则、使用何种决策规则,以及允许多少比较保持未解决状态。
LLM代理,代理评估,部分评估,最小充分任务预算,可复现性
††copyright:none††conference:KDD Workshop on Evaluation and Trustworthiness of Agentic AI; August 9, 2026; Jeju, Korea††journalyear:2026††ccs:Computing methodologies Artificial intelligence††ccs:General and reference Evaluation## 1. 引言
代理基准测试将众多任务结果转化为系统间的比较。在本文中,系统指的是公开排行榜上的条目,包括模型、提示词、工具、脚手架、重试逻辑以及其他产生任务结果的组件。一旦所有任务运行完毕,基准测试会为每个系统提供一个成功率。对于一对系统,基准测试用户可能会问:系统A的成对成功率相对于系统B是否足够高,以至于在当前决策中倾向于选择A是合理的。
改进阈值应与该决策相匹配。0个百分点(0 pp)阈值仅衡量方向:系统A的成对成功率是否严格高于系统B。正阈值(如5 pp或10 pp)要求在倾向于一个系统之前有更大的差距。在所有情况下,该阈值定义了在所有任务运行完后的完整基准测试决策。
运行更少的任务可以服务于两个目标。一个目标是分数估计:如果完整基准测试会给出系统55%的成功率,那么部分运行能否足够准确地估计这个数字?本文研究另一个不同的目标:如果完整基准测试会得出结论认为A优于B,那么在给定的错误目标、覆盖规则以及部分结论缺失情况限制下,部分运行能否支持相同的结论?分数是一种测量。成对结论是一种决策。
部分评估仅观察其预算内选定的任务。它可能先观察固定比例的任务,然后返回一个结论,或者花费更多预算,或者因观察到的任务不足而停止,不给出结论。我们将此类情况称为未解决的比较。在技术符号中,相同的结果记为推迟。例如,如果阈值是5 pp,且在100个观察到的任务中A领先4个,那么部分运行产生了一个分数,但它并未表明A超过了阈值。如果观察子集中的不确定性也阻止评估者得出A未超过阈值的结论,那么规则会让比较保持未解决状态,而不是强制得出结论。
这种区别很重要,因为部分评估可能以分数估计无法捕捉的方式失败。部分分数可能接近最终分数,但同时遗漏了一个会改变成对结论的任务组。一个低错误的部分规则也可能看起来可靠,因为它只决定容易的比较,而将较难的比较留作未解决。一个廉价优先的排序可以节省成本,但同时观察那些对于被比较的这对系统而言不具有信息量的任务。这些是决策失败,而不仅仅是估计误差。
一个小例子可以使问题具体化。假设一个部分运行只观察来自一个仓库的任务,其中A击败了B。如果未观察到的仓库足够强烈地偏向B,那么完整基准测试可能得出相反的成对结论。一份仅报告部分任务比例或部分分数的报告,不会说明观察到的任务是否覆盖了比较所需的组。当规则保留了许多困难的比较时,也会出现同样的问题:其报告的错误率可能较低,因为许多困难案例从未获得部分结论。
因此,我们通过重放部分任务运行来分析完整的基准测试记录。任务集、系统和任务结果是固定的;变化的是在预算耗尽之前哪些任务已被观察。目标是完整记录所引发的完整基准测试决策。关于未来任务、总体层面抽样或正式在线停止的声明需要不同的模型。
由此产生的问题比分数估计或在线停止更为具体:给定一个阈值、一个覆盖规则、一个关于未解决比较的目标、一个选择任务的规则,以及一个允许部分运行得出结论的规则,需要多少任务才能使部分运行足够频繁地匹配完整基准测试的决策,以满足所述的使用场景?
核心量是最小充分任务预算:在测试的预算中,能使部分运行对于所述决策足够可靠的最小者。为了估计它,分析从完整的任务级记录开始,并重放部分任务顺序。对于每个有预算的规则,它询问部分结论是否与完整基准测试匹配,观察到的任务是否覆盖了所需的任务组,以及规则缺乏足够证据得出最终结论的频率。只有当决策错误目标、任务组覆盖目标和未解决比较目标都得到满足时,任务预算才被认为是充分的。
经验证据是公开的,每个来源扮演着不同的角色。SWE-bench Lite和Verified为许多公开排行榜条目提供任务级的软件修复结果(Jimenez et al., 2024 (https://arxiv.org/html/2607.12338#bib.bib11);SWE-bench Team, 2026 (https://arxiv.org/html/2607.12338#bib.bib9))。SWE-bench Lite是大规模案例,预算通过任务数量来衡量。SWE-bench Verified是即使低重放错误率仍可能留下太多未解决比较的案例。AppWorld为交互式编码和应用使用代理提供任务级结果(Trivedi et al., 2024 (https://arxiv.org/html/2607.12338#bib.bib10)),这检验了相同的部分评估问题是否适用于软件修复之外的领域。tau-bench的公开轨迹发布提供了一个包含成本和奖励处理字段的网格(Yao et al., 2024 (https://arxiv.org/html/2607.12338#bib.bib7);Barres et al., 2025 (https://arxiv.org/html/2607.12338#bib.bib8)),这让我们能够测试一种廉价优先的失败模式。
**主要发现。** 公开记录显示了为什么任务比例本身不是决策规则。在严格0个百分点阈值、5个百分点预算网格上,AppWorld在15%时达到充分性,tau-bench在25%,SWE-bench Verified在90%。在主要覆盖规则下,SWE-bench Lite在95%时仍未达到充分性。在这种情况下,早期预算可以控制决策错误和覆盖失败,但太多比较仍然未解决。
确切的预算取决于阈值、覆盖规则、系统对方向和任务排序。在5 pp和10 pp时,SWE-bench Lite比在0 pp时更早达到充分性。在采用单任务容差的覆盖规则版本下,0 pp的SWE-bench Lite预算在25/50/75%网格上于75%时变得充分。每个无序系统对只保留一个方向是一种依赖性检查,而非替代有向比较;它可能改变正负支持以及一些充分预算的判断,因此我们明确报告系统对方向。
本文做出三项贡献:
1. (1)识别了报告失败:部分任务比例或部分分数可能隐藏错误的成对决策、缺失的任务组或过多未解决的比较。
2. (2)定义了最小充分任务预算,即在给定阈值下,满足决策错误目标、任务组覆盖目标和未解决比较目标的最小测试预算。
3. (3)在公开的SWE-bench、AppWorld和tau-bench记录上测量了该量,结果表明答案随基准测试、阈值、覆盖规则、未解决比较目标、系统对方向和任务排序而变化。
## 2. 相关工作
### 用更少的评估估计分数
高效的评估方法通常针对分数估计:能否从更少的项目中准确估计基准测试分数?HELM为广泛的语言模型评估标准化了场景和指标(Liang et al., 2023 (https://arxiv.org/html/2607.12338#bib.bib2))。MT-Bench与Chatbot Arena为聊天助手的成对偏好收集标准化了流程(Zheng et al., 2023 (https://arxiv.org/html/2607.12338#bib.bib4))。经济高效的LLM评估询问需要多少示例、查询或基准测试项目来估计模型性能。
几种统计工具适用于该分数估计目标。Cer-Eval通过置信区间为LLM评估构建测试数据充分性框架(Wang et al., 2025 (https://arxiv.org/html/2607.12338#bib.bib1))。FAQ在基准评估的有限总体视角下为性能估计提供置信区间(Wu et al., 2026 (https://arxiv.org/html/2607.12338#bib.bib5))。针对无放回抽样和分层分配的有限总体不等式为部分基准使用提供了工具(Serfling, 1974 (https://arxiv.org/html/2607.12338#bib.bib16); Neyman, 1934 (https://arxiv.org/html/2607.12338#bib.bib17))。
当目标是均值分数或置信区间时,这些方法是有用的。我们的目标是部分任务集是否支持与完整基准测试相同的成对决策。分数区间可以为该决策提供信息,但它并未指定完整的决策策略:什么阈值重要,必须覆盖哪些任务组,哪些决策错误是可接受的,或者评估者可以多频繁地保留最终决策。因此,除了部分分数外,我们还报告决策错误、任务组覆盖和未解决的比较。
### 代理基准测试与成本
代理基准测试使决策问题具体化,因为它们的任务昂贵、异构并且与下游使用相关。总成功率可能隐藏成本、可复现性和可靠性问题。Kapoor等人(Kapoor et al., 2024 (https://arxiv.org/html/2607.12338#bib.bib6))认为代理评估应考虑准确性、成本、下游开发人员需求、过拟合和可复现性。SWE-bench评估软件代理在实际GitHub问题解决中的表现(Jimenez et al., 2024 (https://arxiv.org/html/2607.12338#bib.bib11))。AppWorld评估通过API以程序化状态检查操作应用的交互式编码代理(Trivedi et al., 2024 (https://arxiv.org/html/2607.12338#bib.bib10))。tau-bench和tau2-bench在现实领域的代理-用户交互中评估工具使用(Yao et al., 2024 (https://arxiv.org/html/2607.12338#bib.bib7);Barres et al., 2025 (https://arxiv.org/html/2607.12338#bib.bib8));这里使用的公开轨迹文件也包括成本字段。
我们的分析从这些基准测试固定了它们的任务、系统和通过/失败结果之后开始。此时,评估者仍然需要一个在部分预算下用于一对系统的决策规则。相同的部分任务比例可以支持一个决策、失败覆盖,或者在观察错误任务组的同时节省成本。
### 停止规则与推迟
序贯检验和置信序列为在不确定性下的停止提供了工具(Wald, 1945 (https://arxiv.org/html/2607.12338#bib.bib18);Howard et al., 2021 (https://arxiv.org/html/2607.12338#bib.bib15))。选择性预测和学习推迟处理的是系统保留预测或将决策路由给另一个决策者的设置(Geifman and El-Yaniv, 2019 (https://arxiv.org/html/2607.12338#bib.bib13);Mozannar and Sontag, 2020 (https://arxiv.org/html/2607.12338#bib.bib14))。共形风险控制在明确假设下研究校准的风险约束(Angelopoulos et al., 2022 (https://arxiv.org/html/2607.12338#bib.bib12))。
我们对推迟的使用更为狭窄。在本文中,推迟意味着部分策略在预算处保留了比较未解决。由于完整基准测试记录在部分观察下被重放,测量目标不是在线停止或总体风险控制。它是在给定的覆盖和未解决比较目标下,部分运行是否保留了完整基准测试的成对决策。
## 3. 方法论
### 从部分分数到决策
设置从一个完整的基准测试记录开始。两个系统在相同任务上有通过/失败结果。完整记录告诉我们被测试系统在该固定任务集上相对于比较系统表现出了多大的优势。一旦评估者选择了改进阈值,完整基准测试就会引发完整基准测试决策:如果被测试系统的成对改进严格高于阈值,则得出正向结论,否则为负向结论。下面的指标名称使用“错误接受”和“错误拒绝”来表示这两个错误方向。普通行文使用正向结论、负向结论和未解决的比较。
重放询问如果在证据更少的情况下会发生什么。如果评估者只看到了任务集的固定比例,观察到的子集是否会导致相同的成对结论?一个有用的部分评估必须做的不仅仅是匹配容易案例的最终决策。它必须覆盖相关的任务组,并且足够频繁地返回最终结论以使其有用。
形式上,令 \( T = \{ t_1, \ldots, t_N \} \) 为固定的任务集。每个任务可以具有元数据,例如仓库、领域、难度或预期成本。对于一个有序的成对比较,令 \( A \) 为被测试系统,\( B \) 为比较系统。该比较询问一个单侧评估问题:被测试系统 \( A \) 相对于比较系统 \( B \) 是否超过阈值 \( \delta \)?一个无序对的两个方向共享相同的任务结果。因此,有序计数统计评估问题,而无序计数描述系统对的证据。我们报告这两个计数,并且在每个无序对仅保留一个方向后重复分析。
对于任务 \( t_i \),\( Y_{i,A} \in \{0,1\} \) 和 \( Y_{i,B} \in \{0,1\} \) 是验证过的结果。成对任务差为
\( (1) \quad D_i = Y_{i,A} - Y_{i,B}. \)
完整任务集给出
\( (2) \quad \Delta_{\mathrm{full}} = \frac{1}{N} \sum_{i=1}^{N} D_i. \)
对于预算 \( b \) 观察到的子集 \( S_b \),部分成对改进为
\( (3) \quad \widehat{\Delta}_b = \frac{1}{|S_b|} \sum_{i: t_i \in S_b} D_i. \)
#### 阈值。
在重放部分评估之前,评估者设定一个改进阈值 \( \delta \)。评估者将此阈值作为决策问题的一部分提供;基准测试提供任务结果。当问题仅仅是某个系统是否严格高于另一个时,阈值可以为零,或者当问题要求一个实际显著的差距时,阈值可以为正。相似文章
ORAgentBench:LLM代理能否端到端解决具有挑战性的运筹学任务?
本文介绍ORAgentBench,一个用于评估LLM代理在端到端运筹学任务中表现的执行基准,包含107个经过人工审查的任务。实验表明,当前最佳代理仅通过35.51%的任务,揭示了在可靠决策制定方面的重大不足。
Agentick:用于通用序贯决策智能体的统一基准
本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
Agent 评估:详细指南(53 分钟阅读)
关于评估基于 LLM 的 Agent 系统的全面指南,涵盖基本概念、评估框架以及来自近期基准测试的案例研究。