EcoAgent-Bench:评估预算受限的LLM代理中的经济决策

arXiv cs.AI 论文

摘要

本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。

arXiv:2608.05519v1 公告类型:新 摘要:代理基准测试通常衡量任务完成情况,并将资源使用视为辅助统计量。然而,在实际部署中,在本地查找、广泛搜索、组合研究工具、更强的模型或人工升级之间的选择本身就是任务的一部分。我们引入了EcoAgent-Bench,其中每个任务都指定了定价操作和明确的预算。其304个真实衍生任务涵盖五个任务族,改编自GAIA、HotpotQA和MuSiQue,并测试四种决策:避免不必要的升级、在本地证据不足时升级、选择模型层级,以及在无依据的前提上停止。我们在工具API和工作区CLI设置中评估了七个LLM代理,以及四个预言机脚本控制。微平均准确率奖励单边策略:始终升级的控制实现了高微成功,但在节省导向的任务上失败。因此,我们还报告了一个经济一致性分数(升级导向和节省导向任务组准确率中的较差者),该分数揭示了这一失败。工具API代理的微严格成功率仅为3.9%-24.0%(经济一致性最多为7.3%),通常要么在应升级之前停止,要么在廉价任务上过度支出。阈值交叉预算扫描将GPT-5.4的升级率从0%仅改变到3%。这些结果表明,在预算下完成任务和经济地选择行动是两种不同的属性。我们发布了研究这两者所需的任务包、转换管道、冻结的评估环境和完整性绑定的结果工件。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:47

# EcoAgent-Bench:评估预算受限的 LLM 智能体中的经济决策

Source: https://arxiv.org/html/2608.05519

###### 摘要

Agent 基准通常衡量任务完成情况,并将资源使用视为辅助统计量。然而,在实际部署中,在本地查找、广度搜索、复合研究工具、更强模型或人工升级之间进行选择,本身就是任务的一部分。我们引入了 **EcoAgent-Bench**,其中每个任务都指定了定价操作和明确的预算。其 304 个真实衍生任务横跨五个任务族,改编自 GAIA、HotpotQA 和 MuSiQue,并测试四种决策:避免不必要的升级、本地证据不足时进行升级、选择模型层级、以及在前提不支持时停止。我们在工具 API 和工作区 CLI 设置中评估了七个 LLM 智能体,以及四个 oracle 脚本化控制。微平均准确率会奖励单边策略:总是升级的控制实现了高微平均成功率,却在节省型任务上失败。因此,我们还报告了一个*经济一致性*分数——升级导向与节省导向任务组中准确率的较低者——该分数暴露了这一失败。工具 API 智能体的微严格成功率仅为 3.9%–24.0%(经济一致性最高为 7.3%),它们往往在应升级时过早停止,或在廉价任务上过度花费。一次跨阈值预算扫描使 GPT-5.4 的升级率从 0% 仅变为 3%。这些结果表明,预算限制内的完成与经济化的动作选择是两个不同的属性。我们发布了任务包、转换流水线、冻结的评估环境,以及研究这两者所需的完整性绑定结果工件。

## 引言

基于 LLM 的智能体浏览网页、编写代码、查询数据库,并编排多步骤工作流。然而,每一个动作都有成本:API 调用消耗 token,复合工具收取额外费用,而人工升级则代价高昂。现有的智能体基准——GAIA(Mialon 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib1))、SWE-bench(Jimenez 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib2))、WebArena(Zhou 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib3))、AgentBench(Liu 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib4))和 τ-bench(Yao 等人,2025 (https://arxiv.org/html/2608.05519#bib.bib5))——主要衡量任务完成情况;资源使用通常只在外包(episode)结束后报告。很少有基准将明确的预算和定价操作作为任务实例的一部分,使得首选动作会随可用证据而变化。

我们认为这是一个关键缺口。一个总是调用最昂贵工具的智能体可能准确但浪费;一个总是使用最便宜工具的智能体可能节俭,但在廉价证据不足时却会出错。经济理性的智能体会做出*条件性*决策:当廉价证据足够时使用它,仅在证据需要时才升级,只有在推理需求确实需要时才路由到更强(更贵)的模型,并且在无法找到答案时停止——而不是继续花钱。

EcoAgent-Bench 将这一设定操作化(图 1 (https://arxiv.org/html/2608.05519#Sx1.F1))。任务源自既有数据集,而非仅仅为说明成本权衡而编写。转换过程在保留源问题或议题的同时,添加了带预算的工具环境、标准策略轨迹、与之形成对比的高遗憾轨迹,以及分离的智能体与评估器视图。

贡献。\(1\) 一种预算条件化的任务格式,其中成本是任务的一部分,而非记录后果。\(2\) 一个包含 304 个任务、五个真实衍生家族的任务包,覆盖四种经济决策。\(3\) 一个可复现的转换协议,具有确定性选择、泄漏与来源检查、离线模型层级标签、经过验证的虚假前提停止任务,以及完整性绑定的结果工件。\(4\) 对七个 LLM 智能体和四个 oracle 控制的评估,跨越三条轨道,包括一次跨阈值预算扫描,用于测试工具选择是否随可用预算而变化。\(5\) 一个*经济一致性*诊断指标——升级导向与节省导向任务组准确率的较低者——它揭示了被单纯微平均准确率所掩盖的单边策略。

参见图注 图 1:EcoAgent-Bench 流水线。数据集种子被转换为带有定价操作、独立智能体/评估器视图、标准轨迹和高遗憾轨迹的冻结任务。评估记录正确性、证据访问、预算可行性和轨迹成本,覆盖五个任务族。

## 相关工作

智能体基准。GAIA(Mialon 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib1))、SWE-bench(Jimenez 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib2))、WebArena(Zhou 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib3))和 AgentBench(Liu 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib4))评估智能体是否能够*完成*任务;τ-bench(Yao 等人,2025 (https://arxiv.org/html/2608.05519#bib.bib5))增加了模拟用户和领域政策,OSWorld(Xie 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib6))则测试真实桌面环境。这些基准主要评估成功完成情况,而非在明确价格表下的条件性动作选择。EcoAgent-Bench 的不同之处在于将成本作为任务的一等约束:同一任务根据证据质量和剩余预算,可能需要不同的工具策略。

成本感知评估。CostBench(Liu 等人,2025 (https://arxiv.org/html/2608.05519#bib.bib7))是最接近的先前工作:一个带有定价原子与复合工具以及动态成本变化的成本最优多轮工具规划基准。EcoAgent-Bench 与其是互补关系,而非对其的修正:我们强调*真实衍生*任务、*证据条件化*升级、显式*模型层级路由*和*止损*决策,以及带有防泄漏控制的冻结智能体/评估器分离。FrugalGPT(Chen 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib8))和 RouteLLM(Ong 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib9))通过逐查询层面的模型级联解决成本问题,而非多步骤工具规划。Kapoor 等人(Kapoor 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib10))认为智能体评估必须衡量与部署相关的因素(包括成本);我们将这一主张操作化。

工具使用与弃答。Toolformer(Schick 等人,2023 (https://arxiv.org/html/2608.05519#bib.bib11))、Gorilla(Patil 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib12))以及 Qin 等人的综述(Qin 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib13))奠定了工具使用领域的基础;SWE-agent(Yang 等人,2024 (https://arxiv.org/html/2608.05519#bib.bib14))和 OpenHands(Wang 等人,2025 (https://arxiv.org/html/2608.05519#bib.bib15))提供了工作区接口。我们的种子来源包括 HotpotQA(Yang 等人,2018 (https://arxiv.org/html/2608.05519#bib.bib18))和 MuSiQue(Trivedi 等人,2022 (https://arxiv.org/html/2608.05519#bib.bib19))的多跳问答。止损任务族根植于 SQuAD 2.0 的弃答传统(Rajpurkar 等人,2018 (https://arxiv.org/html/2608.05519#bib.bib20)):一个能力合格的系统在没有任何答案被支持时必须拒绝回答。LLM-as-a-judge 评分(Zheng 等人,2023 (https://arxiv.org/html/2608.05519#bib.bib16);Liu 等人,2023 (https://arxiv.org/html/2608.05519#bib.bib17))支撑了我们的语义评估。

## 基准设计

### 任务结构

每个任务包含一个指令、一个智能体可见的冻结定价环境,以及仅评估器可见的 oracle 材料。它还指定了一条*标准*预算合规轨迹、一条形成对比的*高遗憾*轨迹,以及由标准成本推导出的宽松/中等/严格预算。标准轨迹代表任务构造者的预期决策:它通常更便宜,但必须升级的项目需要更昂贵的模型层级。对比轨迹则捕获不必要的升级,或一种无法解决该任务的更廉价动作。表 1 (https://arxiv.org/html/2608.05519#Sx3.T1) 列出了共享的检索动作;补充材料给出了每个家族的完整核算和完整注册表。

表 1:共享检索动作与抽象价格。廉价搜索与 agentic 深度研究之间的差距使得过度升级变得可测。

### 经济决策

五个任务族实例化了四种经济决策:

- • 不要过度升级。廉价证据已经足够;为高级工具付费是浪费。由 `cheap_qa` 承载(低成本搜索已能呈现答案,而 agentic 深度研究则冗余)。
- • 必须升级。一次廉价搜索只返回部分或误导性证据;答案位于只有迭代深度研究才能触及的来源。由 `escalation_qa` 承载。
- • 模型层级路由。所有证据在本地都是完整的;唯一的决策是推理是需要昂贵的前沿模型,还是廉价的小模型已然足够。由 `model_upgrade_qa` 以及真实 GAIA 的 `frozen_information_qa` 锚点承载。
- • 止损。前提不受支持。智能体应当收集证据并弃答,而不是继续花费或捏造答案。由 `stop_loss` 承载。

### 经济理性

给定预算为 \(B\) 的任务 \(t\),智能体选择一条轨迹 \(\pi=(a_1,\dots,a_k)\),其每步动作成本为 \(c(a_i)\),总成本为 \(C(\pi)=\sum_i c(a_i)\)。令 \(\mathbb{1}[\pi\models t]\) 表示答案是否正确。轨迹的效用为

\[
U(\pi,t)=\begin{cases}
R-\lambda\,C(\pi) & \text{if } \mathbb{1}[\pi\models t]=1,\; C(\pi)\le B\\
-\lambda\,C(\pi) & \text{if } \mathbb{1}[\pi\models t]=0,\; C(\pi)\le B\\
-\infty & \text{if } C(\pi)>B
\end{cases}
\]

其中 \(R\) 奖励正确性,\(\lambda>0\) 对成本加权。经济理性的智能体会最大化 \(\mathbb{E}[U(\pi,t)]\):当廉价工具足够时使用它们,只在不够时升级或向上路由,在任何工具都无济于事时停止,并且绝不超出预算。

### 成本模型

我们使用抽象单位,因为供应商价格和工具实现会随时间变化。该价格表保留了一个粗糙的层级结构:有界本地操作是基础;更广的检索花费数次本地操作;复合智能体的成本大致高一个数量级;人工升级最高。模型层级价格在独立的 1:8 尺度上定义。公开搜索和模型价格支撑了这些层级(Google,2026a (https://arxiv.org/html/2608.05519#bib.bib21) 和 b (https://arxiv.org/html/2608.05519#bib.bib22);Perplexity AI,2026 (https://arxiv.org/html/2608.05519#bib.bib23)),但这些单位并非美元估算。补充材料报告了完整的层级校准和工具注册表。

该标度被有意压缩,以便升级在某些任务上仍然可行,而不是在构造上就被排除。为了测试所选取整数对结果的敏感性,我们独立地用一个从 \(U(1/R,R)\) 抽取的因子扰动每个动作成本。在七个家族/决策层的每一层各进行 50,000 次抽取后,标准轨迹与高遗憾轨迹之间的先后顺序在 \(R=2\) 时 100% 的抽取中得到保持,在 \(R=3\) 时至少 99.90% 得到保持。这一分析支持的是相对动作成本的论断,而非对特定部署计费模型的迁移。

## 任务族

表 2:评估包:跨五个真实衍生家族的 304 个任务。

`frozen_information_qa`(7 个)。真实 GAIA 2023 验证集问题,附件被冻结为本地文本,包括保留单元格背景颜色的电子表格,从而使颜色/空间问题仍然有据可依。由于证据在本地是完整的,这里的决策是模型层级的选择(廉价模型 vs. 前沿模型);它们作为模型升级轴上的真实 GAIA 锚点。

`escalation_qa`(115 个)。真实衍生自 HotpotQA 多跳问题(96 个)、GAIA 表格(4 个)和 MuSiQue 可回答问题(15 个)。一个支持性跳跃被隐藏到一个仅能通过迭代深度研究到达的权威来源,因此本地(充满干扰项)的结果确实不足,而回答*必须*升级。

`cheap_qa`(72 个)。真实衍生自 MuSiQue 双跳可回答问题,其答案直接出现在普通的(冻结的)搜索引擎结果中:一次低成本搜索加上快速阅读即足够,因此为 agentic 深度研究付费是浪费的过度升级。该族是升级族的问答对偶:智能体看到一页搜索结果,而正确决策是*相反的*——仅当答案尚未出现时才升级。

`stop_loss`(10 个)。经过验证的虚假前提项目基于 MuSiQue 干扰语料编写,并独立检查为不可回答。目标行为是在证据访问后基于证据不足而弃答,而非重复搜索或捏造。

`model_upgrade_qa`(100 个)。真实衍生自 HotpotQA,所有支持证据都保留在上下文中,因此唯一决策是运行哪个模型层级。该族在 50 个必须升级 / 50 个廉价足够之间保持平衡,并预先离线记录每项的快/专业模型可解性,作为查找表发布,因此评分无需在评估时进行实时模型调用。

## 转换协议

对于每个家族,流水线应用相同的高层阶段:\(1\) 从带来源元数据的真实种子池中获取或摄取;\(2\) 使用加盐的稳定哈希从候选池中确定性选择行;\(3\) 将种子行改编为带冻结证据的预算条件化任务;\(4\) 将仅评估器可见的 oracle 材料与智能体可见视图分离;\(5\) 物化固定数据和投影清单以供外部审查;\(6\) 运行泄漏、可追溯性、预算、来源、打包和可重现性检查。协议同时记录继承的种子内容和 EcoAgent 新增的表面,因此该基准并非仅仅“SWE-bench / GAIA / 多跳问答加一个成本列”。预算化的工具环境、标准和高遗憾轨迹,以及经过删减的智能体视图,都是被转换任务的一部分。

## 有效性控制

无泄漏。在智能体视图中,预期答案仅在冻结证据中自然出现时才出现;评估器理由、诱导性答案、层级标签和参考轨迹均被移除。

答案可用性。对于可解决的任务,预期答案可以从冻结证据或评估器提供的支持字段中恢复。当前回合级接地检查有意较为粗糙:对于几个问答族,它验证的是证据访问,而非从引用片段中推出的蕴含关系。

升级验证。每个 `escalation_qa` 任务都对照四个条件进行检查:廉价搜索无法到达权威来源;答案不存在于任何廉价可见文档中;深度研究可以到达它;脚本化廉价智能体失败,而升级智能体成功。

模型层级验证。廉价足够项目要求一个小模型在全部三次尝试中都能正确回答;必须升级项目要求小模型全部三次失败,而前沿模型在大多数尝试中成功——因此标签反映的是稳健的能力差距,而非单次噪声。预算在该族内保持一致,使其大小不会泄漏正确层级,同时成本遗憾项仍然惩罚过度升级。

止损验证。停止任务被独立检查为虚假前提项目。评分器要求在证据访问之后进行证据不足的弃答;它不要求调用标准深度研究。

难度线索。工作区运行中的任务 ID 会被哈希化,预算为 s

相似文章

BAGEN:LLM智能体是否具有预算意识?

arXiv cs.LG

本文介绍了BAGEN,一个评估LLM智能体预算意识的框架,将预算估计定义为内部预算和外部预算,并形式化了渐进式区间估计。实验表明,强智能体缺乏预算意识,过于乐观,提前停止可以节省令牌,而训练可以改善告警行为。