DAREBench: 部署感知与可靠评估模型作为代理
摘要
DAREBench 是一个专为部署感知和可靠评估 AI 模型作为代理而设计的基准测试,评估多模态任务和执行形式,结果显示在商业模型和开源权重模型之间存在准确性和成本的权衡。
arXiv:2609.06059v1 Announce Type: new
摘要:随着大型语言模型从问答系统演变为通用代理,评估必须超越静态答案正确性,以评估多模态感知、多步骤执行、工具使用和制品交付。然而,现有的基准测试通常与特定任务类型、执行环境或评分协议绑定,限制了它们在部署决策中的可比性、可解释性和可靠性。我们介绍了 DAREBench(部署感知与可靠评估模型作为代理),这是一个旨在捕获工作负载变化并支持可靠代理评估的基准测试。基于共享的 OpenClaw 执行环境,DAREBench 将从 22 个源基准测试中选择和调整的 233 个任务组织成一个由输入模态和执行形式定义的 $\times3$ 工作负载矩阵,并在统一的基于合同的协议下使用基于证据的分数审计进行评估。我们评估了 23 个商业 API 模型和 12 个本地部署的开源权重模型,共进行 7,587 次模型--任务运行,报告了准确性、令牌消耗以及 API 模型的参考成本。结果显示,没有单一模型在所有工作负载组中占据主导地位,文本和多模态任务表现出不同的准确性--成本权衡,本地开源权重模型在几个组中具有竞争力,但总体上仍落后于前沿商业模型。这些发现表明,代理部署和模型选择应考虑工作负载配置文件、部署模式以及准确性--成本权衡,而不是依赖单一的聚合分数。
查看缓存全文
缓存时间: 2026/09/10 08:45
# DAREBench:部署感知与可靠的智能体模型评估基准
来源:https://arxiv.org/html/2609.06059
刘之林、杨志伟、张少杰、邓哲远、黄廷伟、罗振波、姜磊、刘彦兵、付培(\corresponding)
###### 摘要
随着大语言模型从问答系统演变为通用智能体,评估必须超越静态的答案正确性,转向对多模态感知、多步执行、工具使用和产物交付的综合评估。然而,现有基准测试往往绑定于特定任务类型、执行环境或评分协议,限制了其在可比性、可解释性和支持部署决策方面的可靠性。我们提出DAREBench(部署感知与可靠的智能体模型评估基准),一个旨在捕获工作负载变化并支持可靠智能体评估的基准。基于共享的OpenClaw执行环境,DAREBench从22个源基准中筛选并调整了233个任务,组织成一个由输入模态和执行形式定义的2×3工作负载矩阵,并通过统一的基于合约的协议和基于证据的评分审计进行评估。我们在7,587次模型-任务运行中评估了23个商业API模型和12个本地部署的开源权重模型,报告了准确率和token消耗量,并使用公开定价为API模型估算参考成本。结果表明,没有单一模型在所有工作负载组中占优;文本与多模态任务表现出不同的准确率-成本权衡;本地部署的开源权重模型在若干组中具有竞争力,但整体上仍落后于前沿商业模型。这些发现表明,智能体部署和模型选择应综合考虑工作负载特征、部署模式和准确率-成本权衡,而非仅依赖单一综合分数。基准测试详情见https://github.com/SeerRay-Lab/DAREBench。
1 中国科学院信息工程研究所
2 中国科学院大学网络空间安全学院
3 小米科技有限责任公司 MiLM Plus
4 布朗大学计算机科学系
## 1 引言
[参照图表]
图1:模型在(a)文本和(b)多模态任务上的准确率-成本权衡。标签显示每任务平均token数;成本使用对数尺度。虚线标出帕累托前沿:(a)中为MiMo-V2.5、MiMo-V2.5-Pro和GPT-5.5;(b)中为MiMo-V2.5、GPT-5.4、Gemini-3.1-Pro和Claude-Opus-4.8。
前沿大语言模型正从独立的问答系统演变为通用智能体系统的核心决策组件。这些智能体需在动态工作空间中感知、推理、规划、使用工具并交付产物,而非仅仅生成答案字符串(Wei et al. 2022; Schick et al. 2023)。相应地,模型评估正从静态输入-输出性能转向在工具、上下文、时间和成本约束下的端到端执行。然而,现有评估框架未能充分支持这一转变。传统的知识、推理和长上下文基准主要评估静态输入下的答案正确性(Hendrycks et al. 2021; Rein et al. 2024; Bai et al. 2025c)。多模态基准虽引入了视觉输入,但大多仍遵循静态输入-输出范式(Yue et al. 2024; Wang et al. 2024)。相比之下,工具使用和端到端智能体基准常局限于特定命令行、网页或桌面环境(Merrill et al. 2026; Xie et al. 2024; Mialon et al. 2024; Liu et al. 2024; Zhou et al. 2024; Yao et al. 2025)。此外,这些基准采用不同的运行时、工具接口、任务协议和评分标准,导致结果难以直接比较。近期研究通过执行轨迹、环境快照和审计日志提升了评估的可观察性(Ye et al. 2026; Li et al. 2026a)。但这些研究仍主要报告特定环境下的总体成功率,因此对模型在不同模态、执行过程和工具依赖程度下的行为洞察有限,难以为实践中可比较、可解释和可靠的模型选择提供支持。
我们认为,智能体评估要支持部署决策,必须解决三个相互关联的问题,而非仅扩大基准规模。第一,结果是否可解释?智能体任务在输入模态、执行过程和工具依赖上差异显著,单一综合分数可能掩盖模型在不同工作负载上的优劣。第二,比较是否可归因?当任务依赖不同智能体框架、工具接口和执行协议时,观察到的差异混杂了模型能力与运行时兼容性。第三,分数是否可信?开放式智能体任务常涉及多步操作和产物交付,仅匹配最终文本无法验证任务是否实际完成;此外,LLM评判者可能在工具未执行、任务超时或所需产物缺失时错误给予正分。这些问题共同要求建立一个面向部署的基准,统一工作负载组织、执行环境控制和结果验证。
为解决这些需求,我们提出DAREBench(部署感知与可靠的智能体模型评估基准)。为提升工作负载级可解释性,我们通过可测量性、难度和代表性三阶段筛选,从22个现有基准中选择并调整了233个任务,并按输入模态和执行形式组织成2×3工作负载矩阵,涵盖文本与多模态输入,以及单步、多步和工具介导的多步任务。为提升跨基准比较的可归因性,我们基于OpenClaw构建了共享执行环境(Steinberger and OpenClaw Contributors 2026)。所有模型在统一的智能体循环、工具接口、工作空间抽象和日志协议下运行,从而减少异构智能体框架的影响。对于开放式任务,我们定义了任务合约,指明初始工作空间、可用工具、目标产物、评分者和时间预算。任务结果通过自动检查、LLM-as-a-Judge或混合评分进行评估。我们进一步引入基于证据的审计机制,结合确定性事后规则与元评判者,审查缺乏执行轨迹或最终产物支持的可疑正分。
利用该框架,我们在7,587次模型-任务运行中评估了23个商业API模型和12个本地部署的开源权重模型,报告了准确率和token消耗量,并利用公开定价估算API模型的参考成本,分析其准确率-成本权衡。结果显示,模型优势具有任务依赖性,文本与多模态API工作负载呈现不同的准确率-成本前沿。近期本地部署的开源权重模型在若干任务组中具有竞争力,但整体仍落后于前沿商业模型。审计进一步识别并移除了143个缺乏执行证据支持的正分。
主要贡献如下:
- 我们提出DAREBench,包含从22个源基准调整而来的233个任务,在统一运行时下按模态和执行形式组织成2×3工作负载矩阵。
- 我们评估了35个商业API和本地部署的开源权重模型,涉及7,587次模型-任务运行,揭示了工作负载依赖的排名、文本与多模态工作负载间不同的准确率-成本权衡,以及本地模型的优势与局限。
- 我们刻画了智能体评估中缺乏支持的正分问题,并引入基于证据的审计机制,依据执行轨迹和最终产物验证可疑分数。
## 2 相关工作
### 2.1 智能体基准与能力来源
智能体评估正从静态问答转向操作环境中的执行。Terminal-Bench(Merrill et al. 2026)、OSWorld(Xie et al. 2024)和MMSearch(Jiang et al. 2025)分别评估命令行工作流、图形界面交互和多模态搜索,但仍受限于特定领域或环境。OpenClaw进一步推动了通用智能体基准的发展。Claw-Eval(Ye et al. 2026)强调基于轨迹的可信评估;ClawBench(Zhang et al. 2026)针对实时网页交互;ClawArena(Ji et al. 2026)研究冲突推理;WildClawBench(Ding et al. 2026)和ZClawBench(Z.AI 2026)引入真实环境中的工具使用任务;ClawsBench(Li et al. 2026b)联合评估能力与安全性。然而,不同的运行时、任务分类和评分协议阻碍了在统一框架下的系统比较。
[参照图表]
图2:DAREBench概览。该基准包含四个阶段:(1)从22个源基准构建233个任务,并按模态和执行形式组织;(2)在共享智能体环境中执行所有模型;(3)应用自动化、基于LLM或混合评分,并进行基于证据的审计;(4)报告整体及工作负载级准确率、token使用量、参考成本及准确率-成本前沿。
### 2.2 智能体评估中的LLM-as-a-Judge
LLM-as-a-Judge在MT-Bench和Chatbot Arena(Zheng et al. 2023)中得到验证后,已被应用于代码(Jimenez et al. 2024; Jiang et al. 2026)、多模态(Chen et al. 2024)、对话(Dubois et al. 2024)和安全评估(Shao et al. 2026)。智能体任务因涉及长期工具使用、动态交互和产物验证而更难评判(Li et al. 2025)。先前研究显示,评判者可能从看似合理的输出推断成功,而未验证执行证据,导致“幻觉式正确”(You et al. 2026; Gurram 2026)。Claw-Eval(Ye et al. 2026)同样报告了在缺乏审计日志时的大量误判。然而,对此类幻觉的系统刻画与缓解仍十分有限。
## 3 DAREBench
如图2所示,DAREBench包含四个组件:工作负载构建、共享智能体执行、可靠评分和面向部署的指标。它将22个源基准的233个任务组织成2×3工作负载矩阵,并在统一执行协议下评估所有模型。性能通过自动化、基于LLM或混合评分进行评估,并伴随基于证据的审计,最终报告准确率、token使用量和参考成本。
### 3.1 问题定义
不同于仅评估最终响应的传统基准,智能体任务要求模型与执行环境交互并产生可验证的输出。我们将每个任务形式化为τᵢ = (pᵢ, 𝒲ᵢ⁰, 𝒯ᵢ, 𝒞ᵢ, Gᵢ, tᵢᵐᵃˣ),其中pᵢ为任务指令,𝒲ᵢ⁰为初始工作空间,𝒯ᵢ为可用工具集,𝒞ᵢ为产物合约,Gᵢ为任务特定评分者,tᵢᵐᵃˣ为执行时间预算。产物合约规定所需输出路径及其有效性谓词:𝒞ᵢ = {(aᵢⱼ, φᵢⱼ)}ⱼ₌₁^|𝒞ᵢ|,φᵢⱼ: file bytes → {0, 1}。
令𝒲*[a]表示最终工作空间中路径a的内容。完全合约满足定义为Sat(𝒲*, 𝒞ᵢ) = ∏ⱼ₌₁^|𝒞ᵢ| 𝟙[∃ 𝒲*[aᵢⱼ]] φᵢⱼ(𝒲*[aᵢⱼ])。
在此形式化下,模型在共享执行环境中运行以产生所需产物,并由Gᵢ进行评估。任务构建与评分分别在§3.2和§3.3中描述。
### 3.2 任务构建
#### 查询选择
为构建多样且与部署相关的评估套件,我们从22个公开可用的基准中选取候选任务,涵盖推理、长上下文理解、问答、指令遵循、领域特定分析、代码与Shell工作流、桌面控制、多模态理解与搜索。我们采用三阶段筛选流程:
1. **可行性过滤**:移除无法定义明确产物合约𝒞ᵢ或可靠评分者Gᵢ的任务。
2. **难度过滤**:排除过于简单的任务。对于单步任务,我们运行Qwen3.5-27B三次,移除三次均正确解决的任务。若源基准提供难度标注,仅保留标记为“中等”或“困难”的任务。
3. **代表性过滤**:根据每个源基准的类别结构手动选择任务,在保持广泛覆盖的同时避免任何单一类别过度代表。
此流程从22个源基准中产生233个任务。
#### 工作负载分类
我们不按源基准组织结果,而是沿两个工作负载维度对任务分组:输入模态和执行形式。模态维度𝒑区分仅文本和多模态输入,执行形式维度𝒦区分单步、多步和多步加工具任务。其笛卡尔积定义六组工作负载:
𝒢 = 𝒑 × 𝒦。相似文章
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 评测基准
AJ-Bench 提出一套评测基准,用于衡量 Agent-as-a-Judge 系统通过与环境交互来验证智能体行为的能力,覆盖搜索、数据系统与 GUI 领域的 155 项任务。
K-Bench:评估模型在真实科学代理请求中的性能
论文介绍了 K-Bench 01,一个用于评估 AI 代理在真实科学请求中性能的基准,揭示了没有模型能持续达到可接受性能的阈值,过度声明是常见的失败模式。
EvalDetectBench:用于测量前沿语言模型评估意识的基准
本文介绍了EvalDetectBench,这是一个用于测量前沿语言模型评估意识的开放基准和流水线,旨在解决现有方法中的偏差,以提升AI安全评估。
DuMateBench: 评估复杂真实世界工作流中的自主代理
DuMateBench 引入了一个源于匿名化用户会话的基准测试,用于评估复杂真实世界工作流中的自主代理,测试在环境复杂性如不足、不稳定性和噪声下的性能。
DeltaML-Bench: 评估现实研究代码库上的机器学习智能体
介绍了DeltaML-Bench,一个用于评估机器学习智能体在现实研究代码库上的基准测试,展示了ARG脚手架相比标准方法显著提高了成功率。