ClawProBench:基于运行时覆盖和冻结工作区风格保留集的AI代理跟踪感知评估

Hugging Face Daily Papers 论文

摘要

ClawProBench引入了一个跟踪感知的基准测试,用于评估AI代理,强调运行时执行和安全性,以揭示最终答案排名的局限性。

代理基准测试通常只评估最终答案,即使代理在有状态运行时上运行。我们认为这没有充分指定被评估的内容:正确的单位是声明的模型加运行时配置,其故障可能发生在证据获取、运行时路由、安全边界或重复执行中。我们介绍了ClawProBench,一个用于运行时原生代理评估的跟踪感知基准测试,它基于OpenClaw实例化,OpenClaw是一个实时代理运行时,具有工作区工具和原生界面,用于浏览、记忆、消息传递、调度、技能和子代理。ClawProBench定义了两个赛道:一个102个场景的完整配置文件,带有实时工作区和原生运行时路由任务,以及一个冻结的68个场景保留集,带有闭世界JSON输出契约,用于稳健排名。试验通过执行跟踪进行评分,使用一个安全门控公式,结合正确性、过程质量和效率,保留故障证据以供审计。我们的匿名工件包括基准测试定义、评分代码、清单和清理后的跟踪。我们在完整配置文件上评估了68个配置,在保留集上评估了37个。最高安全门控平均跟踪分数为0.7671。原生运行时任务表现不如工作区实时任务(0.5238 对比 0.6415)。在保留集上,pass@k-any 优于严格的三次试验通过(0.6638 对比 0.2890),而完整配置文件和保留集排名显示弱相关性(Spearman 0.1300)。纯粹基于正确性的排名与过程感知、安全门控和严格通过的观点有显著差异。最终答案排行榜可能隐藏原生界面的弱点、一次性成功和跟踪局部的代理失败模式。
查看原文
查看缓存全文

缓存时间: 2026/08/25 20:38

论文页面 - ClawProBench:具有运行时覆盖与冻结工作场景保留集的轨迹感知AI智能体评估

来源:https://huggingface.co/papers/2608.22510

摘要

ClawProBench通过跨实时与冻结赛道的执行轨迹评估智能体配置,揭示了最终答案排名会掩盖原生运行时故障与过程质量差异。 智能体基准测试(https://huggingface.co/papers?q=Agent%20benchmarks)即使在智能体运行于有状态运行时时,也常仅评估最终答案。我们认为这未充分界定评估对象:合适的评估单元是声明的模型加运行时配置,其故障可能发生在证据获取、运行时路由、安全边界或重复执行环节。我们提出ClawProBench,一个轨迹感知的运行时原生智能体评估基准,实例化于OpenClaw(https://huggingface.co/papers?q=OpenClaw)——一个配备工作区工具(https://huggingface.co/papers?q=workspace%20tools)与原生界面(https://huggingface.co/papers?q=native%20surfaces)的实时智能体运行时,支持浏览、记忆、消息、调度、技能和子智能体。ClawProBench定义了两个赛道:一个包含102个场景的完整档案,涉及实时工作区与原生运行时路由任务;以及一个包含68个场景的冻结式保留集,采用封闭世界JSON输出契约以确保稳健排名。试验通过执行轨迹(https://huggingface.co/papers?q=execution%20traces)进行评分,采用结合正确性、过程质量(https://huggingface.co/papers?q=process%20quality)与效率的安全门控公式,保留故障证据以供审计。我们的匿名成果包含基准定义、评分代码、清单与脱敏轨迹。我们在完整档案上评估了68种配置,在保留集上评估了37种。最高的安全门控平均轨迹得分为0.7671。原生运行时任务表现不及工作区实时任务(0.5238对比0.6415)。在保留集上,pass@k-any(https://huggingface.co/papers?q=pass%40k-any)优于严格三次尝试通过(0.6638对比0.2890),而完整档案与保留集排名仅呈现弱相关性(斯皮尔曼系数0.1300)。仅基于正确性的排名与过程感知、安全门控及严格通过视角存在显著差异。最终答案排行榜可能隐藏原生界面弱点、一次性成功及轨迹局部智能体故障模式。

查看arXiv页面 (https://arxiv.org/abs/2608.22510) 查看PDF (https://arxiv.org/pdf/2608.22510) 项目页面 (https://suyoumo.github.io/bench/) GitHub822 (https://github.com/suyoumo/ClawProBench) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.22510)

通过智能体获取此论文: hf papers read 2608.22510

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文 在模型README.md中引用arxiv.org/abs/2608.22510以从此页面链接。

引用本文的数据集1

xyh110sym/clawprobench 约11小时前更新 • 2 (https://huggingface.co/datasets/xyh110sym/clawprobench)

引用本文的Spaces0

无Space链接本文 在Space README.md中引用arxiv.org/abs/2608.22510以从此页面链接。

包含本文的收藏夹1

相似文章

OpenClawBench:真实世界代理执行轨迹中过程侧异常的基准测试

arXiv cs.AI

本文介绍了OpenClawBench,这是一个大规模数据集,用于对真实世界AI代理执行轨迹中的过程侧异常进行基准测试。该数据集揭示了任务成功可能掩盖过程失败,9.33%通过oracle测试的执行仍包含异常,并通过一种新颖的分类法提供了结构化监督。

WildClawBench:真实世界长周期智能体评估基准

Hugging Face Daily Papers

WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。