WildClawBench:真实世界长周期智能体评估基准
摘要
WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。
查看缓存全文
缓存时间: 2026/05/15 04:23
论文页面 - WildClawBench:面向真实世界、长周期智能体评估的基准测试
来源:https://huggingface.co/papers/2605.10912 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
WildClawBench 评估语言模型和多模态语言模型在真实长周期任务上的表现,这些任务使用实际 CLI 环境,并配备真实工具,而非合成沙箱。
大型语言模型和多模态语言模型越来越多地驱动着基于命令行界面 (CLI) 框架、代表用户行动的智能体。然而,大多数智能体基准测试仍然依赖于合成沙箱、短周期任务、模拟服务 API 以及最终答案检查,这让我们无法判断智能体能否在其实际部署的运行环境中完成真实的长周期工作。本文提出了 WildClawBench,一个原生运行环境的基准测试,包含60个由人工编写的、中英双语的、多模态任务,涵盖六个主题类别。每个任务平均需要约8分钟的挂钟时间,以及超过20次工具调用,并在一个可复现的 Docker 容器内运行,该容器托管一个真实的 CLI 智能体框架(OpenClaw、Claude Code、Codex 或 Hermes Agent),并可使用真实工具而非模拟服务。评分采用混合方式,结合了基于规则的确定性检查、环境状态副作用审计,以及用于语义验证的 LLM/VLM 评判。在19个前沿模型中,表现最佳的 Claude Opus 4.7 在 OpenClaw 框架下整体得分仅为 62.2%,而其他所有模型均低于 60%;仅更换框架就能使同一个模型的得分相差高达 18 个百分点。这些结果表明,对于当前前沿模型而言,长周期、原生运行环境的智能体评估仍然是一个远未解决的问题。我们公开了任务、代码和容器化的工具,以支持可复现的评估。
查看 arXiv 页面 (https://arxiv.org/abs/2605.10912) 查看 PDF (https://arxiv.org/pdf/2605.10912) 项目页面 (https://internlm.github.io/WildClawBench/) GitHub364 (https://github.com/internlm/WildClawBench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.10912)
在您的智能体中获取此论文:
hf papers read 2605.10912
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.10912 以在此页面建立链接。
引用此论文的数据集1
internlm/WildClawBench 更新于12分钟前 • 7.56k • 59 (https://huggingface.co/datasets/internlm/WildClawBench)
引用此论文的Space0
无Space关联此论文
请在Space README.md中引用 arxiv.org/abs/2605.10912 以在此页面建立链接。
包含此论文的收藏集0
无收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。
UniClawBench:面向现实世界任务的主动智能体通用基准
UniClawBench 提出了一个以能力为导向的基准,用于评估在动态现实世界环境中运行的主动智能体,采用实时 Docker 容器和包含多个智能体角色的闭环评估策略。
Long-Horizon-Terminal-Bench:通过密集奖励评分测试智能体在长时程终端任务上的极限
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。
OpenClawBench:真实世界代理执行轨迹中过程侧异常的基准测试
本文介绍了OpenClawBench,这是一个大规模数据集,用于对真实世界AI代理执行轨迹中的过程侧异常进行基准测试。该数据集揭示了任务成功可能掩盖过程失败,9.33%通过oracle测试的执行仍包含异常,并通过一种新颖的分类法提供了结构化监督。