TerminalWorld:在真实终端任务中评估智能体的基准

Hugging Face Daily Papers 论文

摘要

本文介绍了TerminalWorld,这是一个基于80,870个终端记录构建的、用于在真实终端任务中评估AI智能体的基准。当前系统最高仅达到62.5%的通过率,凸显了真实终端工作流中的挑战。

我们推出了TerminalWorld,这是一个可扩展的数据引擎,能够自动从“野外”终端记录中逆向工程出高保真评估任务。该引擎处理了80,870个终端记录,生成了一个包含1,530个经过验证的任务的完整基准,覆盖18个真实世界类别,从简短的日常操作到超过50步的工作流,并涵盖1,280个独特命令。从中,我们精心挑选了一个包含200个具有代表性且经过人工审查的任务的Verified子集。在TerminalWorld-Verified上对八个前沿模型和六个智能体进行全面基准测试后发现,当前系统仍然难以应对真实的终端工作流,最高通过率仅为62.5%。此外,TerminalWorld捕捉到了与现有专家策展基准(例如Terminal-Bench)不同的真实终端能力,并且与它们的分数相关性较弱(Pearson r=0.20)。该自动化引擎使TerminalWorld本身具有真实性和可扩展性,能够随着开发者实践的发展在真实终端环境中评估智能体。数据和代码可在 https://github.com/EuniAI/TerminalWorld 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/22 02:28

论文页面 - TerminalWorld:在真实终端任务中评测智能体

来源:https://huggingface.co/papers/2605.22535 作者:

,

,

,

,

,

,

,

,

,

摘要

我们提出 TerminalWorld,这是一个可扩展的数据引擎,能够自动从“真实世界“的终端记录中逆向工程出高保真的评测任务。该引擎处理了 80,870 条终端记录,生成了一个包含 1,530 个经过验证的任务的完整基准测试集,涵盖 18 个真实世界类别,从简短日常操作到超过 50 步的工作流程,并涉及 1,280 个独特命令。从中,我们精选了一个包含 200 个代表性、人工审核任务的 Verified 子集。在 TerminalWorld-Verified 上对八个前沿模型和六个智能体进行的全面评测表明,当前系统在真实终端工作流上仍面临困难,最高通过率仅为 62.5%。此外,TerminalWorld 捕捉到的真实终端能力与现有专家策划的基准测试(如 Terminal-Bench)截然不同,两者得分之间仅存在弱相关性(Pearson r = 0.20)。自动化引擎使 TerminalWorld 在构建上就具备真实性和可扩展性,从而能够在开发者实践不断演进时,在真实终端环境中评测智能体。数据和代码可在 https://github.com/EuniAI/TerminalWorld 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2605.22535)
查看 PDF (https://arxiv.org/pdf/2605.22535)
GitHub1 (https://github.com/EuniAI/TerminalWorld)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22535)

在你的智能体中获取此论文:

hf papers read 2605.22535

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2605.22535 即可从此页面链接。

引用此论文的数据集0

无数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.22535 即可从此页面链接。

引用此论文的 Spaces0

无 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2605.22535 即可从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

有人注意到记忆API的基准测试数据不一致吗?

Reddit r/AI_Agents

这篇文章质疑了像Mem0和Zep这样的记忆API基准测试分数的可靠性,指出在LoCoMo基准测试中,自报数据与第三方数据存在显著差异,暗示这些指标可能更多是营销手段而非准确比较。