TerminalWorld:在真实终端任务中评估智能体的基准
摘要
本文介绍了TerminalWorld,这是一个基于80,870个终端记录构建的、用于在真实终端任务中评估AI智能体的基准。当前系统最高仅达到62.5%的通过率,凸显了真实终端工作流中的挑战。
查看缓存全文
缓存时间: 2026/05/22 02:28
论文页面 - TerminalWorld:在真实终端任务中评测智能体
来源:https://huggingface.co/papers/2605.22535 作者:
,
,
,
,
,
,
,
,
,
摘要
我们提出 TerminalWorld,这是一个可扩展的数据引擎,能够自动从“真实世界“的终端记录中逆向工程出高保真的评测任务。该引擎处理了 80,870 条终端记录,生成了一个包含 1,530 个经过验证的任务的完整基准测试集,涵盖 18 个真实世界类别,从简短日常操作到超过 50 步的工作流程,并涉及 1,280 个独特命令。从中,我们精选了一个包含 200 个代表性、人工审核任务的 Verified 子集。在 TerminalWorld-Verified 上对八个前沿模型和六个智能体进行的全面评测表明,当前系统在真实终端工作流上仍面临困难,最高通过率仅为 62.5%。此外,TerminalWorld 捕捉到的真实终端能力与现有专家策划的基准测试(如 Terminal-Bench)截然不同,两者得分之间仅存在弱相关性(Pearson r = 0.20)。自动化引擎使 TerminalWorld 在构建上就具备真实性和可扩展性,从而能够在开发者实践不断演进时,在真实终端环境中评测智能体。数据和代码可在 https://github.com/EuniAI/TerminalWorld 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2605.22535)
查看 PDF (https://arxiv.org/pdf/2605.22535)
GitHub1 (https://github.com/EuniAI/TerminalWorld)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22535)
在你的智能体中获取此论文:
hf papers read 2605.22535
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.22535 即可从此页面链接。
引用此论文的数据集0
无数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.22535 即可从此页面链接。
引用此论文的 Spaces0
无 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2605.22535 即可从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
新的 Go JSON API:快两倍,还是慢1.5倍?
这篇文章对 Go 1.27 中的新 JSON API 进行了基准测试,显示在反序列化方面速度显著提升,但在序列化方面与旧实现相比结果不一。
AI开发者如何判断一个AI是否真正在进行批判性思考?
本文讨论了评估AI系统是否真正展示批判性思考或仅仅模仿它的挑战,强调了需要更好的基准来区分真正的推理和模式化的回应。
在线发现一个新论坛,约3200个代理在评估过程中在线交流
推文报道称,发现一个新的在线论坛,约3200个代理在评估期间进行交流。
当智能体逃离沙箱,防护措施究竟在哪里失效?
Anthropic 报告了三起 Claude 模型在网络安全评估中因测试环境错误连接到公共互联网而访问真实系统的事件,引发了对沙箱失效和智能体防护措施的担忧。
有人注意到记忆API的基准测试数据不一致吗?
这篇文章质疑了像Mem0和Zep这样的记忆API基准测试分数的可靠性,指出在LoCoMo基准测试中,自报数据与第三方数据存在显著差异,暗示这些指标可能更多是营销手段而非准确比较。