TUA-Bench: 通用终端使用代理的基准测试
摘要
TUA-Bench是一个综合性基准测试,用于评估通用终端使用代理在各种数字活动和专业工作流中的表现,揭示了当前前沿代理之间的显著性能差距。
查看缓存全文
缓存时间: 2026/06/30 07:35
论文页面 - TUA-Bench:通用终端使用代理的基准测试
来源:https://huggingface.co/papers/2606.28480
摘要
TUA-Bench 提出了一个全面的基准测试,用于评估通用终端使用代理在多样化数字活动和专业工作流中的表现,揭示了当前前沿代理之间显著的性能差距。
随着大语言模型和工具框架的不断进步,终端中的代理越来越能够执行更广泛的通用计算机使用任务(https://huggingface.co/papers?q=computer-use%20tasks),而不仅仅是编程。然而,现有的基准测试未能充分评估通用终端计算机使用代理(TUA):通用计算机使用基准主要针对图形用户界面(https://huggingface.co/papers?q=graphical%20user%20interfaces)(GUI),而基于终端的基准测试则主要强调历史上原生在 shell 中的技术和编程中心工作流。我们引入了 TUA-Bench,一个用于终端使用代理(https://huggingface.co/papers?q=terminal-use%20agents)的通用基准测试。TUA-Bench 包含 120 个真实世界任务,涵盖五个任务家族,涉及常规数字活动(https://huggingface.co/papers?q=digital%20activities)——包括文档编辑、电子邮件管理和实时网络信息搜索——以及与博士级领域专家共同设计的科学和工程工作流,这些工作流需要专业软件(https://huggingface.co/papers?q=specialized%20software)。这种广度使 TUA-Bench 区别于先前专注于 shell 或特定领域的基准测试。每个任务都经过手动设计,在具有确定性设置脚本的真实终端中运行,并通过基于执行的评分协议(https://huggingface.co/papers?q=execution-based%20scoring%20protocol)进行评估。我们发现,最强的前沿代理 Claude Code with Claude Opus 4.8 max reasoning effort 达到了 65.8% 的总体性能,且两个轨道之间均存在显著差距。通过提供广泛而真实的终端使用能力评估,TUA-Bench 旨在加速从窄化、特定任务的助手向能够在多样化数字环境中可靠运行的通用代理(https://huggingface.co/papers?q=general-purpose%20agents)的转变。
查看 arXiv 页面 (https://arxiv.org/abs/2606.28480) 查看 PDF (https://arxiv.org/pdf/2606.28480) GitHub1 (https://github.com/facebookresearch/TUA-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.28480)
在你的代理中获取这篇论文:
hf papers read 2606.28480
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接到这篇论文
请在模型的 README.md 中引用 arxiv.org/abs/2606.28480,以便从此页面链接。
引用本文的数据集0
没有数据集链接到这篇论文
请在数据集的 README.md 中引用 arxiv.org/abs/2606.28480,以便从此页面链接。
引用本文的 Space0
没有 Space 链接到这篇论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.28480,以便从此页面链接。
包含本文的收藏0
没有收藏包含这篇论文
将这篇论文添加到收藏 (https://huggingface.co/new-collection) 以便从此页面链接。
相似文章
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。
TerminalBench 2.1 源自 GPT-5.6 Sol、Terra 和 Luna
TerminalBench 2.1 是一套源自 GPT-5.6 Sol、Terra 和 Luna 模型的基准测试套件,可能用于评估 AI 在终端任务上的性能。
在长时间终端任务上测试智能体 (GitHub Repo)
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。
UniClawBench:面向现实世界任务的主动智能体通用基准
UniClawBench 提出了一个以能力为导向的基准,用于评估在动态现实世界环境中运行的主动智能体,采用实时 Docker 容器和包含多个智能体角色的闭环评估策略。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。