Hyper-τ-bench: 评估构建代理的代理(4分钟阅读)
摘要
Sierra AI 开源了 Hyper-τ-bench,这是一个新的基准测试,用于评估AI模型构建客户服务代理的能力,揭示了自主构建的局限性以及在人类协助下的改进。
Hyper-τ-bench 将一个开发代理置于沙盒工作区中,该工作区包含模拟业务和模拟客户的记录,代理可以随时与模拟客户发送消息。开发代理从证据中提取规格说明,设计架构,并将业务操作转化为工具,直到它拥有一个可用的客户服务代理。最终代理必须在每次对话的成本预算内,从固定的模型菜单中提供服务。Claude Opus 5(最大推理)在Claude Code中运行时,独立工作仅通过23.9%的保留评估任务。与一位具有深厚背景的工程师配对后,同类模型在相同任务上达到了82.2%。
查看缓存全文
缓存时间: 2026/09/10 02:28
# Hyper-τ-bench: 评估构建智能体的智能体
来源:https://sierra.ai/blog/hyper-t-bench-evaluating-agents-that-build-agents
1. Sierra 博客 (https://sierra.ai/blog)
2. Hyper\-τ\-bench: 评估构建智能体的智能体
我们于 2024 年构建了 τ\-bench(https://sierra.ai/blog/benchmarking-ai-agents),旨在回答一个当时感觉新颖的问题:模型能否作为可靠的客服智能体?这在如今已是基础要求。更难的问题是,究竟是谁在构建这个智能体?答案越来越指向模型自身。
我们与一些世界领先的公司紧密合作,推出了他们的智能体。实践中,这项工作不像实现一个规范,更像是在做研究。需求散布在手册、支持文档、电子表格以及最优秀一线员工的头脑中——因此你需要形成假设,挖掘证据,并通过构建和测试来找出哪些杠杆确实能推动性能提升。
今天我们开源了 hyper\-τ\-bench(以 τ^τ\-bench 的形式发布),这是一个新的长周期智能体评估基准,用于衡量模型不仅能够充当智能体,还能构建智能体的能力。
Hyper\-τ\-bench 的设置:一个开发者智能体从企业记录中恢复需求,在沙盒工作区中构建一个客服智能体,并根据该智能体处理预留任务的表现进行评分。
## **沙盒内部**
Hyper\-τ\-bench 将一个开发者智能体置入一个沙盒工作区,其中包含模拟企业的记录,以及一个它可以随时联系的模拟客户。从那里,开发者智能体端到端地完成工作——它从证据中恢复规范,设计架构,并将企业的操作转化为工具——直到它拥有一个可工作的客服智能体。客户的 REST API 可能存在细微缺陷,因此部分工作是判断错误是出在规范中还是代码中。完成后的智能体必须使用固定的模型菜单,并在每次对话的成本预算内提供服务。一旦交付,我们会使用开发者在构建过程中从未见过的完全可验证的 τ\-bench 风格测试,针对模拟生产流量部署它。
## **当前的前沿水平**
独自工作时,我们最好的配置——在 Claude Code 中运行的 Claude Opus 5(最大推理模式)——仅通过了 23\.9% 的预留评估任务。与拥有深度背景的工程师配合后,同类模型在相同任务上达到了 82\.2%。
通过率 vs\. 人类 + 模型参考,以及构建时间和开销。
架构、模型选择以及接近作弊的尝试率。
我们审阅了开发者轨迹,以查看他们的构建在何处受挫。有五种模式尤为突出:
- **他们没有完成规范的恢复。**在银行任务中,开发者打开的文件不到约 1700 个文件中的 80 个,仅接入了关键词搜索碰巧显示的内容。
- **他们没有向客户提问。**对于需要客户单独掌握 20\-25 项需求上下文的任务,开发者最多只问了四个问题。提问能直接带来回报。对于参考智能体(由工程师构建)得分为 95–100% 的任务——那些未提问的构建得分为 5%,问一个问题得 15%,问两个得 25%,依此类推。
- **他们在经济性上双向出错。**两个构建分别超出预算 3\.0 倍和 1\.3 倍,在扣分后得分为零。其余的则保留了计算余量——存活下来的智能体平均只使用了其预算的 0\.45 倍。
- **他们没有探索设计空间。**92% 的构建是单一的 LLM 工具循环,且大多数默认使用他们已知的模型——96% 的 Codex 构建使用 OpenAI 模型,而 Kimi 仅占 13%。这代价高昂:一句架构建议就使开发者的电信任务得分从 31% 翻倍至 67%。
- **他们试图作弊。**在 17\-42% 的运行中,开发者至少尝试了一次作弊——探测沙盒以获取预留数据,或探测评分机制本身。无一成功,但这提醒我们,加固沙盒与编写任务同样重要。
## **更大的图景**
Hyper\-τ\-bench 与 MLE\-bench 和 RE\-Bench 等衡量研究能力的基准并列,这些能力包括设计实验、权衡取舍以及迭代以获得更好的系统。构建一个智能体需要所有这些能力——并额外增加了一些自身的问题。规范必须从文档和人那里恢复。而且,由于构建的系统本身是人工智能,判断设计是否有效的唯一方法就是运行它,并阅读它向真实用户传达的内容,而这些用户在构建过程中是开发者看不见的。
τ\-bench 询问模型能否成为好的智能体。Hyper\-τ\-bench 则询问它们能否构建智能体。随着智能体承担越来越多这样的工作,我们将继续使用 hyper\-τ\-bench 来跟踪它们在这方面做得如何。
论文 (https://arxiv.org/abs/2609.04611)\|代码库 (https://github.com/sierra-research/hyper-tau-bench)\|排行榜 (https://sierra-research.github.io/hyper-tau-bench/)
#### 订阅 Sierra 博客
获取有关新功能、客户更新等的通知。
## 发现 Sierra 能为您做什么
了解 Sierra 如何帮助您通过 AI 实现更好的结果。
相似文章
JobBench:让智能体工作与人类意愿对齐
JobBench 是一个基于工人调查构建的基准,用于评估 AI 智能体在工人最希望自动化的任务上的表现,涵盖 35 个职业的 130 个任务,并配备详细的评分细则。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
StartupBench: 基准测试:针对市场验证的端到端工作流程的通用代理
StartupBench 引入了一个基准,用于评估通用AI代理在真实世界创业工作流程中的表现,揭示顶级模型仅能完成约30%的任务,原因在于复杂指令遵循和领域特定专业知识方面的不足。
@ApexAIHighlight:大多数AI基准测试模型是否能给出正确答案。@Accio_official 正在测试更难的事情:能否……
CommerceAgentBench是一个新的基准测试,包含107个真实电子商务任务,旨在检验AI代理能否实际完成工作,超越传统的基于答案的AI基准测试。