Hyper-τ-bench: 评估构建代理的代理(4分钟阅读)

TLDR AI 工具

摘要

Sierra AI 开源了 Hyper-τ-bench,这是一个新的基准测试,用于评估AI模型构建客户服务代理的能力,揭示了自主构建的局限性以及在人类协助下的改进。

Hyper-τ-bench 将一个开发代理置于沙盒工作区中,该工作区包含模拟业务和模拟客户的记录,代理可以随时与模拟客户发送消息。开发代理从证据中提取规格说明,设计架构,并将业务操作转化为工具,直到它拥有一个可用的客户服务代理。最终代理必须在每次对话的成本预算内,从固定的模型菜单中提供服务。Claude Opus 5(最大推理)在Claude Code中运行时,独立工作仅通过23.9%的保留评估任务。与一位具有深厚背景的工程师配对后,同类模型在相同任务上达到了82.2%。
查看原文
查看缓存全文

缓存时间: 2026/09/10 02:28

# Hyper-τ-bench: 评估构建智能体的智能体 来源:https://sierra.ai/blog/hyper-t-bench-evaluating-agents-that-build-agents 1. Sierra 博客 (https://sierra.ai/blog) 2. Hyper\-τ\-bench: 评估构建智能体的智能体 我们于 2024 年构建了 τ\-bench(https://sierra.ai/blog/benchmarking-ai-agents),旨在回答一个当时感觉新颖的问题:模型能否作为可靠的客服智能体?这在如今已是基础要求。更难的问题是,究竟是谁在构建这个智能体?答案越来越指向模型自身。 我们与一些世界领先的公司紧密合作,推出了他们的智能体。实践中,这项工作不像实现一个规范,更像是在做研究。需求散布在手册、支持文档、电子表格以及最优秀一线员工的头脑中——因此你需要形成假设,挖掘证据,并通过构建和测试来找出哪些杠杆确实能推动性能提升。 今天我们开源了 hyper\-τ\-bench(以 τ^τ\-bench 的形式发布),这是一个新的长周期智能体评估基准,用于衡量模型不仅能够充当智能体,还能构建智能体的能力。 Hyper\-τ\-bench 的设置:一个开发者智能体从企业记录中恢复需求,在沙盒工作区中构建一个客服智能体,并根据该智能体处理预留任务的表现进行评分。 ## **沙盒内部** Hyper\-τ\-bench 将一个开发者智能体置入一个沙盒工作区,其中包含模拟企业的记录,以及一个它可以随时联系的模拟客户。从那里,开发者智能体端到端地完成工作——它从证据中恢复规范,设计架构,并将企业的操作转化为工具——直到它拥有一个可工作的客服智能体。客户的 REST API 可能存在细微缺陷,因此部分工作是判断错误是出在规范中还是代码中。完成后的智能体必须使用固定的模型菜单,并在每次对话的成本预算内提供服务。一旦交付,我们会使用开发者在构建过程中从未见过的完全可验证的 τ\-bench 风格测试,针对模拟生产流量部署它。 ## **当前的前沿水平** 独自工作时,我们最好的配置——在 Claude Code 中运行的 Claude Opus 5(最大推理模式)——仅通过了 23\.9% 的预留评估任务。与拥有深度背景的工程师配合后,同类模型在相同任务上达到了 82\.2%。 通过率 vs\. 人类 + 模型参考,以及构建时间和开销。 架构、模型选择以及接近作弊的尝试率。 我们审阅了开发者轨迹,以查看他们的构建在何处受挫。有五种模式尤为突出: - **他们没有完成规范的恢复。**在银行任务中,开发者打开的文件不到约 1700 个文件中的 80 个,仅接入了关键词搜索碰巧显示的内容。 - **他们没有向客户提问。**对于需要客户单独掌握 20\-25 项需求上下文的任务,开发者最多只问了四个问题。提问能直接带来回报。对于参考智能体(由工程师构建)得分为 95–100% 的任务——那些未提问的构建得分为 5%,问一个问题得 15%,问两个得 25%,依此类推。 - **他们在经济性上双向出错。**两个构建分别超出预算 3\.0 倍和 1\.3 倍,在扣分后得分为零。其余的则保留了计算余量——存活下来的智能体平均只使用了其预算的 0\.45 倍。 - **他们没有探索设计空间。**92% 的构建是单一的 LLM 工具循环,且大多数默认使用他们已知的模型——96% 的 Codex 构建使用 OpenAI 模型,而 Kimi 仅占 13%。这代价高昂:一句架构建议就使开发者的电信任务得分从 31% 翻倍至 67%。 - **他们试图作弊。**在 17\-42% 的运行中,开发者至少尝试了一次作弊——探测沙盒以获取预留数据,或探测评分机制本身。无一成功,但这提醒我们,加固沙盒与编写任务同样重要。 ## **更大的图景** Hyper\-τ\-bench 与 MLE\-bench 和 RE\-Bench 等衡量研究能力的基准并列,这些能力包括设计实验、权衡取舍以及迭代以获得更好的系统。构建一个智能体需要所有这些能力——并额外增加了一些自身的问题。规范必须从文档和人那里恢复。而且,由于构建的系统本身是人工智能,判断设计是否有效的唯一方法就是运行它,并阅读它向真实用户传达的内容,而这些用户在构建过程中是开发者看不见的。 τ\-bench 询问模型能否成为好的智能体。Hyper\-τ\-bench 则询问它们能否构建智能体。随着智能体承担越来越多这样的工作,我们将继续使用 hyper\-τ\-bench 来跟踪它们在这方面做得如何。 论文 (https://arxiv.org/abs/2609.04611)\|代码库 (https://github.com/sierra-research/hyper-tau-bench)\|排行榜 (https://sierra-research.github.io/hyper-tau-bench/) #### 订阅 Sierra 博客 获取有关新功能、客户更新等的通知。 ## 发现 Sierra 能为您做什么 了解 Sierra 如何帮助您通过 AI 实现更好的结果。

相似文章

JobBench:让智能体工作与人类意愿对齐

arXiv cs.AI

JobBench 是一个基于工人调查构建的基准,用于评估 AI 智能体在工人最希望自动化的任务上的表现,涵盖 35 个职业的 130 个任务,并配备详细的评分细则。