@dair_ai:一篇关于编程智能体的极具参考价值的基准测试论文。在Claude Code环境中运行的Claude Opus 5仅通过23.9%的测试项……

X AI KOLs Timeline 论文

摘要

该论文提出了一种新的编程智能体评估基准,用于衡量其在真实环境中完成实际客户服务任务的能力。

这是一篇关于编程智能体的非常出色的基准测试论文。 在Claude Code环境中运行的Claude Opus 5仅通过23.9%的测试项,而专业人类评估者的得分则为82.2%。 以下是具体任务内容。 开发出的智能体需被投入真实的客户服务场景中。它需要处理企业存储的业务数据、提出需求并解答问题的客户信息、运营团队必须使用的生产级API、现有的代码库,同时还面临服务成本和模型选择的严格限制。最终它需要构建出一个能够正常工作的客户服务智能体。 评估方式是将该智能体部署到预设的模拟用户环境中,共包含四个领域的53项任务。 对于从事过相关工作的人来说,这些智能体的失败模式十分常见:它们只是浅层次地查询业务数据,而非真正深入理解;几乎不会向客户提供任何有效信息;也很少对智能体架构或资源消耗进行优化,往往直接使用最初能运行的设计版本。 现有的编程基准测试仅能评估代码修复能力,而这项测试则着眼于智能体是否具备完成协作类任务的能力。 论文链接:https://academy.dair.ai/papers/bench-an-environment-for-end-to-end-realistic-agent-construction-2609.04611…
查看原文
查看缓存全文

缓存时间: 2026/09/08 15:35

一篇关于编程智能体的极具参考价值的基准测试论文。

在 Claude Code 环境下运行的 Claude Opus 5 在测试中仅通过了 23.9% 的评估任务,而专业人类评测员的得分则为 82.2%。

以下是该测试的具体任务内容。

开发人员需要构建一个智能体,将其投入实际客户服务场景中。该智能体需处理企业存储的业务数据、提出需求的客户及负责解答问题的客户、运维团队必须使用的生产级 API、现有的代码库,同时还面临服务成本与模型选择方面的严格限制。最终,它必须能够生成一个可正常工作的客户服务智能体。

评估方式是将构建好的智能体部署到预置的模拟用户环境中,完成四个领域共 53 项任务。

对于从事过相关工作的人来说,这些失败案例显得十分常见:模型只是浅层次地查询业务数据,而未能真正深入理解其含义;它们几乎不会向客户提供任何有效信息;也极少尝试不同的智能体架构或资源分配方案,往往直接使用最初能运行的设计版本。

现有的编程基准测试大多仅能衡量模型的基础功能,而这篇论文则侧重评估智能体是否具备完成协作类任务的能力。

论文链接:https://academy.dair.ai/papers/bench-an-environment-for-end-to-end-realistic-agent-construction-2609.04611…

相似文章

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。

@Xudong07452910: 这篇论文很适合所有重度使用 Claude Code、Codex 或者其他AI Agent 的人看。 它研究的不是 Agent 在 benchmark 上怎么失败,而是一个更真实的问题: 在真实开发里,AI coding agent 到底是…

X AI KOLs Timeline

This paper analyzes 20,574 real-world coding-agent sessions to identify how AI agents misalign with developer intent, finding that constraint violations and inaccurate self-reporting are the most common failure modes, imposing trust and effort costs rather than irreversible damage.

深入Claude Code:当前与未来AI代理系统的设计空间

Hugging Face Daily Papers

本文分析了Claude Code作为代理编程工具的架构,识别出影响其实现的五种人类价值观和十三项设计原则,包括安全系统、上下文管理和可扩展机制。研究将Claude Code与OpenClaw进行比较,展示了不同的部署环境如何针对常见的AI代理设计挑战产生不同的架构解决方案。