@dair_ai:一篇关于编程智能体的极具参考价值的基准测试论文。在Claude Code环境中运行的Claude Opus 5仅通过23.9%的测试项……
摘要
该论文提出了一种新的编程智能体评估基准,用于衡量其在真实环境中完成实际客户服务任务的能力。
查看缓存全文
缓存时间: 2026/09/08 15:35
一篇关于编程智能体的极具参考价值的基准测试论文。
在 Claude Code 环境下运行的 Claude Opus 5 在测试中仅通过了 23.9% 的评估任务,而专业人类评测员的得分则为 82.2%。
以下是该测试的具体任务内容。
开发人员需要构建一个智能体,将其投入实际客户服务场景中。该智能体需处理企业存储的业务数据、提出需求的客户及负责解答问题的客户、运维团队必须使用的生产级 API、现有的代码库,同时还面临服务成本与模型选择方面的严格限制。最终,它必须能够生成一个可正常工作的客户服务智能体。
评估方式是将构建好的智能体部署到预置的模拟用户环境中,完成四个领域共 53 项任务。
对于从事过相关工作的人来说,这些失败案例显得十分常见:模型只是浅层次地查询业务数据,而未能真正深入理解其含义;它们几乎不会向客户提供任何有效信息;也极少尝试不同的智能体架构或资源分配方案,往往直接使用最初能运行的设计版本。
现有的编程基准测试大多仅能衡量模型的基础功能,而这篇论文则侧重评估智能体是否具备完成协作类任务的能力。
论文链接:https://academy.dair.ai/papers/bench-an-environment-for-end-to-end-realistic-agent-construction-2609.04611…
相似文章
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
@dair_ai: If you maintain an AGENTS.md or a CLAUDE.md, this is worth a read. (bookmark it) 288 gold-test evaluated runs across Cl…
This paper presents a controlled ablation study across Claude Code and Codex, 17 real tasks, and 288 runs, finding that context files like AGENTS.md/CLAUDE.md do not measurably improve correctness; agents fail on implementation skill, not missing repository knowledge.
@Xudong07452910: 这篇论文很适合所有重度使用 Claude Code、Codex 或者其他AI Agent 的人看。 它研究的不是 Agent 在 benchmark 上怎么失败,而是一个更真实的问题: 在真实开发里,AI coding agent 到底是…
This paper analyzes 20,574 real-world coding-agent sessions to identify how AI agents misalign with developer intent, finding that constraint violations and inaccurate self-reporting are the most common failure modes, imposing trust and effort costs rather than irreversible damage.
@dair_ai: 关于计算机使用智能体的杰出论文。(收藏)计算机使用智能体通过屏幕操控真实软件,……
PreAct 将成功的智能体运行编译成小型状态机程序,在重复任务上实现 8.5-13 倍更快的重放,无需逐步骤的语言模型调用,并通过运行时屏幕检查确保正确性。
深入Claude Code:当前与未来AI代理系统的设计空间
本文分析了Claude Code作为代理编程工具的架构,识别出影响其实现的五种人类价值观和十三项设计原则,包括安全系统、上下文管理和可扩展机制。研究将Claude Code与OpenClaw进行比较,展示了不同的部署环境如何针对常见的AI代理设计挑战产生不同的架构解决方案。