AA 推出 Coding Agent Index —— 模型与 Harness 组合的性能对比
摘要
Artificial Analysis 推出了 Coding Agent Index,这是一套新的基准测试套件,结合了 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,旨在评估 AI 编程代理在多样化任务中的表现。
>**Artificial Analysis Coding Agent Index 包含 3 个主要基准测试,代表了广泛的编程代理应用场景:** ➤ **SWE-Bench-Pro-Hard-AA**,源自 Scale AI 的 SWE-Bench Pro,包含 150 个前沿模型难以处理的真实编程任务 ➤ **Terminal-Bench v2**,来自 Laude Institute 的 84 个代理终端任务,涵盖系统管理、密码学到机器学习等领域(其中 5 个任务因环境不兼容被过滤) ➤ **SWE-Atlas-QnA**,由 Scale AI 开发的 124 个技术问题,涉及代码行为、问题根本原因等,要求代理探索代码库并给出文字回答 更多细节见其 X 帖子:[Artificial Analysis on X](https://x.com/ArtificialAnlys/status/2053865095076438427/photo/1)
相似文章
Prime Agent —— 超越 Codex/CC/PI 的新型编码框架
Prime Agent 是一个开源编码与研究框架,性能超越专有框架,在 ARC-AGI-3 上得分 95.5%,并在多个基准测试中提升模型表现。
AI编程代理可复现社会科学发现
本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
合并你PR的智能体,尚无基准可循。
Artificial Analysis 推出了一个编码智能体指数,该指数分别测试框架与模型的组合,强调基准测试任务与实际生产需求不同。文章认为,团队应基于自身的代码库和工作流来评估智能体配置,而非仅依赖标准化基准。
@Ali_TongyiLab: https://x.com/Ali_TongyiLab/status/2067158015615041755
AgentScope团队推出了PawBench,这是一个用于评估模型与代理框架综合性能的基准测试。通过对4,050个测试单元的分析,结果表明框架选择的影响堪比模型升级。