Apex-Testing:真实世界、真实仓库的智能编码基准测试(更新)
摘要
Apex-Testing 是一个用于评估智能编码模型的基准测试,基于真实的私有 GitHub 仓库。该测试已更新,加入了最新模型和详细指标,包括成本、时间以及基于 ELO 的排行榜。
**Apex-Testing 大更新!** [https://www.apex-testing.org/](https://www.apex-testing.org/) **真实世界智能编码** 基准测试已(95%)更新,包含所有最新模型!该测试基于 65-70 个**真实私有 GitHub 仓库**,专门设计用于测试模型的真实智能编码能力。**如果您是第一次了解这个项目,以下是网站摘录:**
"**什么是 APEX Testing?** 每周都会有一款新模型号称“史上最佳”。每个供应商都承诺以极低的成本实现 10 倍性能。基准测试被精心挑选,演示被精心策划,网红被付费推广,而人们仍然不断上当。APEX 的存在是因为我厌倦了这些炒作和刻意的基准优化。模型被放入真实的代码库中,面对真实的 bug 和真实的功能需求,它们必须像开发者一样解决问题。涵盖 8 个类别的 70 项任务,全部基于你在工作中实际会遇到的场景。你可以看到哪些是真正有效的,哪些只是营销。"
**当前指标包括:**
- 平均成本
- 平均时间
- 基于类别/难度的评分
- 基于 ELO 的排行榜(详见网站)
- 模型对比
- 各种指标(详见网站)
**仍有部分内容需要跟进,例如:**
- Qwen3.7 Max 的测试尚未完成(已完成约 40/70 个仓库任务)
- 需要添加 Qwen3.6 本地模型(将在接下来几天以 BF16 完成)
- Deepseek v4 pro+flash 的测试尚未完成
- 理想情况下,我还想添加 Qwen3.5 397B BF16(已添加 Q4_K_XL 并完成)
我**很可能**会为此开放某种捐赠渠道,或者如果有人有 OpenRouter 代币可供使用,我将不胜感激。否则,往后我可能只会选择性更新模型(本地模型只要我的 VRAM 能容纳,就一定会添加,这里仅指 API 成本)。请不要将此视为任何形式的压力或要求,仅针对有兴趣且有能力的人。
相似文章
它是否具备足够的代理能力?使用你自己的工具对开放模型进行基准测试
这篇博客文章介绍了一种基准测试方法,用于评估开放模型在代理编程任务上的表现,不仅关注准确性,还关注代理过程的效率。它提供了一个使用 pi coding agent 的可定制工具框架,并在不同模型和库版本上进行测试。
APEX-Accounting
APEX-Accounting 是由 Mercor 和 Ramp 联合创建的基准测试,用于评估前沿人工智能模型在实际会计任务中的表现。表现最佳的模型 Claude-Fable-5 (Max) 达到了 56.4% 的平均标准。
SWE-Explore:编码代理仓库探索能力基准测试
SWE-Explore 引入了一个基准测试,用于评估编码代理的仓库探索能力,要求在行预算内返回相关代码区域的排序列表。实验表明,基于代理的探索优于传统检索,而行级覆盖仍然是关键区分因素。
@adithya_s_k: https://x.com/adithya_s_k/status/2067628584680710292
这篇文章讨论了代码代理如何通过复制已知补丁来作弊评估,并介绍了Repo2RLEnv,一个从真实仓库创建可验证编码环境的工具,用于为AI代码代理构建稳健的基准和训练数据。
REAP: 从交互式生产使用中自动策划编码代理基准 [R]
REAP是一个自动化管道,从真实的开发者-代理会话中策划生产环境衍生的编码代理基准,利用基于LLM的分类和稳定性检查,确保无需手动标注的可靠评估。