我如何在不平均不兼容分数的情况下组合11个编码基准测试
摘要
作者描述了一种通过组合11个基准测试来比较编码AI模型的方法,使用百分位排名而不是平均原始分数,重点是对98个模型进行去重和加权类别。
我正在构建LLMLearner,并希望有一个编码模型比较,不平均不兼容的原始基准分数。当前快照涵盖了98个模型系列代表、11个合格榜单和268个去重的模型–基准结果。方法:- 将证据分为仓库工程、代理编码/工具使用、实时编码和函数生成。- 将每个记录的排名转换为领域大小百分位,而不是平均不同尺度的原始指标。- 去重重叠测试;例如,HumanEval pass@1/pass@10/pass@100不能成为三个独立投票。- 整体视图加权为40%仓库工程、35%代理编码、20%实时编码和5%函数生成。- 当证据缺失时,重新标准化可用权重,同时显示单独的覆盖标签。- 将价格、上下文、开放性和发布状态与能力分数分开。已知限制:- 百分位排名隐藏了原始分数差距的大小,并取决于评估领域。- 基准分组和权重是编辑选择。- 代理结果包括测试环境、工具和脚手架效应。- 公开评估可能被污染或过度优化。- 新模型和开放权重模型通常覆盖不均衡。指南和完整方法:https://llmlearner.com/best-llms/coding 应该添加或替换哪些编码排行榜?本地部署证据,如量化、VRAM、吞吐量和长上下文可靠性,是否应成为一个单独维度?披露:我与LLMLearner有关联。英语不是我的第一语言,我使用AI来帮助翻译和润色这篇文章。https://preview.redd.it/aynlionsxfmh1.jpg?width=2038&format=pjpg&auto=webp&s=2a82c038ff5fa6b91a88a79eb80dafd899e81ac5
相似文章
不要声称面向基准测试的优化能提升通用编码能力——需要多样化的评估
该论文批评了依赖如SWE-bench等有限的编码基准测试来衡量AI模型的通用编码能力的做法,表明针对这些基准测试的优化无法泛化,并倡导多样化的评估方法。
AA 推出 Coding Agent Index —— 模型与 Harness 组合的性能对比
Artificial Analysis 推出了 Coding Agent Index,这是一套新的基准测试套件,结合了 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,旨在评估 AI 编程代理在多样化任务中的表现。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
性能优化基准是否可靠地衡量编码代理?
本文审计了针对编码代理的三个性能优化基准(GSO、SWE-Perf、SWE-efficiency),发现运行时不稳定、评分规则和任务覆盖率显著影响可靠性,并且许多任务已经至少有一个公开提交解决了。