我如何在不平均不兼容分数的情况下组合11个编码基准测试

Reddit r/ArtificialInteligence 工具

摘要

作者描述了一种通过组合11个基准测试来比较编码AI模型的方法,使用百分位排名而不是平均原始分数,重点是对98个模型进行去重和加权类别。

我正在构建LLMLearner,并希望有一个编码模型比较,不平均不兼容的原始基准分数。当前快照涵盖了98个模型系列代表、11个合格榜单和268个去重的模型–基准结果。方法:- 将证据分为仓库工程、代理编码/工具使用、实时编码和函数生成。- 将每个记录的排名转换为领域大小百分位,而不是平均不同尺度的原始指标。- 去重重叠测试;例如,HumanEval pass@1/pass@10/pass@100不能成为三个独立投票。- 整体视图加权为40%仓库工程、35%代理编码、20%实时编码和5%函数生成。- 当证据缺失时,重新标准化可用权重,同时显示单独的覆盖标签。- 将价格、上下文、开放性和发布状态与能力分数分开。已知限制:- 百分位排名隐藏了原始分数差距的大小,并取决于评估领域。- 基准分组和权重是编辑选择。- 代理结果包括测试环境、工具和脚手架效应。- 公开评估可能被污染或过度优化。- 新模型和开放权重模型通常覆盖不均衡。指南和完整方法:https://llmlearner.com/best-llms/coding 应该添加或替换哪些编码排行榜?本地部署证据,如量化、VRAM、吞吐量和长上下文可靠性,是否应成为一个单独维度?披露:我与LLMLearner有关联。英语不是我的第一语言,我使用AI来帮助翻译和润色这篇文章。https://preview.redd.it/aynlionsxfmh1.jpg?width=2038&format=pjpg&auto=webp&s=2a82c038ff5fa6b91a88a79eb80dafd899e81ac5
查看原文

相似文章

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。

性能优化基准是否可靠地衡量编码代理?

Hugging Face Daily Papers

本文审计了针对编码代理的三个性能优化基准(GSO、SWE-Perf、SWE-efficiency),发现运行时不稳定、评分规则和任务覆盖率显著影响可靠性,并且许多任务已经至少有一个公开提交解决了。