基准测试变得简单
摘要
作者创建了Any-Bench,这是一个用于在个人代码库上对AI模型进行基准测试的工具,解决了现有基准测试如SWE-Bench的不足。
基准测试狂热:你怎么知道一个模型不是只针对基准测试进行优化?我在看到排行榜数字后尝试了DeepSeek-V4.1,确实,是个好模型,但离我实际代码库上的预期相差甚远。所以我创建了Any-Bench:(URL:链接在评论中)这正是SWE-Bench/DeepSWE/Terminal-Bench的问题所在。它们有用,但仍然是别人的问题。我只想知道一件事:哪个模型在我的代码库上真正最好?这就是AnyBench的用途。
相似文章
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
ProgramBench(5分钟阅读)
ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。
专为小型模型设计的新基准:ObviousBench.com
ObviousBench 是一个专门为评估小型 AI 模型而设计的新基准。
介绍 BenchBench(5分钟阅读)
介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。
基准测试:万事万物,无处不在,一气呵成
介绍 Benchmark Agent,一个完全自主的系统,用于创建多样化的基准测试,只需最少的人工干预,支持跨领域的持续模型评估。