@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
摘要
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
查看缓存全文
缓存时间: 2026/08/03 11:39
编程基准正在趋于饱和。AI4Research 是下一个前沿。
很高兴看到我们的 MLS-Bench (https://t.co/yExIXjAjkv) 成为首个获得社区广泛认可和采用的 AI4Research 基准。祝贺团队!https://t.co/KCkBsP4j2s
MLS-Bench:对构建更好 AI 的 AI 系统进行的全面且严谨的评估
Source: https://mls-bench.com/
MLS-Bench 测试 AI 智能体能否发明下一代 AI。
每个任务都围绕一个定义明确的研究问题展开,要求智能体提出一个单一的模块化改进——新的损失函数、注意力变体、采样器或路由规则——然后衡量该改动是否能跨模型、数据集和随机种子迁移。
140 个可执行任务,涵盖 12 个领域,每个任务都围绕一个目标 ML 组件、一个受控的编辑面以及多设置迁移证据构建。
MLS-Bench-Lite 排行榜
在官方 30 个任务的 Lite 子集上,跨测试框架和努力程度的得分。
按类别划分的模型性能
每个模型的条形图显示:Vanilla 为较暗的下部,Agent 为较浅的叠加部分,并以半透明灰色 Human SOTA 参考线作为对照,该参考线由复现的人类基线计算得出。分数采用论文中的归一化任务指标。
Claude Opus 4.6 GPT-5.4 Gemini 3.1 Pro DeepSeek-V3.2 Qwen 3.6 Plus Vanilla Agent Human SOTA
任务类别
140 个任务,涵盖 12 个扁平类别。打开一个类别即可浏览其任务。
相似文章
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
MLS-Bench:对 AI 系统在构建更优 AI 方面能力的全面与严格评估
本文介绍了 MLS-Bench,这是一个旨在评估 AI 系统能否发明具有通用性和可扩展性的机器学习方法,而非仅仅进行工程调优的基准测试。
@KLieret: 你可以自己在 ProgramBench 上进行评估:https://github.com/facebookresearch/ProgramBench/… 我们将开放排行榜…
ProgramBench 是一个新的基准测试,用于测试 AI 智能体从编译后的二进制文件及其文档中重建完整代码库的能力。排行榜即将开放提交。
介绍 BenchBench(5分钟阅读)
介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。
ResearchClawBench:面向端到端自主科学研究的基准测试
ResearchClawBench 是一个用于评估端到端自主科学研究的基准测试,涵盖来自10个领域的40个任务,结果显示当前AI智能体和LLM的重新发现准确率较低,其中Claude Code平均得分为21.5,Claude-Opus-4.7平均得分为20.7(在可能的总分中)。