@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)

X AI KOLs Timeline 论文

摘要

正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。

编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。 很高兴看到我们的 MLS-Bench(https://t.co/yExIXjAjkv)成为首个获得社区广泛认可和采用的 AI4Research 基准测试。 祝贺团队!https://t.co/KCkBsP4j2s
查看原文
查看缓存全文

缓存时间: 2026/08/03 11:39

编程基准正在趋于饱和。AI4Research 是下一个前沿。

很高兴看到我们的 MLS-Bench (https://t.co/yExIXjAjkv) 成为首个获得社区广泛认可和采用的 AI4Research 基准。祝贺团队!https://t.co/KCkBsP4j2s


MLS-Bench:对构建更好 AI 的 AI 系统进行的全面且严谨的评估

Source: https://mls-bench.com/

MLS-Bench 测试 AI 智能体能否发明下一代 AI。

每个任务都围绕一个定义明确的研究问题展开,要求智能体提出一个单一的模块化改进——新的损失函数、注意力变体、采样器或路由规则——然后衡量该改动是否能跨模型、数据集和随机种子迁移。

140 个可执行任务,涵盖 12 个领域,每个任务都围绕一个目标 ML 组件、一个受控的编辑面以及多设置迁移证据构建。

MLS-Bench-Lite 排行榜

在官方 30 个任务的 Lite 子集上,跨测试框架和努力程度的得分。

按类别划分的模型性能

每个模型的条形图显示:Vanilla 为较暗的下部,Agent 为较浅的叠加部分,并以半透明灰色 Human SOTA 参考线作为对照,该参考线由复现的人类基线计算得出。分数采用论文中的归一化任务指标。

Claude Opus 4.6 GPT-5.4 Gemini 3.1 Pro DeepSeek-V3.2 Qwen 3.6 Plus Vanilla Agent Human SOTA

任务类别

140 个任务,涵盖 12 个扁平类别。打开一个类别即可浏览其任务。

相似文章

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。

介绍 BenchBench(5分钟阅读)

TLDR AI

介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。

ResearchClawBench:面向端到端自主科学研究的基准测试

Hugging Face Daily Papers

ResearchClawBench 是一个用于评估端到端自主科学研究的基准测试,涵盖来自10个领域的40个任务,结果显示当前AI智能体和LLM的重新发现准确率较低,其中Claude Code平均得分为21.5,Claude-Opus-4.7平均得分为20.7(在可能的总分中)。