@IntologyAI:编码智能体能做研究吗?我们发布 NanoGPT-Bench,这是我们用来测试编码智能体在 AI 研发问题上的一项内部评估…
摘要
IntologyAI 发布了 NanoGPT-Bench,这是一个用于评估编码智能体在 AI 研发任务上表现的内部基准。当前的智能体仅恢复了人类进展的 9.3%,主要通过超参数调优,凸显了算法研究能力方面的差距。
查看缓存全文
缓存时间: 2026/05/20 06:25
编程代理能做研究吗?
我们发布了NanoGPT-Bench,一个内部评测基准,用于测试代理在人类数月进展的AI研发问题上的表现
Codex、Claude Code、Autoresearch仅恢复了人类进展的9.3%,主要是调超参,忽略了算法研究
NanoGPT-Bench基于NanoGPT Speedrun构建,这是一个流行的LLM预训练竞赛,目标是最小化GPT-2风格模型的训练时间。现有的人类提交成果累计近两年的工作。为控制前沿模型中的依赖和污染,我们将评估标准化为5个月的世界纪录窗口。评估完全自主且端到端,无需人工干预或互联网访问。
相似文章
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
@OpenAI: 我们正在推出GeneBench-Pro,这是一个研究级基准测试,用于衡量一种更难实现的AI进步:智能体在导航…
OpenAI推出了GeneBench-Pro,这是一个研究级基准测试,用于测试AI智能体在计算生物学中导航混乱的生物数据、选择分析路径以及做出判断的能力。
PaperBench:评估AI复现AI研究的能力
OpenAI推出PaperBench,一个评估AI代理复现最先进AI研究能力的基准。该基准通过复现20篇ICML 2024论文,包含8,316个可评分任务。表现最好的模型(Claude 3.5 Sonnet)仅达到21%的复现分数,低于人类博士级别的表现,凸显了当前自主研究能力的局限性。
GeneBench-Pro 介绍
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。