@IntologyAI:编码智能体能做研究吗?我们发布 NanoGPT-Bench,这是我们用来测试编码智能体在 AI 研发问题上的一项内部评估…

X AI KOLs Following 工具

摘要

IntologyAI 发布了 NanoGPT-Bench,这是一个用于评估编码智能体在 AI 研发任务上表现的内部基准。当前的智能体仅恢复了人类进展的 9.3%,主要通过超参数调优,凸显了算法研究能力方面的差距。

编码智能体能做研究吗? 我们发布了 NanoGPT-Bench,这是我们针对一个需要数月人类工作进展的 AI 研发问题,用于测试编码智能体的内部评估工具。 Codex、Claude Code、Autoresearch 仅恢复了人类进展的 9.3%,主要集中在超参数调优,而忽略了算法研究。 NanoGPT-Bench 基于 NanoGPT Speedrun 构建,这是一项旨在最小化 GPT-2 风格模型训练时间的流行 LLM 预训练竞赛。现有的人类提交成果代表了近两年的工作。为了控制前沿模型的依赖和污染问题,我们将评估标准化为 5 个月的世界纪录窗口。评估是完全自主且端到端的,无需人工干预或互联网访问。
查看原文
查看缓存全文

缓存时间: 2026/05/20 06:25

编程代理能做研究吗?

我们发布了NanoGPT-Bench,一个内部评测基准,用于测试代理在人类数月进展的AI研发问题上的表现

Codex、Claude Code、Autoresearch仅恢复了人类进展的9.3%,主要是调超参,忽略了算法研究

NanoGPT-Bench基于NanoGPT Speedrun构建,这是一个流行的LLM预训练竞赛,目标是最小化GPT-2风格模型的训练时间。现有的人类提交成果累计近两年的工作。为控制前沿模型中的依赖和污染,我们将评估标准化为5个月的世界纪录窗口。评估完全自主且端到端,无需人工干预或互联网访问。

相似文章

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。

PaperBench:评估AI复现AI研究的能力

OpenAI Blog

OpenAI推出PaperBench,一个评估AI代理复现最先进AI研究能力的基准。该基准通过复现20篇ICML 2024论文,包含8,316个可评分任务。表现最好的模型(Claude 3.5 Sonnet)仅达到21%的复现分数,低于人类博士级别的表现,凸显了当前自主研究能力的局限性。

GeneBench-Pro 介绍

OpenAI Blog

OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。