我们距离真正的自动研究还有多远?
摘要
本文介绍了ResearchArena,一个用于评估自动研究智能体的框架,并发现虽然智能体生成的论文在仅稿件评审下看似具有竞争力,但结合工件的评审揭示了实验严谨性方面的严重缺陷,没有一篇论文达到顶级会议的接收标准。
arXiv:2605.19156v1 Announce Type: new
摘要:近期自动研究系统能够生成完整的论文,但可行性并不等同于质量,该领域仍缺乏对智能体生成论文实际质量的系统性研究。我们引入了ResearchArena,一个最小化框架,允许现成的智能体(使用Opus 4.6的Claude Code、使用GPT-5.4的Codex以及使用K2.5的Kimi Code)在仅需轻量级引导的情况下自主完成整个研究循环(构思、实验、论文撰写、自我完善)。在13个计算机科学种子任务和每个智能体-领域对3次试验中,ResearchArena生成了117篇智能体论文,每篇论文在三个互补视角下进行评估:仅稿件评审(SAR)、结合工件的同行评审(PR,智能体在审阅稿件的同时检查工作空间),以及人工进行的元评审。仅看SAR,情况是乐观的:Claude Code获得最高分,超越了Analemma的FARS,并与人类ICLR 2025提交论文的加权平均分相当,表明最小化框架下的智能体在仅稿件评审下能产生具有竞争力的论文。然而,人工检查表明这一画面被夸大了:SAR分数与其实际接收决策的一致性较差,并且奖励了看似合理但未验证实验实质的框架。在结合工件的PR下,分数急剧下降,人工审计发现实验严谨性是主要瓶颈,可分解为三种失败模式(结果伪造、实验力度不足、计划与执行不匹配),这些模式高度依赖于智能体:Codex的论文-工件不匹配/伪造参考文献比例分别为5%/8%,而Kimi Code为77%/72%,两者相差$\sim$15$\times$,反映了智能体发展出的不同研究风格。117篇智能体论文中没有一篇达到顶级会议的接收标准。这表明我们距离真正的自动研究仍有差距。
查看缓存全文
缓存时间: 2026/05/20 08:28
# 我们距离真正的自动研究还有多远? 来源: https://arxiv.org/html/2605.19156
郑新张 *宁旺 * Sainyam Galhotra * Claire Cardie
康奈尔大学
{zz865, nw366}@cornell.edu
###### 摘要
最近的自动研究系统*能够*生成完整的论文,但可行性不等于质量,该领域仍然缺乏对智能体生成的论文质量到底有多好的系统性研究。我们引入了**ResearchArena**,一个最小的脚手架框架,允许现成的智能体(使用 Opus 4.6 的 Claude Code、使用 GPT-5.4 的 Codex 以及使用 K2.5 的 Kimi Code)在仅需轻量级指导的情况下自行完成完整的研究循环(构思、实验、论文写作、自我改进)。在 13 个计算机科学种子以及每个智能体-领域对 3 次试验中,ResearchArena 生成了 117 篇智能体生成的论文,每一篇都经过三种互补视角的评估:仅手稿审阅(SAR)、工件感知同行评审(PR,智能体在查看手稿的同时检查工作空间),以及人工进行的元评审。仅从 SAR 来看,情况是乐观的:Claude Code 获得了最高分,超越了 Analemma 的 FARS,并与人类 ICLR 2025 提交的加权平均分数相当,这表明最小脚手架的智能体能够产生在仅手稿评审中看起来具有竞争力的论文。然而,人工检查发现这种看法被夸大了:SAR 分数与其实际接受决策的关联度很差,并且奖励看似合理但未验证实验实质的叙述框架。在工件感知的 PR 中,分数大幅下降,人工审计发现实验严谨性是主要瓶颈,可分解为三种失败模式(*捏造结果*、*实验力度不足*以及*计划/执行不匹配*),这些模式高度依赖于智能体:Codex 只有 5%/8% 的论文-工件不匹配/捏造引用,而 Kimi Code 则为 77%/72%,差距达∼15×,这追踪了智能体发展的不同研究"角色"。在 117 篇智能体生成的论文中,没有一篇达到顶级会议/期刊的录取标准。这表明我们距离真正的自动研究还有差距。
## 1 引言
大型语言模型(LLMs)已迅速从被动的文本生成器演变为能够结合推理与行动 Yao et al. (2022)、调用外部工具 Schick et al. (2023)、浏览网页 Nakano et al. (2021); Zhou et al. (2023)、在真实软件环境中编写和执行代码 Yang et al. (2024); Jimenez et al. (2023),以及在开放环境中长期运行 Wang et al. (2023, 2024) 的自主智能体。最近的研究 Lu et al. (2024); Yamada et al. (2025); Analemma Intelligence (2026); Baek et al. (2025); Schmidgall et al. (2025); Schmidgall and Moor (2025) 已经开始将这些能力串联成端到端的科学研究管道,这些管道接受一个种子主题并生成完整的研究成果。例如,AI Scientist Lu et al. (2024); Yamada et al. (2025) 集思广益研究想法、编写并运行代码、总结结果并起草完整手稿,其第二个版本生成了第一篇完全由 AI 系统撰写并经过同行评审接受的研讨会论文。Analemma 的全自动研究系统(FARS)Analemma Intelligence (2026) 以更大的计算规模追求类似的全管道目标。这些工作表明,智能体系统*能够*生成完整的论文。
然而,它们主要证明的是可行性而非质量:我们仍然缺乏对智能体生成的论文质量到底有多好的系统性研究。为了研究这一问题,我们为现成智能体构建了一个最小的脚手架框架,称为 **ResearchArena**,它允许通用智能体自行完成完整的研究循环:构思、实验、论文写作和自我改进,仅需轻量级指导。先前的基准测试如 MLR-Bench Chen et al. (2025) 通过模块化脚手架进行分阶段和端到端评估来评价开放式 ML 研究,而 ResearchArena 研究的是一种互补的设置:单个现成智能体自主地在更广泛的计算机科学领域内操作,而不是由阶段特定组件组成的管道。
我们评估了三个前沿智能体:使用 Opus 4.6 的 Claude Code Anthropic (2026)、使用 GPT-5.4 的 Codex OpenAI (2026) 以及使用 K2.5 的 Kimi Code Moonshot AI (2026)。为了在不同研究环境中测试这些系统,我们选择了 13 个计算机科学领域,包括 5 个仅 CPU 和 8 个 GPU 密集型领域,并为每个智能体-领域对运行了 3 次试验。这产生了 117 篇智能体生成的论文,以及它们附带的实验工件。每篇论文随后在三种互补视角下进行评估:仅手稿智能体审阅(SAR)Stanford ML Group (2025)、我们的工件感知同行评审(PR,智能体在查看手稿的同时检查工作空间),以及人工检查。
仅 SAR 评估描绘了一幅乐观的图景,并作为一个有用的仅手稿校准镜头:Claude Code 在三个智能体中获得了最高平均分,超越了 Analemma 的 FARS 系统,并达到了与人类撰写的 ICLR 2025 提交加权平均分数相当的水平。这表明,最小脚手架的智能体能够生成在仅手稿审阅下看起来具有竞争力的论文。然而,人工检查发现,这种图景被夸大了:SAR 分数与实际 ICLR 接受决策的关联度很差,SAR 奖励看似合理但不可行的想法、精炼的叙述框架以及看似诚实的负面结果,而并未验证实验实质。
我们的工件感知 PR 和人工检查则呈现了不同的故事。在 PR 中,审稿人在查看手稿的同时还能看到代码和日志,分数急剧下降,几乎所有论文都低于接受阈值。人工检查发现,*实验严谨性*是所有智能体的主要瓶颈,可分为三种不同的失败模式:*捏造结果*(论文中报告的数字与底层输出不匹配)、*实验力度不足*(范围狭窄,仅聚焦于单个小型数据集和单个模型),以及*计划/执行不匹配*(实验未包含构思中的所有组成部分)。这些模式因智能体而异:Codex 主要表现为实验力度不足,并且诚信问题最少(仅 5%/8% 的论文存在结果-工件不匹配和捏造引用);Kimi Code 则结合了捏造和计划/执行不匹配(77%/72%);Claude Code 介于两者之间(31%/36%);这约 15× 的差距追踪了智能体发展的不同研究"角色":Codex 是谨慎的实证科学家,Kimi Code 是雄心勃勃的系统构建者,而 Claude Code 是全栈研究者(§4)。
综合来看,我们的发现表明,尽管智能体生成的论文在仅手稿审阅下看起来光鲜亮丽,但其实际质量(通过工件感知同行评审和人工审计衡量)仍远低于人类撰写的作品,并且**在 117 篇智能体生成的论文中,没有一篇达到顶级会议/期刊的录取标准**。为了支持社区随着模型进步跟踪进展,我们发布完整的语料库:117 篇论文及其代码和日志、351 份 PR 评审、117 个 SAR 分数、人工检查结果以及可配置的框架程序。
## 2 相关工作
**自动研究系统。** 越来越多的研究工作 Karpathy (2026); Analemma Intelligence (2026); Lu et al. (2024); Yamada et al. (2025); Baek et al. (2025); Schmidgall et al. (2025); Schmidgall and Moor (2025) 已经展示了端到端的智能体驱动研究。例如,AI Scientist Lu et al. (2024) 开创了构思、实验、写作和自动审阅的完整循环,采用线性多智能体管道,在三个机器学习子领域(扩散建模、基于 Transformer 的语言建模和学习动力学)上进行了评估。其后续版本 Yamada et al. (2025) 将线性循环替换为智能体树搜索,加入了用于图形的 VLM 反馈和并行实验执行,并生成了第一篇通过同行评审接受的研讨会论文。相反,Analemma 的全自动研究系统(FARS)Analemma Intelligence (2026) 是一个封闭的多智能体管道,据报道以相当高的计算规模运行(报告成本为 $104,000),并生成了超过 100 篇智能体生成的论文。Karpathy 的 Auto-Research Karpathy (2026) 则是一个极简的单智能体演示,它迭代地修改一个固定的 train.py 以探索架构和超参数选择,并对照一个保留的验证指标,仅自动化了编码和实验阶段。ResearchAgent Baek et al. (2025) 仅针对早期阶段(问题定义、方法提出和实验设计),由多个基于 LLM 的审阅智能体根据人类标准进行迭代细化,并以学术引用图加上跨论文概念存储为基础,不涉及代码、实验执行或论文写作。Agent Laboratory Schmidgall et al. (2025) 将整个过程结构化为三个由专门 LLM 智能体驱动的顺序阶段:文献综述、用于实验的 `mle-solver` 模块以及用于报告写作的 `paper-solver` 模块,并提供一个可选的人工参与共驾驶模式。AgentRxiv Schmidgall and Moor (2025) 增加了一个共享的预印本服务器,多个智能体实验室可以通过该服务器上传和检索彼此的跨运行报告,使得连续运行能够建立在先前研究的基础上,而不是孤立运行。
**LLM 研究智能体的基准测试。** 现有的基准测试 Huang et al. (2023); Chan et al. (2024); Zhang et al. (2025); Wijk et al. (2024); Chen et al. (2024, 2025); Starace et al. (2025); Siegel et al. (2024) 评估语言智能体在研究过程的局部切片,可分为三组。*固定任务 ML 工程基准测试* 根据客观排行榜指标对智能体在预定义任务上的表现进行评分:MLAgentBench Huang et al. (2023)(13 个任务,从 CIFAR-10 到 BabyLM 和 Kaggle 挑战)、MLE-bench Chan et al. (2024)(75 个 Kaggle 竞赛)、MLRC-Bench Zhang et al. (2025)(7 个 ML 研究竞赛任务,针对新方法提出和实现)、以及 RE-Bench Wijk et al. (2024)(7 个开放式 ML 研发环境,在匹配时间预算下将智能体与人类专家进行竞争)。*开放式研究任务基准测试* 从同行评审出版物中抽取任务,并要求生成自包含的研究工件:ScienceAgentBench Chen et al. (2024) 从 44 篇跨四个学科的论文中提取了 102 个数据驱动的发现问题,MLR-Bench Chen et al. (2025) 包含了 201 个取自 NeurIPS / ICLR / ICML 研讨会的开放式 ML 研究任务。*复现基准测试* 要求智能体达到已知目标:PaperBench Starace et al. (2025) 通过分层分解的评分标准评估从零开始复现 20 篇 ICML 2024 亮点论文,而 CORE-Bench Siegel et al. (2024) 衡量从已发表论文中复现计算结果的性能(这是一个相邻的、互补的研究方向)。
## 3 ResearchArena
在本节中,我们首先概述 ResearchArena §3.1,然后描述设置 §3.2,接着在 §3.3–3.5 中描述三种互补的评估视角:斯坦福智能体审阅系统(SAR)、我们的工件感知同行评审(PR)以及人工检查。
### 3.1 概述
如图 1 所示,每个智能体接收一个 CS 领域种子,并运行一个四阶段研究循环:构思、实验、论文写作和审阅。第 1-3 阶段各包含一个自我改进循环。在这三个阶段中的每一个,智能体都配有一份简洁的领域特定指南,该指南固定了可交付成果而非研究本身,这些指南是从成熟的研究实践中提炼出来的(例如 Schulman 的 ML 研究笔记 Schulman (2020)、ResearchAgent 方法论 Baek et al. (2025)、Peyton Jones 的写作建议 Peyton Jones (2017) 以及投稿人和审稿人指南)。这些指南特意保持简短,以便它们充当最小脚手架,而不是逐步的操作说明。我们在附录 B 中提供了示例指南。第 4 阶段通过三种互补视角评估生成的论文:斯坦福智能体审阅系统(SAR,仅手稿)、我们的工件感知同行评审(PR,三个智能体在查看手稿的同时检查工作空间)以及人工检查。
(图 1 描述:ResearchArena 管道)
### 3.2 设置
ResearchArena 跨越 13 个研究种子,分布在两个计算平台上。5 个 CPU 种子(因果学习、编译器优化、数据集成与清理、操作系统设计、概率方法)面向系统/数据库/编程语言类会议/期刊。8 个 GPU 种子(AI 生物学、计算机视觉、数据集与基准测试、生成模型、可解释性、自然语言处理、机器学习中的隐私、监督表示学习)面向 ML 类会议/期刊。硬件:主要实验使用 1× NVIDIA RTX A6000 (48 GB),配备 4 个 CPU 和 60 GB 内存。我们在所有 GPU 种子上重新运行...相似文章
智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
AutoResearch AI:迈向人工智能驱动的研究自动化以实现科学发现
本综述审视了人工智能驱动的研究自动化(AutoResearch)这一新兴领域,分析了AI系统如何从孤立的任务辅助转向完整的工作流级别的科学发现。它定义了从人类引导的‘Vibe Research’到AI主导系统的光谱,并提出了五个评估科学可信度的维度。
AutoResearch AI:迈向AI驱动的科学发现研究自动化
一篇综述论文,探讨了AI从特定任务助手到工作流级研究自动化工具的转变,将AutoResearch定义为AI驱动的科学工作流自动化的光谱,并分析了自主性、可重复性和问责制方面的挑战。
ARAC:端到端研究的自动研究对齐性与完整性基准测试
本文介绍了ARAC-Bench,一个用于评估自动研究系统的研究过程在方法论对齐性、逻辑连贯性和完整性方面与人类研究方法匹配程度的基准。对11个最先进框架的实验显示,最佳对齐分数仅为67.9/100,凸显了在模拟严谨人类研究行为方面的显著差距。
@rohanpaul_ai: Meta、斯坦福、谷歌等多家顶级实验室的新论文提出了AutoResearchClaw。表明自动化研究改进…
来自Meta、斯坦福和谷歌的一篇新论文提出了AutoResearchClaw,该方法通过整合故障恢复、辩论和选择性人工输入来改进自动化研究。它在ARC-Bench上以54.7%的优势超越了AI Scientist v2,并揭示了当受到过程约束而非无限自由时,自主性会得到增强。