AI能否评估AI科学家?一项使用自动化多模型评审的自主研究生成系统基准测试研究
摘要
本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。
arXiv:2607.28631v1 Announce Type: new
摘要:具备自主研究能力的AI科学家系统有望显著加速科学发现。然而,评估和比较AI生成论文的质量仍然是一个开放挑战。我们提出并实现了一种严格的基准测试协议,利用前沿大语言模型构建自动化同行评审系统,从四个核心维度评估科学论文:原创性、科学严谨性、清晰度和重要性。我们评估了四个领先的AI科学家框架:\textit{Sakana AI (v1 & v2)}、\textit{CycleResearcher}和\textit{Data-to-Paper}。每个框架均在商业自主AI科学家公司(FARS)发布的15个一致的研究提案上运行,生成了60篇论文,我们将其与15篇FARS基准论文一同评估。使用三个独立的LLM评审者(GPT-5.4、Gemini和Claude),我们发现FARS基准论文显著优于所有竞争框架,在1--5分制上平均得分2.14--2.47,而其他系统仅为1.00--1.87。值得注意的是,在Gemini和Claude评估中,FARS的得分比次优系统高出2$\times$以上。我们发现Gemini和Claude之间具有很强的一致性($\rho$ = 0.907,$p < 0.001$),并且两者与综合得分都极强相关($\rho$ = 0.961,$p < 0.001$),验证了自动化评估的可靠性。然而,GPT-5.4表现出较弱的一致性($\rho \approx 0.32$),表明它使用不同的标准评估论文。这些结果为AI科学家系统建立了首个定量基准,并证明多模型LLM评估为评估自主研究质量提供了可扩展、一致的框架。
查看缓存全文
缓存时间: 2026/08/03 07:29
###### 摘要 能够进行自主研究的 AI 科学家系统有望大幅加速科学发现。然而,评估和比较 AI 生成论文的质量仍然是一个未解决的挑战。我们提出并实现了一个严格的基准测试协议,利用自动化同行评审系统,借助前沿大语言模型从四个核心维度评估科学论文:原创性、科学严谨性、清晰度和重要性。我们评估了四个领先的 AI 科学家框架:Sakana AI(v1 和 v2)、CycleResearcher 和 Data-to-Paper。每个框架都基于一家商业自主 AI 科学家公司(FARS)发布的 15 个一致的研究提案运行,生成了 60 篇论文,并与 15 篇 FARS 基准论文一起进行评估。使用三个独立的 LLM 评审者(GPT-5.4、Gemini 和 Claude),我们发现 FARS 基准论文显著优于所有竞争框架,在 1-5 分制上平均得分为 2.14–2.47,而其他系统为 1.00–1.87。值得注意的是,在 Gemini 和 Claude 的评估中,FARS 的得分比次优系统高出 2 倍以上。我们发现 Gemini 和 Claude 之间存在高度一致性(ρ= 0.907,p<0.001),并且两者与综合得分均极强相关(ρ= 0.961,p<0.001),验证了自动化评估的可靠性。然而,GPT-5.4 的一致性较弱(ρ≈0.32),这表明它使用了不同的标准来评估论文。这些结果为 AI 科学家系统建立了首个定量基准,并证明多模型 LLM 评估能够为评估自主研究质量提供一个可扩展、一致的框架。 AI 科学家系统、自动化论文生成、自动化评估、基准测试、大语言模型 ## 1 引言 自动化科学研究代表了当代人工智能的一个重要前沿。大语言模型最近推动了 AI 科学家系统的发展:这些自动化流程能够从问题提案生成完整的研究论文,在极少人工监督的情况下处理假设生成、实验和稿件撰写。近期的研究包括 AI Scientist(Luet al.,2024 (https://arxiv.org/html/2607.28631#bib.bib9))及其后继者 AI Scientist v2(Yamadaet al.,2025 (https://arxiv.org/html/2607.28631#bib.bib8)),以及 CycleResearcher(Wenget al.,2024 (https://arxiv.org/html/2607.28631#bib.bib10))、Data-to-Paper(Technion-Kishony-lab,2024 (https://arxiv.org/html/2607.28631#bib.bib11))和 Agent Laboratory(Schmidgallet al.,2025 (https://arxiv.org/html/2607.28631#bib.bib13))等系统,展示了端到端研究自动化的潜力。这些系统有望通过使研究能力民主化并加快知识生产的步伐,极大地加速科学发现。然而,这些系统的快速 proliferation 已经超出了我们严格评估它们的能力。尽管它们被越来越多地采用和部署,但一些基本问题仍未得到解答:不同的 AI 科学家框架在输出质量上有何差异?哪些系统生成的论文最接近既定的质量标准?我们能否系统地识别每种方法的优缺点? 对 AI 生成研究进行基准测试的挑战与传统性能评估根本不同。与在固定数据集上评估的机器学习系统不同,AI 科学家系统必须评估其端到端开展合理、严谨且新颖研究的能力。这需要同时评估多个维度:假设的原创性、实验设计的合理性、结论的有效性以及表述的清晰度。传统的人工同行评审虽然是黄金标准,但在规模上成本过高。自动化评估系统可以实现快速迭代和改进(Jinet al.,2024 (https://arxiv.org/html/2607.28631#bib.bib29)),但为科学论文创建可信的自动评审者仍然是一个未解决的问题。近期关于智能体基准测试的工作(Huanget al.,2024 (https://arxiv.org/html/2607.28631#bib.bib27))凸显了评估开放式自主系统的复杂性。此外,即使在相同的一组提案上运行和评估少数几个 AI 科学家系统,所需的计算成本和时间也阻碍了系统性比较研究。 为了应对这些挑战,我们进行了一项严格的端到端比较基准测试研究,评估了四个领先的自主 AI 科学家系统:Sakana AI v1、Sakana AI v2、CycleResearcher(Wenget al.,2024 (https://arxiv.org/html/2607.28631#bib.bib10))和 Data-to-Paper(Technion-Kishony-lab,2024 (https://arxiv.org/html/2607.28631#bib.bib11))。每个系统都在来自 FARS(全自动研究系统)数据集的相同 15 个研究提案上执行,生成 60 篇论文,我们使用多模型评估框架对其质量进行评估。作为参考,我们还评估了 FARS 本身在相同提案上生成的论文,从而形成了一个受控的实验设计,能够在具有不同架构和输入要求的系统之间进行公平比较。最终数据集包含 75 篇论文(60 篇来自四个系统,15 篇 FARS 基准论文),并在多个维度上进行了系统性评估,从而能够全面分析相对优势和劣势。 为了实现大规模严格比较评估,我们采用了一个多模型评估框架,利用三个前沿大语言模型——GPT 5.4、Claude Opus 4.6 和 Gemini 3.1 Pro——作为独立评审者。每个模型独立地从四个核心评估维度评估论文:原创性(贡献的新颖性)、科学严谨性(方法和证据的合理性)、清晰度(表述和组织质量)以及重要性(重要性和潜在影响)。每个维度由所有三个模型按 1-5 分制评分,并将结果综合为统一的共识评估。这种多模型方法既提供了定量分数,也提供了定性分析,包括论文优势和劣势的书面总结、已识别的局限性以及具体的改进建议。关键是,该评估过程每篇论文可在 15-30 分钟内完成,首次使多个系统的系统性比较成为可能。 我们在本文中的具体贡献如下:(i)我们进行了**首个严格的比较基准测试研究**,在相同的研究提案上评估了四个领先的框架,并将其输出与高质量参考标准(FARS)进行比较。(ii)我们引入了一个实用、可扩展的框架,使用多个前沿 LLM 作为独立评审者,从四个核心评估维度系统评估 AI 生成的研究论文。(iii)我们提供了**系统间性能差距的定量证据**,证明 FARS 基准论文显著优于竞争框架生成的论文(在多个评审模型上得分高出 2 倍以上)。(iv)我们证明**基于 AI 的评估能够有效且一致地评估研究质量**,既提供定量分数又提供定性反馈,为自主研究系统的自动化迭代和改进开辟了新的可能性。 ## 2 被评估的 AI 科学家与基准参考(FARS) 表 1:四个被评估的 AI 科学家系统和 FARS 基准参考的架构与方法论特征。本基准测试研究将四个领先的自主 AI 科学家系统与参考标准进行比较,通过在相同的研究提案上对其输出进行严格评估。表1 (https://arxiv.org/html/2607.28631#S2.T1) 概述了每个系统的架构和方法论特征。本节描述了被评估的四个系统:Sakana AI(v1 和 v2)、CycleResearcher 和 Data-to-Paper,以及作为我们基准参考的 FARS(全自动研究系统)。理解每个框架的设计理念和独特能力对于解释后续呈现的比较性能结果至关重要。 ### 2.1 FARS:基准参考系统 FARS(全自动研究系统)是一个多智能体系统,旨在无需人工干预的情况下自主执行完整的研究工作流程。四个专门的智能体(负责文献综述和假设生成的构思智能体;负责实验方法论的规划智能体;负责实验执行并可访问 160 块 NVIDIA GPU 的实验智能体;负责论文生成的写作智能体)通过一个共享文件系统进行协调,该系统兼作工作空间和持久内存。FARS 专注于单一、范围明确的贡献,其中可能包含负面结果,代表了大规模自主研究的一个重要实例。尽管在计算密集型能力和人工参与需求方面存在局限性,FARS 论文仍可作为评估其他 AI 科学家框架的质量参考标准。 ### 2.2 Sakana AI – AI Scientist(v1) AI Scientist v1 系统(Luet al.,2024 (https://arxiv.org/html/2607.28631#bib.bib9))构成了一个端到端的自动化研究流程,实现了完全自主的智能体架构。该系统接受一个研究问题规范作为输入,并生成一份完整的研究手稿作为输出。该流程包括四个主要阶段:**想法生成**,利用大语言模型从问题描述和初始代码库中综合出新的研究假设和方法方向;**实验**,系统自动生成并执行所提出实验的 Python 实现,包括模型训练、基线比较以及基于实证结果的迭代改进;**分析与可视化**,对发现进行定量分析并自动生成图表;以及**手稿撰写**,以 LaTeX 格式生成完整的研究文档,涵盖摘要、引言、方法论、实验结果和参考文献。 ### 2.3 Sakana AI – AI Scientist(v2) AI Scientist v2(Yamadaet al.,2025 (https://arxiv.org/html/2607.28631#bib.bib8))在 v1 架构的基础上引入了几项方法论改进,解决了先前版本的局限性。与线性顺序流程不同,v2 采用**智能体树搜索**来系统探索研究假设和实验方向的空间。这种方法使系统能够并行评估多个有前景的分支,并在实验证据有限或结果为负面时执行战略性回溯。此外,v2 实现了**领域泛化**,消除了对人工策划代码模板的需求,使系统能够在不同研究领域运行,而无需特定领域的定制化。此外,该框架还引入了**基于视觉-语言模型的反馈机制**,生成的图表由多模态语言模型进行评估,以优化清晰度和视觉呈现,并在模型反馈的指导下对图形和图表进行迭代改进。 v2 框架在输出质量上显示出显著改进。该系统生成的论文被国际学习表征会议(ICLR)的同行评审研讨会接收,其同行评审分数与人类作者投稿的中位分布相匹配。这表明该系统能够产生与专业研究人员相媲美的研究成果。 ### 2.4 CycleResearcher CycleResearcher(Wenget al.,2024 (https://arxiv.org/html/2607.28631#bib.bib10))实现了一个迭代框架,通过两个互补的智能体在反馈循环中紧密集成研究综合与自动化质量评估:**研究员智能体**,负责执行完整的研究活动(系统性文献综述、手稿综合和迭代改进);**评审员智能体**,通过分析手稿并生成详细评论来模拟同行评审。该框架利用在精选同行评审数据集(Review-5k)和科学文献数据集(Research-14k)上训练的强化学习,使两个智能体与真实的科学标准保持一致。CycleResearcher 在标准化的 5 分制上实现了平均质量得分 5.36,与人类预印本(5.24)相当,并接近已接受会议论文(5.69)。 ### 2.5 Data-to-Paper Data-to-Paper(Technion-Kishony-lab,2024 (https://arxiv.org/html/2607.28631#bib.bib11))采用了一种根本不同的方法,将实证数据作为研究发现过程的主要输入。该系统不遵循先提出问题再设计实验的传统范式,而是接受数据集作为输入,并实现以数据为中心的工作流程。该流程包括三个主要阶段:**探索性数据分析**,系统进行全面的统计和视觉检查,以识别数据中的模式、相关性和分布特征;**假设生成**,突出的实证模式为可检验假设的形成提供依据;以及**统计验证**,候选假设在适当的方法学控制下接受严格的统计检验。最后,系统进行**手稿生成**,将经过验证的发现综合成一个连贯的研究叙述。 Data-to-paper 系统特别适合以发现为导向的研究情境,其中丰富的数据集为科学探究提供了基础,并在整个综合过程中强调统计推断的方法学严谨性和数据保真度。 ## 3 实验设置与协议 参见图注图 1:实验协议工作流程,展示了评估四个 AI 科学家框架的完整流程。从 15 个 FARS 提案开始,自定义包装器将提案转换为特定于框架的输入(Data-to-Paper 接收来自相关 GitHub 仓库的数据集,而不是提案)。四个系统各自并行处理其输入,生成 PDF 输出。Sakana v1 和 v2 每个提案生成多个 PDF,通过基于 LLM 的协调系统进行合并。所有生成的论文(60 篇来自框架 + 15 篇 FARS 基准 = 共 75 篇)由 AI 评审者(三个独立 LLM)进行评估,生成分数、评审意见和最终分析。对于我们的基准测试研究,我们使用了 FARS(全自动研究系统)系统生成的 15 个精选研究提案111https://analemma.ai/fars/。这些提案指明了人工智能安全和机器学习领域的研究方向,包括详细的背景、动机和预期成果。值得注意的是,选择这 15 个提案时考虑了 Data-to-Paper 的要求,后者需要数据集作为输入,而不是问题规范。因此,我们选择了 FARS 已发布关联 GitHub 仓库(包含实证数据集)的提案。这一约束确保了所有四个框架都能在一组一致的提案上进行评估,同时兼顾各框架的输入要求。
相似文章
PaperBench:评估AI复现AI研究的能力
OpenAI推出PaperBench,一个评估AI代理复现最先进AI研究能力的基准。该基准通过复现20篇ICML 2024论文,包含8,316个可评分任务。表现最好的模型(Claude 3.5 Sonnet)仅达到21%的复现分数,低于人类博士级别的表现,凸显了当前自主研究能力的局限性。
关于AI评审员的局限与机遇:联合45位专家科学家评审Nature系列期刊论文的评审意见
一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。
AI审稿人能看清全貌吗?多模态同行评审的攻击与防御
本文介绍了PaperGuard,这是一个用于评估和防御多模态AI同行评审系统对抗性攻击的基准,涵盖多个科学领域的文本和图像攻击。
@ai_suxiaole: 现在很多 AI 工具都能帮科研人员省时间 但大多数只解决一个环节: 读文献、写代码、润色论文、整理摘要。 Sakana AI 的 AI Scientist-v2 它想做的是一个能跑完整科研流程的 AI 系统 从生成研究假设开始,到设计实验…
Sakana AI 发布了 AI Scientist-v2,一个端到端的自动化科研系统,能够从生成研究假设到撰写论文自动完成,并已通过同行评审被 ICLR2025 Workshop 接收。
代理审核系统基准测试
本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。