NLPCC 2026 共享任务 11 概览:从科学论文中基于智能体的实验复现

arXiv cs.CL 论文

摘要

本文介绍了 AgentActionBench,一个过程导向的基准测试,用于评估 LLM 智能体在机器学习和 AI4Science 领域从科学论文中复现实验的能力。

arXiv:2609.11117v1 公告类型:新 摘要:可重复性对科学进步至关重要,但科学出版物数量和复杂性的增长使详尽的手动验证变得越来越不切实际。尽管大型语言模型(LLM)智能体的最新进展使得自动化实验复现成为可能,但现有评估大多关注最终存储库,且通常局限于机器学习(ML)。我们介绍了 AgentActionBench,一个过程导向的基准测试,用于评估基于智能体的实验复现,涵盖机器学习和 AI4Science 领域。我们的框架使用基于 MCP 的动作记录器来捕获智能体在整个复现过程中的行为,并使用特定于论文的评分标准评估生成的跟踪记录。AgentActionBench 包含 150 篇论文,其中 120 篇机器学习论文和 30 篇 AI4Science 论文。一个人工标注的子集覆盖基准测试的 10%,提供验证数据,而模型辅助的增强将整个基准测试扩展到超过 10,000 个评分项。实验结果表明,当前系统仍然有限,执行是主要瓶颈。同时,模型生成的评分标准与人工标注的评分标准之间强烈的皮尔逊和斯皮尔曼相关性验证了我们可扩展评分标准生成方法的可靠性。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:23

# NLPCC 2026 共享任务 11 概述:基于代理的论文实验复现
来源:https://arxiv.org/html/2609.11117
作者:Yizhi Li(单位:曼彻斯特大学,IQuest Research)、Luu Gia Huy、Jian Yang、Ming Zhou(单位:越南国立大学、北京航空航天大学、朗道)、Chenghua Lin

###### 摘要

可复现性是科学进步的基石,但日益增长的科学文献数量与复杂度使得全面的人工验证变得愈发不切实际。尽管近期大型语言模型(LLM)代理的发展使自动化实验复现成为可能,现有评估大多聚焦于最终代码库,且通常局限于机器学习(ML)领域。我们提出 **AgentActionBench**,一个面向过程的基准测试,用于评估跨机器学习与 AI4Science 领域的基于代理的实验复现。我们的框架使用基于 MCP 的行为记录器来捕捉代理在整个复现过程中的行为,并利用针对论文的特定评分标准来评估生成的轨迹。**AgentActionBench** 包含 150 篇论文,其中 120 篇来自机器学习领域,30 篇来自 AI4Science 领域。一个覆盖基准测试 10% 的人工标注子集提供了验证数据,而模型辅助的增强则将完整基准测试扩展到超过 10,000 个评分标准项。实验结果表明,当前系统仍然存在局限,执行环节是主要瓶颈。同时,模型生成的评分标准与人工标注的评分标准之间存在强皮尔逊和斯皮尔曼相关性,验证了我们可扩展的评分标准生成方法的可靠性。

###### 关键词:

LLM 代理、基于评分标准的评估、数据增强

## 1 引言

可复现性对于可信的科学进步至关重要,然而实践中难以实现。一项《自然》调查发现,超过 70% 的研究人员未能复现其他科学家的实验,而近期研究表明,顶级计算机科学会议只有约 20% 的论文发布了足以进行复现的代码[6 (https://arxiv.org/html/2609.11117#bib.bib25), 16 (https://arxiv.org/html/2609.11117#bib.bib13), 20 (https://arxiv.org/html/2609.11117#bib.bib9)]。随着科学出版物数量和复杂性的增长,大规模的人工验证正变得日益不切实际。

大型语言模型(LLMs)的最新进展显著提升了长上下文理解、代码生成、推理和工具使用能力。因此,基于 LLM 的代理越来越多地应用于复杂的科学工作流程,从机器学习实验到生物学和化学等领域的 AI for Science(AI4Science)任务[1 (https://arxiv.org/html/2609.11117#bib.bib23), 7 (https://arxiv.org/html/2609.11117#bib.bib24), 13 (https://arxiv.org/html/2609.11117#bib.bib15), 19 (https://arxiv.org/html/2609.11117#bib.bib17), 36 (https://arxiv.org/html/2609.11117#bib.bib14), 38 (https://arxiv.org/html/2609.11117#bib.bib3)]。这些能力使它们成为自动化实验复现的有前景的候选者,复现需要理解论文、制定实施计划、生成代码、执行实验和验证结果。

参见插图图 1:先前基准测试中基于输出的评估示例。当描述和实现一起评估时,基于 LLM 的评估器可能会错误推断从未产生或执行的实现。近期的基准测试,包括 Paper2Code[25 (https://arxiv.org/html/2609.11117#bib.bib2)] 和 PaperBench[28 (https://arxiv.org/html/2609.11117#bib.bib1)],评估 AI 系统是否能复现研究论文。然而,它们大多关注机器学习,并评估最终产物而非复现过程。这种基于输出的评估可能不可靠,因为代理可能生成看似合理的文件或描述,同时忽略了重要的论文内容,未能执行其代码,或伪造执行记录。如图 1 (https://arxiv.org/html/2609.11117#S1.F1) 所示,这种模糊性使得难以确定复现是否基于源论文并由具体行动支持。

参见插图图 2:我们的框架概述。标准化的执行环境记录代理行为,这些行为与针对论文的评分标准相匹配,用于可审计的、面向过程的评估。为了解决这些局限性,我们引入了一个面向过程的基准测试,用于基于代理的实验复现。我们的框架不是仅评估最终代码库,而是将复现分解为细粒度阶段,并验证代理是否执行了所需操作。基于 MCP 的行为记录器在标准化环境中捕获读、写和命令执行操作。生成的行为日志为基于评分标准的评估提供了可审计的证据,允许直接评估复现工作流的每个阶段。图 2 (https://arxiv.org/html/2609.11117#S1.F2) 展示了该框架的概览。

我们进一步将评估范围扩展到传统机器学习论文之外,涵盖天文学、生物学、化学、环境科学、材料科学和医学等领域的 AI4Science 研究。我们首先构建了 **AgentActionBench-Human**,一个包含 12 篇机器学习论文和 3 篇 AI4Science 论文的纯人工标注子集。为了降低专家标注成本,我们开发了一个代理辅助的评分标准生成流程,在 **AgentActionBench-Human** 的人工标注上验证其有效性,并将基准测试扩展到完整的 **AgentActionBench**,包含 120 篇机器学习论文和 30 篇 AI4Science 论文,以及超过 10,000 个评分标准项。

总之,我们的贡献有三点:

- • 我们引入了 **AgentActionBench**,一个面向过程、多领域的基准测试,评估跨 150 篇机器学习和 AI4Science 论文的完整实验复现工作流。
- • 我们开发了基于 MCP 的行为记录器和基于评分标准的评估协议,利用可审计的行为轨迹来评估论文理解、实现、执行和结果验证。
- • 我们评估了提交给 NLPCC 2026 共享任务的系统,揭示了当前代理在实验复现方面的关键局限性,并验证了我们可扩展的评分标准生成流程的可靠性。

## 2 相关工作

### 2.1 基于代理的实验复现

自主科学代理因其复现已发表实验的能力而受到越来越多的研究,这是提高科学效率和可复现性的重要能力。现有系统处理了此过程的不同阶段。AI Scientist[18 (https://arxiv.org/html/2609.11117#bib.bib11)] 支持从想法生成到论文撰写的端到端工作流;DOLPHIN[36 (https://arxiv.org/html/2609.11117#bib.bib14)] 采用构思、实施和反馈的闭环过程;PaperCoder[25 (https://arxiv.org/html/2609.11117#bib.bib2)] 通过三阶段流程将研究论文转化为可执行的代码库;HiRAS[11 (https://arxiv.org/html/2609.11117#bib.bib16)] 协调专门的子代理完成细粒度的复现阶段。越来越多的基准测试评估这些能力,包括端到端的机器学习复现[15 (https://arxiv.org/html/2609.11117#bib.bib27), 26 (https://arxiv.org/html/2609.11117#bib.bib26), 28 (https://arxiv.org/html/2609.11117#bib.bib1)]、基于算法描述的 NLP 实现[32 (https://arxiv.org/html/2609.11117#bib.bib28), 35 (https://arxiv.org/html/2609.11117#bib.bib29)],以及基于大规模实验和公共竞赛的通用机器学习工程任务[8 (https://arxiv.org/html/2609.11117#bib.bib30), 14 (https://arxiv.org/html/2609.11117#bib.bib31)]。它们的结果一致表明,当前的代理仍然远远落后于人类专家,特别是当任务需要稳健的实现和执行时。然而,大多数现有评估关注粗粒度的结果指标,对中间复现过程的可见性有限,并且主要针对单一领域。相比之下,我们的基准测试通过可审计的行为轨迹评估从论文理解到结果验证的完整工作流,从而实现对机器学习和 AI4Science 论文的细粒度评估。

### 2.2 基于评分标准的评估

评分标准通过将复杂任务分解为细粒度的评估标准来提供结构化监督,解决了粗粒度、基于结果指标的局限性[10 (https://arxiv.org/html/2609.11117#bib.bib20)]。诸如 PaperBench[28 (https://arxiv.org/html/2609.11117#bib.bib1)] 和 HealthBench[5 (https://arxiv.org/html/2609.11117#bib.bib18)] 等基准测试使用人工编写的评分标准进行逐步评估,但它们对领域专家的依赖使其构建成本高昂且难以扩展。这一局限性推动了基于模型生成的评分标准的发展[24 (https://arxiv.org/html/2609.11117#bib.bib32), 17 (https://arxiv.org/html/2609.11117#bib.bib21), 37 (https://arxiv.org/html/2609.11117#bib.bib19)]。例如,RubricHub[24 (https://arxiv.org/html/2609.11117#bib.bib32)] 结合了原则引导的综合、多模型聚合和难度演化来生成具有区分性的标准,而先前的工作表明,针对问题的评分标准可以提高逻辑评估的准确性和一致性[23 (https://arxiv.org/html/2609.11117#bib.bib33)]。基于这些研究,我们专门为研究论文复现生成评分标准。与用于通用奖励建模或开放式问答的方法不同,我们的方法针对实验复现的多阶段、基于代码库的特性。

### 2.3 基于 LLM 的数据增强

大型语言模型越来越多地被用于生成训练和基准测试数据本身,这是由人工标注的高成本以及需要随着模型规模扩大而扩展监督所驱动的。[29 (https://arxiv.org/html/2609.11117#bib.bib37)] 综述了这一转变,将基于 LLM 的增强方法组织为简单型、基于提示型和基于检索型。一个突出的研究方向是扩展指令多样性以使模型与人类意图对齐,从基于少量种子集引导生成新的指令-响应对[31 (https://arxiv.org/html/2609.11117#bib.bib34)] 到逐步将指令重写为更复杂的变体[34 (https://arxiv.org/html/2609.11117#bib.bib35)]。[9 (https://arxiv.org/html/2609.11117#bib.bib36)] 将同样的思想应用于特定领域,提示 LLM 将现有的几何问题集(GeoQA+,Geometry3K)扩展为更大的 Geo170K 数据集。这些工作共同表明,当需要扩展监督或数据多样性时,基于 LLM 的生成可以替代昂贵的人工策划。我们将同一原理应用于自动合成用于实验复现的细粒度、针对论文的评分标准,使用代理框架代替先前增强工作中采用的单次提示方法。

表 1:行为记录器提供的工具。可选参数包含在方括号中。

## 3 方法论

### 3.1 行为记录器

为了忠实捕捉代理在实验复现期间的行为,我们实现了一个基于模型上下文协议(MCP)的行为记录器。记录器不是授予代理直接访问底层操作系统的权限,而是通过一组小型的 MCP 工具来协调与执行环境的所有交互。因此,每个操作都作为结构化的操作日志自动捕获,提供复现过程的完整且可复现的轨迹。

如表 1 (https://arxiv.org/html/2609.11117#S2.T1) 所总结,行为记录器提供了三个核心工具:Read、Write 和 Execute。Read 工具检索文件内容,并可选支持行范围选择以高效检查大文件。Write 工具创建或修改源代码、配置文件和其他复现所需的产物。Execute 工具运行 shell 命令并返回执行状态、标准输出和标准错误,使代理能够进行实验并检查其结果。为了安全和公平,所有工具交互都限制在指定的工作空间内。

行为记录器将每个工具调用视为一个原子化的、标准化的操作。对于每次调用,它按时间顺序记录输入参数、返回结果和时间戳到 JSON 日志中,如附录 0.A (https://arxiv.org/html/2609.11117#Pt0.A1) 所示。当代理终止时,日志会自动导出。由于所有交互都通过 MCP 接口进行协调,记录器在不修改代理的情况下捕获其行为,并且与任何支持 MCP 的系统兼容。这些结构化日志为基于评分标准的评估提供了主要证据,能够对复现过程进行细粒度评估,而不仅仅依赖于最终代码库。

### 3.2 基准测试构建

我们收集了 150 篇论文来构建完整的 **AgentActionBench** 基准测试。其中 120 篇来自顶级机器学习会议,包括 ICML、ICLR、ACL 和 NeurIPS,其余 30 篇是发表在《自然》、《生物信息学》和《npj 计算材料》等顶级科学期刊上的 AI4Science 论文。

我们采用基于评分标准的评估协议,其中每篇论文都配有一个针对论文的清单,用于评估复现质量。形式上,每个评分标准项表示为 \(r_i = (c_i, s_i, t_i)\),其中 \(c_i\) 表示评估标准,\(s_i\) 是其重要性分数,\(t_i\) 是对应的复现过程阶段。我们定义了五种评分标准类型:论文观察、计划撰写、代码实现、命令执行和结果匹配。这些类别共同覆盖了完整的复现工作流,并比仅考虑生成的代码库与源论文之间一致性的方法能够进行更全面的评估。

我们通过随机抽样 12 篇机器学习论文和 3 篇 AI4Science 论文(占完整基准测试的 10%)构建了人工标注子集 **AgentActionBench-Human**。三位拥有在顶级会议发表和审稿丰富经验的研究学生对评分标准进行标注。初始标注后,每套评分标准由另外两位标注员独立轮换审核并根据需要修订。此过程持续进行,直至所有标注员达成共识。生成的子集平均每篇论文包含 67.75 个评分标准项,总共超过 1,000 个手动标注项。

基于近期基于 LLM 的数据增强的进展,我们通过自动为所有论文生成评分标准来扩展基准测试。我们首先使用 MinerU[30 (https://arxiv.org/html/2609.11117#bib.bib38)] 将论文转换为 Markdown 格式,为 LLM 提供更干净、更结构化的输入。然后,我们应用先前工作中引入的评分标准生成框架[12 (https://arxiv.org/html/2609.11117#bib.bib39)] 来生成针对论文的评分标准,将 **AgentActionBench-Human** 扩展为完整的 **AgentActionBench** 基准测试。生成的基准测试包含超过 10,000 个评分标准项,平均每篇论文 69.92 个项。最后,我们使用相关性分析评估了在 **AgentActionBench-Human** 上模型生成的评分标准与人工标注评分标准之间的一致性。详细结果见第 5.2 节 (https://arxiv.org/html/2609.11117#S5.SS2)。

表 2:评分标准类型与行为记录器工具之间的映射关系,其日志提供了相应的评估证据。
### 3.3 评估

我们的评估框架主要依赖于第 3.1 节 (https://arxiv.org/html/2609.11117#S3.SS1) 描述的行为记录器导出的操作日志 \(LL\)。

相似文章

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。

AI编程代理可复现社会科学发现

arXiv cs.CL

本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。