@dair_ai: 编码代理能否复现科学机器学习论文?我们知道这是可能的,因为我们已经可以做到@dair_ai。仍…

X AI KOLs Following 论文

摘要

本文介绍了“论文复现”(Paper-replication),这是一种编码代理的工作流程,通过将每项声明转化为带有记录证据的目标,系统地复现科学机器学习论文,并在十二次运行中证明所有工作区和目标均已完成。

编码代理能否复现科学机器学习论文? 我们知道这是可能的,因为我们已经可以做到@dair_ai。 仍然是一篇值得一读的好文章。 因此,他们尝试仅凭论文材料复现一篇机器学习论文。 他们运用一种编码代理技能,将所选论文的每项声明转化为带有记录证据的目标。代理重构方法,运行实验,将输出与来源关联,与论文声明进行比较,并通过验证检查后才完成。 完成取决于工作区证据,而非代理的最终消息。 在四篇科学机器学习论文的十二次运行中,所有十二个工作区均通过完成关卡,所有158个记录目标均与报告覆盖范围匹配。然而,重复运行在论文如何分割为目标、数值精度、耗时以及用于接受证据的规则上仍然存在差异。 基本上,即使路径不可复现,完成结果也是可复现的。 论文:https://arxiv.org/abs/2607.02134 在我们的学院学习构建有效的AI代理:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/07/04 16:53

编码智能体能否复现科学机器学习论文?

我们知道这是可能的,因为 @dair_ai 已经做到了。

不过,这仍然是一篇值得一读的好文章。

文章尝试仅凭论文材料来复现一篇机器学习论文。

他们使用一种编码智能体技能,将所选论文中的每个声明转化为带有记录证据的目标。智能体重构方法,运行实验,将输出与来源关联,与论文声明进行比较,并在完成前通过验证检查。

完成取决于工作区中的证据,而不是智能体的最终消息。

在针对四篇科学机器学习论文进行的十二次独立运行中,所有十二个工作区都通过了完成关卡,所有 158 个记录目标都与报告覆盖范围匹配。然而,重复运行在如何将论文拆分为目标、数值保真度、耗时以及用于接受证据的规则方面仍然存在差异。

基本上,即使路径不同,完成结果也变得可复现。

论文:https://arxiv.org/abs/2607.02134

在我们的学院学习构建有效的 AI 智能体:https://academy.dair.ai


编码智能体可以复现科学机器学习论文

来源:https://arxiv.org/html/2607.02134

摘要

科学机器学习论文通常会提出计算声明,例如,相对均方误差小于 5%,或者 95% 的预测可信区间覆盖了测试数据。一个编码智能体可以被提示仅凭论文材料复现这些声明,但提示本身并不足以可靠地保留进度或检查生成的证据是否支持论文的声明。我们引入了论文复现(Paper-replication)这一工作流,它将每个选定的论文声明变成一个带有记录证据的目标,并将其实现为编码智能体的一项技能。该工作流使智能体记录这些目标,重构论文的方法,运行计算实验,将生成的输出与来源及与论文声明的比较相关联,记录匹配证据在复现报告中出现的位置,并在完成前通过验证检查。我们在四篇科学机器学习论文上进行了十二次独立运行,对论文复现进行了评估。所有十二个工作区都通过了完成关卡,所有记录的 158 个目标都与报告覆盖范围匹配。即使在工作区已完成的状态下,重复运行在如何将论文划分为目标、对源论文的数值保真度、复现耗时、在最终证据被接受前替换的中间执行次数,以及用于接受证据的规则方面仍然存在差异。论文复现使完成状态取决于工作区证据和验证检查,而不是智能体的最终消息。

关键词:

编码智能体,工具工程,论文复现,科学可重现性,科学机器学习

††期刊:Computer Physics Communications\affiliation

[aff1] organization=普渡大学机械工程学院,城市=西拉法叶,州=IN,邮编=47907,国家=美国

1 引言

科学机器学习论文的计算声明依赖于可微求解器和神经微分方程 (Chen et al., 2018 (https://arxiv.org/html/2607.02134#bib.bib25); Rackauckas et al., 2020 (https://arxiv.org/html/2607.02134#bib.bib24); Hans et al., 2023a (https://arxiv.org/html/2607.02134#bib.bib40), 2024 (https://arxiv.org/html/2607.02134#bib.bib21))、物理信息神经网络和物理信息学习目标 (Raissi et al., 2019 (https://arxiv.org/html/2607.02134#bib.bib18); Karniadakis et al., 2021 (https://arxiv.org/html/2607.02134#bib.bib17))、动力系统和偏微分方程的稀疏辨识 (Brunton et al., 2016 (https://arxiv.org/html/2607.02134#bib.bib22); Rudy et al., 2017 (https://arxiv.org/html/2607.02134#bib.bib23)),以及贝叶斯或基于采样的反问题方法 (Stuart, 2010 (https://arxiv.org/html/2607.02134#bib.bib27); Hans et al., 2020 (https://arxiv.org/html/2607.02134#bib.bib26), 2023b (https://arxiv.org/html/2607.02134#bib.bib10); Alberts and Bilionis, 2023 (https://arxiv.org/html/2607.02134#bib.bib28))。读者可以查阅文本中的方程和算法,但报告的结果也依赖于代码、数据、数值求解器、预处理、随机训练以及实现选择 (Hans, 2024 (https://arxiv.org/html/2607.02134#bib.bib11); Hans et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib15))。因此,可重现研究实践将代码、数据、计算环境以及每个结果如何产生的记录视为科学记录的一部分 (Peng, 2011 (https://arxiv.org/html/2607.02134#bib.bib5); Stodden et al., 2016 (https://arxiv.org/html/2607.02134#bib.bib6))。它还强调了版本化的项目组织 (Wilson et al., 2017 (https://arxiv.org/html/2607.02134#bib.bib8))、显式跟踪随机种子和中间结果 (Sandve et al., 2013 (https://arxiv.org/html/2607.02134#bib.bib7))、可执行笔记本 (Kluyver et al., 2016 (https://arxiv.org/html/2607.02134#bib.bib41)),以及工作流溯源 (Davidson and Freire, 2008 (https://arxiv.org/html/2607.02134#bib.bib38); Belhajjame et al., 2013 (https://arxiv.org/html/2607.02134#bib.bib37); Goecks et al., 2010 (https://arxiv.org/html/2607.02134#bib.bib39))。

关于可重现性(reproducibility)和可复现性(replicability)的术语在不同领域有所差异 (Barba, 2018 (https://arxiv.org/html/2607.02134#bib.bib9))。我们将论文复现定义为根据论文材料重构论文方法、重新生成支持其声明的计算结果,并为每个声明记录证据的任务。仅凭论文材料复现论文,比重新运行一个已发布的软件包更为狭窄和困难。可用材料可能包括 LaTeX 源码、图表、附录和数据引用,但未必包含采样的训练集、种子、优化器状态、采样器状态、预处理约定或绘图规则。在机器学习中,可重现性分类学将仅基于论文的记录视为比包含代码、数据、依赖项和环境信息的可运行软件包更弱的证据 (Tatman et al., 2018 (https://arxiv.org/html/2607.02134#bib.bib13))。对人工智能论文的调查也发现,经验细节常常报告不足 (Gundersen and Kjensmo, 2018 (https://arxiv.org/html/2607.02134#bib.bib14))。随机训练使得这些遗漏变得重要,因为数据采样、初始化、实现选择和超参数可能会改变结果,即使算法描述保持不变 (Henderson et al., 2018 (https://arxiv.org/html/2607.02134#bib.bib16); Bouthillier et al., 2021 (https://arxiv.org/html/2607.02134#bib.bib3); Pineau et al., 2021 (https://arxiv.org/html/2607.02134#bib.bib12))。

研究代码生成方法解决了论文复现的一部分问题:它们将论文描述转化为代码或实现任务。PaperCoder 是一个多智能体框架,通过规划、实现分析和模块化代码生成将机器学习论文转化为代码仓库 (Seo et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib43))。ResearchCodeBench 将最近的机器学习论文转化为可执行的实现挑战 (Hua et al., 2026 (https://arxiv.org/html/2607.02134#bib.bib44)),而 ResearchCodeAgent 使用具有规划、记忆和动作的多智能体系统来编纂机器学习文献中的方法 (Gandhi et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib45))。其他基准测试评估了从自然语言处理论文中复现算法 (Xiang et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib46))、重构掩码语言建模研究代码 (Yan et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib47)) 以及渐进式代码掩码实验 (Kim et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib48))。这些研究表明,智能体可以帮助阅读论文、恢复实现细节以及编写或修复研究代码。

论文复现基准将焦点从代码生成转移到复现报告的结果。PaperBench 要求智能体通过阅读论文、构建代码库和执行实验来复现国际机器学习大会(ICML)的论文,并使用作者提供的评分细则对尝试进行评分 (Starace et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib42))。CORE-Bench 评估在代码和数据包可用时的计算可重现性 (Siegel et al., 2024 (https://arxiv.org/html/2607.02134#bib.bib49))。社会科学基准和系统要求智能体根据论文和复现包评估可重现性 (Hu et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib50)),在包括数据检索、实验设计、执行和解释在内的各个阶段复现声明 (Nguyen et al., 2026 (https://arxiv.org/html/2607.02134#bib.bib51)),使用原始数据和代码复现发现 (Alizadeh et al., 2026 (https://arxiv.org/html/2607.02134#bib.bib52)),修复受控的可重现性失败 (Shah et al., 2026 (https://arxiv.org/html/2607.02134#bib.bib53)),或者根据论文方法描述和原始数据但没有原始代码重新实现分析 (Kohler et al., 2026 (https://arxiv.org/html/2607.02134#bib.bib54))。最近的基准测试也将问题扩展到天体物理学 (Ye et al., 2025 (https://arxiv.org/html/2607.02134#bib.bib55))、材料科学 (Huang et al., 2026 (https://arxiv.org/html/2607.02134#bib.bib56)) 和对撞机物理学 (Faroughy et al., 2026 (https://arxiv.org/html/2607.02134#bib.bib57))。这些研究表明,智能体可以运行实验并评估复现的输出。它们还表明,论文复现不仅仅是一个智能体能否生成代码或运行实验的问题。在许多这些设置中,基准测试工具、掩码代码库、复现包、原始数据集或作者提供的评分细则定义了智能体必须生成什么以及结果如何评判。当复现仅从论文材料开始时,工作流必须定义这个证据标准。工作流必须首先将选定的用于复现的论文声明识别为目标。然后,每个被接受的目标必须将其声明链接到智能体对论文方法的重构、一次成功的运行、溯源、比较证据以及报告覆盖范围。没有这些链接,生成的输出即使来自复制的论文提供的资产、替代方法或未记录的运行,也可能看起来合理。现有工作并未将论文复现定义为持久工作区中的目标级证据合同。它也未能说明如何使完成成为工作区状态,而不是智能体最终消息中的声明。

编码智能体提供了执行此工作流所需的能力。Codex (OpenAI, 2026b (https://arxiv.org/html/2607.02134#bib.bib29)) 和 Claude Code (Anthropic, 2026 (https://arxiv.org/html/2607.02134#bib.bib30)) 可以检查文件、编辑代码、运行命令并在失败时迭代。编码智能体基准测试通过要求智能体检查仓库、编辑代码、运行测试和解决问题来测试相关能力 (Jimenez et al., 2024 (https://arxiv.org/html/2607.02134#bib.bib33); Yang et al., 2024 (https://arxiv.org/html/2607.02134#bib.bib34))。对于论文复现,这些能力映射到检查论文源、编写实现、执行实验、比较输出以及准备复现报告。这些动作是必要的,但它们本身并没有定义什么算作可接受的复现声明证据。

一个提示可以告诉智能体遵循什么标准,但仅凭提示并不能使该标准持久。智能体必须记住哪些目标仍待处理,在中断之间保留假设,区分生成的输出和论文提供的资产,并决定比较是否支持声明。智能体基准测试报告了在长时推理、决策和指令遵循方面的失败 (Liu et al., 2024 (https://arxiv.org/html/2607.02134#bib.bib35))。内在自我纠正的研究也表明,语言模型无法在没有外部反馈的情况下可靠地判断和修复自己的推理 (Huang et al., 2024 (https://arxiv.org/html/2607.02134#bib.bib36))。一个要求智能体完成复现的提示可能会导致它在工作区包含所需的目标级证据之前就报告完成 (Manheim and Garrabrant, 2018 (https://arxiv.org/html/2607.02134#bib.bib1))。对于论文复现,智能体的最终消息不足以作为证据。工作流必须在该消息之外存储状态并检查证据。

因此,论文复现需要一个工作流,利用编码智能体处理文件和运行命令的能力,同时通过工作区记录和验证检查来定义进度和完成。编码智能体技能为现有智能体提供此工作流提供了一种方法 (Anthropic, 2025 (https://arxiv.org/html/2607.02134#bib.bib31); OpenAI, 2026a (https://arxiv.org/html/2607.02134#bib.bib32))。该技能是一组可重用的任务指令和工作区实用程序,适用于一类任务。对于论文复现,技能可以指定智能体如何初始化或重新打开复现工作区、写入哪些记录、运行哪些检查,以及何时可以将目标标记为已匹配。

我们引入了 论文复现(Paper-replication) 作为这一工作流,并将其实现为编码智能体的一项技能。论文复现使用目标作为记录证据和检查完成的单位。它通过工具工程 (Lopopolo, 2026 (https://arxiv.org/html/2607.02134#bib.bib4)) 解决了上述仅使用提示的失败模式:它通过添加持久化的复现工作区和验证检查来改变智能体工作的环境,而不是仅依赖提示指令。从论文材料开始,智能体在复现矩阵中记录目标集,在任务账本中保持一个活动目标,在规范文件中记录其对论文方法的重构,记录实验执行和溯源,将生成的输出与论文提供的资产分开,记录每个生成输出与相应论文声明之间的比较证据,并在完成前在最终复现报告中记录匹配证据的覆盖范围。复现工作区是运行的记录。验证检查决定记录的证据是否算作已复现。由于论文声明可以是数值型、分布型、结构型或视觉型,可接受的证据是特定于声明的,而不是精确的数值相等。因此,完成是相对于记录的目标集及其上应用的验证检查的工作区状态。

我们在针对四篇科学机器学习论文进行的十二次独立运行中评估了论文复现:物理信息信息场论 (PIFT) (Alberts and Bilionis, 2023 (https://arxiv.org/html/2607.02134#bib.bib28))、使用物理信息神经网络的数据驱动求解 (PINN-I) (Raissi et al., 2017a (https://arxiv.org/html/2607.02134#bib.bib19))、使用物理信息神经网络的数据驱动发现 (PINN-II) (Raissi et al., 2017b (https://arxiv.org/html/2607.02134#bib.bib20)),以及非线性动力系统的稀疏辨识 (SINDy) (Brunton et al., 2016 (https://arxiv.org/html/2607.02134#bib.bib22))。在这些运行中,工作区记录了学习场、求解误差、发现的系数、后验结构、稀疏支持、轨迹以及由随机采样、神经网络优化或模拟动力学形成的图形。所有十二次运行都在完成关卡下达到了完成的工作区状态

相似文章

PaperBench:评估AI复现AI研究的能力

OpenAI Blog

OpenAI推出PaperBench,一个评估AI代理复现最先进AI研究能力的基准。该基准通过复现20篇ICML 2024论文,包含8,316个可评分任务。表现最好的模型(Claude 3.5 Sonnet)仅达到21%的复现分数,低于人类博士级别的表现,凸显了当前自主研究能力的局限性。

AI编程代理可复现社会科学发现

arXiv cs.CL

本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。