VERITAS:迈向通用型科学研究可重复性工具
摘要
Veritas 是一个通用型可重复性工具,它使用 CLI 编码代理自动从论文和代码中复现科学研究,提取声明并对其进行评估,在基准测试中取得了最先进的性能。
arXiv:2607.02931v1 公告类型:新
摘要:人工智能工具正在加速科学出版,而审查这些出版物的系统却难以跟上步伐,对已发表研究的独立验证变得既更加困难也更加重要。由于手动复现既缓慢又昂贵,越来越多的工作使用编码代理来自动化部分流程。现有的努力大多被封装为基准测试,并配有仅在基准测试自身管道内运行的配套代理,目前尚不存在通用型的复现工具。我们提出了 VERITAS,这是一个基于 CLI 编码代理构建的领域无关复现框架。给定一篇论文、一个代码仓库或两者,VERITAS 提取论文中的声明,运行方法论并在出现问题时解决它们,然后根据实验运行的结果判断每个声明。该管道返回一个重要性加权的复现分数、一个包含每次修复的严重性评级的日志以及修补后的代码库。我们在 CORE-Bench 和 ReplicationBench 上评估了 VERITAS,涵盖计算机科学、社会科学、医学和天体物理学领域的 65 篇论文。在相同模型和主机环境下,与两个强大的 Claude Code 基线相比,VERITAS 在两个基准测试的所有指标上都取得了最先进的性能并领先。
查看缓存全文
缓存时间: 2026/07/07 04:34
# Veritas:面向科学研究的通用复现工具 来源:https://arxiv.org/html/2607.02931 Haokun Liu∗ 芝加哥大学 haokunliu@uchicago\.edu &Filbert Aurelian Tjiaranata∗ 印度尼西亚大学 filbert\.aurelian@ui\.ac\.id &Chenhao Tan 芝加哥大学 chenhao@uchicago\.edu ###### 摘要 AI工具正在加速科学出版,而评审系统却难以跟上这一步伐,对已发表研究的独立验证变得既困难又重要。由于人工复现缓慢且昂贵,越来越多的工作尝试使用编码代理来自动化部分流程。现有工作大多以基准测试的形式打包发布,并附带有原始作者为评估其基准测试而构建的配套代理,但这些代理仅能在基准测试自身的流程中运行,尚不存在通用的复现工具。我们提出**Veritas**,一个围绕CLI编码代理构建的、与领域无关的复现框架。给定一篇论文、一个代码仓库或两者兼有,Veritas会提取论文中的声明,执行方法并实时解决问题,然后根据实验运行产生的证据评判每条声明。该流程返回一个按重要性加权的复现分数、一份按严重程度评级的修复日志,以及修补后的代码库。我们在CORE-Bench和ReplicationBench上评估了Veritas,共涉及计算机科学、社会科学、医学和天体物理学四个领域的65篇论文。与使用相同模型和宿主环境的两个强基线Claude Code相比,Veritas达到了最先进水平,在两个基准测试的所有指标上均领先。 11footnotetext:同等贡献。 ## 1 引言 AI工具正在重塑科学工作的产生与评审方式。主要学术会议上的投稿量增长速度快于评审系统:NeurIPS在2025年收到了21,575份投稿,相比2020年增长了128%[19 (https://arxiv.org/html/2607.02931#bib.bib30),18 (https://arxiv.org/html/2607.02931#bib.bib31)],如此规模的同行评议已超出了现有评审流程的承载能力[29 (https://arxiv.org/html/2607.02931#bib.bib32)]。在这种压力下,包含虚构参考文献的论文已开始通过评审而未被发现[27 (https://arxiv.org/html/2607.02931#bib.bib33),1 (https://arxiv.org/html/2607.02931#bib.bib34),10 (https://arxiv.org/html/2607.02931#bib.bib35)]。因此,对已发表结果进行超越表面检查的独立验证变得愈发重要。复现是实现独立验证的标准机制,然而人工复现既缓慢又昂贵[5 (https://arxiv.org/html/2607.02931#bib.bib20),21 (https://arxiv.org/html/2607.02931#bib.bib21)]。越来越多的研究[25 (https://arxiv.org/html/2607.02931#bib.bib8),26 (https://arxiv.org/html/2607.02931#bib.bib9),30 (https://arxiv.org/html/2607.02931#bib.bib10),9 (https://arxiv.org/html/2607.02931#bib.bib11),13 (https://arxiv.org/html/2607.02931#bib.bib14),31 (https://arxiv.org/html/2607.02931#bib.bib15),3 (https://arxiv.org/html/2607.02931#bib.bib36)]通过使用编码代理自动化部分复现流程来弥补这一差距。这些工作大多以基准测试的形式发布:固定的任务集,并附有原始作者为评估其基准测试而构建的配套代理。随CORE-Bench[25 (https://arxiv.org/html/2607.02931#bib.bib8)]、PaperBench[26 (https://arxiv.org/html/2607.02931#bib.bib9)]和ReplicationBench[30 (https://arxiv.org/html/2607.02931#bib.bib10)]发布的代理均针对其基准测试的任务格式和评分机制进行了专门化,并且只能在该基准测试的评估流程中运行。 Zeroshot Retry Veritas 0 20 40 60 80 100 80.4 97.8⋆ 通过率 (%) (a) CORE-Bench Hard。 Zeroshot Retry Veritas 0 20 40 60 80 100 31.5 31.5 33.3 51.4 57.1 60 匹配率 (%) 仅论文 完整 (b) ReplicationBench。 图1:经过作弊修正后的原生基准测试分数(§̃3.1 (https://arxiv.org/html/2607.02931#S3.SS1))。所有系统均使用Claude Code搭配Claude Opus 4.8运行;Zeroshot和Retry基线的详细信息见§̃3.1 (https://arxiv.org/html/2607.02931#S3.SS1)。(1(a) (https://arxiv.org/html/2607.02931#S1.F1.sf1)) CORE-Bench Hard在45个胶囊的公开测试集上的逐个胶囊通过率。⋆标记表示在所有三个系统上统一应用零方差重新评分规则后的分数;该规则翻转了四个Veritas失败案例和零个Zeroshot或Retry失败案例(附录̃D (https://arxiv.org/html/2607.02931#A4))。(1(b) (https://arxiv.org/html/2607.02931#S1.F1.sf2)) ReplicationBench的逐个任务匹配率,按输入模式划分:仅论文模式覆盖全部20篇论文,完整模式覆盖7篇拥有公开仓库的论文。Veritas在两个基准测试上均达到最先进水平,并在所有指标上领先。 另外也出现了一些独立的复现框架。Kohler等人[13 (https://arxiv.org/html/2607.02931#bib.bib14)]根据论文的方法描述和原始数据复现社会科学论文。AutoReproduce[32 (https://arxiv.org/html/2607.02931#bib.bib13)]仅根据论文本身复现机器学习论文。每个框架针对特定领域和特定的输入组合,且没有现有框架能够跨领域处理论文或适应多样化的输入集。 与此同时,基于CLI的编码代理也已出现。Claude Code[2 (https://arxiv.org/html/2607.02931#bib.bib23)]、Codex[22 (https://arxiv.org/html/2607.02931#bib.bib24)]和Gemini CLI[8 (https://arxiv.org/html/2607.02931#bib.bib25)]能够读取文档、安装依赖项,并在生成和运行的代码上迭代。它们在多种编码基准测试上取得了最先进的结果[11 (https://arxiv.org/html/2607.02931#bib.bib28),17 (https://arxiv.org/html/2607.02931#bib.bib29)]。在CORE-Bench上,一个基于Claude Code的脚手架最近达到了95%的准确率,远高于该基准测试的自定义CORE-Agent基线[12 (https://arxiv.org/html/2607.02931#bib.bib27)],这表明这类CLI代理是复现工作的坚实基础。 我们提出**Veritas**,这是第一个围绕CLI编码代理构建的、端到端且与领域无关的复现框架。Veritas支持灵活的输入模式,独立于原始作者提取论文中的声明,并对复现代理隐藏这些声明,以减轻信息泄露。该流程涵盖声明提取、复现和验证,并将逐条声明的判定结果汇总为按重要性加权的论文复现分数。我们在CORE-Bench[25 (https://arxiv.org/html/2607.02931#bib.bib8)](计算机科学、社会科学和医学)和ReplicationBench[30 (https://arxiv.org/html/2607.02931#bib.bib10)](天体物理学)上,使用相同模型和宿主环境,与两个强基线Claude Code进行比较,评估了Veritas。Veritas在两个基准测试的我们报告的所有指标上均领先。在CORE-Bench Hard上,它达到了97.8%的逐个胶囊通过率。在ReplicationBench上,它在仅论文模式和完整模式下的逐个任务匹配率均领先。同样的领先优势也体现在我们从先前工作改编的两个轨迹级指标上。在Kohler等人[13 (https://arxiv.org/html/2607.02931#bib.bib14)]的作弊指标(该指标标记读取禁止来源的轨迹)上,Veritas的作弊次数最低。在Bai等人[3 (https://arxiv.org/html/2607.02931#bib.bib36)]的忠实度指标(该指标判断轨迹的证据是否支持其报告的值)上,Veritas也表现出最大的改进。总之,我们做出以下贡献: - • 我们引入了**Veritas**,这是第一个围绕CLI编码代理构建的、与领域无关的复现框架,支持三种输入模式(论文加代码、仅论文、仅代码),并在仅论文模式下包含从零开始的代码生成阶段。对于每篇论文,Veritas返回一份详细的、逐条声明的复现报告,包括按严重程度评级的修复日志,以及一个汇总论文声明复现情况的单一复现分数。 - • 我们将两种现有的轨迹级评估改编到我们的框架中:来自Kohler等人[13 (https://arxiv.org/html/2607.02931#bib.bib14)]基于访问检测器的作弊指标,以及来自Bai等人[3 (https://arxiv.org/html/2607.02931#bib.bib36)]基于执行检查清单的忠实度指标。我们对所有报告的结果应用了统一的作弊修正。 - • 我们在来自两个复现基准测试、跨越从计算机科学到天体物理学四个领域的65篇论文上评估了Veritas,并证明了Veritas的有效性。 ## 2 Veritas Veritas是一个用于科学研究的、与领域无关的复现框架。给定一篇论文、一个代码仓库或两者兼有,Veritas会运行论文中的方法,解决出现的问题,并根据结果评判每条实证声明。Veritas生成一份验证报告,包括复现分数、一份按严重程度评级的修复日志,以及修补后的代码库。输出中还包含将逐条声明判定结果汇总起来的复现分数。 Veritas以六个阶段构成的流水线运行(图̃2 (https://arxiv.org/html/2607.02931#S2.F2))。**analyze**阶段提取论文中的声明。**codegen**阶段在未提供代码仓库时根据论文生成代码。**plan**阶段起草复现流程,**replicate**阶段执行该流程并在失败时进行修复。一个有限的管理循环包裹**replicate**,并在流水线继续之前评判每次尝试。**assess fixes**阶段评估每次修复的严重程度,**verify**阶段根据运行产生的证据评判每条声明。每个阶段由一个编码代理执行。我们在实验中使用Claude Code;Veritas也支持Codex和Gemini。下面我们描述输入模式和各个阶段。 请参阅图注 图2:Veritas流水线。**Analyze**提取结构化声明,**plan**起草复现流程,**replicate**执行流程并解决问题,**assess fixes**评估每次修复,**verify**通过比较器步骤(提取复现值)和确定性评分器(分配状态)评判每条声明。判定结果汇总为按重要性加权的复现分数。**Codegen**仅在仅论文模式下运行,在**plan**之前执行。一个有限的管理循环在每次**replicate**尝试后读取执行检查,要么接受该尝试,要么发出书面指令,以新的指导重新运行**replicate**(如果计划本身有问题,则重新运行**plan**)。 ### 2.1 输入模式 Veritas接受三种输入模式: - • **完整模式**:论文及其代码仓库。声明从论文中提取,复现针对作者的代码仓库运行。 - • **仅论文模式**:没有代码仓库的论文。**codegen**阶段首先从零编写论文方法的实现,复现针对生成的代码库运行。 - • **仅仓库模式**:没有论文的代码仓库。声明从仓库的README中提取。 Veritas还接受一个可选的预置数据目录作为输入,以只读方式挂载到复现环境中。 ### 2.2 论文声明 **analyze**阶段将输入转换为结构化的论文声明集,即Veritas后续尝试验证的个体断言。在完整模式和仅论文模式下,声明从论文中提取;在仅仓库模式下,从仓库的README中提取。Veritas也接受手工编写的声明集,此时跳过提取步骤。声明集对复现代理隐藏。 Veritas为每条声明标注类型和重要性级别。类型指定声明证据的形式,并决定验证器如何进行比较。标量声明是单个报告的数字。标量范围声明是论文断言位于某个区间内的值。表格声明或多值声明将相关数字分组。定性声明涵盖非数值发现,例如一种方法优于另一种。图形声明涵盖证据为图形布局或趋势的情况。重要性级别指示声明对论文的核心程度:标题声明陈述论文的主要结果,支持性声明是次要发现。重要性级别对声明在复现分数中的贡献进行加权(§̃2.5 (https://arxiv.org/html/2607.02931#S2.SS5))。 ### 2.3 代码生成 在仅论文模式下,Veritas没有要复现的源代码,因此**codegen**阶段将论文的方法写入一个全新的代码库。生成的代码库随后像原始作者的仓库一样通过流水线的其余部分。**codegen**提示引导代理完成四个步骤:探索论文、规划代码库、逐模块实现计划,以及自我审查结果。为了防止代理硬编码论文报告的结果,自我审查提示包含一个常数来源检查,验证生成代码中的每个数值常数要么是论文中声明的输入,要么是在运行时计算的。除了提示之外,Veritas还提供一份科学计算技能目录,放在代理的工作目录中,并指示代理在相关时使用这些技能。 ### 2.4 复现 **计划阶段**。**plan**阶段读取代码库并生成复现计划,即一份有序的步骤列表,用于运行方法并产生每条声明所需的证据。每个步骤记录它服务于哪些声明(仅通过标识符,从不记录论文报告的值)以及预期结果,即其输出应具有的形式(例如文件路径或一组字段名)。计划只向执行代理暴露声明标识符,从不暴露论文报告的值。 **复现阶段**。**replicate**阶段在代码库的可写副本上执行计划,原始仓库保持只读。222Veritas支持两种运行时:默认使用Docker容器[16 (https://arxiv.org/html/2607.02931#bib.bib22)],以及一种直接在主机的包装器。两种运行时的流水线逻辑相同。代理主动解决遇到的失败,在宣布某个步骤不可复现之前尝试多次修复。每次修复都会被记录下来,供**assess fixes**阶段使用。 **管理循环**。一个有限的管理循环包裹**replicate**,并决定该尝试是否足够好,可以进行评分。每次**replicate**尝试后,Veritas根据运行日志计算一小部分确定的执行检查。检查涵盖:是否每个计划步骤都已执行、每步的退出代码和声明的输出文件、表明陷入循环的重复命令、修复总数以及墙钟时间。这些检查和运行记录传递给一个独立的管理代理,该代理返回一个包含两部分的判定结果。第一部分是决策,要么**accept**(接受),要么**revise**(修改)。第二部分是书面指令,解释代理应在下一次尝试中如何修改。如果判定为**accept**,流水线进入**assess fixes**阶段;如果判定为**revise**,则指令会调用下一次尝试。大多数修订针对**replicate**,代理随后在新指令下重新运行。当指令归咎于计划而非执行时,管理代理会针对**plan**,流水线从那里重新开始。该循环受硬迭代上限约束,并在执行检查未改善且指令在尝试之间未变化时提前停止。管理代理能看到轨迹和检查,但看不到论文报告的值。 **修复评估**。如果在复现过程中应用了任何修复,**assess fixes**阶段会将每次修复评为次要、主要或严重。评分来自一个独立的代理调用,而不是应用修复的代理,以避免自评偏差。 ### 2.5 验证与复现分数 **验证**。**verify**阶段分两步评判每条声明。一个比较器LLM读取运行的证据,并以与声明类型匹配的结构化形式提取复现值,以及运行报告中的任何不确定性。
相似文章
@adithya_s_k: https://x.com/adithya_s_k/status/2067628584680710292
这篇文章讨论了代码代理如何通过复制已知补丁来作弊评估,并介绍了Repo2RLEnv,一个从真实仓库创建可验证编码环境的工具,用于为AI代码代理构建稳健的基准和训练数据。
@dair_ai: 编码代理能否复现科学机器学习论文?我们知道这是可能的,因为我们已经可以做到@dair_ai。仍…
本文介绍了“论文复现”(Paper-replication),这是一种编码代理的工作流程,通过将每项声明转化为带有记录证据的目标,系统地复现科学机器学习论文,并在十二次运行中证明所有工作区和目标均已完成。
Replicas
Replicas 是一款工具,允许用户在云端运行任何编码代理框架。
TVIR:构建面向文本-视觉交织报告生成的深度研究代理
介绍了TVIR,一个用于生成文本-视觉交织报告的基准和层次化多代理框架,评估了自动化报告生成中的事实可靠性和视觉对齐。
Traxia:一个可验证、智能体原生的科学出版框架
Traxia提出了一种可验证、智能体原生的科学出版框架,其中自主AI智能体可以发表论文、进行同行评审并与人类协作,解决了可重复性和溯源问题。