神经符号文献中仅6.5%可通过其发布工件复现:一个六阶段审计框架及其首次实例化
摘要
本文提出一个六阶段审计框架,用于评估神经符号AI文献的可复现性,发现仅有6.5%的已发布工件研究可被复现,凸显了研究可复现性的危机。
arXiv:2608.26236v1 宣布类型:新
摘要:我们提出了一个六阶段框架,用于审计计算机科学领域研究文献中科学主张的可复现性,并针对神经符号AI(NSAI)子领域实例化我们的框架。在NSAI子领域实例化该框架产生了一个多年审计。第一阶段检索了5,497条记录,并移除了3,018条重复项。第二阶段在标题和摘要层面筛选了2,479条唯一记录,识别出1,365条自标识为NSAI的记录,然后因主题不符、非研究性质、无定量评估或全文不可访问等原因,在全文层面进一步移除了61条。第三阶段为1,304条合格记录中的每一条寻求可验证的公共代码工件,发现849条没有代码工件,剩下455条进入工件清单并进行第四和第五阶段的有限重运行。我们完全或部分复现了85项研究,占合格语料库的6.52%,占尝试重运行的18.68%。我们发现,321次尝试重运行因缺少非代码工件而受阻,42次因代码仓库缺失或不可用而受阻。这些数字量化了持续存在的可复现性缺口,即使名义上的“代码可用”声明也无法弥补,并表明未来NSAI出版物需要强制、版本化且永久归档的工件包。我们主张,经验性NSAI论文在提交时应被要求提供完整、版本化且永久归档的工件包。
查看缓存全文
缓存时间: 2026/08/28 09:33
# 6.5%的神经符号文献可从其公开成果重现:六阶段审计框架与首次应用 来源:https://arxiv.org/html/2608.26236 作者:Vladimir Martirosyan、Ishan Tamrakar、William Regli 所属机构:Aditya Kumar、Anh N\. Nhu、Dhruv Dubey、Raj Ambavane、Haowei Deng ###### 摘要 我们提出一个六阶段框架,用于审计计算机科学领域研究文献中科学论断的可重复性,并在神经符号AI(NSAI)子领域进行首次框架实例化应用。该框架在NSAI子领域的应用产生了长达数年的审计研究:第一阶段检索到5,497条记录并移除3,018条重复条目;第二阶段对2,479条唯一记录进行标题和摘要筛选,识别出1,365条自标识的NSAI记录,随后因偏离主题、非研究性质、无量化评估或全文不可访问等原因再移除616条;第三阶段为1,304条合格记录寻找可验证的公开代码成果,发现849条无可用代码,最终455条进入成果清单并触发第四、五阶段的有限复现。我们完全或部分复现了85项研究,占合格文献库的6.52%,占尝试复现案例的18.68%。研究发现,321次尝试复现因缺失非代码成果受阻,42次因代码仓库缺失或不可用而中断。这些数据量化了即使通过名义“代码可用”声明也无法消除的持续性可重复性缺陷,并指出未来NSAI出版物需强制实施版本化且永久存档的成果包机制。我们认为,经验性NSAI论文在投稿时应要求提供完整、版本化且永久存档的成果包。 马里兰大学帕克分校计算机科学系 地址:美国马里兰大学帕克分校,马里兰州 邮箱:brandcol@umd\.edu ## 引言 独立团队能否重新运行已发布论文的计算流程并重现其主要报告结果?我们对455项声称公开代码成果的神经符号研究提出了这个问题。其中85次复现成功。本文针对新兴的神经符号人工智能领域,研究已发表成果的同源重现实验。具体而言,我们探究独立团队能否重新运行论文发布的计算流程,并在预设容差内重现主要报告结果。 NSAI被许多人视为融合连接主义方法与传统符号AI概念的前沿领域,后者通常被称为“旧式人工智能”,包含用于推理的逻辑和形式化技术。集成方式涵盖从神经组件为符号组件提供输入的松散流程,到紧密耦合的联合训练系统。旨在整合这两种技术的前沿科学动态多变,尽管声称在该领域做出贡献的论文数量激增,本文报告指出,这些论文中的大多数成果无法通过重新运行已发布成果来复现。这表明“神经符号AI”研究领域正面临复现危机,且缺乏能使已发布成果在论文发表时可靠执行的学术共同体规范。 为推动该领域发展到许多人认为必然的重要地位,我们应提高科学标准,更强调如何记录可重复性,使他人能验证我们的主张。基于下文证据,我们认为该领域的经验性投稿在投稿时应附带完整、版本化且永久存档的成果包。 ## 背景 如近期文献多次记载,当前许多科学领域正经历“可重复性危机”(Baker 2016 (https://arxiv.org/html/2608.26236#bib.bib3)),因为研究已被证明难以或无法复现(López\-Nicolás et al\. 2022 (https://arxiv.org/html/2608.26236#bib.bib12)),数据源不可用(Miłkowski, Hensel, and Hohol 2018 (https://arxiv.org/html/2608.26236#bib.bib14)),且实验假设未明确说明(Hensel 2020 (https://arxiv.org/html/2608.26236#bib.bib8))。这些现象在社会科学中记录最为广泛,还存在事后重新设计科学假设的额外问题。这种被称为“结果已知后假设”或“p值操纵”的现象发生在研究者观察数据后形成或修改假设,然后呈现该假设时仿佛其在数据收集前已指定(Rubin 2022 (https://arxiv.org/html/2608.26236#bib.bib18))。 计算领域理论上应具有高度可重复性,因为算法、代码、数据和其他成果可以轻松共享和采用。会议和期刊已开始要求数据共享和其他最佳实践以提高可重复性(noa 2020 (https://arxiv.org/html/2608.26236#bib.bib1))。缺乏可重复成果的计算研究可能沦为无法独立验证、因而不属于科学范畴的不可证伪主张。我们需要能够严格且独立地测试计算机科学界论文中提出的假设,如同其他领域一样,以便工作更具可信度。 ### 贡献与研究问题 我们遵循ACM徽章术语(Association for Computing Machinery 2020 (https://arxiv.org/html/2608.26236#bib.bib2))对可重复性的定义,将其指代为原团队之外的团队使用原团队成果获得一致结果。我们做出两项贡献:一是用于审计跨文献同源重现实验可重复性的六阶段框架;二是框架本身的首次实例化应用,这是迄今最大规模的尝试,对1,304条合格NSAI记录应用该框架。 我们旨在解决的研究问题包括: *RQ1* 发布代码的NSAI论文中,有多大比例可完全或部分复现? *RQ2* 成果完整性(代码/数据/模型权重)如何影响成功复现的概率? *RQ3* 复现结果是否因发表年份或出版平台类型(会议、期刊、预印本)而系统性变化? ### 相关工作 复现失败在多个经验学科中均有充分记载。心理学和医学的里程碑研究表明,相当一部分已发表发现无法独立复现(Open Science Collaboration 2015 (https://arxiv.org/html/2608.26236#bib.bib15); Ioannidis 2005 (https://arxiv.org/html/2608.26236#bib.bib9)),社会科学和生物医学的大规模调查将这些失败归因于未披露的分析选择、不可用数据和选择性报告(Baker 2016 (https://arxiv.org/html/2608.26236#bib.bib3); López\-Nicolás et al\. 2022 (https://arxiv.org/html/2608.26236#bib.bib12); Hensel 2020 (https://arxiv.org/html/2608.26236#bib.bib8))。感兴趣的读者可参考该更广泛文献获取全面论述。 计算机科学呈现结构性差异,因为算法、代码和数据原则上可精确共享,意味着经验主张应属科学中最易验证的类别。然而实践中,相同的失败模式反复出现,如下文研究示例所示。 Vanderdonckt和Vatavu引入*Amplitum*框架,通过参与者、设备和物理环境的明确描述扩充通用复现分类法(Vanderdonckt and Vatavu 2025 (https://arxiv.org/html/2608.26236#bib.bib20))。他们的手势激发案例研究表明,只有当复现者匹配原始实验室环境和用户群体时,才能重现先前发现,强调当人类行为作为主要因变量时,仅靠代码和刺激材料是不够的。 Ferrari Dacrema等人审查了26篇当时的“最先进”神经推荐论文(2015–2018),仅能完全复现其中12篇原始论文,且发现其中11篇在强制执行通用实验协议后,其性能落后于精心调优的邻域、矩阵分解或稀疏线性基线(Ferrari Dacrema et al\. 2021 (https://arxiv.org/html/2608.26236#bib.bib6))。他们将明显性能提升归因于方法学缺陷,包括基线保持默认设置、时期选择时意外测试集泄露以及未记录的数据划分选择。 ReproNLP共享任务系列要求独立团队使用原作者提供的材料重复已发表的人工评估,报告表明经常无法达到与原始数据的一致性(Belz and Thomson 2023 (https://arxiv.org/html/2608.26236#bib.bib4))。组织者将分歧归因于评估协议规定不足和原始设置细节未被记录。 Henderson等人评估了几种广泛引用的深度强化学习算法,发现当随机种子、硬件平台或训练周期变化时,基准排名可能逆转(Henderson et al\. 2018 (https://arxiv.org/html/2608.26236#bib.bib7))。因此他们建议报告多个种子的结果、应用形式显著性检验并披露每个实验细节。 Pawlik等人研究了公开数据集的持久性,发现许多链接降级、移动或悄悄变更版本,导致后续实验尽管名义可访问却无法复现(Pawlik et al\. 2019 (https://arxiv.org/html/2608.26236#bib.bib16))。他们主张采用不可变存储、严格版本标识符和溯源元数据。 当实验上下文的任何部分缺失时,复现就会中断,神经符号AI也不例外。仅提供代码链接而缺乏硬件详细信息、求解器提交记录、预处理脚本、数据集划分和超参数调度表,除了表面合规外意义甚微。一旦基线获得同等调优或知识库修订,归因于符号-神经融合的性能提升可能消失;神经组件的随机变异也可能主导符号层。因此,可靠复现需要不可变、版本化的成果包、多种子评估,以及预训练权重、逻辑程序和精选知识图谱的完整溯源。 ## 方法论审计框架 | 审计阶段 | 记录数量 | 备注 | |----------|----------|------| | 来自数据库的初始记录 | n =5,497 | | | 去重后唯一记录 | n =2,479 | 移除重复记录 n =3,018 | | 筛选记录(标题/摘要) | n =2,479 | 主题排除 n =1,114 | | 主题相关记录 | n =1,365 | | | 合格全文NSAI记录 | n =1,304 | 全文资格排除 n =61 | | 尝试复现记录 | n =455 | | | 成功复现并纳入记录 | n =85 | | | 未成功复现记录 | n =370 | | | 无可验证公开代码成果记录 | n =849 | | 图1:NSAI审计的筛选与资格流程。后期全文资格排除单独显示,不计入复现结果。底部虚线框报告尝试集中的成功复现数量,作为审计结果呈现。 我们展示用于审计跨文献同源重现实验可重复性的六阶段框架及其实例化应用。第一阶段构建和筛选文献库;第二阶段确认全文资格;第三阶段在尝试执行前识别代码成果并记录六项成果清单;第四阶段构建发布环境并检查可执行完整性;第五阶段在有限修复允许和既定保真度标准下重运行主要实验;第六阶段提取数据并审计结果标签。 ### 文献库构建与筛选(审计协议第1-3阶段) 第一阶段构建文献库。我们从有意宽泛的文献扫描开始,旨在全面覆盖神经符号领域。基于经PRESS验证的查询(McGowan et al\. 2016 (https://arxiv.org/html/2608.26236#bib.bib13)),以“neuro-symbolic OR NeSy OR NSAI”为核心,于2025年5月23日查询九个主要数字图书馆:Web of Science、Scopus、PubMed、Ei Compendex、IEEE Xplore、ACM DL、SpringerLink、Google Scholar和arXiv。查询返回5,497条记录。这种宽泛扫描提高了对新兴或表述独特研究的覆盖率,这些研究常被更窄查询忽略。 去重流程移除3,018条重复记录(原始命中55%),留下2,479条唯一记录。跨来源的显著重叠反映了NSAI研究中的交叉发布规范,并强调了多次去重处理的必要性。 相关性筛选采用单盲标题摘要筛选。经20条记录校准后,审稿人筛选标题和摘要,保留作者明确描述为“神经符号”的论文,无论应用领域如何。1,365篇论文满足此宽泛标准。 代码可用性并非仅从摘要推断。相反,仓库验证在全文资格评估期间进行,标注者首先检查全文中的仓库或成果链接,若无,则使用论文标题、作者姓名和方法或领域关键词进行结构化外部搜索。此过程排除了849条无法识别可验证公开代码成果的记录,留下455项含代码研究进行复现审计,65.11%的淘汰率暴露了开放科学声明与实际交付成果之间的差距。 这些阶段将文献从2,479条唯一记录缩减至1,365篇NSAI相关论文,并进一步筛选出455项至少链接或可匹配至代码成果的审计候选者。图1可视化每个缩减步骤,将文献库构建直接关联到量化神经符号AI可验证进展的目标。 ### 审计协议第4-6阶段 #### 纳入标准 论文需满足*全部*以下条件方可进入复现流程: IC1\- 神经符号集成——研究自述为神经符号。 IC2\- 经验评估——论文报告基准、真实世界数据集或合成任务的量化结果,并与基线或消融实验对比。 IC3\- 计算机科学相关性——工作为计算机科学领域提供技术见解。 IC4\- 可审计代码声明——论文提供直接仓库链接或所报告系统的唯一可识别公开代码成果,足以允许成果审计。 IC5\- 全文可获取——论文具有可供审计的可访问全文。 #### 排除标准 论文若违反*任何*以下条件将被移除: E1\- 非英文写作。 E2\- 文献综述、评论、综述、社论或非原始经验研究。 E3\- 无法通过论文或结构化外部搜索识别所报告系统的可验证公开仓库或存档代码成果。 E4\- 无法在研究协议下识别、访问或重建重运行主要实验所需的不可或缺成果。E4适用于论文或其链接的...
相似文章
AI编程代理可复现社会科学发现
本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。
PaperBench:评估AI复现AI研究的能力
OpenAI推出PaperBench,一个评估AI代理复现最先进AI研究能力的基准。该基准通过复现20篇ICML 2024论文,包含8,316个可评分任务。表现最好的模型(Claude 3.5 Sonnet)仅达到21%的复现分数,低于人类博士级别的表现,凸显了当前自主研究能力的局限性。
@askalphaxiv: 70%的AI研究不可重复。上周ICML 2026期间,有超过6000+篇研究论文发布,但……
Alphaxiv和Hugging Face发起了一项社区挑战,旨在检验ICML 2026上AI研究论文的可重复性,提供4500美元的GPU积分和一个自动研究代理来帮助参与者。
用于法律AI的神经符号AI-TRISM:值得信赖、可靠、可解释、安全的模型
本立场论文提出了TRISM框架,该框架将神经符号AI与LLMs和RAG相结合,以解决法律AI中的幻觉和可解释性问题,引入了RASOR RAG用于生成可解释的理由,并形式化了符号化法律知识库。
人工神经网络中符号模式涌现的数学原理与实验发现
本文证明,在广泛的人工神经网络类别中,推理逻辑可以被重新表述为稀疏符号交互,并得到数学判据和大量实验的支持,为可解释性和泛化性提供了新颖的见解。