超越最终决策:一个用于透明人工智能辅助同行评审的以过程为中心的基准
摘要
本文介绍了一个用于评估人工智能辅助同行评审系统的以过程为中心的基准,旨在超越最终决策准确性,提高透明度和可靠性。
arXiv:2609.05947v1 公告类型:新
摘要:同行评审是科学质量控制的核心。然而,现有对人工智能辅助同行评审的评估主要关注生成的评审整体质量或最终决策的准确性。因此,它们提供的证据有限,无法说明模型决策是否得到充分且可靠的评审证据支持。我们引入了一个用于人工智能辅助同行评审的以过程为中心的诊断基准。它使用(x,$z_s$,$z_c$,$z_r$,y)
来表示论文内容、摘要、批评、建议和决策。我们将来自PeerRead、NLPeer ARR-22和OpenReview-ICLR的异构评审记录转换为过程对齐数据。我们的基准使用从论文内容直接预测决策(Direct)作为基线。它比较了Gold-process变量和Predicted-process变量的决策价值,并进行了阶段级评估、链一致性评估和干预敏感性分析。在三个数据集和六个模型上的实验表明,Gold-process变量通常具有更高的决策价值。对于主要分析模型,Gold--Predicted差距在数据集和随机种子上保持稳定。这一差距在大多数模型--数据集组合中也得以重现。尽管模型生成的中间评审文本在相邻阶段显示出相对较高的局部一致性,但最终决策并未始终得到先前评审证据的支持。我们的基准旨在针对设计用于辅助而非替代人类评审员的人工智能系统。它提供了一个透明且可审计的诊断工具,用于评估其评审过程的可靠性。
查看缓存全文
缓存时间: 2026/09/10 08:45
# 超越最终决策:面向透明AI辅助同行评审的过程化基准测试
来源:https://arxiv.org/html/2609.05947
张雪怡 倪旺泽 肖天放 狄诗敏 朱嘉 蒋卓然 谭蓉 陈蕾 任奎
###### 摘要
同行评审是科学质量控制的核心。然而,现有的AI辅助同行评审评估主要关注生成评审的整体质量或最终决策的准确性,因此对于模型决策是否由充分可靠的评审证据支持所提供的证明有限。我们引入了一个面向AI辅助同行评审的过程化诊断基准,使用\(x,z_s,z_c,z_r,y\)表示论文内容、摘要、批评、建议和决策。我们将来自PeerRead、NLPeer ARR-22和OpenReview-ICLR的异构评审记录转换为过程对齐数据。该基准以直接基于论文内容的决策预测(Direct)作为基线,比较黄金过程变量与预测过程变量的决策价值,并执行阶段级评估、链一致性评估和干预敏感性分析。在三个数据集和六个模型上的实验表明,黄金过程变量通常具有更高的决策价值。对于主要分析模型,黄金-预测差距在数据集和随机种子间保持稳定,该差距在大多数模型-数据集组合中也可重现。尽管模型生成的中间评审文本在相邻阶段显示出相对较高的局部一致性,但最终决策并未始终得到先前评审证据的支持。本基准旨在评估设计用于辅助而非替代人类审稿人的AI系统,为评估其评审流程的可靠性提供了一个透明且可审计的诊断工具。
1浙江大学
2南洋理工大学
3中山大学商学院
4东南大学
5浙江师范大学
6香港科技大学数据科学与人工智能学院
## 引言
随着人工智能会议投稿量持续增长,同行评审面临工作量不断增加的压力。评审质量、及时性和问责制也面临越来越大的压力(Kim et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib30))。大型语言模型已被用于生成评审意见、协助论文分析以及预测评审分数和接收决策。一些会议也开始进行受控试点项目,探索其在真实评审工作流程中的应用(Association for the Advancement of Artificial Intelligence 2025 (https://arxiv.org/html/2609.05947#bib.bib32); NeurIPS 2026 (https://arxiv.org/html/2609.05947#bib.bib33))。然而,AI辅助同行评审的日益普及引发了关于公平性和研究诚信的担忧。针对特定会议数据的研究发现,AI辅助评审倾向于给予更高的分数,并可能影响接近接收阈值的论文的结果(Latona et al. 2024 (https://arxiv.org/html/2609.05947#bib.bib31))。因此,人类审稿人必须保留最终决策权和问责制,同时需要透明且可审计的评估方法来评估AI提供评审辅助的可靠性。
参见标题图1:从独立任务评估到AI辅助同行评审的过程化基准测试。同行评审是领域专家分析论文、识别其主要贡献和问题、提供改进建议并形成整体评估的过程(Liang et al. 2023 (https://arxiv.org/html/2609.05947#bib.bib2); Idahl and Ahmadi 2025 (https://arxiv.org/html/2609.05947#bib.bib3); Biswas et al. 2026 (https://arxiv.org/html/2609.05947#bib.bib4))。例如,NeurIPS的评审表在单独的字段中记录这些评审组成部分(Neural Information Processing Systems Foundation 2025 (https://arxiv.org/html/2609.05947#bib.bib34))。受此结构启发,我们将单次评审的核心证据形成过程表示为四个阶段:摘要、批评、建议和决策。如图1所示,这种表示不仅支持评估每个阶段的功能质量,还支持评估跨阶段的链一致性以及最终决策是否得到先前评审证据的充分支持。
现有评估主要关注独立任务的表现(Kang et al. 2018 (https://arxiv.org/html/2609.05947#bib.bib1); Zhou et al. 2024 (https://arxiv.org/html/2609.05947#bib.bib5))或基于过程的评审人的最终评审质量和人类对齐性(D’Arcy et al. 2024 (https://arxiv.org/html/2609.05947#bib.bib6); Weng et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib7); Zhu et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib8); Garg et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib9))。很少有研究在统一的框架内比较过程变量的决策价值、评估链一致性并检查最终决策对中间过程变量的干预敏感性。使用多阶段或结构化程序生成评审并不意味着中间阶段及其关系已得到系统评估。随着AI辅助同行评审进入受控的现实世界试点项目,缩小这一评估差距对于提高系统透明度、明确问责制以及支持可靠部署至关重要。
然而,过程级评估面临两个关键挑战。首先,现有的同行评审数据集通常包含异构的论文-评审-决策记录。它们的字段结构、文本粒度和标签来源各不相同,使得将摘要、批评和建议对齐为统一的过程变量变得困难(Kang et al. 2018 (https://arxiv.org/html/2609.05947#bib.bib1); Dycke et al. 2023 (https://arxiv.org/html/2609.05947#bib.bib10); Wang et al. 2023 (https://arxiv.org/html/2609.05947#bib.bib11))。其次,这些过程变量是开放文本,没有单一的正确表达。因此,一个在某一阶段看似合理的输出并不能建立在完整评审链上的一致性(Liang et al. 2023 (https://arxiv.org/html/2609.05947#bib.bib2); Idahl and Ahmadi 2025 (https://arxiv.org/html/2609.05947#bib.bib3)),也无法表明最终决策实际使用了相应的证据。因此,过程级评估必须评估每个阶段的功能质量,并检查过程变量的决策价值、链一致性以及过程变量对最终决策的影响。
为解决这些挑战,我们引入了一个面向AI辅助同行评审的过程化诊断基准。为了支持对核心评审组件的阶段性诊断,我们将每个评审实例表示为\(x,z_s,z_c,z_r,y\)。这些变量对应论文内容、摘要、批评、建议和决策。然后,我们将来自PeerRead(Kang et al. 2018 (https://arxiv.org/html/2609.05947#bib.bib1))、NLPeer ARR-22(Dycke et al. 2023 (https://arxiv.org/html/2609.05947#bib.bib10))和OpenReview-ICLR(Idahl and Ahmadi 2025 (https://arxiv.org/html/2609.05947#bib.bib3))的异构评审记录对齐为统一的过程对齐数据。
基于此表示,我们首先比较三种输入设置下的决策性能:仅论文内容、从人类评审记录对齐的黄金过程变量,以及由模型生成的预测过程变量。此比较衡量两类过程变量的过程变量决策价值。然后,我们进行阶段级评估、链一致性评估、干预敏感性分析和条件错误分析。这些评估共同诊断模型如何生成和使用评审证据。
结果表明,黄金过程变量通常具有更高的决策价值。对于主要分析模型Qwen2.5-14B-Instruct,黄金-预测差距在数据集和随机种子间保持稳定,该差距在大多数模型-数据集组合中也可重现。尽管模型生成的中间评审文本在相邻阶段显示出相对较高的局部一致性,但最终决策并未始终得到先前评审证据的支持。因此,仅最终标签准确性和整体评审质量无法完全评估模型评审过程的可靠性。本基准旨在评估设计用于辅助而非替代人类审稿人的AI系统,评估这些系统提供的评审证据的可靠性,而不将模型输出视为接收决策的独立依据。
本工作的主要贡献如下:
- 我们引入了一个面向AI辅助同行评审的过程化诊断基准,使用\(x,z_s,z_c,z_r,y\)表示论文内容、摘要、批评、建议和决策。基于此统一表示,我们将来自PeerRead、NLPeer ARR-22和OpenReview-ICLR的异构论文、人类评审和决策记录转换为可比较的过程对齐数据。
- 我们开发了一个过程级评估框架,比较黄金过程变量与预测过程变量的决策价值,并进行阶段级评估、链一致性评估、干预敏感性分析和条件错误分析,以系统诊断模型如何生成和使用评审证据。
- 我们在三个数据集和六个模型上进行了系统实验。结果揭示了黄金过程变量与预测过程变量之间的决策价值差距。尽管模型生成的中间评审文本在相邻阶段显示出相对较高的局部一致性,但最终决策并未始终得到先前评审证据的支持。
## 相关工作
AI辅助同行评审。AI辅助同行评审主要包括评审生成、分数预测和接收预测。早期工作探索了初始评审意见的自动生成(Yuan et al. 2022 (https://arxiv.org/html/2609.05947#bib.bib12)),而PeerRead实现了对评审文本和接收决策的计算分析(Kang et al. 2018 (https://arxiv.org/html/2609.05947#bib.bib1))。更新的系统使用分层问答、检索增强、迭代反思和多智能体协作来构建更强的评审人。代表性系统包括TreeReview(Chang et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib13))、ScholarPeer(Goyal et al. 2026 (https://arxiv.org/html/2609.05947#bib.bib14))、ReviewerTool(Sahu et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib15))和DeepReviewer(Zhu et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib8))。这些方法提高了生成评审的深度、事实性或结构,但其主要目标仍然是改进评审人或其最终输出。相比之下,我们的工作考察了中间评审证据是否包含决策相关信息、在各阶段间是否保持一致以及是否反映在最终决策中。
面向过程的评估。评估已从分数或决策准确性扩展到多维评审质量和人类对齐性。Beyond Rating(Li et al. 2026 (https://arxiv.org/html/2609.05947#bib.bib16))、ReviewEval(Garg et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib9))、MMReview(Gao et al. 2025 (https://arxiv.org/html/2609.05947#bib.bib17))、PRISM(Loc et al. 2026 (https://arxiv.org/html/2609.05947#bib.bib18))和CoCoReviewBench(Deng et al. 2026 (https://arxiv.org/html/2609.05947#bib.bib19))从事实性、完整性、建设性以及与人类评审的对齐性等方面评估生成的评审。关注级别的匹配进一步支持更细粒度的诊断(Jin 2026 (https://arxiv.org/html/2609.05947#bib.bib20))。现有数据资源提供了互补的基础。PeerRead包含论文、评审和接收标签(Kang et al. 2018 (https://arxiv.org/html/2609.05947#bib.bib1)),而NLPeer标准化了多个同行评审数据源(Dycke et al. 2023 (https://arxiv.org/html/2609.05947#bib.bib10))。PeerSum(Li et al. 2022 (https://arxiv.org/html/2609.05947#bib.bib21))、MOPRD(Lin et al. 2023 (https://arxiv.org/html/2609.05947#bib.bib22))和关于同行评审论证的资源(Fromm et al. 2021 (https://arxiv.org/html/2609.05947#bib.bib23))分别支持评审摘要、多阶段评审记录和话语分析。然而,现有评估通常关注单个任务或最终评审质量。很少有研究将摘要、批评、建议和决策对齐为统一且可干预的过程变量。我们提供了这样的统一表示,并评估了阶段级质量、过程变量决策价值、链一致性、干预敏感性以及条件错误关联。
参见标题图2:提出的面向AI辅助同行评审的过程化诊断基准概述。它将异构的同行评审记录对齐为过程变量,并评估其决策价值、阶段质量、链一致性、干预敏感性和条件错误关系。
## 面向过程的基准测试
我们引入了一个面向AI辅助同行评审的过程化诊断基准。如图2所示,该基准将异构的同行评审记录转换为过程对齐数据。通过比较黄金过程变量与预测过程变量的决策价值并进行过程级诊断分析,分析模型如何生成和使用评审证据。
### 问题形式化
现有的结果级评估通常将AI辅助同行评审建模为从论文内容\(x\)直接预测最终决策\(y\):\(\hat{y}^\mathrm{direct}=f_\mathrm{direct}(x)\),\(y\in\{\mathrm{accept},\mathrm{reject}\}\)。这种设置衡量最终标签是否正确,但无法揭示决策是否得到中间评审证据的支持。为实现过程级诊断,我们将每个评审样本表示为\((x,z_s,z_c,z_r,y)\)。这里,\(x\)表示论文内容;\(z_s\)、\(z_c\)和\(z_r\)分别表示摘要、批评和建议;\(y\)表示最终决策。这使得对这些阶段的独立评估、组合和干预成为可能。黄金过程变量从人类评审记录中对齐得到,记为\(Z_G=(z_s,z_c,z_r)\)。预测过程变量由被评估模型生成,记为\(\hat{Z}_P=(\hat{z}_s,\hat{z}_c,\hat{z}_r)\)。黄金过程变量作为评估的参考表示,而非唯一正确的人类推理链。基于此表示,我们评估每个阶段的功能质量,比较两类过程变量的决策价值,并检查模型生成的阶段是否形成相互支持的评审链,以及中间评审证据与最终决策的关系。
### 过程对齐数据构建
我们从PeerRead、NLPeer ARR-22和OpenReview-ICLR构建过程对齐数据。这些数据集分别涵盖早期同行评审语料库、ACL滚动评审过程和公开的ICLR评审记录,在字段结构、文本粒度和标签来源上各不相同。我们使用字段感知对齐:\(z_s\)使用评审人相似文章
代理审核系统基准测试
本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。
AI能否评估AI科学家?一项使用自动化多模型评审的自主研究生成系统基准测试研究
本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。
AI审稿人能看清全貌吗?多模态同行评审的攻击与防御
本文介绍了PaperGuard,这是一个用于评估和防御多模态AI同行评审系统对抗性攻击的基准,涵盖多个科学领域的文本和图像攻击。
开源软件投稿的AI辅助预审:来自BOSC 2026的经验报告
来自BOSC 2026的经验报告,介绍使用生成式AI对开源软件投稿进行预审,由人类审稿人做出最终决定。大多数审稿人认为AI辅助预审有用,但更倾向于独立验证AI的结论。
清晰的直觉还是真正的分析?在LLM作为评审人的同行评审中基准测试认知可靠性
本文介绍了Kahneman4Review基准,包含3,563条同行评审,这些评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行评定,旨在评估LLM评审者能否区分同行评审中的分析性形式与真实的认知质量。