评估审稿指南设计对基于LLM的自动化同行评审的影响

arXiv cs.CL 论文

摘要

本研究分析了不同类型的审稿指南(正式会议指南与模仿审稿人指南)如何影响基于LLM的自动化同行评审,发现正式指南产生的结果与人类判断更一致,而严格的评分细则则会降低性能。

arXiv:2607.22553v1 Announce Type: new 摘要: 同行评审是科学研究中的关键环节,但日益增长的工作量使其自动化变得越来越必要。在本研究中,我们分析了不同类型的审稿指南(如正式会议指南和基于高质量人工评审生成的模仿审稿人指南)如何影响基于LLM的自动化同行评审。实验表明,正式会议指南产生的评审结果与人类判断最为一致,这表明经过会议实践优化的评价标准同样能为自动化评审提供有效指导。相比之下,模仿审稿人的指南效果通常不如正式会议指南。此外,强制执行严格的评分细则会持续降低性能,凸显了允许主观和整体评分的重要性。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:27

# 评估审稿指南设计对基于LLM的自动化同行评审的影响

来源:https://arxiv.org/html/2607.22553

Haowen Li¹, Yoichi Ishibashi², Masafumi Oyamada²  
¹庆应义塾大学,²日本电气株式会社  
tony\_li\.haowen@keio\.jp, \{yoichi\-ishibashi, oyamada\}@nec\.com

###### 摘要

同行评审是科学研究中不可或缺的环节,然而日益增长的工作量使得其自动化变得愈发必要。在本研究中,我们分析了不同类型的*审稿指南*(例如,官方会议指南和基于高质量人类评审使用LLM生成的模仿审稿人指南)如何影响自动化同行评审。我们的实验表明,官方会议指南产生的评审结果与人类判断最为一致,这表明经过会议实践提炼的评估标准同样能为自动化评审提供有效指导。相比之下,模仿审稿人指南通常不如官方会议指南有效。此外,强制采用严格的评分量规风格会持续降低性能,这凸显了允许主观和整体评分的重要性。

# 评估审稿指南设计对基于LLM的自动化同行评审的影响

Haowen Li¹††thanks:本文完成于日本电气株式会社实习期间.,Yoichi Ishibashi²,Masafumi Oyamada²  
¹庆应义塾大学,²日本电气株式会社  
tony\_li\.haowen@keio\.jp, \{yoichi\-ishibashi, oyamada\}@nec\.com

## § 1 引言

近年来,主要机器学习会议投稿数量的爆炸式增长给同行评审者带来了巨大负担Stelmakhet al.\(2020 (https://arxiv.org/html/2607.22553#bib.bib19)\); Zhanget al.\(2022 (https://arxiv.org/html/2607.22553#bib.bib22)\); Weiet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib20)\); Kimet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib21)\)。当前基于人类的同行评审系统面临严重挑战,包括审稿人负担过重、判断不一致、评审肤浅以及反馈延迟。与此同时,随着研究自动化的发展,准确评估的重要性只增不减,使得同行评审过程的自动化成为迫切需要。一个明显的例证来自ACL滚动评审(ARR)指南,该指南要求审稿人“*检查常见的评审问题*”¹¹¹https://aclrollingreview.org/reviewerguidelines。这些条目不仅仅提醒审稿人避免错误,更建立了判断论文学术贡献的具体标准:例如,不应仅仅因为结果看起来“不令人惊讶”而低估其价值,也不应仅仅因为贡献与先前认知相矛盾就否定其意义。通过形式化这些原则,ARR有效地提供了操作性指标,界定了什么是合理、新颖且有影响力的研究。正如Seeber \(2020 (https://arxiv.org/html/2607.22553#bib.bib16)\)所指出的,这些方向表明,审稿指南塑造了同行评审的性质和质量,而不仅仅是作为行政注释。

尽管已有若干研究探索了使用大型语言模型(LLM)的自动化同行评审Zhuanget al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib23)\); Shinet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib24)\); Chenet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib25)\); Linet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib26)\); Liet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib27)\); Wenget al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib28)\),但决定评审政策的指南和量规对自动化评审性能的影响尚未得到充分研究。指南引导审稿人在评估论文时关注特定方面和视角,因此是评审质量的关键决定因素。然而,对于自动化同行评审,哪些类型的指南有效、哪些无效,仍不清楚。

广义上,自动化同行评审的指南设计可以考虑两种方法。一种是直接将现有的人类编写的各会议指南(例如ARR的官方审稿指南)提供给LLM,让其进行评审。另一种是模仿审稿人的方法,即使用高质量的人类撰写的评审作为指南生成器(如LLM)的输入,然后提取反复出现的评估模式和关键视角,以生成新指南。

在本研究中,我们系统性地调查了LLM在不同指南条件下进行评审时,评审质量如何受到影响。具体而言,我们解决以下研究问题:
**RQ1:提供指南是否能提高自动化同行评审的性能?** 
**A:** 我们发现提供指南能提高自动化同行评审的性能。特别是,使用官方会议指南(例如来自NeurIPS和ARR的指南)被证明更为有效。这表明,经过研究社区长期打磨的评估标准同样为自动化评审提供了坚实基础(§ 3 (https://arxiv.org/html/2607.22553#S3))。

**RQ2:模仿审稿人指南是否有效?特别是,让模型主观打分更好,还是使用量规风格的标准严格计算更好?** 
**A:** 我们发现模仿审稿人指南通常不如官方会议指南有效。特别是,量规风格的形式进一步降低了对人类判断的一致性。这表明,在特定情境下,允许LLM主观确定分数可能比强制执行僵化的累加评分逻辑更接近人类判断(§ 4 (https://arxiv.org/html/2607.22553#S4))。

## § 2 问题定义

#### 审稿指南的类型

本研究分析了自动化同行评审的两种方法:(1) 使用人类创建的指南(例如ICLR官方审稿指南)直接提供给LLM进行评审;(2) 使用LLM从高质量人类评审(基于附录A (https://arxiv.org/html/2607.22553#A1)中的标准过滤)中生成指南,然后使用这些生成的指南进行评审。

#### 基于指南的自动化评审

两种方法都遵循共同的输入-输出结构进行自动化评审,如附录 (6 (https://arxiv.org/html/2607.22553#LST6)) 中的提示模板所示。**输入**包括:(i) 文本格式的论文²²²从PDF转换而来,移除了参考文献和附录,以及 (ii) 评审指南(人类创建或LLM生成)。**输出**是数值评审分数(通常为1-10分制)以及文本理由。

#### 评估

为评估自动化评审的质量,我们计算LLM生成分数与同一篇论文的人类评审分数之间的均方根误差(RMSE)。RMSE越低,表明模型的评分在数值上越接近人类评分。鉴于我们的1-10分制,RMSE为3.0意味着模型预测与人类平均分偏差约3分。该指标使我们能够评估自动化系统逼近人类同行评审的效果Weiet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib20)\)。虽然RMSE是我们的主要量化指标,但生成理由的逻辑深度和可操作性在附录D中进行了定性文本分析。

## § 3 会议审稿指南对自动化评审的有效性

本节评估审稿指南在多大程度上改进了自动化同行评审。我们探讨提供指南是否能提高准确性,以及哪个会议的指南最有效。

**表1:** 无指南和官方会议指南下自动化评审分数的RMSE。上方区块显示使用*官方审稿指南*的结果,下方区块使用相同内容改写为*指令风格提示*(使用ChatGPT转换)。最佳结果以**粗体**显示,次佳结果以下*下划线*显示。数值越小越好,表示与人类分数越接近。

#### 实验设置

我们从ICLR 2024同行评审数据集中随机抽取了1,500份投稿(论文和评审)³³³我们从OpenReview收集了ICLR 2024投稿数据,包括7,262篇论文PDF和28,028份开放获取评审,来源为https://openreview.net/group?id=ICLR.cc/2024/Conference。对于每篇论文,人类参考标签是其所有审稿人总体评分的平均值。我们评估了三种模型:Qwen3-30B-A3B(MoE模型)Yanget al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib33)\)、DeepSeek-R1-Distill-Qwen3-32BDeepSeek-AIet al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib31)\)和Qwen3-32BYanget al.\(2025 (https://arxiv.org/html/2607.22553#bib.bib33)\)。我们有意优先选择这些开放权重模型,而非专有的最先进系统(例如GPT-5或Gemini 3),以确保为研究社区提供一个科学透明、可复现且经济高效的基础。虽然使用专有模型评估绝对性能上限是有价值的,但处理1,500篇完整论文需要巨大的Token消耗,而且商业API的“黑箱”性质使其行为变化难以复现。由于我们的主要目标是确立不同指南设计的相对影响,使用能力强大的开放权重模型可以有效隔离指南的效果,同时不影响我们核心发现的完整性。

“无指南”表示仅向模型提供论文(无指南),让其输出一个整数总体评分,如附录B (https://arxiv.org/html/2607.22553#A2)所示。这作为一个严格的零样本下限;虽然提示赋予模型“专家”角色,但有意缺乏任何具体的评估背景或结构要求,以隔离指南的纯粹影响。

我们还使用了来自ICLR⁴⁴⁴https://iclr.cc/Conferences/2024/ReviewerGuide/、NeurIPS⁵⁵⁵https://neurips.cc/Conferences/2024/ReviewerGuidelines/和ARR⁶⁶⁶https://aclrollingreview.org/reviewerguidelines的官方审稿指南。由于官方文档通常包含非评估性的行政注释和说明性散文,我们额外测试了一种指令风格变体,其中相同的评估内容被改写为强制性、带项目符号的指令,并包含明确的输出要求,使用ChatGPT 5(GPT-5)转换。所有基于指南的条件所使用的提示如附录C (https://arxiv.org/html/2607.22553#A3)所示。

#### 问题1:指南能改进自动化评审吗?

我们将无指南与使用会议指南的运行结果进行比较。如表1 (https://arxiv.org/html/2607.22553#S3.T1)所示,当提供指南时,所有模型的RMSE均一致下降。例如,DeepSeek-R1-32B在三个会议指南条件下相比无指南基线均显示出显著的误差减少。同样,指令风格提示在所有测试模型中的表现均优于基线,表明明确的评估标准能提高与人类判断的一致性。

#### 问题2:哪些会议指南更有效?

接下来我们比较ICLR/NeurIPS/ARR指南。使用官方指南文本时,所有三种模型在NeurIPS指南下获得最低RMSE,其次是ICLR,最后是ARR(例如,对于Qwen3-30B-A3B:2.07 < 2.91 < 3.18)。当相同内容转换为指令风格提示时,最佳会议因模型而异:Qwen3-30B-A3B偏好ARR(2.97),而DeepSeek-R1-32B和Qwen3-32B偏好ICLR(分别为3.05和3.09)。换言之,除了指南内容,表现形式(逐字政策文本 vs. 指令风格提示)也能改变模型行为,并颠倒各会议之间的相对排名。

## § 4 模仿审稿人指南在自动化同行评审中的有效性

除了使用人类撰写的会议审稿指南外,另一种方法是使用LLM*构建*指南。在本节中,我们考察从人类撰写的评审中生成的*模仿审稿人指南*是否能改进自动化同行评审。我们使用若干指标(如评审长度)评估评审质量,并从高质量评审中提取常见视角,然后由LLM将其转换为指南。通过这一过滤过程,我们将评审分为三组:*好评审*、*中等评审*和*差评审*。我们从每组生成指南,并比较在这些不同设置下的自动化评审性能。

#### 指南生成概述

我们通过以下步骤生成模仿审稿人指南并将其应用于自动化同行评审:

**清单1:** 从高质量(“好”)评审中提取的模仿审稿人指南示例。
`提供以下基于同行评审行为清单的内容: peer_review_behavior_checklist: good_paper: contribution_and_impact: -question:"论文是否解决了一个重要且及时的问题?" description:"审稿人积极评价那些解决重要且相关研究主题的论文,认为这是潜在影响力的标志。" -question:... clarity_and_presentation:... bad_paper: novelty_and_scholarship: -question:"贡献是否只是增量式或是现有想法的再实现?" description:"这是一个常见且严重的问题。审稿人知识渊博,会拒绝他们认为只是先前工作微小变种的论文,通常会引用具体论文。" -question:... clarity_and_soundness:...`

* **步骤1:评审数据过滤**:为确保指南是从深入的评审中提炼而来,我们使用程序化代理标准过滤数据:长度、提交日期、引用次数和一致性。虽然人工专家注释是黄金标准,但这些结构化的指标为评估审稿人的参与度和透彻性提供了可扩展且可重复的基础。根据综合分数(33-1717分),评审被分为*好*、*中等*和*差*三组。
* **步骤2:指南生成**:我们将过滤后的评审提供给Gemini 2.5 ProGoogle Gemini Team \(2025 (https://arxiv.org/html/2607.22553#bib.bib32)\)以生成模仿审稿人指南。具体来说,我们从步骤1定义的三个质量池(好、中等、差)中各随机抽取恰好30条评审,以生成相应的模仿审稿人指南。生成的指南结构化为一个清单,包含正面方面(好论文)和负面方面(差论文)的单独条目。它们捕捉了频繁提及的批评意见、反复出现的评估标准和特征性视角。例如,清单1 (https://arxiv.org/html/2607.22553#LST1)展示了一个实际生成的指南(为简洁起见节选)。更多细节见§ A.3 (https://arxiv.org/html/2607.22553#A1.SS3)。
* **步骤3:使用指南进行自动化评审**:此步骤遵循与会议指南实验相同的流程。将生成的模仿审稿人指南与论文文本一起提供给LLM。然后模型输出一个1-10分制的总体评分,并给出简要理由。

**表2:** 在模仿审稿人指南下,比较有量规和无量规设置的RMSE(数值越小越好)。“好”和“差”分别指从*高质量*和*低质量*人类评审中提炼的指南。

#### 问题1:模仿审稿人指南能优于无指南吗?

我们将无指南(模型仅使用论文)与来自好/差组的模仿审稿人指南进行比较。模仿审稿人指南的影响依赖于模型(见表2 (https://arxiv.org/html/2607.22553#S4.T2)与无指南基线的比较)。

相似文章

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

RubricReviewer:从直接批判到客观全面的基于评分标准的同行评审

arXiv cs.CL

介绍了RubricReviewer,一个用于基于大语言模型(LLM)的同行评审的评分标准驱动框架,它显式生成论文自适应的评分标准,并将无训练的证据收集智能体(Scout)与经过训练的人类对齐模型(Aligner)相结合,以产生更全面、更具区分性和更鲁棒的评审意见。

PRISM:评估LLM审稿人的多维度基准

arXiv cs.CL

介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。

Review Arcade:论LLM评审的人类对齐性与可操控性

arXiv cs.AI

本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。

LLM能否生成可靠的评分标准?实验复现的元评估

arXiv cs.CL

本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。