更多批评未必带来更佳评审:EquiReview-R
摘要
EquiReview-R 通过基于证据细化结构化关注点,减少遗漏和过度批评,提高评审准确性,从而改进 AI 辅助的同行评审。
查看缓存全文
缓存时间: 2026/09/04 06:15
# 更多批评未必造就更好的评审:EquiReview-R
来源:https://arxiv.org/html/2609.03943
###### 摘要
## 摘要
AI评审系统现在能产出大量具体批评,但批评越多未必代表评审质量越高。一篇评审可能遗漏关键缺陷,或保留现有证据无法支撑的指控。这两类错误需要相反的纠正措施,但面向生成的系统与聚合性指标却模糊了这一区别。因此,我们将AI辅助评审重新定义为**基于证据对结构化问题集进行精炼**的过程,将遗漏风险与过度批评风险视为独立问题。基于此框架,我们提出EquiReview-R系统,该系统能针对局部证据解决现有问题,从独立视角和基于评审的视角搜索缺失问题,并返回“停止”、“继续”或“延迟”决策。为揭示该设计所针对的失效模式,我们构建了带证据标注的轨迹语料库。回顾性分析表明:高召回率评审中几乎所有问题都缺乏明确的证据判定,而早期的精炼机制无法修改这些问题。在冻结的未见论文测试集上,EquiReview-R满足预设的重大遗漏非劣效标准,将重大过度批评从15.5%降至8.1%,并在52.4%的论文上停止时,实现单侧遗漏率上限9.9%。计算匹配的对照组、配对对照和消融实验证明,改进源于精炼而非额外推理或更短输出。我们已将语料库作为ReviewTrace发布,这是一个用于研究评审修订、分歧和溯源的带证据标注资源。
###### 关键词
AI辅助同行评审、科学评审、评审修订、选择性风险控制、证据溯源
## 1 引言
AI辅助正在改变科学同行评审。在ICLR 2025的大规模随机研究中,模型生成的反馈促使评审人修改真实报告并更深入地参与作者回应(Thakkar等,2026)。语料库研究同样发现语言模型越来越多地修改会议评审(Liang等,2024a)。一项针对自然系列期刊论文的补充研究请领域科学家评估人类和AI的独立批评。AI评审发现了人类遗漏的问题,但彼此重叠度很高,且对次要问题过度批评(Kim等,2026)。综合这些结果表明核心技术问题正在转变。随着评审智能体检查论文更多方面并生成更多候选异议,瓶颈已从产出批评转向决定哪些批评在证据核查后仍然成立。
简单示例说明这种区分的重要性。假设一篇评审遗漏了匹配基线的缺失,恰当的纠正应是增加问题;另一篇评审指控数据泄漏,但论文已说明清晰的数据划分,恰当的纠正应是删除或缩窄指控。前者缺乏覆盖,后者给作者和读者强加了无证据支撑的负担。系统可能在改进一种错误的同时加剧另一种错误,即使其输出更长且看似更全面。
因此,我们将评审改进视为对结构化问题集的修订过程。每个问题陈述一个指控的科学错误,标识论文相关部分,并记录解决该问题所需的证据。当存在实质性问题缺失时该集合应扩大,当问题被证伪、重复、已解答或超出证据合理范围时也应收缩。这种视角将论文级风险分为两类:**重大遗漏**指评审结束时缺失或未解决的实质性问题;**重大过度批评**指应从可见评审中删除或实质性缩窄的实质性指控。
为直接研究该过程,我们构建了ReviewTrace而非从现有语料库提取静态评审。该资源记录每个问题如何被提出、质疑、关联、修订和判定。其回顾性轨迹揭示了聚合分数掩盖的结构性问题:在高召回率评审状态下,96.3%的问题尚未得到支持、缩窄或拒绝。后续的精炼机制未能修改任何初始问题,因为其修订步骤仅重新访问已获得临时判定的问题。图1展示了更广泛的影响:相似聚合失败率的系统可能在遗漏-过度批评平面上占据截然不同的位置,因此需要不同的纠正措施。
图1:瓶颈从寻找批评转向解决批评。额外搜索能发现遗漏问题,但也可能积累未经证据检验的指控。可靠的精炼必须支持双向纠正。不同系统在遗漏-过度批评平面上占据不同区域,因此单一维度的失败标签无法揭示所需纠正类型。
此诊断引出直接的设计原则:在扩展评审前先修订当前评审。我们提出EquiReview-R,该系统首先根据局部支持证据、反证和明确的解决条件重新评估每个未解决的问题,然后冻结修订状态,从两个互补视角搜索遗漏。一种搜索独立于当前评审,另一种利用修订后的评审针对其未覆盖的方面。最后,选择性程序根据未解决的后果、证据完整性和判定不确定性返回*停止*、*继续*或*延迟*。这个顺序很重要:精炼控制无证据支撑的批评,互补搜索保护召回率,选择性停止防止未解决的高后果问题被误认为完成评审。
评估遵循相同逻辑:缺失问题仅在系统冻结评审和停止决策后才被搜索,因此答案无法定义测试。严格覆盖要求相同的指控错误和解决条件,每个条件性遗漏结果都与停止覆盖率配对。计算匹配的对照组和最小差异的问题对-清洁对照对用于检验改进是否源于精炼而非额外推理或普遍减少输出的偏好。
我们的贡献包括:
- 将遗漏与过度批评分离,证明其并集无法识别所需纠正类型。
- 提出EquiReview-R,结合证据导向精炼、互补发现和选择性停止,构建可重构状态。
- 在冻结测试集上进行评估,采用匹配计算、独立遗漏候选、配对对照和消融实验。
- 发布ReviewTrace,一个包含问题轨迹和独立判定的带证据标注语料库。
## 2 相关工作
#### AI辅助科学评审
早期资源如PeerRead实现了评审文本和分数预测(Kang等,2018)。后续工作研究了模型生成反馈的实用性和实际采纳(Yuan等,2022;Liang等,2024b;Liang等,2024a;Thakkar等,2026)。现代系统通过多阶段分析、检索、基于回应的验证或主动调查改进生成:SEA整合多篇评审(Yu等,2024);DeepReview生成结构化、证据丰富的报告(Zhu等,2025);DIAG和E3强调特定弱点及问题级回测(Zou等,2026;Chaudhuri等,2026);ProReviewer维护结构化日志以指导主动调查(Fang等,2026)。这些方法扩展或组织了系统能产出的批评。我们的对象是生成的问题集,研究的是在进一步搜索或停止决策前哪些问题应经受住证据检验。
#### 评审内容评估
科学评审通过分数一致性、评审-回应问题、与观察反馈的重叠、问题匹配和论文层面关注度进行评估(Zhou等,2024;Liang等,2024b;Jin,2026;Li等,2026;Shin等,2025)。CriticEval类似地从任务和维度分解批评质量(Lan等,2024)。这些视角揭示了单个评论是否正确、有用或聚焦适当方面,但本身无法确定持续的评论集是否足以结束评审,或是否包含证据不再支持、应缩窄或合并的主张。我们将这些修订动作及其论文级后果作为主要评估对象。
#### 修订、鲁棒性和选择性决策
自我批评和工具交互批评能暴露错误并改进模型回应(Saunders等,2022;Gou等,2024)。在同行评审中,人在回路分析和鲁棒性研究强调了相关模型错误、操纵和部署风险(Drori和Te'eni,2024;Ye等,2024;Baumann等,2026;Xin等,2026)。选择性预测为不确定性存在时的弃权提供了原则性语言(El-Yaniv和Wiener,2010;Geifman和El-Yaniv,2017)。学习后测试和保形风险控制提供了评估预设风险约束的有限样本程序(Angelopoulos等,2025;Angelopoulos等,2024)。我们通过将选择性风险控制应用于修订后的评审状态(而非标量预测)连接了这些研究方向。
## 3 方法
### 3.1 问题形式化
设x为论文,S₀为初始结构化评审。我们将评审状态表示为:
S = (A(S), G(S), H(S))
其中A(S)是当前评审显示的问题集,G(S)是将问题关联为相同、重叠、父子或独立的类型化图,H(S)是证据和修订动作的不可变历史。问题c∈A(S)包含指控的错误、论文位置、支持证据和反证、解决条件、重要性及当前状态。将A与H分离允许可见评审变得更简洁,而不抹除提议内容或变更原因。
有效性判定优先于重要性。问题仅当解决它可能改变主要主张的有效性、范围或证据支持,实质性改变核心结果的解释,或影响主要评估的可信度时才被视为**重大**。中等问题需要局部分析或限定,次要问题主要影响呈现。主要终点仅使用有效的重大问题。
设Q_K为固定的外部搜索程序,具有K次预设搜索机会。我们定义两种论文级损失:给定停止规则g_λ,L_miss(S;Q_K,g_λ)在Q_K发现与A(S)不同的有效重大问题时为1,或当g_λ停止时仍有重大问题未解决则为1。L_over(S)在A(S)保留独立判定应删除或实质性缩窄的重大问题时为1。我们仅在规则停止的论文上报告遗漏率:
R_miss(g_λ) = E[L_miss(S;Q_K,g_λ) | g_λ(S)=停止]
C_stop(g_λ) = Pr[g_λ(S)=停止]
这两个量必须共同解释。从不停止使条件风险无信息量,而停止所有论文可能违反目标。
严格问题是次要约束。设Cov(S)表示该量。问题仅当同时匹配独立构建参考问题的指控错误和解决条件时才获得学分。因此“定理1缺少引理2的证明”和“定理1缺少收敛率分析”被视为不同问题,尽管它们涉及同一结论。重叠和父子关系仅在敏感性分析中获得部分学分。
方法现可写为三个耦合算子:
S⁻ = R_φ(x, S₀)
U = D_ind(x) ∪ D_cond(x, A(S⁻))
S⋆ = Γ_ψ(S⁻, U), d = g_λ(f(S⋆))
其中R_φ修订现有评审,两个D算子从独立和基于评审的视角搜索遗漏,Γ_ψ合并并接受候选问题,g_λ返回d∈{停止,继续,延迟}。设计目标是在保持问题发现能力和非平凡停止覆盖率的同时减少过度批评:
min_{φ,ψ,λ} E[L_over(S⋆)]
约束条件:
R_miss(g_λ) ≤ α, C_stop(g_λ) ≥ c₀, Cov(S⋆) ≥ Cov(S₀) - ε
该约束形式明确解释了为何单纯缩短评审无法解决问题。
### 3.2 EquiReview-R
图2总结了四个阶段及其共享状态。相同的问题标识符、证据记录和关系图连接修订、发现和停止,使后续阶段无法悄然重新解释早期阶段产生的内容。
图2:EquiReview-R概览。修订算子R_φ在两个发现算子之前解决现有评审...相似文章
精确但不耦合:审稿人的精确性并不能保证在多智能体数学推理中采纳批评意见
本文研究多智能体数学推理系统,发现审稿人在识别错误方面的精确性并不能保证解题者会采纳这些批评意见,揭示了检测与有效采纳之间的差距,从而限制了整体性能的提升。
AI编写的评论帮助人类发现缺陷
# AI编写的评论帮助人类发现缺陷 来源:[https://openai.com/index/critiques/](https://openai.com/index/critiques/) 我们希望确保未来执行极困难任务的AI系统始终与人类意图保持一致。[Many](https://openai.com/index/learning-to-summarize-with-human-feedback/)[previous\(opens in a new window\)](https://arxiv.org/abs/2204.05862)[works\(opens in a new window\)](https://www.deepmind.com/publications/gophercite-teaching-language-models-to-suppo
关于AI评审员的局限与机遇:联合45位专家科学家评审Nature系列期刊论文的评审意见
一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。
使用AI进行代码审查六个月教会我:“review this”是一个伪装成提示问题的QA问题
一位开发者回顾了六个月来使用AI进行代码审查的经历,发现模糊的提示会产生看似合理但毫无用处的反馈。解决办法是将审查视为一个带门控的流水线,包含明确的上下文、分范围的检查、验证清单和对抗性自我批评。
RubricReviewer:从直接批判到客观全面的基于评分标准的同行评审
介绍了RubricReviewer,一个用于基于大语言模型(LLM)的同行评审的评分标准驱动框架,它显式生成论文自适应的评分标准,并将无训练的证据收集智能体(Scout)与经过训练的人类对齐模型(Aligner)相结合,以产生更全面、更具区分性和更鲁棒的评审意见。