超越模仿审稿人:评估用于预提交同行评审的LLMs

arXiv cs.AI 论文

摘要

本文评估了LLM系统在预提交同行评审中的应用,表明广泛的生成能够恢复大多数历史评审问题,但将其压缩成简短报告仍具挑战性,这对AI辅助研究反馈具有启示意义。

arXiv:2609.05788v1 Announce Type: new 摘要:同行评审反馈往往在作者能够做出有意义的修改之前就已到达。我们研究了一个面向作者的LLM系统,它将部分压力测试移至投稿之前:生成一个广泛的原子问题池,并将其压缩成简短报告。我们评估了与历史评审的一致性,以及它们可能遗漏问题的有效性。 从10,000篇ICLR 2026投稿中,我们使用了3,398篇可在评审前获取版本的稿件。在一个十篇论文的诊断中,独立采样覆盖了44.9%的历史问题;去重和补充达到了78.7%的严格覆盖和84.9%的严重性加权覆盖,但需要3.6$\times$的请求和5.2$\times$的令牌。一个隐藏的Top-32 Oracle保留了256个候选池的79.3%加权覆盖率,但仅基于论文的选择器仅保留了40--44%。因此,LLM评审通过大型候选池提供了广泛的覆盖,但压缩效果不佳;消融实验表明代表性选择和匹配器敏感性是这一差距的主要来源。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:42

# 不止于模仿评审:投稿前同行评审的LLM评估
来源:https://arxiv.org/html/2609.05788
\\workshoptitle

我们可以信任这个评判者吗?

Pouya Parsa(明尼苏达大学)parsa025@umn\.edu 与 Amin Rezaei¹¹footnotemark:1(Invariant Tech Inc\.amin@invariant\.sh)††thanks:等贡献\.

###### 摘要

同行评审反馈往往在作者能够进行有意义修改后才送达。我们研究一种面向作者的LLM系统,它将部分压力测试环节提前至投稿前:该系统生成大量原子问题,并将其压缩为简短报告。我们评估了系统输出与历史评审的一致性,并单独评估了其所遗漏问题可能具有的有效性。

我们从10,000篇ICLR 2026投稿中,使用了3,398篇在评审前即可获取的稿件。在十篇论文的诊断测试中,独立采样覆盖了44.9%的历史问题;经过去重和补充,严格覆盖率和加权覆盖率分别达到78.7%和84.9%,但需要3.6倍请求量和5.2倍的token消耗。一个隐藏的Top-32预言机保留了256个候选问题池79.3%的完整加权覆盖率,但仅基于论文的选择器只能保留40–44%。因此,LLM评审通过大候选池提供了广泛覆盖,但压缩效果不佳;消融实验表明代表性选择和匹配器敏感性是导致这一差距的主要原因。

## 1引言

正式的同行评审为研究思路提供了一些最具价值的反馈,但通常只在投稿之后才到来。那时,可能已没有足够时间来补充缺失的实验、修复核心主张或重新设计评估方案。我们探讨一个面向作者的LLM系统能否将部分压力测试环节提前:审阅草稿,预测评审者可能提出的合理担忧,并在仍有修改余地时揭示额外的薄弱环节。

我们的系统采用“先广泛后压缩”的设计。它首先生成数百个基于证据的问题,去除语义重复项,然后选择一份简短的报告。这种设计将生成与评判相耦合:生成器限定了可被发现的范围,而语义决策决定了哪些问题被视为新问题、哪些能在压缩后保留以及哪条流程看起来最佳。已知的位置效应和自我偏好效应[9,8]因此成为系统风险,而不仅仅是评估工件。

历史评审同样构成不完整的参考。一个小规模评审团只采样了部分有效批评。一个匹配历史评审的生成问题展示了*评审预期*;一个不匹配的问题可能无效,也可能是评审团遗漏的有用反馈。因此,我们区分了*与历史评审的一致性*和*独立有效性*。这一区别对于预期产品至关重要:广泛的AI反馈应与人类反馈高度重叠,而非被迫完全模仿。

我们在评审者可见的ICLR 2026稿件上进行评估。基于论文的生成过程在人工评审开启前即已冻结;随后将评审转化为校正后的原子问题,并将每个候选问题与每个问题进行比对。该协议衡量了广度、冗余度、历史覆盖率、压缩损失和评判者分歧,同时在生成过程中不暴露评审目标。结果表明,广泛生成可以恢复有限评审团的问题权重的大部分,但将候选池缩减至32个有用问题仍然困难。

我们的贡献包括:
- •基于10,000篇投稿和3,398篇评审前稿件构成的严格队列,构建了一个控制泄漏的基准;
- •通过受控的流程对比,表明去重和补充将加权历史覆盖率从49.5%提升至84.9%,但消耗了5.2倍的token;
- •一项Top-32研究,分离了三个误差来源:语义聚类、代表性选择以及匹配/原子化;
- •证据表明AI与人类问题集有大量重叠但不可互换,这促使我们分别评估一致性和有效性。

## 2相关工作

##### 评审数据与模拟。

PeerRead实现了对14.7万份草稿和10.7万份专家评审的数据驱动研究[5];后续工作使用LLM代理模拟评审者行为和决策[4]。我们则研究一个面向作者的任务:从草稿中发现原子问题并保留一个紧凑子集。

##### LLM生成的科学反馈。

GPT-4反馈与人类评论的重叠率可达到类似于人类间重叠的水平,且许多作者报告发现其有用[6]。MARG使用专业代理[2],OpenReviewer基于79K评审微调了一个8B参数的评审模型[3],TreeReview动态扩展评审问题[1]。我们的关注点是互补的:语义广度、生成成本、Top-k压缩以及与隐藏人类问题的原子一致性。

##### LLM作为评判者。

LLM评判者在捕捉语义等价性方面优于词汇指标[10,7],但表现出位置偏差和同家族偏差[9,8]。我们研究当评判者评分同时定义评估和选择时,这些失效模式。

## 3方法

### 3.1任务与系统设计

一份草稿在我们的系统中经历两个主要阶段:广泛候选生成和压缩为面向作者的报告。

##### 广泛生成。

对于稿件\(P\),一个仅基于论文的生成器产生\(C(P)=\{c_1,\ldots,c_K\}\)。独立采样是最简单的基线,但它会重复发现常见问题。我们的去重-补充流程检查稿件证据和模式,拒绝被判定与已接受问题语义相近的候选问题,向生成器提供一个紧凑的排除列表,并持续填充直到候选配额满。这更倾向于边际语义广度而非名义输出数量。

##### 压缩选择。

仅基于论文的选择器\(S_k(P,C)\subseteq C(P)\)必须在不接触历史评审的情况下选择至多\(k=32\)个问题。我们将直接基于论文的排序与先聚类再选择的方法进行对比:按语义相似性对候选问题分组,仅使用稿件对可能的代表进行评分,并在各簇间分配最终名额。我们将使用隐藏评审匹配的选择器称为*预言机*:它们提供上界,但在推理时不可行。

### 3.2与历史评审的一致性

历史评审被转化为去重后的问题集合\(H(P)=\{h_1,\ldots,h_J\}\)。对于候选问题\(c_i\),语义评判者估计其为同一问题的概率\(M_{ij}\),其中等价意味着实质性的相同问题而非共享类别。我们在阈值\(\tau=0.70\)下衡量问题召回率\(R(C,H)\):

\[
M_{ij}=\Pr(c_i\equiv h_j\mid P,c_i,h_j),\quad R(C,H)=\frac{1}{|H|}\sum_{j=1}^{|H|}\mathbf{1}\!\left[\max_i M_{ij}\geq\tau\right].
\]

加权覆盖率用严重性权重\(w_j\)替换问题计数;我们还报告了主要问题召回率、候选匹配率和语义唯一性。命中率与覆盖率不同,因为重复的候选可能匹配一个问题,而其他问题仍未被发现。无限制的Top-k预言机使用\(M\)最大化覆盖权重;簇预言机首先固定一个分区。它们之间的差距衡量分区损失,而到仅基于论文选择器的剩余差距衡量代表性选择损失。

### 3.3独立有效性与语义饱和

匹配矩阵衡量的是*评审预期*,而非有效性。未匹配的问题需要针对其依据、合理性、具体性、重要性以及论文是否已解决这些问题进行单独评估。语义饱和发生在发现新问题变得越来越困难时:如果\(p_n\)是发现\(n\)个问题后的接受概率,那么达到\(K\)个问题需要期望次数\(\mathbb{E}[A_K]=\sum_{n=0}^{K-1}1/p_n\)。生成器混合只有在模型覆盖不同语义区域时才有帮助。

## 4实验

### 4.1数据集与稿件恢复

##### OpenReview来源。

##### 评审可见版本恢复。

当前论坛的PDF可能包含评审后的修改,因此不作为输入使用。OpenReview-arXiv映射恢复了2,123个投稿前版本,而OpenReview时间戳通过第二条恢复路径识别了1,548份评审前PDF。两条路径在273篇论文上重叠;在重叠部分选择arXiv版本,最终得到3,398篇评审可见的稿件。

##### 评审后与出版侧快照。

我们为每篇论文单独保留其当前的OpenReview PDF与其评审前输入。对于1,392篇接收论文,这提供了公开的评审后版本,可用于未来的修改分析。

图1(https://arxiv.org/html/2609.05788#S4.F1)总结了恢复和版本配对工作流。历史文件和当前文件在整个过程中保持分离。

图1:数据构建流程。表1:语料库构建与冻结的论文族划分。决策从显式决策说明和当前会议状态归一化而来。

##### 冻结划分。

重复和可能的重投稿在分层前共享一个族ID。不可变的划分包含2,446篇训练、272篇验证和680篇预留测试论文(表1)。本文报告回顾性训练诊断和一个五篇论文的验证试点;测试目标尚未开启。

### 4.2评估协议

##### 原子目标。

评审被拆分为人工校正、去重的原子问题。严重性区分了快速修复与需要新实验或核心主张修改的问题。十篇论文的诊断测试包含178个问题。

##### 泄漏边界。

生成仅使用历史稿件或其冻结的结构化表示;评审、评分、反驳、决策、后续版本和匹配矩阵保持隐藏。

##### 生成器与评判者。

生成器和选择器包括GPT-5.6 Sol、DeepSeek V4 Flash、Inkling NVFP4、Kimi-K3和Qwen3.8-2.4T-A95B。匹配使用受模式约束、零温度的调用,并保留完整的匹配矩阵。

### 4.3基线与比较

在512个候选问题时,我们将独立采样与去重补充进行比较,然后测试提前停止和模型混合。在256个候选问题时,我们将仅基于论文的压缩与Top-32预言机进行比较;第二个匹配器测试评判者依赖性。某些设置是联合变化的,因此这些是流程比较。

### 4.4广泛候选生成

#### 4.4.1独立采样与去重补充

表2(https://arxiv.org/html/2609.05788#S4.T2)比较了两种DeepSeek V4 Flash流程在每篇论文512个保留候选上的表现。独立的人格分批调用保留了重复答案。去重补充拒绝与已接受问题语义相近的候选,提供一个紧凑的禁止问题列表,并持续填充直到配额满。

表2:DeepSeek在十篇论文上每篇512个保留候选的生成策略。独立采样覆盖80/178个问题。尽管1,265/5,120个候选至少命中一个目标,但只有656个(12.8%)是语义唯一的:许多命中重复相同问题。去重补充覆盖140/178个问题,尽管候选命中率较低(0.204 vs. 0.247)。收益在于语义广度,而非更多的名义阳性,但它需要16,143个原始问题、1,905次请求和96.61M token,而独立采样只需525次请求和18.66M token。

图2:候选生成覆盖率与成本。

#### 4.4.2覆盖率增益变得昂贵

随着我们生成更多独特候选,覆盖率增长,但请求量和token使用增长更快。将候选从256扩展到512,将加权覆盖率从.692提高到.849,但需要额外的593次请求和55.61M token;最后的128个候选仅增加了九个问题。基于新颖性的提前停止将请求减少87.6%,token减少92.3%,但将加权覆盖率降低至.660。

#### 4.4.3异构生成器

在93篇训练论文上,规模匹配的32候选Sol和DeepSeek池分别获得.387和.423的宏严格召回率;它们的并集达到.535,包含265个仅Sol和347个仅DeepSeek的目标。一个临时的256候选混合池(128 DeepSeek, 64 Inkling, 32 Kimi, 32 Qwen)在五篇验证论文上达到.767的加权覆盖率。不同的策略和预算使得增益不能完全归因于模型本身,但它们的支持是互补的。

### 4.5Top-32压缩

实际报告必须将256个问题压缩为32个。在十篇训练论文上,无限制的Top-32预言机保留了完整候选池.793的加权覆盖率,因此在冻结的匹配矩阵下,32个名额具有足够的容量。仅基于论文的选择器只能达到.402–.442。聚类保留了无限制预言机可用的大部分覆盖率;更大的损失发生在仅基于论文的模型选择哪个成员代表每个簇时。我们在第5节(https://arxiv.org/html/2609.05788#S5)(表3)中分离了分区、选择和匹配器的影响。

表3:十篇训练论文上的Top-32压缩。所有行使用相同的冻结候选-问题矩阵。预言机选择器访问该矩阵,是上界,而非可部署系统。

#### 4.5.1历史匹配并非目标

与人类评审的一致性衡量的是对有限评审团的预期,而非AI反馈的全部价值。未匹配的候选包括错误,但它们也可能识别出评审团遗漏的具体问题。对于*OmniSpatial*,一个候选标记出推理与非推理模型的不同答案提取方法可能是一个混淆因素。对于*Regularization can make diffusion models more efficient*,另一个候选询问渐近保证如何支持激发性的少步机制,而没有有限的\(\epsilon\)-\(\epsilon\)阈值。两者都具体且基于论文,但都没有达到历史匹配阈值。因此,我们分别评估历史一致性和独立有效性;后者的专家裁定尚未完成。

## 5消融实验

我们通过改变探索策略、聚类、代表性选择和匹配方式来定位主要瓶颈。

### 5.1探索策略

细粒度的人格配额将重复拒绝率从37.1%提高到74.5%,而僵化的章节-类别-人格槽位有56.7%的时间返回no\_issue。与自适应停止策略一起,这些结果表明局部新颖性是不够的;探索必须重视边际候选池覆盖。

### 5.2分区与代表性选择

在八个聚类族中,每簇一个的预言机保留.755的加权覆盖率,而无限制预言机为.793。在160个簇中,70个没有历史边缘优势,41个与多个问题相关,表明存在分割和合并错误,但总体分区损失适中。

图3:候选簇及其历史评审匹配。代表性选择损失更大。使用固定的Ward分区,Qwen点选和最佳LLM锦标赛达到.402和.442的加权覆盖率,而簇预言机为.755。在五篇确认论文上,分区成本为6.1个百分点,而Qwen选择成本为33.9个百分点。

相似文章

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

PRISM:评估LLM审稿人的多维度基准

arXiv cs.CL

介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。

Review Arcade:论LLM评审的人类对齐性与可操控性

arXiv cs.AI

本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。