清晰的直觉还是真正的分析?在LLM作为评审人的同行评审中基准测试认知可靠性

arXiv cs.CL 论文

摘要

本文介绍了Kahneman4Review基准,包含3,563条同行评审,这些评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行评定,旨在评估LLM评审者能否区分同行评审中的分析性形式与真实的认知质量。

arXiv:2607.10511v1 公告类型:新提交 摘要:当LLM评审者称某篇同行评审具有分析性,而人类委员会称另一篇评审质量很高时,它们追踪的是同一个东西吗?我们认为并非如此,且这一差异在哲学上具有重要意义。我们将卡尼曼(Kahneman)的双重过程理论操作化为一个结构化的同行评审评价标准,并发布了Kahneman4Review基准,包含3,563条经评分的评审,每个评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行打分。三个发现关乎可信度:决策层级与评价标准中基于文本的认知质量代理未发现可检测的对齐;公开演示的代理评审获得比汇集的人类评审更高的原始分数,但长度和会议地点解释了大部分差距,且样本并非论文配对;ICLR的评审文本诊断在2022—2023年转变期间发生偏移,时间上与LLM的广泛可用性一致,但未识别出其原因。一项匹配的功能探测初步试验进一步表明,该评价标准能够区分设计用于对比真实找错与表面流利度的文本探测。我们认为,一个可信赖的LLM评审者可靠性基准必须将分析性形式与认知功能分离,并提出了实现这一目标的具体设计选择。交互式演示见 https://huggingface.co/spaces/nuojohnchen/Kahneman4Review
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:22

# 表达清晰还是真正分析?评估LLM作为评审的认知可靠性基准

来源:https://arxiv.org/html/2607.10511

###### 摘要

当一个LLM评审将某篇同行评审称为“分析性”,而一个人工委员会将另一篇评审称为“高质量”时,它们衡量的是同一回事吗?我们认为并非如此,且这种差异具有哲学意义。我们将Kahneman的双过程理论操作化,构建了一个结构化的同行评审评分标准,并发布了Kahneman4Review基准,该基准包含3,563篇按九个理论驱动的文本维度、八个偏差诊断指标和一个连续推理质量评分评级的评审。三个发现涉及*可信度*:决策层与基于文本的认知质量代理未检测到对齐;公开展示的代理式评审获得的原始分数高于汇总的人类评审,但长度和会议场所解释了大部分差距,且样本未按论文配对;ICLR评审文本诊断在2022-2023年过渡期发生偏移,时间上与LLM广泛可用性一致,但未确定其原因。一个匹配的功能探测试点进一步表明,该评分标准能够区分旨在对比真正找错与表面流畅性的文本探测。我们认为,一个可信的LLM评审可靠性基准必须将*分析形式*与*认知功能*分离,并为此目标提出具体的设计选择。交互式演示可在以下网址获取:https://huggingface.co/spaces/nuojohnchen/Kahneman4Review。

## 1 引言

同行评审是科学中最广泛使用的认知把关机制,大型语言模型越来越多地被提议既*生成*评审13 (https://arxiv.org/html/2607.10511#bib.bib19)、10 (https://arxiv.org/html/2607.10511#bib.bib16),也*评判*评审质量24 (https://arxiv.org/html/2607.10511#bib.bib10)、2 (https://arxiv.org/html/2607.10511#bib.bib18)。在这两种角色中部署LLM引出了一个机器学习社区很少直接提出的哲学问题:什么样的评审才算好?答案通常通过训练目标和基准设计(接受预测、评分一致性、人类偏好对齐)被偷运进来,然而哲学家们长期以来一直认为,认知质量不是一个标量结果,而是推理本身的一个属性8 (https://arxiv.org/html/2607.10511#bib.bib6)、14 (https://arxiv.org/html/2607.10511#bib.bib7)、4 (https://arxiv.org/html/2607.10511#bib.bib3)。一篇评审可能在技术上正确,但文本上缺乏充分论证;一篇负面评审如果基于事实、可证伪且能回应反驳,则可能是高质量的。

同行评审为这个问题提供了一个异常干净的测试平台。首先,评审是一种书面产物,适合细粒度分析。其次,存在一些结果(接受、元评审、领域主席标记)通常被视为真实标准,但我们的数据将显示它们与评分标准的文本基础认知质量代理*未检测到对齐*。第三,最近出现的智能AI评审者10 (https://arxiv.org/html/2607.10511#bib.bib16)、13 (https://arxiv.org/html/2607.10511#bib.bib19)在截止日期下的人类评审与拥有完整论文访问权限的检索增强LLM流程的输出之间,创造了一种自然的文本对比。这种对比为机器学习评估提出了一个双过程启发的问题:LLM评审能否识别出区分*清晰表达直觉*与*真正分析*的文本证据,而不会将分析形式误认为已验证的认知功能?

贡献。 (1) 我们提出了九个理论驱动的文本维度、八个偏差诊断指标、一个四标签分类法和一个连续推理质量评分,这些均基于分析认识论和解释哲学。 (2) 我们使用claude-sonnet-4-6作为评审,对3,563篇评审进行了评级:1,155篇来自ICLR、ICML和NeurIPS 2025的分层抽样人类评审;2,307篇来自ICLR 2021/2022/2023人类评审用于纵向研究;以及101篇来自一个开放的智能AI评审者流程。已发布的代码、评分标准提示、评级和来源元数据可通过Kahneman4Review演示 (https://huggingface.co/spaces/nuojohnchen/Kahneman4Review) 获取。 (3) 我们报告了三个直接涉及可信度的实证发现:(a) 分析痕迹分数在各会议中表现出普遍的天花板效应(RQS∈[2.80,2.94]);(b) 决策层不能预测RQS;(c) 公开展示的智能评审与汇总的人类评审在那些经过训练的LLM能够流畅模仿的维度上具有统计上的可区分性。 (4) 尽管评分标准提出了九个理论上的不同维度,但当前的LLM评审将它们合并为一个主导的分析痕迹因子。我们将其视为文本基准的一个*失败模式发现*,而非多维测量的证据。

## 2 相关工作

**同行评审分析**主要关注结果信号:评分一致性、作者身份偏见和策略行为23 (https://arxiv.org/html/2607.10511#bib.bib15)、22 (https://arxiv.org/html/2607.10511#bib.bib12)、20 (https://arxiv.org/html/2607.10511#bib.bib13)、12 (https://arxiv.org/html/2607.10511#bib.bib14)。这些框架隐含地将评审可靠性等同于评估者间一致性或评分有效性。我们则相反地将评审质量操作化为推理文本的一个属性。

**LLM作为评审**系统被用于偏好评分24 (https://arxiv.org/html/2607.10511#bib.bib10)、2 (https://arxiv.org/html/2607.10511#bib.bib18)、15 (https://arxiv.org/html/2607.10511#bib.bib11),近期工作记录了它们的系统性偏差,包括自我识别和分布内偏好17 (https://arxiv.org/html/2607.10511#bib.bib26)。同期工作13 (https://arxiv.org/html/2607.10511#bib.bib19)使用LLM*生成*评审反馈;我们的评分标准则是一个结构化的*评审*,其输出在每个维度和每个区间均可审计,因此评审可靠性问题可以在比标量一致性更细的粒度上提出。

**哲学与机器学习评估**。可解释机器学习的工作越来越多地借鉴哲学和认知科学16 (https://arxiv.org/html/2607.10511#bib.bib8)、3 (https://arxiv.org/html/2607.10511#bib.bib9)。我们的框架借鉴了解释的分析论述8 (https://arxiv.org/html/2607.10511#bib.bib6)、14 (https://arxiv.org/html/2607.10511#bib.bib7)、理解4 (https://arxiv.org/html/2607.10511#bib.bib3)和认知运气19 (https://arxiv.org/html/2607.10511#bib.bib4),并与FAccT相关的信任和可靠性讨论9 (https://arxiv.org/html/2607.10511#bib.bib25)相联系,这些讨论将可信度视为超越预测准确性的东西。

## 3 双过程评审认知评分标准

**从理论到评分标准**。Kahneman11 (https://arxiv.org/html/2607.10511#bib.bib1)区分了系统1(快速、联想、基于印象)和系统2(缓慢、深思熟虑、整合证据)。我们以此区分作为认知推理的文本诊断灵感:系统1类痕迹包括压缩印象和无支持的标签,而系统2类痕迹包括明确的证据关联、可反驳性和不确定性处理5 (https://arxiv.org/html/2607.10511#bib.bib2)、7 (https://arxiv.org/html/2607.10511#bib.bib22)。这些标签描述了与清晰表达直觉和真正分析相关的文本痕迹,而非评审者的认知状态。在没有论文访问权限的情况下,它们无法确定真正分析的发生或批评的正确性。

**维度**。每篇评审在九个0-3分制维度上评分。两个维度(印象依赖、启发式捷径使用)是系统1倾向的;其他七个是系统2倾向的。每个维度锚定到一个特定的哲学需求:*可证伪性*到Popper18 (https://arxiv.org/html/2607.10511#bib.bib23),*证据特异性*到最佳解释推理14 (https://arxiv.org/html/2607.10511#bib.bib7),*不确定性处理*到理解的对比观点4 (https://arxiv.org/html/2607.10511#bib.bib3),*问题优先级*到美德认识论21 (https://arxiv.org/html/2607.10511#bib.bib5),*推理密度*到经验充分性6 (https://arxiv.org/html/2607.10511#bib.bib24),*推理链*到解释的结构8 (https://arxiv.org/html/2607.10511#bib.bib6),*启发式捷径*到快速节俭认知7 (https://arxiv.org/html/2607.10511#bib.bib22)。完整映射,包括评分标准提示,见表1 (https://arxiv.org/html/2607.10511#S3.T1)。

**表1:九个评分标准维度及其哲学锚点。第三列是评分者寻找的评分标准提示。**
| 维度 | 锚点 | 提示 |
|------|------|------|
| 印象依赖† | 直觉判断11 (https://arxiv.org/html/2607.10511#bib.bib1) | 全局标签(“新颖”) |
| 推理链 | 论证结构8 (https://arxiv.org/html/2607.10511#bib.bib6) | 前提→结论 |
| 证据特异性 | IBE14 (https://arxiv.org/html/2607.10511#bib.bib7) | 数字、公式、引用 |
| 可证伪性 | 分界18 (https://arxiv.org/html/2607.10511#bib.bib23) | 具体可反驳性 |
| 启发式使用† | 快速节俭7 (https://arxiv.org/html/2607.10511#bib.bib22) | 场所匹配捷径 |
| 不确定性处理 | 理解4 (https://arxiv.org/html/2607.10511#bib.bib3) | 条件句、更新 |
| 问题优先级 | 美德认识论21 (https://arxiv.org/html/2607.10511#bib.bib5) | 核心vs.外围 |
| 推理密度 | 经验充分性6 (https://arxiv.org/html/2607.10511#bib.bib24) | 每项主张的支持 |
| 核心批判性 | 可反驳性18 (https://arxiv.org/html/2607.10511#bib.bib23)、14 (https://arxiv.org/html/2607.10511#bib.bib7) | 决策推动 |

†系统1倾向:低分表示分析性推理。

**连续分数**。评分者输出两个文本痕迹标量s₁, s₂∈[1,5]和一个推理质量分数RQS∈[1,5],旨在区分印象式形式与明确论证的形式。标签l∈{系统1, 系统2, 混合, 非评估性}是(s₁, s₂, RQS)联合的离散化。我们明确要求一个*最近替代标签*和一个反事实论证(“为什么不是X?”),这是评分标准对对比解释的认同14 (https://arxiv.org/html/2607.10511#bib.bib7)、16 (https://arxiv.org/html/2607.10511#bib.bib8)。

**偏差诊断**。八个偏差类别(清单膨胀、代表性、问题替代、结论优先、过度自信、叙事谬误、权威替代、确认偏差)作为开放集标签检测。

**评分标准实际衡量了什么?** 对跨会议的1,155个人类评级的九个维度进行主成分分析,发现一个主导因子解释了65%的方差;一个特征值超过Kaiser阈值,最大非对角相关性为0.91,且PC1在每个符号翻转的维度上正载荷(图7 (https://arxiv.org/html/2607.10511#A2.F7))。因此,尽管评分标准在理论上是多维的,但当前评审并未恢复九个经验上不同的构念。我们将其视为一个*失败模式发现*:评级收缩为近乎一维的分析痕迹轴,因此一个精心提示的LLM可能在全局上而非单个轴上饱和基准(在第5节 (https://arxiv.org/html/2607.10511#S5)中返回讨论)。

## 4 实证研究

### 4.1 数据与协议

我们从ICLR、ICML、NeurIPS 2025按级别(6个口头报告、10个亮点、84个海报)分层抽样每个会议100篇论文,得到1,155篇人类评审;此外,我们还在同一评审下对ICLR 2021/2022/2023每年各200篇随机论文(共2,307篇评审)进行纵向研究评级,以及101篇来自一个开放智能评审流程公开展示的评审10 (https://arxiv.org/html/2607.10511#bib.bib16)、1 (https://arxiv.org/html/2607.10511#bib.bib17)(总计3,563篇评级)(完整来源及策展限制见附录G (https://arxiv.org/html/2607.10511#A7))。所有评级均使用claude-sonnet-4-6和冻结提示。LLM评审仅根据评审文本、会议和评分元数据进行评级;被评审的论文不包含在评审者的输入中。我们酌情使用Mann–Whitney U、Kruskal–Wallis、单因素ANOVA和χ²;每个维度比较使用9项检验的Bonferroni校正。

![参见标题](图1:三个会议和Stanford智能评审者的标签分布。会议层面的差异显著(χ², p<10⁻⁴)。)

### 4.2 分析痕迹分数呈现广泛的天花板效应和时间下降

2025年的平均RQS为2.80(ICLR)、2.83(ICML)、2.94(NeurIPS),基于1-5分制;会议层面的Kruskal–Wallis显著(p=0.003),但绝对差异很小。ICLR在*标签分布*上是统计异常值:ICLR评审中35%为系统1,而ICML为21%,NeurIPS为20%(图1 (https://arxiv.org/html/2607.10511#S4.F1))。

**时间趋势**。使用与2025年相同的评审和提示对ICLR 2021、2022和2023进行评级(总数n=2,683篇评审),揭示了2022-2023年过渡期的间断性,时间上与LLM的广泛可用性一致:2021年和2022年的平均RQS相同(3.03 vs 3.03),然后降至2.91(2023年)和2.80(2025年);系统1类份额增加了两倍,从11%增至35%;系统2类份额几乎减半,从23%降至16%(图2 (https://arxiv.org/html/2607.10511#S4.F2))。K–W p<10⁻⁴,标签χ² p<10⁻⁴。以2021年为参考且包含对数长度的长度控制回归显示,*2022年相对于2021年RQS为-0.03(p=0.20,不显著)*,但*2023年相对于2021年为-0.15(p<10⁻⁸)*,*2025年相对于2021年为-0.21(p<10⁻¹¹)*。这种模式是描述性的,而非因果性的:评审者构成、评审政策、会议规模、规范变化和LLM辅助起草都是可能的解释。

![参见标题](图2:ICLR不同年份的评审文本诊断。左:标签分布从较少的系统1类和较多的系统2类痕迹(2021/2022)转向更多的系统1类混合(2025)。右:RQS分布单调下降。K–W p<10⁻⁴;长度调整后的残差差距为-0.21 RQS,p<10⁻¹¹。)

### 4.3 结果不能预测认知质量代理

我们发现,跨会议汇总后,接受级别对RQS无显著主效应(p=0.260,图3 (https://arxiv.org/html/2607.10511#S4.F3));在每个会议内部,级别均值落在0.2 RQS点内。这个零结果在两种解读下都有信息量:*要么*会议系统最可见的结果信号与评分标准的文本代理不匹配,*要么*评分标准和结果在某个我们n无法解决的水平上跟踪相关属性。无论哪种情况,在我们的数据中,级别一致性充其量只是论证推理质量的弱代理。

![参见标题](图3:按会议和接受级别的平均RQS。样本量:ICLR/ICML/NeurIPS Oral分别为n=23/23/26,Spotlight为36/40/43,Poster为317/313/334。会议内部差异在标准误差范围内;汇总的单因素ANOVA为零(p=0.260)。)

作为辅助探测,我们评级了149位其质量被领域主席明确评论的评审者。AC标记为负面评论的评审者(n=37)与其同论文的同行(n=109)在RQS上的差异为p=0.578(不显著),观察到的d=-0.03,而80%功率下最小可检测效应为d=0.53。我们不认为这一发现可以排除存在差异——

相似文章

PRISM:评估LLM审稿人的多维度基准

arXiv cs.CL

介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

忠实还是虚构?LLM评审中合理化偏见的因果框架

arXiv cs.CL

本文提出了一个因果框架,用于量化LLM评审中的合理化偏见,即判决和解释受非证据性线索而非底层文本的影响。该框架提出了线索干预、锚定度量以及Proof-Before-Preference缓解协议,展示了改进的线索不变性。

LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。