大型语言模型是否仔细审查其评审内容?对评分校准、错误检测和作者身份效应的多模态审计
摘要
本研究评估了两个多模态大型语言模型作为ICLR 2026投稿的同行评审,发现评分校准高但错误检测低,作者身份无影响,而图表降低了错误检测。
arXiv:2608.28626v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地用于生成同行评审,这引发了对其批判性评估能力的检验。本研究评估了两个多模态LLM,Qwen2.5-VL-72B和Pixtral-Large-124B,作为评审者,针对165篇投稿到2026年国际学习表征会议(ICLR 2026)的稿件,该会议晚于两个模型的训练截止日期。稿件以作者身份被盲化、替换为高声望机构或低声望机构的形式呈现给两个模型,并采用纯文本或文本加图表格式。此外,在55篇稿件中插入了145个可验证检测的错误,以评估在自然提示和验证导向提示下的错误识别。在所有稿件组中,包括被拒稿件,LLM的分数范围从7.0到8.1,而人类平均分数范围从3.4到6.8。模型在自然提示下检测到12.1\%的已验证错误,一句验证指令将检测率提高到22.2\%;然而,78\%的错误仍未被检测到。提供图表降低了错误检测,同时提高了评审分数。没有视觉错误被可靠地与其对应图表验证,一半的纯文本评审描述了未提供的图表。作者身份既不影响评审分数,也不影响错误检测。LLM的编辑决定与简单分数平均产生的决定完全匹配。
查看缓存全文
缓存时间: 2026/09/01 11:54
# 大型语言模型会仔细审查其评审的内容吗?针对评分校准、错误检测与作者身份效应的多模态审计研究
来源:https://arxiv.org/html/2608.28626
\[1\]\\fnmEmad\\surAlharbi
\[1\]\\orgdiv信息科技系,\\orgname塔布克大学,\\orgaddress\\city塔布克,\\postcode71491,\\state塔布克,\\country沙特阿拉伯
###### 摘要
大型语言模型(LLMs)越来越多地被用于生成同行评审,这引发了人们对其批判性评估能力的审视。本研究评估了两种多模态LLM——Qwen2.5-VL-72B和Pixtral-Large-124B——作为评审员,在2026年国际学习表征会议(ICLR 2026)的165份投稿上的表现,该会议的投稿截止日期晚于这两个模型的训练数据截止日期。稿件以三种方式呈现给两个模型:作者身份匿名、替换为高声望机构或替换为低声望机构,并采用纯文本或文本加图表格式。此外,在55篇稿件中插入了145个可验证的错误,以评估在自然提示和验证导向提示下的错误识别情况。在所有稿件组(包括被拒稿件)中,LLM评分范围为7.0至8.1分,而人类评审的平均评分范围为3.4至6.8分。在自然提示下,模型仅检测到12.1%的已验证错误;一句简单的验证指令将检测率提升至22.2%;然而,仍有78%的错误未被发现。提供图表减少了错误检测,但提高了评审分数。没有视觉错误能根据其对应的图表被可靠地验证,一半的纯文本评审描述了实际未提供的图表。作者身份既不影响评审评分,也不影响错误检测。LLM编辑的决策与简单平均评分得出的结果完全一致。
###### 关键词:
同行评审,大型语言模型,研究诚信
## 1背景
2026年国际学习表征会议(ICLR 2026)收到了19,814份投稿,需要约80,000份评审报告,评审员的招募已成为各会议的资源瓶颈\[aczel2021billion,shah2022challenges\]。大型语言模型(LLMs)已被用于加速评审过程,无论是评审员非正式地使用它们来起草或修改评审意见,还是会议试点LLM辅助评审\[liang2024monitoring,zhuang2025large\]。先前研究表明,LLM生成的反馈与人类评审员的意见有大量重叠,并且被作者认为是有帮助的\[liang2024can,thakkar2026large\]。然而,LLM生成的评审质量是一个独立的问题,不同于作者是否认为其意见有帮助。
一个独立的关注点是偏差。人类同行评审存在声望效应\[peters1982peer,tomkins2017single,tomkins2017reviewer\],而早期对LLM评审员的评估也发现了类似的机构偏差\[von2024affiliation\]。现有的LLM评审评估存在四个方法论弱点。第一,*数据污染*:模型在可能包含其训练数据的会议论文上进行评估,使得评估更像是检索而非真正的评估。第二,*版本不匹配*:由于OpenReview将修订历史限制为作者和组织者可访问,已接收论文的公开PDF是最终版而非人类评审员评审的版本。因此,基于已接收论文的研究是将LLM输出与评审不同稿件版本的人类评审进行比较。据我们所知,这种不匹配的普遍性和后果尚未被量化。第三,*未经验证的错误基准*:错误注入研究很少确认注入的错误在原则上是否可检测\[liu2023reviewergpt\]。它们通常未能保留稿件中的矛盾证据或提供经过验证的答案,导致检测率难以解释。第四,*模态盲区*:尽管同行评审依赖图表,但对LLM评审员的评估几乎完全基于文本。多模态模型在完整稿件上的表现,包括它们是否对未见过的图表进行评论,尚未被测量。
本文解决了所有这四个方法论弱点。我们的语料库由ICLR 2026投稿组成,其投稿日期晚于两个评审模型的训练截止日期。据我们所知,本研究首次对OpenReview会议进行了版本溯源普查,显示已接收稿件的预审版本几乎完全无法从公开来源获得。通过使用相应评审意见中的行锚定引文恢复并验证了原始版本,并且所有人类对比分析都限制在版本匹配的稿件上。构建了一个145个错误的基准,其中每个注入的错误都被验证为可检测的。每次编辑后都保留了矛盾证据,并用经验验证的子类型进行标注,包括一个只能从图表中回答的已认证视觉子集。在165份分层稿件中,采用稿件内析因设计,操纵了作者身份(匿名、高声望或低声望)、输入模态(纯文本或文本加图表)、稿件完整性(干净或错误注入)和评审提示(自然或验证导向),生成了9,900份结构化评审,这些评审来自两个前沿的开源多模态LLM。生成的评审由一个LLM编辑裁决,并通过一个独立的LLM评审员根据固定答案进行评分,并进行了分层的人类验证。
该实验设计检验了以下问题:LLM评分是否与人类对稿件质量的评估一致;作者身份是否影响评审评分或错误检测;访问图表是否能提高评审质量;以及LLM编辑是否提供超出简单分数聚合的价值。基准、语料库溯源标签和评估流程已发布以支持可重复性https://doi.org/10.5281/zenodo.21720411\。
## 2方法
### 2.1研究设计
使用LLM作为评审员进行同行评审。每份稿件在两种输入条件下进行评审:纯文本和文本加图表。每种输入条件下又进一步使用匿名作者身份以及高声望和低声望机构进行评估。此外,向稿件中引入错误以评估评审的完整性。使用了两个评审提示(自然提示和错误检测提示)以及两个LLM:一个作为评审员和编辑,另一个作为评分错误检测的评审员。
### 2.2数据收集
通过OpenReview API收集了所有19,814份ICLR 2026投稿及其官方评审意见和投稿决定;其中14,175份已收到最终决定。选择ICLR 2026是因为其2025年9月的投稿截止日期晚于两个LLM的训练数据截止日期,确保其投稿在LLM训练期间不可用。所有数据集均公开可用。
### 2.3数据版本与恢复
对于ICLR 2026,OpenReview将投稿修订历史限制为作者和组织者可访问。因此,已接收稿件的公开PDF是最终版而非人类评审员评审的版本,而被拒稿件的公开版本是人类评审过的版本。为了恢复已接收稿件的评审版本,查询了互联网档案馆在评审期间捕获的快照,获得了16份稿件。
### 2.4数据抽样与匿名化
从具有至少三份官方评审意见、可解析分数、可用PDF且不超过40页的已决定投稿中,通过种子冻结分层随机抽样选择了150份稿件:50份明确接收(平均评审分至少6.5分)、50份边缘稿件(平均评审分在5.0至6.5之间)和50份明确拒绝(平均评审分低于4.5分)。额外从互联网档案馆检索的15份稿件(其中一份已被选为明确接收)使最终样本量增加到165份用于实验。
稿件通过移除作者区块、致谢和参考文献列表进行匿名化。移除致谢和参考文献部分是为了防止通过机构致谢或自引推断作者身份。裁剪了页眉以从最终版中移除出版会议信息。
### 2.5实验条件
进行了18项实验,如表1所示 (https://arxiv.org/html/2608.28626#S2.T1),涉及以下描述的因子。
#### 2.5.1作者身份
如第2.4节 (https://arxiv.org/html/2608.28626#S2.SS4) 所述,稿件中移除了作者身份以进行匿名评审,同时移除了致谢和参考文献列表部分。对于高声望评审偏差测试,作者被分配到排名靠前的机构和相应的计算机科学系。对于低声望评审偏差测试,作者被分配虚构的机构隶属关系,其名称类似于小型机构。
#### 2.5.2稿件完整性
通过查找替换编辑向稿件注入了三类错误:A) 数字矛盾,即摘要或引言中的一个值被修改以与结果部分或表格冲突;B) 逻辑或趋势矛盾,即结论、数据集属性或效应方向被反转,而其他陈述保持不变;C) 图文不匹配,即图表描述被重写以与相应的图表矛盾。稿件的一个子集包含的错误在文本其他地方未出现,只能从图表中检测到。表2 (https://arxiv.org/html/2608.28626#S2.T2) 展示了这些错误类别内的子类型,以及原始和注入错误的示例。错误由LLM(Pixtral-Large-Instruct-2411)提出,然后通过自动化预筛选实施并验证。对错误进行了审查以确保评审员能够检测到。
#### 2.5.3评审提示设计
使用了两个提示:自然提示和验证导向提示。验证导向提示明确强调检查摘要数字与结果和表格的一致性,比较图表声明与图像,并确认图表和表格引用(例如“如图3所示”)对应与其描述一致的内容。
#### 2.5.4评审生成与评估流程
使用Qwen2.5-VL-72B-Instruct和Pixtral-Large-Instruct-2411生成评审意见,推理在8×A100 GPU上进行。评审意见以JSON格式存储,包含总体评分(1-10分)、带位置的详细优点和缺点、以及用于图表或表格批评的字段,该字段被指导在图表不可用时说明“无法评估”。每篇评审意见生成三次以减少随机偏差,最终分数计算为三次运行的平均值,温度为0.3,top-p值为0.9。
一个LLM编辑(Qwen2.5-VL-72B)对每对自然提示的评审进行裁决,做出接收或拒绝决定,该决定与平均评审员分数和会议决定进行比较。一个LLM评审员(Pixtral-Large)评估错误注入稿件的每一篇评审意见对每个注入错误,仅当评审正确识别了错误的位置和性质并有引用的证据支持时,才认为错误被检测到。评审员模型与一个评审员属于不同的模型家族,并且在不知道作者身份的情况下,对两个评审员的输出应用相同的评分标准。63份判断样本(在评审员模型、提示变体和裁决之间平衡)由一位作者独立重新评估,与两位评审员输出的协议率分别为92.1%(Qwen2.5-VL-72B为95.8%,Pixtral-Large为89.7%)。
#### 2.5.5统计分析
使用二项广义估计方程(GEE)\[liang1986longitudinal\]分析结果,按错误(145个簇)聚类以估计每个因子对错误检测概率的影响。此外,将每篇稿件的平均LLM分数与其平均人类评审分数进行了相关性分析。
表1:执行的实验及其比较。每个实验在所有适用稿件上使用两个评审员模型进行,共三次重复。每个组与仅在研究因子上不同的其他完全相同的组进行比较。表2:错误类别及其子类型。对于每个错误子类型,显示了原始文本的示例和相应的注入错误。
## 3结果
### 3.1评分与人类评审员的校准
图1 (https://arxiv.org/html/2608.28626#S3.F1) 显示了在匿名作者身份下,两个LLM和人类评审员对纯文本和文本加图表输入分别分配的平均评审分数。人类评审员对明确拒绝稿件的平均评分为3.4分,边缘稿件为5.4分,明确接收稿件为6.8分。相比之下,在匿名条件下,两个LLM分配的平均纯文本分数在所有稿件组中仅窄幅波动于7.0至7.2分之间。提供图表后,Qwen2.5-VL分配的分数范围从7.5到8.1分,而Pixtral-Large分配的分数在7.1到7.3分之间。提供图表使Qwen2.5-VL在所有稿件组中的分数提高了0.5至0.9分,Pixtral-Large提高了0.1至0.2分。获得人类平均分5.6分的“金标准”稿件,在文本加图表条件下达到了所有稿件组中最高的Qwen2.5-VL分数,为8.1分。
参考图注 图1:两个LLM和人类评审员对四组稿件的平均评审分数
### 3.2稿件错误检测
图2 (https://arxiv.org/html/2608.28626#S3.F2) 显示了在自然提示下,两个评审模型对145个已验证错误的检测率,按表2 (https://arxiv.org/html/2608.28626#S2.T2) 中列出的错误子类型分层。无效统计声明和p值错误检测率最高,Pixtral-Large的检测率分别为0.67(纯文本)和0.71(文本加图表),而Qwen2.5-VL为0.28和0.17。相比之下,Qwen2.5-VL几乎未检测到数字矛盾错误,纯文本为0.01,文本加图表为0.03,而Pixtral-Large的第二高检测率分别是0.36(纯文本)和0.20(文本加图表)。趋势反转错误在两个模型的两种输入条件下均未被检测到。当提供图表时,错误检测显著低于纯文本条件(比值比 = 1.53,\(p=7.9×10^{-7}\),GEE按错误聚类)。
参考图注 图2:Qwen2.5-VL和Pixtral-Large模型按错误子类型划分的错误检测比例
### 3.3验证导向提示的影响
图3 (https://arxiv.org/html/2608.28626#S3.F3) 显示了两个LLM在自然提示和验证导向提示下的错误检测率。验证导向提示将两个LLM的整体错误检测率从12.1%提高到22.2%(比值比 = 2.05,\(p=1.3×10^{-12}\));Qwen2.5-VL的检测率在文本加图表条件下从0.06增加到0.16,在纯文本条件下从0.11增加到0.22。对于Pixtral-Large,相似文章
大型语言模型中的稳定校准错误:高置信度错误的实用视角
本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。
大型语言模型中的置信度校准
本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。
多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象
本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。
Review Arcade:论LLM评审的人类对齐与可游戏性
本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。