大语言模型威胁双盲评审

arXiv cs.CL 论文

摘要

本文证明,仅凭标题和摘要,大语言模型就能有效解除科学论文作者匿名,从而威胁到双盲同行评审的有效性。作者认为,问题框架和研究焦点中的稳定模式构成了作者身份的潜在概念特征,这要求我们在人工智能增强的研究生态系统中重新评估匿名实践。

arXiv:2608.05157v1 公告类型:新 摘要:双盲同行评审是科学界对抗身份和隶属关系偏见的主要手段。其有效性依赖于这样一个假设:匿名稿件在展示科学价值的同时不会泄露作者身份。虽然作者身份通常可以通过引文网络或文体特征来恢复,但我们表明,在大语言模型(LLM)存在的情况下,这一假设日益脆弱。仅使用模型训练后发表的论文标题和摘要,我们发现大语言模型比人类更高效地瓦解了匿名性,将置信度集中到从五位领域专家候选池中抽取的少量可能作者上。即使排除了文体和书目线索,这种脆弱性依然存在,表明问题框架和研究焦点中的稳定模式充当了作者身份的潜在概念特征。这些发现共同表明,双盲评审易受自动化语义推理的影响,这要求我们重新评估在人工智能增强的研究生态系统中如何维持匿名性和公平性。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:49

# 大语言模型威胁双盲评审
来源:https://arxiv.org/html/2608.05157
Prasenjit Mitra卡内基梅隆大学非洲校区,基加利,卢旺达

## 摘要

双盲同行评审是科学界抵御身份和机构偏见的主要防线。其有效性建立在这样一个假设之上:匿名化稿件在传递科学价值的同时不会暴露作者身份。虽然通过引用网络或文体标记通常可以恢复作者身份,但我们表明,在大语言模型(LLM)存在的情况下,这一假设正变得越来越脆弱。仅使用模型训练后发表的论文标题和摘要,我们发现LLM比人类更高效地瓦解匿名性,其信念会集中到从五名领域专家候选者组成的小集合中选出的少量可能作者身上。即使排除文体和文献计量线索,这种脆弱性依然存在,这表明问题框架和研究焦点中的稳定模式起着作者身份潜在概念签名的作用。综上所述,这些发现表明双盲评审容易受到自动化语义推断的攻击,因此有必要重新评估在人工智能增强的研究生态系统中如何维护匿名性和公平性。

## 1 引言

双盲同行评审是促进科学出版公平性的基石2 (https://arxiv.org/html/2608.05157#bib.bib4),16 (https://arxiv.org/html/2608.05157#bib.bib20)。它在多个学科中被广泛采用,尤其是在社会科学、计算机科学、人文学科、教育学、管理学和商业研究领域1 (https://arxiv.org/html/2608.05157#bib.bib29),23 (https://arxiv.org/html/2608.05157#bib.bib30)。通过隐藏作者身份,它旨在减轻与声誉、机构隶属关系和先前可见性相关的偏见,使稿件能够仅凭科学价值接受评判11 (https://arxiv.org/html/2608.05157#bib.bib17)。这一体系建立在一个基本假设之上:匿名化提交的稿件不包含足够的信息来可靠地揭示作者身份,因此不易被揭开。这一假设支撑着整个科学事业中大量的匿名化指南和评审政策。

先前的研究表明,当存在丰富的文本或结构信息时,作者身份通常可以被恢复19 (https://arxiv.org/html/2608.05157#bib.bib22),22 (https://arxiv.org/html/2608.05157#bib.bib23)。经典和现代归因方法表明,文体模式、词汇规律,尤其是文献计量和引用结构,可以编码强烈的身份信号2 (https://arxiv.org/html/2608.05157#bib.bib4),4 (https://arxiv.org/html/2608.05157#bib.bib6),13 (https://arxiv.org/html/2608.05157#bib.bib19),16 (https://arxiv.org/html/2608.05157#bib.bib20)。这些发现推动了越来越严格的匿名化实践,重点是移除命名实体、机构和自引3 (https://arxiv.org/html/2608.05157#bib.bib5),24 (https://arxiv.org/html/2608.05157#bib.bib25)。然而,此类结果大多依赖于宽泛或约束较弱的候选池,其中主题错配和残留元数据主导着推断6 (https://arxiv.org/html/2608.05157#bib.bib10),12 (https://arxiv.org/html/2608.05157#bib.bib18)。当表层线索被移除且推断仅限于密切相关的领域专家时,匿名化是否真正消除了有意义的作者身份信号?

大语言模型(LLM)的最新进展提出了一种可能性:匿名化在更深的语义层面是脆弱的,去匿名化可以快速且以最少精力完成5 (https://arxiv.org/html/2608.05157#bib.bib9),7 (https://arxiv.org/html/2608.05157#bib.bib13),18 (https://arxiv.org/html/2608.05157#bib.bib21)。虽然审稿人通常不会费心去识别作者,因为需要大量时间或精力的行为不太可能被采取,但LLM触手可及的广泛可用性降低了这一障碍。有了这些易于获取的工具,审稿人可以在几秒钟内通过快速查询推断出可能的作者身份。这种易得性可能改变与潜在审稿人行为相关的基本平衡。

与早期的归因方法不同,现代LLM以高维表示编码科学文本,捕捉细粒度的概念关系。因此,身份泄露可能并非来自明显的文体标记或文献计量痕迹,而是来自研究者如何框定问题、界定贡献范围以及在领域内定位自身工作的潜在规律26 (https://arxiv.org/html/2608.05157#bib.bib27)。然而,现有的基于LLM的作者身份推断研究并不可靠,因为它们明显依赖可识别的文本线索,且模型训练数据与评估样本之间缺乏明确的时间隔离10 (https://arxiv.org/html/2608.05157#bib.bib16),27 (https://arxiv.org/html/2608.05157#bib.bib28)。

在本工作中,我们评估LLM是否能在审稿人对作者身份可能有一些猜测的情况下,对论文作者进行去匿名化。仅使用模型训练数据截止日期17 (https://arxiv.org/html/2608.05157#bib.bib1),14 (https://arxiv.org/html/2608.05157#bib.bib2),9 (https://arxiv.org/html/2608.05157#bib.bib14),25 (https://arxiv.org/html/2608.05157#bib.bib26)之后发表的论文标题和摘要,并将推断限制在由五名合理领域专家组成的小集合内,我们发现匿名性无法维持。人类研究者仅达到11%的top-1准确率,而大语言模型在相同条件下达到42%,提高了近四倍。这一性能差距表明,即使在密切相关的领域专家候选者中,最少的科学文本也包含人类审稿人无法可靠检测、但语言模型可以利用的持久作者身份信号,这对双盲同行评审的匿名性保证构成威胁。这些发现表明,双盲评审在现代语言模型面前面临结构性局限,促使我们重新审视当代同行评审中如何维护匿名性和公平性。

## 2 结果

我们分析了从Semantic Scholar API21 (https://arxiv.org/html/2608.05157#bib.bib31)获取的超过12,000篇科学论文语料库,涵盖广泛的研究领域,发表于2024年至2025年之间。我们选择在此时间之前训练的LLM,以确保LLM不是通过死记硬背复述论文作者姓名,从而保证与所评估模型17 (https://arxiv.org/html/2608.05157#bib.bib1),14 (https://arxiv.org/html/2608.05157#bib.bib2)的已知训练数据没有重叠。在每次试验中,推断在包含五名作者的候选池上进行,其中四名候选者以两种方式构建:一种是从通过Semantic Scholar API21 (https://arxiv.org/html/2608.05157#bib.bib31)获得的大型随机作者池中抽取,另一种是从通过Semantic Scholar推荐API20 (https://arxiv.org/html/2608.05157#bib.bib3)和OpenAlex API15 (https://arxiv.org/html/2608.05157#bib.bib32)获得的领域专家作者中抽取,候选者中恰好有一位是真实作者。对于每篇论文,我们考虑真实作者的多种定义:(i)最后一位作者,作为我们的主要基线;(ii)最资深的作者;(iii)最资浅的作者。这种设计确保我们的发现不依赖于单一、可能因学科而异的作者重要性概念。模型对候选者中的可能作者进行排序,并分配对数概率,解释为相对信念分数,该分数被聚合成具有置信度感知的嫌疑人集合*定义为满足累计概率分数超过给定阈值\(\tau\)τ的最小候选者集合*。上述阈值*是一个置信度水平,表示需要覆盖的总概率质量的目标比例*。例如,在概率阈值\(\tau\)τ为0.9时,嫌疑人集合包含组合置信度分数达到90%的最小作者组,以确保真实作者很可能被包含在内。这种表述不仅捕捉了真实作者是否被优先考虑,还捕捉了随着置信度增加,有效匿名性崩溃的速度。

### 2.1 人类作者身份推断显示出有限的选择性

我们首先评估人类在仅限标题和摘要的最少科学内容中推断作者身份的表现。为了建立有意义的人类基线,我们招募了来自一所全球排名机构(嵌入国际研究联盟网络)的二十名研究生研究员。所有参与者都是活跃研究者,在机器学习和相关领域从事并发表研究多年,隶属于学术界和工业界的多元机构。他们的领域专长确保了人类评估反映的是知情且研究活跃的科学家的判断,为评估模型性能提供了强大且知情的人类基线。

他们参与了一项封闭集合的概率归因任务,每位参与者评估机器学习文献中的五篇论文,以标题-摘要对的形式呈现。对于每篇论文,参与者看到一个由五名作者组成的候选集合,其中包含一位真实作者和四名领域专家干扰项,这些干扰项使用与模型评估相同的程序选择。参与者为每位候选者分配置信度分数,反映他们对该候选者是论文作者的信念。这些分数事后归一化,形成候选集合上的概率分布,从而能够在不同阈值τ下计算top-k准确率、平均倒数排名(MRR)以及具有置信度感知的嫌疑人集合。

人类在精确归因方面的表现有限。真实作者仅在11%的案例中被排在第一(表1 (https://arxiv.org/html/2608.05157#S4.T1))。排名质量仍然较低,整体平均倒数排名(MRR)为0.36(95% CI: [0.31, 0.41]),表明正确作者并未被持续优先考虑。在中等置信度阈值(τ=0.5)下,平均嫌疑人集合包含约1.94个候选者(共五个)(表2 (https://arxiv.org/html/2608.05157#S4.T2))。这表明参与者倾向于将概率质量分散到多个可能作者身上,而不是将信念集中于一个占主导地位的候选者。尽管准确率有限,参与者还表现出相对中等的置信度(均值=0.49),以及较弱的期望校准误差(ECE=0.37),表明存在不确定性倾向。

总体而言,这些结果表明,当仅限于摘要级信息时,人类判断表现出有限的选择性和不确定性,反映出在语义相似的候选集合中(干扰项来自领域相关作者)隔离作者身份信号的难度。相对较低的MRR及其置信区间进一步表明,这种行为在标注者之间是一致的,并非由少数异常值驱动。

### 2.2 LLM实现高效的匿名性崩溃

接下来,我们评估大语言模型是否能在相同条件下改进人类作者身份推断。与人类研究一样,模型仅获得标题和摘要,并被要求对固定的一组五名语义受限的候选作者进行排序并分配置信度分数。

使用Qwen2.5-72B模型时,匿名性恶化。我们观察到,与人类判断相比,概率质量在合理候选者上的集中程度更强,真实作者经常出现在嫌疑人集合中。该模型的top-1准确率达到42.34%,显著优于人类的11%(表1 (https://arxiv.org/html/2608.05157#S4.T1))。

该模型在排名质量上优于人类评估者,MRR达到0.623(95% CI: [0.617, 0.629]),而人类为0.36。这一改善具有统计学显著性(Wilcoxon p<0.001),效应量大(Cliff's δ=0.52)。排名分数的分布存在显著差异(KS检验,p<0.0001),表明推断行为出现整体上移。

更重要的是,在中等置信度阈值50%(τ=0.5)下,模型将平均嫌疑人集合保持在1.95个候选者,同时在61.6%的情况下保留真实作者,几乎是人类的三倍,展示了在更好的期望校准误差(ECE: 0.30)下缩小可能作者池的能力(表2 (https://arxiv.org/html/2608.05157#S4.T2))。这表明模型的概率估计与经验正确性更加一致,意味着模型预测比人类的不确定性更可靠。

稳健性检查证实,这些结果并非提示或解码的产物。移除置信度评分并仅要求模型生成候选者的排序列表,性能保持稳定,top-1准确率约为40%(表1 (https://arxiv.org/html/2608.05157#S4.T1)),表明归因性能并不依赖于概率校准或评分。打乱候选顺序并将解码温度从0.0提高到0.3没有产生显著变化(表1 (https://arxiv.org/html/2608.05157#S4.T1)),表明其不依赖于位置偏差或确定性解码。

总体而言,这些发现揭示了推断策略上的质性差异:人类将置信度分散到多个合理候选者身上,而语言模型更有效地集中概率质量,从而在可比的不确定性水平下实现改进的排名和更高的召回率*定义为真实作者被包含在嫌疑人集合中的试验比例*。在操作层面,这些结果表明,即使在理想化地遵守双盲评审指南的情况下,科学文本也包含足够的潜在信息,可以将作者身份缩小到一个小的、高置信度的子集,从而在同一领域的作者之间进行区分。

### 2.3 匿名性侵蚀在多个模型中持续存在,但会在主题混淆下退化

第三,我们考察所观察到的匿名性崩溃是否是模型特有的,以及它如何依赖于干扰项候选者的构建方式。为此,我们在相同条件下评估独立训练的大语言模型,包括Qwen2.5-72B和LLaMA3-70B:输入仅限于标题和摘要,候选池为五名作者,其中干扰项是研究密切相关主题的领域专家。我们考虑了多种构建领域专家干扰项的策略。在一种设置中,候选者通过Semantic Scholar推荐20 (https://arxiv.org/html/2608.05157#bib.bib3)获取;在另一种设置中,候选者通过OpenAlex15 (https://arxiv.org/html/2608.05157#bib.bib32)获取。虽然两者都旨在识别主题相似的作者,但这些来源在检索特征和候选者质量方面有所不同8 (https://arxiv.org/html/2608.05157#bib.bib33)。

在各个模型中,我们观察到一致的匿名性侵蚀,以召回率与平均嫌疑人集合大小之间的权衡来衡量(表2 (https://arxiv.org/html/2608.05157#S4.T2)),其中Qwen2.5-72B和LLaMA3-70B的top-1准确率分别接近42%和40%(表.1 (https://arxiv.org/html/2608.05157#S4.T1)),并且具有相当的判别性能AUC-ROC约为

相似文章

论匿名化对大型语言模型性能的影响

arXiv cs.CL

本文系统性地实证研究了在大型语言模型中匿名化输入数据时隐私与性能的权衡,发现匿名化会降低性能,且影响因模型能力和任务类型而异。

网络匿名已悄然消亡,却无人提及

Reddit r/singularity

本文表明,大型语言模型可以通过跨平台匹配非结构化文本,对化名在线账户执行完全自动化的大规模去匿名化,在90%精确率下实现高达68%的召回率,使先前的实际匿名性变得过时。

人工智能在在线评论中的作用

arXiv cs.CL

本文介绍了一种实证方法,用于衡量大型语言模型供应冲击对在线评论的影响,发现未经验证的评论向更负面方向转变,并且出现活动激增,表明人工智能正在重塑平台动态。

对AI辅助同行评议的操纵给科学界带来新风险

arXiv cs.CL

一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。