同行评审已不堪重负——它能在人工智能时代生存吗?
摘要
文章探讨了同行评审系统如何艰难应对研究出版物和人工智能辅助论文的指数级增长,导致志愿审稿人不堪重负,并引发错误和延误,促使人们呼吁改革。
<p>杰森·森普里尼(Jason Semprini)对关于要求小学生接种人乳头瘤病毒疫苗的政策研究感到兴奋。HPV导致大多数宫颈癌病例,但反直觉的是,森普里尼发现强制接种政策并不能显著降低人群中宫颈癌的总体发病率。这很奇怪,但也不完全令人意外——我们知道强制接种疫苗可能会促使一些人想办法避免接种。</p>
<p>森普里尼撰写了这项研究并将稿件提交给了一家期刊,随后进入同行评审流程。同行评审是一个长期存在的流程,由该领域的其他研究人员评估研究的有效性,并就是否应该发表提出建议。这通常是匿名且基于志愿进行的。</p>
<p>在这个案例中,审稿人并没有分享森普里尼的兴奋。这可能源于对研究核心信息的误解:审稿人误以为森普里尼在质疑HPV疫苗本身是否能预防宫颈癌,而不是在研究旨在提高接种率的政策的有效性。“这两者有很大区别,”得梅因大学(Des Moines University)的卫生经济学家森普里尼说。</p><p><a href="https://arstechnica.com/science/2026/08/peer-review-is-overwhelmed-can-it-survive-in-the-ai-era/">阅读全文</a></p>
<p><a href="https://arstechnica.com/science/2026/08/peer-review-is-overwhelmed-can-it-survive-in-the-ai-era/#comments">评论</a></p>
查看缓存全文
缓存时间: 2026/08/10 14:31
# 同行评审不堪重负——在 AI 时代它还能存活吗?
来源:https://arstechnica.com/science/2026/08/peer-review-is-overwhelmed-can-it-survive-in-the-ai-era/
随着研究论文和 AI 辅助论文激增,志愿审稿人越来越难以应付。
[](https://cdn.arstechnica.net/wp-content/uploads/2026/08/peer-review-difficulties.jpg)
图片来源:Aurich Lawson | Getty Images
图片来源:Aurich Lawson | Getty Images
Jason Semprini 对自己关于“强制要求小学生接种人乳头瘤病毒疫苗”政策的研究感到兴奋。HPV 导致大多数宫颈癌病例,但出乎意料的是,Semprini 发现强制接种政策对降低人群总体宫颈癌发病率并没有太大作用。这很奇怪,但也不完全出人意料——我们知道强制接种疫苗会促使一些人想方设法避开它。
Semprini 写好了研究论文,并将稿件提交给一家期刊,随后稿件被送去进行同行评审。同行评审是一项历史悠久的流程,由该领域的其他研究人员评估研究的有效性,并就论文是否应该发表提出建议。这通常是匿名且志愿性质的。
在这次评审中,审稿人并不像 Semprini 那样兴奋。这可能源于对研究核心信息的误解:审稿人误以为 Semprini 是在质疑 HPV 疫苗本身是否能预防宫颈癌,而不是在研究旨在提高疫苗接种率的政策有效性。“这两者之间有非常大的区别,” 供职于得梅因大学的健康经济学家 Semprini 说。
通常情况下,论文会由两到三位专家审阅,因此如果其中一位理解有误,其他人可以补充澄清。但在这次案例中,只有一位审稿人,所以论文被拒了。
看到自己的工作因为审稿人没有仔细阅读而被搁置,Semprini 感到很沮丧,一些研究人员表示,这种经历正变得越来越普遍。在各个学科中,论文发表数量都在稳步上升。审稿人难以跟上步伐,整个系统似乎正在失灵。
例如,被 Scopus 和 Web of Science 数据库收录的论文数量最近正以每年 5.6% 的速度呈指数级增长(https://arxiv.org/pdf/2309.15884)。据一项估计(https://link.springer.com/article/10.1186/s41073-021-00118-2),全球研究人员每年总共投入相当于 15,000 年的时间用于同行评审——如果这些工作有偿支付,仅在美国完成的部分就需要花费 15 亿美元。研究人员越来越难以捐出这样的时间。
“我费尽千辛万苦才能找到审稿人,” Haseeb Irfanullah 说。他是 Wiley 旗下《Learned Publishing》的编委会成员,但他的评论仅代表他作为独立顾问的个人观点。Steven Mack 是《Human Immunology》的编辑,他最近不得不给大约三十位研究人员发邮件,才找到一位愿意审稿的人。他估计,五年前只需发五到十封邮件就能找到三位愿意审稿的人。在这种环境下,编辑把审稿任务分配给不合格或没有时间专心审稿的人,也就不足为奇了。
在大多数领域,研究人员需要同行评审的出版物来获得工作和资助,因此尽管系统变得“极其漫长而痛苦”,他们仍继续在其中艰难前行。这是怀特黑德研究所的微生物学家 Sebastian Lourido 的原话。
越来越多的人在倡导变革。与此同时,一些大胆的研究人员决定,传统出版系统已经不值得再投入了——尤其是 AI 研究领域,已经出现转向通过非常非正式的方式(如博客)来传播重大研究成果的趋势。
Semprini 说,同行评审是“科学的基石”。但在当下,“它并不稳固”。
## 比你想象的更年轻
尽管同行评审在当今研究文化中占据核心地位,但它作为学术出版的普遍特征,也仅仅只有大约 50 年的历史。圣安德鲁斯大学的科学史学家 Aileen Fyfe 说,早在 1800 年代初,科学学会就有审查投稿并评估其是否适合发表的机制,但其内部运作方式各不相同,而且当时整个研究的理念也完全不同。
“想象一下,贵国所有对天文学感兴趣的人——人数并不多——他们每周四晚上聚在一起聊天文,还共同出版一份期刊,” Fyfe 告诉我,以此说明早期评审时代的科学是什么样子。
研究人员是独立的绅士,而不是大学教授,因此发表论文与职业发展无关。此外,为期刊工作是和朋友一起做的一件有趣的事情,所以他们通常乐于志愿担任审稿人。
同行评审几乎是在偶然间变得普遍,它是作为解决品牌问题的一种方式出现的。20 世纪 70 年代,美国经济陷入低迷。通胀上升、就业下降、出现石油危机,美国国家科学基金会(National Science Foundation)面临公众要求其证明开支合理的压力。
这种压力之前是一段二战后的科学热情高涨时期,联邦资助增加了 25 倍。美国国家科学基金会自 20 世纪 50 年代以来一直使用外部评审人来评估拨款申请——这在当时很不寻常——而这后来成了它的救命稻草。因为由独立评审人组成的小组决定如何分配资金,他们的决定带有一种合法性光环。最终,正是这种合法性使得立法者没有将基金会的资金分配决策置于其直接政治控制之下。
“在很多方面,实际上是科学家向其他利益相关者进行的推销,才使同行评审成为科学基石,” 马里兰大学的科学史学家 Melinda Baldwin 说。
英国在 20 世纪 80 年代末和 90 年代初经历了类似的时刻,当时一些有争议的科学问题——从 HIV 到自闭症的成因再到冷聚变——引起了大量媒体关注。突然间,公众对区分合法科学与伪科学产生了兴趣,许多科学组织的回应是:“我们能分辨什么是真正的科学,因为真正的科学是经过同行评审的,” Fyfe 说。
如今,同行评审已成为标准做法。期刊编辑要求大学教授在承担大量其他专业职责的同时撰写评审意见,而且这些请求往往来得很快。Lourido 估计,他每月大约收到 10 个审稿请求,而实际上他只有时间完成一两个。Mack 作为加州大学旧金山分校的免疫遗传学家(同时兼任期刊编辑),每隔一两天就会收到一个审稿请求。
这种节奏部分是因为向期刊投稿的人比以往任何时候都多。但期刊的数量在 1960 年至 2020 年间也在激增(https://direct.mit.edu/qss/article/3/1/37/109076/Scopus-1900-2020-Growth-in-articles-abstracts),有些期刊还定期推出“特刊”(https://arxiv.org/pdf/2309.15884),邀请研究人员创作定制内容。许多期刊还发表更多论文,因为它们现在仅在线出版,编辑不必再把一期内容塞进有限的纸质版面。
研究也日益跨学科,这意味着许多研究需要更多的知识和时间来评审。而 AI 也加剧了(https://arstechnica.com/science/2025/12/llms-impact-on-science-booming-publications-stagnating-quality/)这种超负荷,因为它使研究人员更容易写出论文,也更容易让全球各地的人向英文期刊投稿。此外还有论文工厂,即向绝望的研究人员收费,让他们把名字挂到伪造的(但通常看起来像真的一样)出版物上。
所有这些不仅使维持同行评审质量变得困难,而且使评审能否进行本身都成了问题。“有时候我觉得我们需要开始讨论出版业的‘去增长’,” Irfanullah 说。“它已经疯狂增长。这是极不健康的!”
## 博客上位
AI 研究人员正深切感受到内容爆炸的压力。计算机科学家通常发表在会议论文集中,而提交到顶级 AI 会议的论文数量自 2019 年以来已经增加了两倍到十倍(https://icml.cc/virtual/2025/poster/40108#:~:text=1.,in%2520other%2520venues%2520as%2520well.)。因此,经常收到来自“就是对领域了解不够,无法做出评价或给出好建议”的人的评审意见,加州大学圣巴巴拉分校的计算机科学家 Haewon Jeong 说。
AI 研究人员处于有利地位,可以尝试一些不同的做法。他们的领域很新,发展极快,而且很多工作发生在学术界之外,因此许多研究人员不需要正式出版物来推动职业发展。在这样的背景下,博客已经兴起。“如今,经营一个优质博客几乎就像拥有一个优秀的播客频道,” Jeong 说。“你的声音会被极大放大,你会为人所知。”
许多博客是行业领袖写的,但也有一些学者加入了这一潮流。Flatiron Institute 的 AI 研究员 Helen Qu 非常厌恶会议投稿那种回报微薄又枯燥的过程,以至于她决定只在自己的新博客(https://helenqu.com/blog/posts/)上发布研究成果(她目前正在研究如何利用博弈论防止 AI 采取颠覆性行为)。
一个长期运行的博客名为 AI Alignment Forum(https://www.alignmentforum.org/),由广泛的研究者社区撰写,其中包括许多关注如何让 AI 安全且有益于人类的学者。AI Alignment Forum 不使用同行评审,而是采用一种允许成员对内容投赞成票或反对票并发表评论来解释其观点的机制。
当然,无法保证读者在投票时经过了充分思考。“这是它最大的弱点之一,” 运营 AI Alignment Forum 的 Lightcone Infrastructure 首席执行官 Oliver Habryka 承认。
另一方面,帖子获得的反应往往比在期刊上获得的那区区几份同行评审意见要多得多。而且读者在看到评论后可以改变自己的投票。AI Alignment Forum 尝试突出优质工作的另一种方式是,重新审视年度最佳内容,并要求成员撰写评论,探讨这些内容的时效性以及其中的主张是否仍然成立。
该体系相比传统出版有几个优势。首先,它要快得多、快得多,这在快速发展的领域尤为重要。通常,如果研究人员向传统期刊投稿,“等到你的东西通过同行评审时,它很可能已经过时了,” Habryka 说。
但在 Habryka 看来,AI Alignment Forum 一个更强大的优势是,投票系统将读者的注意力引向优秀研究以及反对它的论据。如果没有这样的机制,许多研究人员会依赖社交媒体来突出新成果。但这会让一个领域的关注点受制于公司,它们使用专有的、可能带有偏见且往往不透明的机制来决定突出展示哪些内容。“我真的不希望我的领域关注点被 Twitter 算法左右,” Habryka 说。
许多博客使用的口语化写作风格也能吸引关注,而这有利有弊。对 Qu 来说,这意味着当她发表在自己的博客上时,不必太过担心别人抢走她想法的功劳,因为没有人会像她那样为作品打上如此鲜明的个人烙印。而 Jeong 认为,这种通俗易懂的风格可以让复杂的概念更容易理解。“这本身就很有价值,” 她说。
但范德堡大学的哲学家 David Thorstad 警告说,易读性可能会以严谨性为代价,而且口语化的写作可能会让有魅力的人脱颖而出,而不管其工作质量如何。
Thorstad 说,脱离同行评审还可能导致你的工作被孤立。他研究长期主义:如何最好地保护未来的人类。最近,许多长期主义者都在关注如何防止 AI 导致人类灭亡,许多人将他们的工作发表在了 AI Alignment Forum 上。
这对 Thorstad 来说是个问题,他坚信同行评审,并且只在其使用同行评审的场所发表论文。引用未经同行评审的工作肯定会引起质疑,因为他自己的工作在那些场所也必须经过评审过程。这意味着他无法引用自己领域中很大一部分工作。“这非常受限,” 他说。
Habryka 说,五年前这是一个比现在更大的问题。如今,大多数学科的审稿人都接受有多种方式可以发表合法工作。“我认为,在一篇机器学习论文中,你真正想引用的东西里,最终真正经过正式同行评审的不到 50%,” 他说。
## 改变策略
由于同行评审仍然占用大量时间,许多研究人员正在寻找捷径来加快流程。Frontiers 期刊工作人员进行的一项调查(https://www.google.com/url?sa=t&source=web&rct=j&opi=89978449&url=https://www.frontiersin.org/documents/unlocking-ai-potential.pdf&ved=2ahUKEwiyhL2D1NmUAxWgkIkEHb-WITUQFnoECA0QAQ&usg=AOvVaw0KcQAZsxFkhH7x0jX9LzAX)发现,超过一半的同行评审人已经以某种方式将 AI 融入评审过程,这大概至少部分是为了这个原因。
总有一天,AI 生成的评审意见可能会被视为常规且有益。但目前,AI 的使用方式常常让研究人员感到恼火和不道德。例如,莱顿大学的语言学家 Marijn van Putten 最初很高兴收到一份评审意见,建议他在论文中引用一份特定的中世纪阿拉伯语手册,该论文讨论的是哪位古代宗教领袖对《古兰经》做出了特定诠释。“我当时想,‘太好了,我要去查一下!’”他说。
但他到处都找不到那份参考文献。最终,经过两天的搜索,van Putten 开始考虑另一种可能:AI 幻觉出了这份参考文献。他回头仔细查看评审意见,发现其中确实含有 AI 生成文本的特征,比如滥用破折号。他用 AI 检测工具运行了这段文本,工具告诉他这几乎可以肯定是 AI 生成的。“这非常令人沮丧,而且极大地浪费了我的时间,” 他说。
除了幻觉风险之外,将未发表的稿件上传到可能保留数据的聊天机器人也可能构成泄密,新墨西哥理工学院的哲学家 Chris ChoGlueck 说。本地运行的大语言模型或同意不保留数据的服务可以提供解决方案,但这要求那些表现出愿意走捷径的人也要有一定程度的谨慎。
今年,AI 会议 NeurIPS 将进行一项试验(https://neurips.cc/Conferences/2026/ai-reviewing-experiment),看看定制 AI 工具是否能在不完全取代审稿人判断的情况下帮助他们。例如,该工具可以帮助研究人员理解投稿并进行撰写评审所需的基础研究,但它不会撰写评审意见本身。
相似文章
对AI辅助同行评议的操纵给科学界带来新风险
一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。
关于AI评审员的局限与机遇:联合45位专家科学家评审Nature系列期刊论文的评审意见
一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。
会议审稿基础设施能否跟上因智能体工具而增加的非垃圾研究数量?[D]
文章讨论了AI工具如何加速真正的机器学习研究,导致像ICLR 2027这样的会议投稿增加,并质疑审稿基础设施是否能跟上,提出审稿人可能也需要使用AI工具。
AAAI的审稿人和组织者怎么了?[D]
一位研究人员抱怨AAAI同行评审的问题,包括未匿名的论文、类似AI的评审,以及组织者沟通不畅。
您对完全开放的审稿系统有何看法? [讨论]
文章主张转向学术界完全开放的审稿系统,以减少偏见、防止虚假声明并提高透明度,特别是为了应对AI生成的投稿和评审带来的挑战。