我标记了两篇有虚假作者的研究论文,结果都被接收为口头报告

Hacker News Top 新闻

摘要

一位审稿人讲述自己标记了两篇作者捏造但被接收为口头报告的论文,并报告称在其审阅的22篇投稿中,68%存在捏造引用、LLM生成内容或虚假作者列表。多项研究证实,仅2025年就有数万篇此类论文,且同行评审中AI生成的内容越来越多。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/30 22:52

# 来自垃圾论文战壕的问答 – GeoSpatial ML 来源:https://geospatialml.com/posts/reviewing-ai-slop/ 今夏,我们两人总共审阅了 22 篇论文投稿,分别来自 NeurIPS (https://neurips.cc/)、WACV (https://wacv.thecvf.com/) 以及 TerraBytes (https://terrabytes-workshop.github.io/)(ECCV 下的一个地理空间研讨会)。这 22 篇中有 15 篇(68%)要么包含完全虚构的引用、对现有论文伪造作者列表,要么明显是 LLM 生成的(例如,幻觉技术术语、无意义的写作、不相关的引用)。这就是所谓身处“垃圾论文战壕”(即处理 AI 垃圾论文炮台的输出)。这里我们抱怨这基本上是在浪费时间,对 LLM 在科学写作和评审中的现状做一个小型文献综述,让 Claude 为问答生成问题,并发布 Isaac 搞的一个`bib-audit`技能 (https://github.com/isaaccorley/skills/tree/main/plugins/bib-audit)。 下表显示了在该会议/期刊的总审稿任务中,出现伪造引用、伪造作者或明显是 LLM 生成写作的审稿任务数量。 | 会议/期刊 | Caleb | Isaac | |-----------|-------|-------| | NeurIPS(数据集与基准赛道) | 2 of 5 | | | NeurIPS(立场论文赛道) | 2 of 2 | | | TerraBytes(ECCV 研讨会) | 1 of 2 | 4 of 5 | | WACV | 3 of 4 | 3 of 4 | | **总计** | **6 of 11 (55%)** | **9 of 11 (82%)** | 我们绝对不是唯一身处垃圾论文战壕的人。在过去一年里,这个问题的规模已经通过各种方式被测量过。今年四月的一项《自然》分析 (https://www.nature.com/articles/d41586-026-00969-z) 发现,至少有数万篇 2025 年的出版物“很可能”包含无效的 AI 生成参考文献。Zhao 等人 (https://arxiv.org/abs/2605.07723) 对 arXiv、bioRxiv、SSRN 和 PubMed Central 进行了一项审计,估计仅在 2025 年就有大约 146,900 个幻觉引用,它们分散在许多论文中,而不是集中在少数不良行为者身上,早期职业研究者和小型团队最有可能包含这些引用。他们还发现评审并未捕捉到这些——他们追踪了包含幻觉引用的 bioRxiv 预印本到其出版版本,发现 85.3% 的幻觉仍然存在。《柳叶刀》的一项审计 (https://www.thelancet.com/journals/lancet/article/PIIS0140-6736%2826%2900603-3/fulltext) 涵盖了 250 万篇生物医学论文,发现至少包含一个伪造引用的论文比例在两年内增长了六倍,从 2023 年的每 2828 篇中有 1 篇,到 2025 年的每 458 篇中有 1 篇,并在 2026 年初达到每 277 篇中有 1 篇。Ansari (2026) (https://arxiv.org/pdf/2602.05930) 对实际发表于 NeurIPS 2025 的论文中抽取的 100 个幻觉引用进行了分析。每一个引用都通过了三到五位专家评审,而携带这些引用的 53 篇论文(约占录取数的 1%)至今仍存在于会议论文集中。 垃圾论文也是双向流动的。Pangram(一家拥有 AI 写作检测产品的公司)对 ICLR 2026 的评审进行了分析 (https://www.pangram.com/blog/pangram-predicts-21-of-iclr-reviews-are-ai-generated),发现 21% 的评审(多达 15,899 份!)完全是 AI 生成的,超过一半的评审涉及某种形式的 AI。Gartenberg 等人 (2026) (https://pubsonline.informs.org/doi/10.1287/orsc.2026.ed.v37.n3) 测量了《组织科学》期刊投稿量在 ChatGPT 后激增 42%,并发现其超过 30% 的同行评审现在使用了某种程度的 AI。ICML 2026 在投稿中隐藏了提示注入陷阱 (https://blog.icml.cc/2026/03/18/on-violations-of-llm-review-policies/),发现“795 篇评审(约占所有评审的 1%)由 506 位被分配到政策 A(禁止 LLM)的独特评审员撰写,被检测出在评审中使用了 LLM”。现在 NeurIPS 的评审已出,反驳正在涌入,我们看到了明显是 AI 生成的伦理评审,以及几个明显是 AI 生成的反驳。这出于很多原因是一个问题,其中一个原因是 AI 评审员可以直接被操纵——Li 等人 (2026) (https://arxiv.org/pdf/2606.10159) 发现,对抗性重写的摘要能够改善 AI 生成的评审结果,“而不改变论文的底层科学内容和交流方式,甚至无需知道评审模型”。他们最强的攻击在约 38% 的情况下成功,将 Gemini 3 Flash 评审员的接受评分提高了 +1.31,将 GPT 5.4 Mini 评审员的接受评分提高了 +0.88(基于 10 分制)。 所有这一切**从评审队列内部看来非常烦人**。同行评审是我们无偿从事的工作(通常在晚上和周末),因为对我们自己工作的同行评审非常有价值。花几个小时审阅一篇投稿,然后意识到其中有幻觉引用,这令人愤怒,因为这浪费了我们的时间!如果你没有花足够时间在自己的工作上,甚至不能正确列出参考文献,那么 a.) 我们为什么要花时间为你评审它,以及 b.) 你最初希望通过投稿达到什么目的?从评审中学习需要反思你的工作,为此你必须花时间在你的工作上。 **今年夏天你审了多少篇论文,其中多少篇仅凭引用你就想直接拒稿?** > **Caleb:** 十一篇(见上表)。其中五篇的参考文献列表中有伪造的作者和/或完整论文。在两篇 WACV 投稿中,参考文献 [1]——**参考文献列表中的第一项**——为真实论文列出了伪造的作者。有一篇 NeurIPS 论文有太多幻觉/无意义的术语(长达 53 页),以至于没有理由再去看它的参考文献。 > **Isaac:** 也是十一篇:两篇 NeurIPS 立场论文,五篇给 TerraBytes,四篇给 WACV。我十一篇中有九篇(!!!)。两篇立场论文都是 LLM 生成的垃圾论文,其中一篇充满了某个代理型疯子的胡言乱语。我分配的五个研讨会任务中,有四个包含伪造的引用或作者。老实说,唯一一篇人类写的论文非常平庸,但读起来没让我恼火,所以我给了它录用。 **你见过的最糟糕的事情是什么?** > **Isaac:** 有两篇投稿引用的论文我认识其作者,并把它们换成了虚构的研究者。论文、会议/期刊和其他作者都是真实的,而捏造的名字足够接近,以至于扫一眼时不会被发现。我建议拒稿并直接向组织者标记了它们。**两篇论文都被接受做口头报告,条件是它们只需修复幻觉引用……** > **Caleb:** 我提到了那篇 53 页的 NeurIPS 论文,到处都是幻觉术语。还有一篇 40 页的也好不到哪去(同样有编造的引用)。其中一篇还在大多数引用旁边嵌入了 LLM 的笔记,这挺搞笑的。之后我花了不少时间审阅了一篇我认为还不错的 WACV 论文,但随后注意到它将 SatMAE 的作者列为“Yuyang Cong, Saurabh Khanna, Chen Meng, et al.”。真实的 SatMAE 作者列表以 Yezhen Cong、Samar Khanna 和 Chenlin Meng 开头 (arXiv:2207.08051 (https://arxiv.org/abs/2207.08051))。 **真实论文上的伪造作者与完全伪造的参考文献:哪个更糟糕?** > **Caleb:** 两者都表明作者没有花时间正确引用某物,并对其是否真正读过所引用的工作(以及是否正确引用)提出质疑,同时也对论文的其他部分可能有多少是幻觉产生疑问。 > **Isaac:** 在我看来,它们是一回事。如果作者懒得读自己的参考文献,或者懒得把它们喂给 ChatGPT 并提示“确保我的参考文献不是假的”,我凭什么期望论文的其余部分、代码和作者创建的数据集不是同样的情况?现在生成结果和写论文比以往任何时候都容易,但仔细审阅一篇论文(甚至包括你自己的)仍然需要几个小时。如果作者没有花时间读自己的论文,我为什么要读?带有幻觉引用的论文应该直接被拒稿,因为它们显然还没有准备好被接收。 **按可靠性排序,你判断“这是 LLM 写的”的三个最佳指标是什么?** > **Caleb:** 1.) 常见的 LLM 短语,如“不是 X,而是 Y”、“真正的 X 是 Y”,到处是粗体格式和破折号;2.) 非常密集、难以解析的句子;3.) 过度吹捧结果。 > **Isaac:** 通常我发现论文的文字或段落中的数字或指标与表格不一致。这种情况发生在作者写作后重新运行实验,却忘了提示代理更新或验证结果在各处是否匹配。似乎没人会重读自己的论文。另外,Claude 非常喜欢把所有可能的数字和细节浓缩到正文中,甚至包括应该在附录或代码中引用的细节。当你提示代理写讨论部分时,它常常只是逐字重复表格中的指标,而不添加任何原创思考。这些比成群的破折号、分号和“不是 X,而是 Y”更微妙,但它们与 ChatGPT 时代(B.C.)之前的论文写作差异太大。 **因为所有这些,你的审稿工作流程发生了怎样的变化?** > **Caleb:** 现在我在读完摘要后肯定会立即扫一遍参考文献(并且会使用我们制作的`bib-audit`技能)。 > **Isaac:** 现在我花更多时间寻找 LLM 的迹象,只是为了弄清楚如何直接拒稿。我假定大多数论文是恶意提交的。每个人都输了。我在寻找:LLM 声称用某个定制模型达到了 SOTA,而增益 <1% 且没有多次运行的均值或标准差;用数学公式代替引用;本应在附录的消融实验;与表格不匹配的正文数字。实际上,我现在想想,除了幻觉引用,其他方面和审阅人类写的垃圾论文相比没什么变化。然而,可读的、像样的人类写论文或有趣的论文数量显著减少了。 **你的审稿时间有多少花在评估科学内容上,有多少花在搜寻 LLM 痕迹上?这可持续吗?** > **Caleb:** 除了检查参考文献和大致判断“这看起来是否直接是 LLM 输出”之外,我并没有刻意*搜寻* LLM 痕迹。如果我看不出它是 LLM 写的,我就不太在意。如果你用 LLM 协助写论文,而且你的论文有趣、实验有效(可复现),那就太好了!如果你提交的是 LLM 的直接输出,那我们到底在干什么? > **Isaac:** 同上,我更关注的是:我觉得这篇论文完全是胡说八道,还是对于它投稿的会议来说足够有趣?没什么深刻的,这只不过是在浪费我的时间。现在评审工作更多了,因为会议规定如果你投稿就必须评审 4-5 篇论文。我基本上是在枪口下审阅垃圾论文。感觉像是活在某层地狱里。 **诚实点:你们俩都用 Claude 做研究和写作。你们的使用方式和在这些投稿中看到的有什么区别?** > **Caleb:** 当然,我们每天都在用,这篇博文并不是在说*不要用 LLM*。这个博客的很多内容最初是由某种代理起草的,但我们会仔细检查所有输出:验证、编辑、完全重写等。实际上,我用了 Claude 来开始本文顶部的文献综述,但我仔细阅读了它找出的论文/博文(被那篇关于对 LLM 评审员进行对抗性攻击的论文 (https://arxiv.org/pdf/2606.10159) 吓了一跳),以对我有意义的方式组织它们,从 Claude 最初引用的博文中提取出原始研究,并剪掉了一堆我认为不直接相关的额外细节。学习本身就是写作的乐趣之一! > **Isaac:** 我在提交前实际上会仔细读自己的论文,所以像这样的小细节不会出现。如果有东西漏过去了,那是我的责任,但你需要费很大劲才能找到。不过,即使是在 LLM 出现之前,这也是我一直以来的做法。我发现一个有用的技巧是让 Claude 找出任何含糊之处,然后用选择题来采访我以获得清晰度,这样在它协助我写作时我们就能保持一致,这一点至关重要。对于参考文献,我会运行`bib-audit`,但我仍然会手动用 Google Scholar 和/或其他数据库(如 IEEE/CVF 等)逐一检查。不过大多数甚至不需要查,因为我通过几年写作积累了一个 Zotero 的真实 BibTeX 库,可以直接复制粘贴。尽早获得他人反馈非常关键,有助于确保想法及其表达适合人类消化。要乐于在草稿中期彻底重写你的文章。理想情况下,它会在截止日期前收敛到合理状态——我确信那种匆忙导致了这些最后一刻的 LLM 论文。最重要的是在 LLM 出现前就培养出某种研究品味。我无法想象现在作为年轻研究者,在 LLM 如此盛行的情况下盲目摸索会是什么样子。 **在论文写作中,“让 Claude 保持受控状态”实际上是什么样的?你需要反复纠正什么?** > **Isaac:** Caleb 和我说过回去读 LLM 之前的视觉论文,那里的讨论听起来像一个有思想的真人。代理式写作太密集了,即使你提示它 100 遍“让我的论文流畅且无误”,它也不流畅。少用破折号和分号。Fable 5 现在喜欢滥用冒号而不是破折号,并且不知为何倾向于生成 B2B SaaS 营销语言,可能是因为它的通用训练。我认为需要在不太生硬或平淡之间取得平衡,因为我们希望领域外的人也能真正读懂我们的论文,而听起来过于聪明并不好读。最近对我有效的一个方法是使用一种介于科学写作和 ASD-STE100 简化技术英语 (https://en.wikipedia.org/wiki/Simplified_Technical_English) 之间的技能。 > **Caleb:** 对 Isaac 的回答没什么要补充的。当你写论文、博文或任何东西时(无论是否有 LLM 协助),你需要知道你想说什么**以及**你的受众是谁。一旦你知道这些,你需要为那个受众格式化你的信息。默认情况下,Claude 和它的朋友们有一种特定的写作风格,并不太适合科学受众。你有没有试过用 LLM 起草一封邮件,然后想“等等,我不想发这个,这不像是我的风格”(因为收到的人会因为写作风格而质疑它)?把 LLM 输出粘贴到科学手稿中**基本上**是同一回事。如果我看到大量粗体格式、枚举列表、Isaac 所说的“营销语言”等,那么我就会质疑内容的来源,就像假设中的邮件接收者会做的那样。 **会议是否应该要求披露 LLM 的使用?这会改变什么吗?** > **Caleb:** 要求披露——也许吧。改变什么——可能不会。再说一次,如果你用 LLM 写一篇很棒的研究论文,结果经得起检验,并且可复现,那我完全支持!我不喜欢的是被要求花时间给某个连自己都没花时间的东西提供反馈。我们需要想办法把那种东西从投稿池中过滤出去。 > **Isaac:** 我对披露要求非常怀疑。它们对善意的人有用,但大多数人不会诚实使用。我们给 TorchGeo 添加了一个 AI 政策,分级如下...

相似文章