AI 反复引用相同的论文——就像人类一样
摘要
这篇文章讨论了像ChatGPT这样的AI工具如何通过反复引用热门论文,强化科学引用中的马太效应,类似于人类行为,这可能阻碍研究创新。
暂无内容
查看缓存全文
缓存时间: 2026/08/24 13:35
# AI 重复引用相同论文——与人类如出一辙
来源:https://www.unite.ai/ai-cites-the-same-papers-over-and-over-again-just-like-humans/
**ChatGPT及其他AI写作工具或许正在悄然将科学转变为一场人气竞赛,它们不断引导研究者关注相同的论文,却忽视了那些可能真正推动领域发展的新颖前沿研究。**
在频率与统计的语境下,**单一化**指的是同一有限来源或资产反复出现,淹没新兴声音与新鲜视角:电台编排中反复播放的有限歌曲(https://archive.is/E0aEx);机场书架上集中陈列的同一批作者与书籍(https://www.publishersweekly.com/pw/print/20191104/81637-is-publishing-too-top-heavy.html);以及超市里千篇一律的有限果蔬品种(https://projects.research-and-innovation.ec.europa.eu/en/horizon-magazine/rise-and-fall-monoculture-farming):
是的,我们有这些香蕉,且仅有这些香蕉。来源:https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f*是的,我们有这些香蕉——且只有这些香蕉。西方食品链中水果蔬菜的同质化,忽略了每个类别中数百种其他可能性,因为各类水果或蔬菜的生产运输链成本过高,难以实现多样化工业生产。* 来源(https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f)
这种现象同样出现在新兴科研论文的**引用**(https://www.unite.ai/citations-can-anthropics-new-feature-solve-ais-trust-problem/)中。研究者们或许出于怠惰,默认引用那些"可靠"的来源,这些来源由此获得势能,直至开始主导某些研究脉络。
这被称为**马太效应**(https://web.archive.org/web/20110611105442/http:/www.garfield.library.upenn.edu/merton/matthew1.pdf)——一种社会学理论,指出**既有优势者总将获益**;该综合征被比作《马太福音》13章12节中的承诺,其中写道(https://biblehub.com/matthew/13-12.htm#:~:text=Whoever%20has%20will%20be%20given%20more%2C%20and%20they%20will%20have%20an%20abundance%2E%20Whoever%20does%20not%20have%2C%20even%20what%20they%20have%20will%20be%20taken%20from%20them)**"凡有的,还要加给他,叫他有余;没有的,连他所有的也要夺过来。"**
## 圈内宠儿
AI增强研究的一个**伟大愿景**(https://link.springer.com/article/10.1007/s11257-024-09406-0)曾是:新型机器学习方法有望突破马太效应——亦称**流行度偏见**(https://www.unite.ai/why-ai-isnt-providing-better-product-recommendations/#:~:text=inclines%20search%20systems%20towards%20long%20term%20popularity%20bias%2C%20where%20obviously%20popular%20results%20are%20pushed%20towards%20end%20users%20that%20are%20unlikely%20to%20be%20enthused%20by%20them)——转而引用那些可能更具洞察力、或更契合论文论点的冷门著作。
然而,基于AI训练流程对数据集的解读方式,这种乐观从未有充分依据;大量研究反复表明,当AI并非**凭空捏造引用**(https://www.unite.ai/ai-generated-language-is-beginning-to-pollute-scientific-literature/#:~:text=Citation%20Failures)——这是迄今**长期存在的难题**(https://www.unite.ai/the-perils-of-using-quotations-to-authenticate-nlg-content/)——它确实在**延续**(https://pubmed.ncbi.nlm.nih.gov/18635800/)马太效应,与人类行为一致,尽管原因可能不同。
训练期间,模型会学会高度评价数据集中被引用最多(或"重复最频繁")的论文,因为训练流程旨在提取有意义的模式,并将异常值视为"噪音"或统计离群点加以**抑制**(https://www.unite.ai/simple-linear-regression-in-the-field-of-data-science/#:~:text=The%20problem%20of%20data%20outliers%20is%20also%20very%20common%2E%20Outliers%20are%20considered%20to%20be%20wrong%20values%20that%20do%20not%20match%20the%20exact%20data)。
在此机制下,等同于爱因斯坦相对论的理论永远不会获得机器的关注——训练完成后的模型自认已掌握基本原理与参照物,仅能通过**检索增强生成(RAG)**(https://www.unite.ai/what-is-retrieval-augmented-generation/)或其他扩展模型训练矩阵边界的方式,对新文献进行轻微调整。
问题在于,它不会像对待已知的"旧爱"那样认可这些新作品,甚至完全无视,因为其统计偏见此时已根深蒂固。
因此,AI延续马太效应并非在观察模仿人类行为——它只是统计研究者们惯常默认引用的相同旧论文次数,并同样给予这些论文高排名。就此而言,引用重复的问题与从**爆炸式增长**(https://www.unite.ai/the-survey-paper-ddos-attack-thats-overwhelming-scientific-research/)的AI研究出版物中**甄选**(https://www.unite.ai/can-ai-develop-a-nose-for-news/)真正有趣的科学论文这一挑战相关,因为最具突破性的工作往往信号最弱。
## 诊断单一化
一篇来自美国的**新颖研究论文**(https://arxiv.org/pdf/2608.19230)探讨了此问题,标题为**《当AI写作时,谁被引用?语言模型引文单一化的证据》**。这项由德克萨斯大学奥斯汀分校、史蒂文斯理工学院、圣路易斯华盛顿大学、莱斯大学及圣母大学合作的新研究,旨在确证机器学习中引文单一化的存在,以便未来能直接针对该变量及问题本身采取应对措施。
测试中,作者发现来自OpenAI、谷歌和Anthropic的十一个模型反复偏爱**同一小群论文**——即便已剥离明显的流行度信号。
为测试这一点,120篇真实论文被移除引用次数和发表平台信息,作者姓名被替换,发表年份随机重分配。随后向每个模型展示随机抽取的三十篇论文,限制引用不超过十篇。
八位相关领域的人类专家获得了相同的盲化论文,但并未与AI选择相同的热门文献,表明偏见**特异于AI模型**而非论文本身:
来自新论文的测试结果,对比AI模型与人类专家的引用选择。所有十一个模型的引用均集中在更小的论文群,而部分论文被完全忽略。人类专家未表现出此倾向。来源 - https://arxiv.org/pdf/2608.19230*来自新论文的测试结果,对比AI模型与人类专家的引用选择。所有十一个模型的引用均集中在更小的论文群,而部分论文被完全忽略。人类专家未表现出此倾向。* 来源(https://arxiv.org/pdf/2608.19230)
即使模型仅被要求选择参考文献(而非撰写综述),相同的论文仍保持热门,表明撰写综述本身**并非**导致偏见的原因。
随后实验扩展至十一轮,每轮后添加120篇AI撰写的论文,以测试当这些共同偏好在不断增长的AI生成研究池中运作时会发生什么。
随着更多AI撰写论文的加入,模型日益将引用集中在数量递减的原始人类论文上。
作者指出:
**"随着语言模型从草拟文本转向运行带有工具调用的文献搜索代理,伪造引用正变得更易发现和约束。**
**"更深层次的失败始于每个候选引用均为真实文献之时:不同模型仍可能选择相同的狭窄子集,在无任何引用错误的情况下制造引文单一化。"**
论文提出,关于该问题的补救措施,仅混合不同供应商的模型或给予论文均等曝光度是不够的,因为许多偏好是跨模型共有的。相反,**对特定论文的底层偏好**需要改变——或许可通过刻意提升被忽视论文的显著性。然而,作者强调此方法尚未经过检验。
## 测试方法
基准测试集由从arXiv收集的120篇真实知识蒸馏论文构成,发表于2015至2022年间。每篇论文收集时的引用次数在50至500次之间,此范围旨在排除冷门及影响力超常的著作。
实验首先从可用文集中随机抽取三十篇论文,隐藏作者姓名、发表年份和引用次数。每个模型生成一篇引用不超过十篇论文的短评或立场文章,其选择与相同材料的随机选取进行对比:
用于测试引用偏好的方法示意图。向模型展示随机选取的30篇隐藏识别信息的论文,之后可引用最多10篇。其选择与随机选择进行对比,同时每轮向次轮文集添加120篇AI撰写论文。*用于测试引用偏好的方法示意图。向模型展示随机选取的30篇隐藏识别信息的论文,之后可引用最多10篇。其选择与随机选择进行对比,同时每轮向次轮文集添加120篇AI撰写论文。*
在扩展实验中,每轮后新增120篇生成论文,逐步提高AI撰写研究的比例。
初步测试中,模型倾向于引用大部分展示的论文,通常从30篇中选择22至27篇。因此研究人员在主实验中设置最多十篇引用,迫使模型做出更具选择性的决策。
以下为最终实验设计的概览:
用于测试引用偏好的实验设置。研究始于120篇真实论文,测试来自三家供应商的十一个模型,使用随机化的30篇论文集和最多十篇引用。后续轮次添加AI生成论文,使文集扩大至1440篇。*用于测试引用偏好的实验设置。研究始于120篇真实论文,测试来自三家供应商的十一个模型,使用随机化的30篇论文集和最多十篇引用。后续轮次添加AI生成论文,使文集扩大至1440篇。*
初始实验使用了三大主要供应商的十一个模型:OpenAI的代表为GPT-5(https://www.unite.ai/gpt-5-officially-released-a-new-chapter-in-generative-ai/)、GPT-5 mini(https://developers.openai.com/api/docs/models/gpt-5-mini)、GPT-4.1(https://openai.com/index/gpt-4-1/)和GPT-4.1 mini(https://developers.openai.com/api/docs/models/gpt-4.1-mini);谷歌的代表为Gemini 2.5 Pro(https://www.unite.ai/gemini-2-5-pro-is-here-and-it-changes-the-ai-game-again/)、Gemini 2.5 Flash(https://www.unite.ai/gemini-2-5-flash-leading-the-future-of-ai-with-advanced-reasoning-and-real-time-adaptability/)、Gemini 3.1 Pro(https://www.unite.ai/gemini-3-1-pro-hits-record-reasoning-gains/)和Gemini 3.1 Flash-Lite(https://www.unite.ai/google-ships-three-gemini-flash-models-as-its-flagship-slips/#:~:text=Gemini%203%2E5%20Flash%2DLite);Anthropic的代表为Claude Opus 4.8(https://www.unite.ai/what-opus-4-8-changes-for-anyone-running-agents-on-claude/)、Claude Sonnet 4.6(https://archive.is/20260219064959/https:/www.anthropic.com/news/claude-sonnet-4-6)和Claude Haiku 4.5(https://www.unite.ai/anthropic-launches-claude-haiku-4-5/)。
以下测试结果显示了每个模型将其引用集中在特定论文群的程度;完全忽略的论文数量;以及实验重复时其选择的一致性:
测试结果展示每个模型将引用集中于特定论文的强度及完全忽略的论文数量。"Top-10%占比"显示引用最多的12篇最受青睐论文所获引用比例,"HHI"衡量整体引用集中度。"可靠性"显示每个模型在不同测试中偏好相同论文的一致程度,*ρ*显示不同模型间偏好的相似度。"匹配零假设"行显示若论文随机选择时的预期结果。*测试结果展示每个模型将引用集中于特定论文的强度及完全忽略的论文数量。"Top-10%占比"显示引用最多的12篇最受青睐论文所获引用比例,"HHI"衡量整体引用集中度。"可靠性"显示每个模型在不同测试中偏好相同论文的一致程度,*ρ*显示不同模型间偏好的相似度。"匹配零假设"行显示若论文随机选择时的预期结果。*
## 模型究竟在偏好什么?
研究发现偏好主要受**论文自身内容**驱动。例如,对于GPT-5 mini,约90%的论文偏好差异可归因于内容,而非列表顺序、生成噪音或附加的伪造元数据等因素。GPT-4.1 mini也再现了同样的"内容主导"效应。
当保留论文原意但大幅改写标题和摘要时,偏好地图(见下文)几乎未变。在四次成功的改写测试中,尽管使用来自三家供应商的不同模型进行改写,相关性仍达到0.95-0.99。
只有当**底层含义**被可测量地改变时,才观察到偏好地图的变化:
对比十一个模型引用偏好的测试结果。数字显示每对模型偏好相同论文的紧密程度,数值越高表示一致性越高。尽管模型和供应商存在差异,但整个群体表现出广泛相似的偏好。*对比十一个模型引用偏好的测试结果。数字显示每对模型偏好相同论文的紧密程度,数值越高表示一致性越高。尽管模型和供应商存在差异,但整个群体表现出广泛相似的偏好。*
因此,模型似乎主要响应语义内容而非特定措辞。然而,其高度一致的原因尚无法最终确定。
作者断言,可能在训练期间吸收了普遍的引用共识。另一种可能性是,对于何为"可引用"论文,模型独立做出了相似判断。
因此,虽然确立了共同偏好的存在,但其最终起源仍不得而知。
作者建议,研究中广泛使用AI可能会缩减获得关注的研究范围,因为不同模型倾向于偏好许多相同论文;且随着AI生成文献的积累,这些共同偏好可能通过重复引用得到进一步强化,使受冷落的研究渐次难觅。引文多样性及对引文集中度的监测至关重要。
相似文章
人们总把'AI研究代理'与ChatGPT在论文研究中的角色搞混
本文批评了将ChatGPT等聊天机器人误标为AI研究代理的现象,指出真正的研究代理必须处理复杂的多步骤工作流程。文章介绍了'mira ai science'作为尝试满足这些需求的工具。
AI模型继承人类偏见——近期医疗研究显示清晰模式。您注意到了什么?
本文讨论了近期医疗研究,揭示AI模型继承人类偏见的现象,并列举了Zack等人(2024年)和Omar等人(2025年)的具体研究案例。文章邀请读者分享在ChatGPT和Claude等模型中遇到AI偏见的经历。
研究发现,自ChatGPT推出以来发布的网页中,有三分之一显示出AI创作的迹象。
Pew Research的一项研究发现,自ChatGPT推出以来发布的网页中,超过三分之一显示出AI创作的迹象,突显了AI生成内容在互联网上的日益普及。
你有哪些“这就是为什么我们不能盲目信任AI”的故事?
文章讨论了一位律师在准备证词时依赖ChatGPT,结果引用了两个不存在的案例的真实事件,法官在法庭上指出了这个错误,并引发了关注。文章还邀请读者分享自己经历的AI失败故事。
互联网的自我退化
本文描述了信誉良好的网站屏蔽AI爬虫如何迫使AI模型依赖低质量的AI生成内容,导致事后引用和基础设施级别的确认偏误等问题,并提供了更好验证来源的建议。