AI评估可能导致认知偏差:学术写作中语境解读的重要性
摘要
本文探讨了当评估方法忽略国家和领域间的语境差异时,对科学写作中AI使用率的估计可能产生偏差,并提出了考虑语境的基准以实现更准确的测量。
查看缓存全文
缓存时间: 2026/05/27 09:08
# AI评估可能偏差认知:语境在解读学术写作中的重要性
来源:https://arxiv.org/html/2605.26662
(2026年5月19日)
###### 摘要
本文探讨当评估方法忽略国家和领域的语境差异时,对科学写作中AI使用量的估计可能产生偏差。利用Dimensions收录的期刊论文大规模数据,我们基于人类撰写与LLM改写摘要之间的差异构建了AI相似性基准。我们表明,全局基准可能将已有的文体差异与AI生成文本混淆,即使在LLM出现之前的论文中也会在各国-领域组间产生显著扭曲。相比之下,特定于国家-领域的基准能减弱此类扭曲,并提供更可信的比较基线。将这些方法应用于2025年的论文发现,全局基准系统性地高估了某些国家和领域的AI使用量,同时低估了其他国家和领域。这些发现凸显了情境感知测量对于准确且公平地评估科学领域AI使用的重要性。
“你不应该使用破折号——那是AI生成写作的标志。”
“但我在AI出现之前就一直用它们啊……”
科学知识能否得到认可,不仅取决于其内在价值,还取决于这些知识如何被感知和评估。科学知识的评估可能因研究团队的性别构成 (11 (https://arxiv.org/html/2605.26662#bib.bib32)) 以及研究人员所在国家 (8 (https://arxiv.org/html/2605.26662#bib.bib31)) 而不同。这些可观察的线索常被用作质量的“捷径”,尤其是在专业知识有限、信息不足或时间紧迫的情况下 (2 (https://arxiv.org/html/2605.26662#bib.bib33))。而近年来大型语言模型(LLM)在科学写作中的兴起为这一问题增添了新的维度。Kusumegiet al. (5 (https://arxiv.org/html/2605.26662#bib.bib27)) 报告称,科学写作中LLM的采用与科学生产力的提升相关,尤其对非英语母语者而言,但同时也侵蚀了像写作复杂度这样的传统质量信号。其他研究也尝试估计LLM在科学中的使用及其对研究方向和科学治理的影响 (3 (https://arxiv.org/html/2605.26662#bib.bib28),4 (https://arxiv.org/html/2605.26662#bib.bib29))。
重要的是,这些对科学写作中LLM使用量的估计往往依赖一个强假设:即“AI相似性”可以通过一个通用基准来衡量,并且可以在不同国家和领域产生的文章之间进行有意义的比较。这一假设影响重大,因为实际上科学写作并不遵循单一的全球标准:语言习惯、学科规范和修辞风格方面的长期差异意味着,即使在LLM兴起之前,某些国家和领域也可能显得比其他更具“AI相似性”。当单一的基准应用于如此异质的语境时,写作风格的差异可能被误认为是AI使用量的差异。这一点很重要,因为读者倾向于贬低被认为由AI生成的写作 (9 (https://arxiv.org/html/2605.26662#bib.bib36)),因此误分类可能引入跨国家和领域的系统性偏差,从而进一步加剧科学评估中已有的不平等 (11 (https://arxiv.org/html/2605.26662#bib.bib32),8 (https://arxiv.org/html/2605.26662#bib.bib31),2 (https://arxiv.org/html/2605.26662#bib.bib33))。
本文认为,准确评估科学出版物中AI的使用需要考虑国家-领域特定的语境。我们通过比较考虑和不考虑此类异质性时对AI类似文本占比的估计来论证这一点。具体地,我们检索了Dimensions中所有英文期刊论文的元数据,并定义了18个国家组(以下简称“国家”)和13个研究领域:附录表B1和B2列出了相应的分类。从234个国家-领域组中的每一个,我们从2020年抽取最多2000篇论文。然后我们使用广泛使用的大型语言模型ChatGPT-4o-mini,按照改编自Kusumegiet al. (5 (https://arxiv.org/html/2605.26662#bib.bib27)) 和Lianget al. (7 (https://arxiv.org/html/2605.26662#bib.bib22)) 的两步程序,对所有抽样论文的摘要进行改写。由此产生的原始摘要和AI改写摘要对构成了一个参考语料库,用于估计人类撰写和AI改写的科学文本的词分布特征。然后我们对原始文本和改写文本进行分词,计算词级别的对数几率比,并构建两组AI相似性基准:(i) 一个全局基准,基于所有抽样论文训练,如先前的工作111先前的工作为每个预印本来源(例如arXiv, bioRxiv, SSRN)拟合不同的模型 (5 (https://arxiv.org/html/2605.26662#bib.bib27),4 (https://arxiv.org/html/2605.26662#bib.bib29),7 (https://arxiv.org/html/2605.26662#bib.bib22))。本文使用来自单一来源的期刊论文。;以及 (ii) 234个国家-领域特定基准,每个只训练对应国家-领域组内的论文。这里,“基准”指的是一个词列表以及每个词对应的对数几率比,其中对数几率比捕捉了该词出现在人类撰写摘要与AI改写摘要中的相对可能性。具体地,在全局基准下,词 t 的对数几率比为
log-odds ratio_t = \log\left(\frac{P_t/(1-P_t)}{Q_t/(1-Q_t)}\right),
其中 P_t 和 Q_t 分别是词 t 在真实人类撰写摘要和AI改写摘要中出现的全局概率。更负的值表明该词在AI改写摘要中相对更常出现。相比之下,国家-领域特定的对数几率比为
log-odds ratio^g_t = \log\left(\frac{P^g_t/(1-P^g_t)}{Q^g_t/(1-Q^g_t)}\right),
其中 P^g_t 和 Q^g_t 表示在国家-领域组 g 内估计的人类撰写和AI改写的词使用概率。因此,全局基准对所有组使用一个共同的词使用基线进行评估,而国家-领域特定基准则根据各个人类与AI词使用分布对每个组进行评估。
利用这些基准分布,我们随后使用最大似然相似文章
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。
AI能否评估AI科学家?一项使用自动化多模型评审的自主研究生成系统基准测试研究
本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。
AI编写的评论帮助人类发现缺陷
# AI编写的评论帮助人类发现缺陷 来源:[https://openai.com/index/critiques/](https://openai.com/index/critiques/) 我们希望确保未来执行极困难任务的AI系统始终与人类意图保持一致。[Many](https://openai.com/index/learning-to-summarize-with-human-feedback/)[previous\(opens in a new window\)](https://arxiv.org/abs/2204.05862)[works\(opens in a new window\)](https://www.deepmind.com/publications/gophercite-teaching-language-models-to-suppo
AI基准测试不如模型能否处理乏味的现实责任重要
文章认为,AI基准测试和华丽的演示被过度强调了;真正考验AI可信度的是模型如何处理乏味的现实责任,如遵循指令、承认不确定性、处理边缘情况以及可审计性。