超过30%的ArXiv新提交现被识别为AI撰写
摘要
一项研究测量了ArXiv上AI撰写文本的普遍程度,发现超过30%的新提交读起来像机器撰写,其中计算机科学领域高达65%,数学领域最低仅为0.7%。
暂无内容
查看缓存全文
缓存时间: 2026/07/20 18:29
# 我们如何衡量arXiv上的AI写作,以及测量在何处失效
来源:https://unslop.run/blog/measuring-ai-writing-on-arxiv
我们对12,750篇arXiv论文的全文进行了评分,发现大约三分之一的新论文读起来像机器写的。以下是方法、结果以及对局限性的坦诚说明。
2021年至2026年间被标记为机器写作的新arXiv论文占比,阈值校准为使ChatGPT之前的论文标记率为0.4%。八个灰色点是LLM之前的对照月份;带状区域是bootstrap 95%置信区间。
按领域划分的被标记为机器写作的论文占比,截至2026年7月的12个月内(每个领域约300篇论文)。
## 一个误报底线
有一种标题套路是“X中有N%现在是AI生成的”,这类文章大多不值一读,因为数字背后的检测器也会将一部分真实的人类写作标记出来。如果一个工具将40%的新论文标记为机器写作,但同时将20%在ChatGPT出现之前撰写的论文也标记为机器写作,那么真正值得关注的是那20%没人提及的部分。
因此我们围绕这一反对意见设计了这项研究。我们的检测器([描述见此处](https://unslop.run/blog/how-our-ai-text-detector-works))针对学术写作进行了校准;在0.4%的误报率下,它能清除99.6%的真实LLM前科学文本,并召回85%的AI学术文本。我们将该误报率作为锚点。我们选取了2021年和2022年(ChatGPT出现之前)提交的论文,将其视为真实的人类写作,并设定标记阈值,使得恰好0.4%的论文被触发。这条线就是底线。我们报告的每一个数字,都是论文占比高于一个阈值,而该阈值下真实的LLM前写作被设定为0.4%。那么ChatGPT之前的年份就充当了内置对照:如果上升是检测器的人为产物,那么2021年和2022年的标记率会与2026年一样高。第一张图显示并非如此。
## 我们测量了什么
我们采样了十个领域组,从2023年1月到2026年7月,每个领域每月约25篇论文,外加2021年和2022年的八个对照月份,共计12,750篇论文。对于每篇论文,我们提取了其第一版PDF,因此2026年修订的论文不会将现代文本泄漏回其2023年的位置。我们对全文正文进行评分,而不是摘要,因为摘要会低估信号:我们见过同一篇论文的摘要评分低于20%,而正文评分超过70%。每个报告的数字都附有bootstrap 95%置信区间。
## 结果
标记比例在2021年和2022年稳定在0.4%,在ChatGPT出现后的几个月内开始上升,并在两波增长中攀升至最近完整季度的约32%,在2026年初达到近39%的峰值。不同领域之间的差异很大,这一点通过表格和第二张图体现。以下数值是每个领域在截至2026年7月的12个月内的标记比例,以及其LLM前的对照水平。
| 领域组 | LLM前对照 | 近期标记比例 | 95%置信区间 |
| --- | --- | --- | --- |
| Computer science | 0.2% | 65.0% | [59.3, 70.3] |
| Quantitative biology | 3.5% | 56.3% | [51.0, 61.7] |
| Electrical eng. & systems | 1.7% | 51.3% | [46.0, 57.0] |
| Economics & finance | 2.5% | 47.0% | [41.3, 52.7] |
| Applied physics | 1.3% | 34.0% | [29.0, 39.7] |
| Statistics | 1.8% | 31.3% | [26.0, 36.7] |
| Condensed matter | 0.0% | 24.0% | [19.3, 29.0] |
| High-energy physics | 0.5% | 14.0% | [10.0, 18.0] |
| Astrophysics | 0.0% | 10.7% | [7.3, 14.3] |
| Mathematics | 0.0% | 0.7% | [0.0, 1.7] |
计算机科学以约65%领先。数学最低,接近0.7%,局限性部分解释了为什么其低值难以解读。对照列是每个领域在2021年至2022年期间,在三种灵敏度设置下平均的标记率;上升最多的领域并非那些LLM前对照水平最高的领域,因此较高的起点并不能解释上升。
## 局限性
**对照样本量。** 每个领域的ChatGPT前对照为200篇论文。在0.4%的标记率下,整个2000篇论文的对照中仅有8篇被标记,分散在十个领域,因此每个领域的单一阈值对照率是粗略的。总体底线估算良好,这也是研究锚定的基准,但每个领域的对照水平只是近似的,而更大的对照样本也无法解决这个问题:要精确确定每个领域百分之几的比率,每个领域需要数千篇对照论文,而2023年之前的arXiv卷并不包含这么多。
**低分可能表示采用率低或检测器盲点。** 数学是最明显的例子。数学论文以符号和定理证明结构为主,一旦移除公式和参考文献,剩余的散文体文本稀疏且不同于检测器所训练的科学英语。一篇在大量模型辅助下撰写的数学论文可能得分较低,因为其散文体文本对于检测器来说是分布外的,因此数学领域的低分并不能有力证明论文由人类撰写。这一结果与两种截然不同的解释一致——采用率较低或该语域中检测器灵敏度降低,而这项数据无法区分两者。具有最强分布内假设的领域,即散文体密集的领域,也是上升最多的领域,因此这一混杂因素并不能解释总体趋势。但在低分领域,排名应被解读为采用率的下限。
**检测器覆盖范围。** 检测器对某些生成器比其他生成器更敏感,我们无法针对作者实际使用的私密模型和提示混合体进行评估。覆盖不完全会降低标记率,因此报告的普遍性是下限:真实比例至少与我们测量的结果一样高。[检测器说明](https://unslop.run/blog/how-our-ai-text-detector-works)报告了每个生成器的性能。
**标记并非作者身份。** 检测器以校准后的概率和已知错误率估计文本是否读起来像机器写的。它无法区分轻微编辑的文档和完全生成的文档,并且单一评分绝不能作为指控特定个人的依据。我们报告的是机器类写作的普遍性,其中包括大量AI辅助编辑。
## 试试看
该检测器运行成本低廉,我们并不从中获利。你可以[在此处](https://unslop.run/check)免费对任何arXiv论文进行测试,也可以[在此处](https://unslop.run/app)测试你自己的文本。
相似文章
研究存储库ArXiv将对让AI完成全部工作的作者实施一年禁发
ArXiv正在实施一项新政策:如果提交的论文显示出未加管控的AI生成证据,例如虚假引用或LLM评论,将禁止作者发表论文一年,并强调作者对内容负全责,无论内容如何生成。
新编写代码中由AI生成或辅助的估计比例
本文报告了一项研究,该研究估计了新编写代码中由AI生成或辅助的百分比,突显了AI工具在软件开发中日益增长的作用。
证据表明AI生成书籍正侵蚀出版行业:2025年自助出版图书数量同比增长40%,从250万本跃升至350万本。随机抽样经AI检测工具筛查后,被判定为AI创作的图书比例同样同比攀升40%。
2025年自助出版图书数量同比增长40%(从250万本增至350万本),AI检测工具识别出的AI创作内容亦同步激增40%,表明抽样小说中近20%含有大量AI生成文本。
人们能在75%的情况下检测出AI生成的文本
UnslopAI的一项测试显示,读者能在75%的情况下识别出AI生成的文本,这凸显了让AI写作听起来更人性化、以避免搜索引擎惩罚并保持真实性的必要性。
SWE领域AI现状:到2026年中,人类与AI编写代码的比例是多少?
询问软件工程师估计到2026年年中AI与人类编写代码的百分比,引发对SWE中AI现状的讨论。