为何AI检测在学术诚信中失效
摘要
本文评估了学术环境中的商业AI检测器,发现对AI辅助的人类写作存在高误报率,而通过人性化工具(humanizers)几乎可以完全规避检测,因此得出结论:检测分数不应作为不当行为的独立证据。
arXiv:2608.11256v1 公告类型:新提交
摘要:高校使用商业AI检测器来维护学术诚信,但检测器无法区分AI编辑与完整的大语言模型草稿,并可能将两者均视为不当行为。在一项针对已发表英文摘要的受控研究中(涵盖四个领域;2013至2015年 vs. 2023至2025年),我们在tau=0.50的代理人类/AI标签下量化了这一政策失败。轻度“仅润色摘要”的编辑——作为符合指南的AI辅助的代理——被标记的比例为64%至80%(Pangram/GPTZero)。未修改的2023至2025年原文被标记的比例为9%至15%,其中非STEM领域的比例远高于STEM领域(p<0.001);升高的分数与长词元密度和学术词汇表密度相关,而非仅由作者意图驱动。经过Undetectable AI人性化处理后,规避几乎完全成功:被标记为AI的改写文本中仅有不到4%仍被标记(人性化后检测率<4%;漏报率>96%)。诚实的AI编辑导致的处罚风险高于借助人性化工具的规避行为。因此,检测分数不应作为不当行为的独立证据。
查看缓存全文
缓存时间: 2026/08/13 15:33
# 为什么AI检测在学术诚信中失效
来源:https://arxiv.org/html/2608.11256
(2018年)
###### 摘要。
各机构使用商业AI检测器来维护学术诚信,但检测器无法区分AI编辑与完整LLM初稿,并可能将两者都视为学术不端。在一项针对已发表英文摘要的对照研究中(四个领域;2013-2015年与2023-2025年对比),我们在τ=0.50的代理人工/AI标签下量化了这一政策失效现象。轻度*润色(仅摘要)*编辑(代表符合指南的AI辅助)被标记的比例为64%至80%(Pangram/GPTZero)。未经修改的2023-2025年原始摘要被标记的比例为9%至15%,非STEM领域的标记率远高于STEM领域(p<0.001);高分与长词元密度和学术词汇表(AWL)密度相关,而不仅仅是作者的意图。经过Undetectable AI拟人化后,规避几乎完全成功:被标记为AI的改写文本中,仅有不到4%仍被检测出来(拟人化后检测率<4%;FNR>96%)。诚实的AI编辑所面临的制裁风险反而高于借助拟人化工具进行规避的行为。因此,检测器得分不应作为学术不端的唯一证据。
AI检测、学术诚信、AI辅助写作、拟人化、LLM、教育
††版权:acmlicensed††出版年份:2018††DOI:XXXXXXX.XXXXXXX††会议:请从权利确认邮件中填写正确的会议名称;2018年6月3-5日;纽约州伍德斯托克††ISBN:978-1-4503-XXXX-X/2018/06††CCS:应用计算 教育††CCS:计算方法 自然语言处理††CCS:计算方法 人工智能††CCS:安全与隐私 安全与隐私的人类与社会层面
## 1. 引言
设想两名学生提交论文或研究文章。一位作者提出论点,但使用LLM优化语言;另一位学生则完全使用LLM生成初稿,没有任何原创分析。在τ=0.50时,商业检测器通常对两者都以很高的比例进行标记。然而,他们与作品的真实关系不同。*他们应该承受相同的后果吗?*
LLM已经引发了对学术界合成文本的担忧(Kasneci等,2023(https://arxiv.org/html/2608.11256#bib.bib5);Cotton等,2024(https://arxiv.org/html/2608.11256#bib.bib6);Perkins,2023(https://arxiv.org/html/2608.11256#bib.bib7)),各机构也越来越多地部署AI检测器(Yan等,2023(https://arxiv.org/html/2608.11256#bib.bib10);Wang,2023(https://arxiv.org/html/2608.11256#bib.bib9))。供应商宣称在基准测试中拥有很高的准确率(Spero,2025(https://arxiv.org/html/2608.11256#bib.bib3);Adam,2026(https://arxiv.org/html/2608.11256#bib.bib15)),但独立研究发现存在大量误报和漏报(Dik和Erdem,2025(https://arxiv.org/html/2608.11256#bib.bib14);Elazar和Antoniak,2026(https://arxiv.org/html/2608.11256#bib.bib11))。
这些错误并不局限于可能被LLM输出污染的文本:我们甚至在AI时代之前的摘要(2013-2015年)中观察到大量误报,尤其是在非STEM文本中。在2023-2025年的原始摘要中,Pangram在τ=0.50时标记了15.0%,GPTZero标记了8.9%(表2(https://arxiv.org/html/2608.11256#S3.T2)),非STEM领域的标记率远高于STEM领域(p<0.001)。这表明现有检测器在已发表、经过同行评审的人类学术文本上也会系统性失效,而不仅仅是对AI生成的初稿。
检测器无法通过单一得分区分完全由AI生成的文本与AI辅助的文本(Spero, 2025(https://arxiv.org/html/2608.11256#bib.bib3);GPTZero, 2026(https://arxiv.org/html/2608.11256#bib.bib25);Pratama, 2025(https://arxiv.org/html/2608.11256#bib.bib26))。与此同时,拟人化工具(旨在规避AI检测器的软件)市场不断增长,又增加了另一类检测错误来源(Wallwork, 2025(https://arxiv.org/html/2608.11256#bib.bib17))。此外,英语学习者可能会合理地使用AI进行翻译、提升清晰度或润色学术语言,同时保留知识所有权(Zhang等, 2023(https://arxiv.org/html/2608.11256#bib.bib13)),但这类编辑可能会推高检测器得分。这些事实共同造成了一种张力:以合理方式使用AI呈现自己观点的人会受到AI检测流程的惩罚,而愿意通过AI结合拟人化工具作弊的人反而不会。为了分析这种张力,我们提出三个以政策为导向、聚焦于*检测错误*而非供应商基准测试的研究问题:
参见图1。AI检测流程
RQ1:在代理真实标签下,商业检测器的误报率和漏报率是多少?它们在不同领域、时间段和改写条件下如何变化?
RQ2:学术摘要的哪些表层语言特征与较高的检测器得分相关(因此在人类写作中导致更高的误报风险)?
RQ3:拟人化如何改变AI生成文本的漏报率?
此前研究已记录了检测器的不可靠性(Dik和Erdem, 2025(https://arxiv.org/html/2608.11256#bib.bib14)),包括润色摘要被误分类为完全改写的情况(Geng和Poibeau, 2025(https://arxiv.org/html/2608.11256#bib.bib1))。我们通过一个统一的错误分析框架扩展了这些文献:代理标签的正/负样本、基于置换的推断,以及跨领域和时间窗口的可解释文本特征相关性。研究结果旨在为基于已发表摘要的政策制定提供参考。
## 2. 方法
我们描述了语料库和检测流程,并定义了如何操作化检测器错误率以及相应的统计分析。简而言之,我们对四个领域、两个时间段的原始摘要和LLM改写摘要进行了评分,使用两种商业检测器,并在拟人化前后各评一次。
### 2.1. 语料库与流程
我们从OpenAlex(Priem等, 2022(https://arxiv.org/html/2608.11256#bib.bib20))中抽取了化学、计算机科学、政治学和神学的英文摘要(过滤前每个领域-时间段桶100篇),时间跨度为2013-2015年和2023-2025年。较早的时间窗口作为LLM时代之前*原始*摘要的代理FPR参考;较晚的时间窗口报告当LLM辅助写作在学术工作流程中可能存在但我们标签中未观察时的标记率(Liang等, 2024(https://arxiv.org/html/2608.11256#bib.bib22);Kobak等, 2025(https://arxiv.org/html/2608.11256#bib.bib23);Geng和Poibeau, 2025(https://arxiv.org/html/2608.11256#bib.bib1))。要求25至500词且有PDF访问权限(损失约20%)后,我们保留了642篇摘要。每篇摘要贡献一个*原始*摘要,以及通过OpenRouter(OpenRouter, 2026(https://arxiv.org/html/2608.11256#bib.bib21))使用Gemini 3 Flash生成的三种改写:*润色(仅摘要)*、*润色(摘要+全文)*和*新建(仅全文)*(提示词见附录D(https://arxiv.org/html/2608.11256#A4))。我们使用Pangram 3.2和GPTZero(Emi和Spero, 2024(https://arxiv.org/html/2608.11256#bib.bib2);Adam, 2026(https://arxiv.org/html/2608.11256#bib.bib15))对所有变体进行评分(s∈[0,1]),并使用LLM辅助基线(GPT-5 Nano)。随后,我们使用Undetectable AI v11(均衡/博士/论文)对所有变体进行拟人化处理,并重新评分输出。整体流程如图1(https://arxiv.org/html/2608.11256#S1.F1)所示。
我们选择两个STEM领域(化学、计算机科学)和两个非STEM领域(政治学、神学),以对比符号密集的技术性文本与叙事性社会科学写作;STEM与非STEM的对比将化学与计算机科学合并,将政治学与神学合并。表1(https://arxiv.org/html/2608.11256#S2.T1)列出了每个领域-时间段桶中保留的摘要数量。三种改写条件在保持生成器不变的情况下逐步增加建模的AI参与程度:*润色(仅摘要)*只编辑摘要文本,*润色(摘要+全文)*使用整篇论文作为上下文,*新建(仅全文)*仅根据正文生成全新摘要。Pangram和GPTZero得分在τ=0.50处对称处理;阈值扫描和供应商声明比较见附录K(https://arxiv.org/html/2608.11256#A11)。
| 领域 | 2013–15 | 2023–25 |
|---|---|---|
| 化学 | 76 | 95 |
| 计算机科学 | 77 | 83 |
| 政治学 | 76 | 79 |
| 神学 | 76 | 79 |
表1. 按领域保留的摘要数量(经过长度和PDF过滤后)。
### 2.2. 错误率与分析
使用τ=0.50和ŷ_i=I{s_i≥τ},我们将代理人工标签分配给原始摘要,将代理AI标签分配给LLM输出,定义FP_i=I{y_i=人工 ∧ ŷ_i=1}和FN_i=I{y_i=AI ∧ ŷ_i=0},并在LLM标记的变体上报告FNR。对于2013-2015年的*原始*摘要,我们报告代理FPR;对于2023-2025年的*原始*摘要,我们报告*标记率*(在τ处被标记的占比),因为未观察到的AI辅助意味着正样本不能确认为误报。我们还报告*AI辅助误报风险*:在代理人工来源标签下,*润色(仅摘要)*输出被标记的占比。
组间比较使用均值得分的双侧置换检验(5,000次迭代;种子42)。文本特征包括长词元比例、学术词汇表(AWL)密度、数字和非字母符号占比、缩写密度和类符-形符比(定义见附录F(https://arxiv.org/html/2608.11256#A6))。我们报告特征与检测器得分之间的Spearman ρ,在每类集合内使用Benjamini-Hochberg FDR校正,并报告领域中心化后的关联。阈值敏感性、自助法置信区间、原始→*润色(仅摘要)*配对变化以及精确率-召回率曲线见附录K(https://arxiv.org/html/2608.11256#A11)。
## 3. 结果
我们围绕三个研究问题组织结果:代理标记的错误率(RQ1)、检测器得分的语言相关因素(RQ2)、以及拟人化对检测器行为和一致性的影响(RQ3)。在全部三个方面,检测器都对风格线索敏感,并且很容易被拟人化工具击败,导致较高的FNR和较低的检测器间一致性。
| 时间段 | 检测器 | FPR/标记率 | FNR(拟人化前) | FNR(拟人化后) |
|---|---|---|---|---|
| 2013-15 | Pangram | 0.0% | 19.4% | 98.5% |
| 2013-15 | GPTZero | 0.0% | 44.2% | 96.0% |
| 2013-15 | LLM辅助 | 46.7% | 35.1% | 30.5% |
| 2023-25 | Pangram | 15.0% | 13.5% | 96.6% |
| 2023-25 | GPTZero | 8.9% | 38.4% | 96.1% |
| 2023-25 | LLM辅助 | 70.8% | 22.8% | 19.7% |
表2. τ=0.50时代理标记的错误率。对于*原始*摘要,2013-2015年报告代理FPR;2023-2025年报告标记率。
表2(https://arxiv.org/html/2608.11256#S3.T2)总结了τ=0.50时的错误率。在代理标签下,2013-2015年的原始摘要FPR=0%;在2023-2025年,原始摘要的标记率为15.0%(Pangram)和8.9%(GPTZero),但由于已发表的摘要可能已经包含LLM辅助,不能将其解释为确认的误报。非STEM领域的标记率超过STEM领域(p<0.001;表4(https://arxiv.org/html/2608.11256#S3.T4))。*润色(仅摘要)*被标记的比例为64%至80%(代理AI辅助误报风险)。经过拟人化后,AI检测器对AI标记改写的检出率不足4%(FNR>96%)。这种不对称性对政策至关重要:符合指南的编辑会触发高标记率,而拟人化规避则使对合成文本的检出率降至接近于零;诚实的编辑目前面临的制裁风险高于恶意规避。
表3(https://arxiv.org/html/2608.11256#S3.T3)按改写条件分解了拟人化前的FNR。较轻的编辑保留最高的FNR,尤其是GPTZero;*新建(仅全文)*改写的Pangram得分大多已超过τ(FNR为2.6%至2.7%)。LLM辅助基线标记了2023-2025年原始摘要的70.8%,仅作为补充处理。
| 时间段 | 条件 | Pangram FNR | GPTZero FNR | n |
|---|---|---|---|---|
| 2013-15 | 润色(仅摘要) | 35.6% | 62.4% | 306 |
| 2013-15 | 润色(摘要+全文) | 19.9% | 54.6% | 306 |
| 2013-15 | 新建(仅全文) | 2.6% | 15.7% | 306 |
| 2023-25 | 润色(仅摘要) | 19.9% | 51.5% | 336 |
| 2023-25 | 润色(摘要+全文) | 17.9% | 48.8% | 336 |
| 2023-25 | 新建(仅全文) | 2.7% | 14.9% | 336 |
表3. τ=0.50时按改写条件划分的拟人化前FNR。
| 领域 | 原始被标记 | 润色(仅摘要)被标记 | n |
|---|---|---|---|
| 化学 | 2.1 / 1.1% | 73.7 / 46.3% | 95 |
| 计算机科学 | 9.8 / 6.0% | 69.9 / 36.1% | 83 |
| 政治学 | 24.4 / 15.2% | 86.1 / 54.4% | 79 |
| 神学 | 26.6 / 15.2% | 92.4 / 58.2% | 79 |
表4. 2023-2025年领域级标记率(Pangram / GPTZero)。
2023-2025年原始摘要的标记率在相同τ下因领域差异显著(表4(https://arxiv.org/html/2608.11256#S3.T4)):Pangram在化学领域标记了2.1%,而在神学领域标记了26.6%;GPTZero呈现相同顺序(1.1%至15.2%)。供应商营销宣称在基准评估中误报率低于1%(Spero, 2025(https://arxiv.org/html/2608.11256#bib.bib3);GPTZero, 2026(https://arxiv.org/html/2608.11256#bib.bib25));而我们的语料中,近年*原始*摘要的标记率为9%至15%,轻度编辑的标记率为64%至80%(附录表12(https://arxiv.org/html/2608.11256#A5.T12))。图2(https://arxiv.org/html/2608.11256#S3.F2)绘制了2013-2015年摘要上的辅助编辑ROC曲线(τ=0.50时原始摘要FPR为0%)。Pangram的AUC-ROC为0.98,GPTZero为0.92;在τ=0.50时,Pangram标记了64%的轻度编辑且没有原始摘要被标记,而GPTZero标记了38%。图3(https://arxiv.org/html/2608.11256#S3.F3)在2023-2025年上复现了这一任务:原始轴上的比率是标记率(15%和9%),Pangram的AUC-ROC为0.91,80%的轻度编辑在τ=0.50时被标记。
参见图2。辅助编辑ROC(2013-2015年):*原始* vs. *润色(仅摘要)*;τ=0.50
参见图3。辅助编辑ROC/PR(2023-2025年,拟人化前)。原始轴上的比率是标记率,不是代理FPR。
没有任何阈值τ∈{0.4, 0.5, 0.6}能同时保持原始标记率低、润色检出力高和AI池FNR低(表5(https://arxiv.org/html/2608.11256#S3.T5)):Pangram在该区间内保持约15%的原始标记率和约80%的润色标记率,而AI标记改写的FNR保持在10%至14%。
| 检测器 | τ | 标记率(原始) | FNR(AI标记) | 润色被标记 |
|---|---|---|---|---|
| Pangram | 0.4 | 15.9% | 10.5% | 85.1% |
| Pangram | 0.5 | 15.0% | 13.5% | 80.1% |
| Pangram | 0.6 | 15.0% | 13.8% | 79.8% |
| GPTZero | 0.4 | 10.1% | 37.6% | 49.4% |
| GPTZero | 0.5 | 8.9% | 38.4% | 48.5% |
| GPTZero | 0.6 | 8.6% | 38.6% | 48.2% |
表5. 阈值敏感性(2023-2025年,拟人化前)。
### 3.1. 语言特征相关因素
长词元比例和AWL比例与2023-2025年得分正相关(ρ约0.30至0.35;p<0.001);数字和非字母符号比例与得分负相关(表6(https://arxiv.org/html/2608.11256#S3.T6);完整检验见附录H(https://arxiv.org/html/2608.11256#A8))。在将得分和特征按领域中心化后,长词元和AWL的关联对Pangram而言更强(领域调整后r>0.41),这表明检测器响应的是领域内的风格线索,而不单是领域归属。
| 特征 | Pangram ρ | GPTZero ρ |
|---|---|---|
| AWL词元比例 | 0.346 | 0.320 |
| 长词元比例 | 0.336 | 0.304 |
| 非字母符号比例 | −0.149 | −0.197 |
| 数字词元比例 | −0.146 | −0.171 |
表6. 最强的得分-特征关联(2023-2025年,拟人化前;Spearman ρ,两个检测器均p<0.001)。
### 3.2. 拟人化与检测器一致性
拟人化后,Pangram在2023-2025年的所有条件下均值降至0.03至0.04(附录K(https://arxiv.org/html/2608.11256#A11)),导致漏报率相似文章
面向政策的AI使用检测:学术出版的证据框架
论文指出,对于学术出版机构而言,标准的AI文本检测工具所测量的并非真正需要关注的对象,并提出了一种面向政策的AI使用检测方法——该证据框架将期刊政策作为显式输入,报告经校准的假设及不确定性(而非二元判定),并基于可复现的合规/非合规工作流管线构建基准测试。
AI检测器正在制造一个充满不信任的新时代
本文探讨了AI检测器在教育领域日益广泛的使用及其引发的不信任氛围,重点指出了误报问题和AI生成文本检测的主观性。
指控性AI:AI技术的广泛误用如何伤害学生
文章讨论了AI检测工具并不可靠,且被教育工作者滥用来惩罚学生,导致错误的作弊指控。文章强调,此类工具不应作为惩罚的唯一证据,并指出了透明度和适当评估的必要性。
顶级AI会议使用AI检测器拒绝涉嫌由AI撰写的论文
NeurIPS 2026使用了专有AI文本检测器,以涉嫌违反AI政策为由直接拒绝论文,但未在目标分布上验证该检测器;随后同一检测器又将会议主席自己的论文标记为可能由AI撰写。
@rohanpaul_ai: AI检测器行业在阅读这份MIT报告时应感到非常不安。最强的机构反对声音……
一份MIT报告强烈建议不要依赖AI检测器,理由包括与AI人性化器的军备竞赛、误报伤害学生、以及对非英语母语者和神经多样性个体的不公平影响。