击中移动目标:持续分布漂移下AI文本检测的测试时自适应
摘要
本文提出了一种基于半监督学习的测试时自适应方法,用于AI文本检测,能够适应来自新LLM、对抗性人工化和时间漂移的持续分布变化,性能优于最先进的监督式检测器。
arXiv:2606.25152v1 公告类型:新
摘要:已部署的AI文本检测方法通常依赖于训练时访问包含人类撰写和AI生成文本的标注数据集。这种方法容易受到部署后持续发生的三种分布变化的影响,且这些变化通常缺乏标注数据:对抗性人工化、新LLM的发布以及人类写作的时间漂移。同时,现有方法未能利用LLM使用的一个关键信号:推理时的同质性。我们提出了一种测试时自适应(TTA)方法,利用半监督学习,通过利用推理时观察到的未标注样本之间的同质性来适应分布变化。实验发现,最先进的监督式检测器在遇到AI生成和人类写作的对抗性和自然分布变化时系统性失效,而基于半监督学习的测试时自适应在很大程度上具有鲁棒性;例如,商业模型Pangram仅检测出24.1%的对抗性AI生成文本,而我们的测试时方法检测出90.5%。我们证实测试时自适应是在现实场景中进行AI文本检测的一种有前景的框架。我们已在 https://github.com/kkr36/llm_detection 公开发布代码(包括模型训练、评估和绘图的代码)。
查看缓存全文
缓存时间: 2026/06/25 05:10
# 击中移动目标:AI文本检测在持续分布漂移下的测试时适应 来源:https://arxiv.org/html/2606.25152 Kevin Ren 康奈尔科技校区 [email protected] & Manish Raghavan 麻省理工学院 [email protected] & Nikhil Garg 康奈尔科技校区 [email protected] ###### 摘要 当前部署的AI文本检测方法通常依赖训练时获取的、包含人工书写和AI生成文本的标注数据集。这种方法容易受到部署后持续发生的三种分布漂移的影响,且针对这些漂移往往缺乏标注数据:对抗性人性化处理、新LLM的发布,以及人类写作随时间产生的漂移。与此同时,现有方法并未利用LLM使用的一个关键信号:推理时的同质性。我们提出一种基于半监督学习的测试时适应(TTA)方法,通过利用推理时观察到未标注样本中的同质性来适应分布漂移。实验发现,最先进的监督检测器在面对AI生成文本和人类写作的分布漂移(无论是对抗性还是自然漂移)时会系统性失效,而采用半监督学习的测试时适应方法则基本保持鲁棒;例如,商业模型Pangram仅能检测出我们对抗性AI生成文本的24.1%,而我们的测试时方法检测率达到90.5%。我们认为测试时适应是在实际环境中进行AI文本检测的一个有前景的框架。我们已在 https://github.com/kkr36/llm_detection 公开代码(包括模型训练、评估和绘图代码)。 ## 1 引言 请参见图注 图1:比较基于监督学习的AI文本检测(上方)和基于半监督学习的测试时适应(下方)。监督检测:检测器在标注的人类和AI文本上训练后发布,可能在分布漂移下失效。测试时适应:检测器在推理时利用提交的文本重新估计其决策边界,从而能够适应。 AI生成文本检测在教育、新闻等多个领域日益普遍,既用于标记特定文本中未披露、不合规的AI使用,也用于广泛理解LLM使用的社会影响(Liang et al., 2024a (https://arxiv.org/html/2606.25152#bib.bib55); Corpus et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib8); Wang & Qiu, 2025 (https://arxiv.org/html/2606.25152#bib.bib101); Russell et al., 2025a (https://arxiv.org/html/2606.25152#bib.bib78))。流行的高性能检测模型主要采用监督学习方法训练。对于**个体级分类**(识别特定AI生成文本),商业检测器Pangram在数十个领域的数百万文本上训练了一个基于Transformer的分类器,并采用了复杂的数据增强算法(Emi & Spero, 2024 (https://arxiv.org/html/2606.25152#bib.bib16))。对于**流行率估计**(估计语料库中AI生成文本的比例),Liang et al. (2024b (https://arxiv.org/html/2606.25152#bib.bib56)) 提出了一种基于轻量级n元语法的方法。这两种方法已被广泛使用(Russell et al., 2025a (https://arxiv.org/html/2606.25152#bib.bib78)、b (https://arxiv.org/html/2606.25152#bib.bib79); Chakrabarty et al., 2025b (https://arxiv.org/html/2606.25152#bib.bib6)、a (https://arxiv.org/html/2606.25152#bib.bib5); Thorat & Caines, 2025 (https://arxiv.org/html/2606.25152#bib.bib92); Leippold, 2026 (https://arxiv.org/html/2606.25152#bib.bib51); Naddaf, 2025 (https://arxiv.org/html/2606.25152#bib.bib68); Qian et al., 2026 (https://arxiv.org/html/2606.25152#bib.bib75); Sharma et al., 2026 (https://arxiv.org/html/2606.25152#bib.bib84); Elazar & Antoniak, 2026 (https://arxiv.org/html/2606.25152#bib.bib14); Kusumegi et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib48); Liang et al., 2025c (https://arxiv.org/html/2606.25152#bib.bib58)、b (https://arxiv.org/html/2606.25152#bib.bib57))。模型开发者声称当前方法可以解决AI检测问题:Pangram声称达到了99%的准确率(Emi & Spero, 2024 (https://arxiv.org/html/2606.25152#bib.bib16); Russell et al., 2025a (https://arxiv.org/html/2606.25152#bib.bib78)),并且对流行的“人性化工具”具有鲁棒性(Masrour et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib65)),这得到了类似独立评估的证实(Jabarian & Imas, 2025 (https://arxiv.org/html/2606.25152#bib.bib33))。然而,其他评估表明这些主张可能不具有普遍性。 Chakrabarty et al. (2025a (https://arxiv.org/html/2606.25152#bib.bib5)) 表明,在将模型微调以匹配特定人类作者的风格特征后,其输出在很大程度上避开了Pangram的检测,检测率仅为3%。越来越多的研究发现检测模型普遍脆弱(Dawkins et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib10); Dugan et al., 2024 (https://arxiv.org/html/2606.25152#bib.bib13); Wang et al., 2024b (https://arxiv.org/html/2606.25152#bib.bib103)、a (https://arxiv.org/html/2606.25152#bib.bib102); Li et al., 2024 (https://arxiv.org/html/2606.25152#bib.bib53); Sadasivan et al., 2023 (https://arxiv.org/html/2606.25152#bib.bib80); Yu et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib109)),我们也在Pangram和我们自己的监督检测器中发现了类似问题。是什么导致了这些测量上的差异?答案往往是:分布漂移。监督方法假设训练数据集与评估数据同分布。为了构建这样的数据集,实践者 (a) 寻找LLM广泛采用之前(即2022年以前)的源领域文本作为已知的人类书写文本,以及 (b) 通过查询LLM改写人类文本来自行生成AI生成文本(“合成镜像”)。当评估(大致)匹配训练分布时,我们预期——并且之前的研究也确实观察到——监督方法表现良好。当两者不同时,性能就会下降。 我们认为,AI文本检测中的分布漂移尤其具有挑战性:它是持续性的,并且通常发生在部署之后(Yu et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib109))。考虑LLM检测中常见的漂移:对抗性人性化处理,即用户或人性化服务(Grammarly, 2026 (https://arxiv.org/html/2606.25152#bib.bib22); Humanize AI, 2026 (https://arxiv.org/html/2606.25152#bib.bib31); Krishna et al., 2023 (https://arxiv.org/html/2606.25152#bib.bib46))策略性地改写AI生成文本以逃避已发布的检测器;以及随着时间推移的自然漂移,这是由于新LLM的发布和人类写作的暂时性漂移所致。这些漂移都有两个共同特征:(1) 它们随时间**持续发生**,因此任务不同于一次性迁移学习;(2) 标注的测试数据可能永远无法获得——或者需要付出高昂的成本或时间延迟。这些特征限制了标准重训练或领域适应方法(即定期重训练部署模型,如每月一次,以适应固定的目标漂移)的性能。 与此同时,现有方法(无论是监督方法还是其他方法)并非设计用来利用现实世界中LLM使用具有同质性这一事实,这种同质性反映了**算法单一文化**(Kleinberg & Raghavan, 2021 (https://arxiv.org/html/2606.25152#bib.bib44); Peng & Garg, 2024 (https://arxiv.org/html/2606.25152#bib.bib73); Wu et al., 2025a (https://arxiv.org/html/2606.25152#bib.bib104); Padmakumar & He, 2024 (https://arxiv.org/html/2606.25152#bib.bib71); Raghavan, 2024 (https://arxiv.org/html/2606.25152#bib.bib76); Ugander & Epstein, 2024 (https://arxiv.org/html/2606.25152#bib.bib96); Doshi & Hauser, 2024 (https://arxiv.org/html/2606.25152#bib.bib11); Goel et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib20); Kim et al., 2025 (https://arxiv.org/html/2606.25152#bib.bib40); Toups et al., 2023 (https://arxiv.org/html/2606.25152#bib.bib94); Jo et al., 2026 (https://arxiv.org/html/2606.25152#bib.bib36))。因此,对测试时同质性进行建模,即使没有标注数据,也为现实世界中的AI使用提供了重要信号:虽然对任何单个漂移文本样本进行分类可能很困难,但给定一个**样本群组**(即足够大的测试时批次),如果分布漂移(例如新LLM和人性化工具的发布)是相当同质的,那么检测就变得可行。¹¹例如,在《纽约时报》中(Vigdor & Ziegler, 2025 (https://arxiv.org/html/2606.25152#bib.bib98)),两位教授描述了要求学生披露未经许可的LLM使用情况。他们收到了许多回复,其中异常大比例的回复包含“sincerely apologize”这个短语。教授们得出结论,许多学生仍然在使用LLM,甚至用LLM来为使用LLM道歉。 因此,我们认为AI文本检测——由于持续的分布漂移和测试时的同质性——是新兴的**测试时适应**(TTA)范式(Sun et al., 2020 (https://arxiv.org/html/2606.25152#bib.bib89); Wang et al., 2021 (https://arxiv.org/html/2606.25152#bib.bib99); Zhang et al., 2022 (https://arxiv.org/html/2606.25152#bib.bib110); Liang et al., 2025a (https://arxiv.org/html/2606.25152#bib.bib54); Sahoo et al., 2020 (https://arxiv.org/html/2606.25152#bib.bib82))的理想应用,该范式利用未标注的测试时数据来调整现有分类器或重新训练新分类器。**基于半监督学习的测试时适应**方法可以利用AI生成文本在测试时的同质性,而训练时冻结的方法则独立处理每个测试样本,无法利用这种潜在信号。 在这项工作中,首先,我们提出了一个概念框架,利用策略分类、测试时适应和正无标签(PU)学习(一种半监督学习)的见解,来解释在(潜在对抗性)持续分布漂移下AI文本检测的动态。我们表明标准方法存在根本性的时机劣势,因此容易受到对抗性和自然漂移的影响。相比之下,基于测试时适应的方法可以表现良好。其次,我们使用科学摘要数据和RAID基准(Dugan et al., 2024 (https://arxiv.org/html/2606.25152#bib.bib13))实验性地证明了我们框架的优势。(a) 监督检测器可以通过策略性选择的人性化工具反复被规避;我们生成的AI文本将Pangram对AI生成文本的检测率从94.7%(非对抗性选择文本)降至24.1%。(b) 最先进的监督检测器在面对来自与训练LLM不同的LLM生成的AI文本时可能表现不佳;例如,在GPT 5.4发布后的实验中,我们发现Pangram对其输出的检测率仅为34%,而对旧模型则近乎完美。(c) 最后,由于人类分布漂移,检测器随时间持续下降;例如,当使用2010年的数据训练时,Liang等人(2024b (https://arxiv.org/html/2606.25152#bib.bib56))的监督方法估计2020年arXiv上摘要中15.1%的句子已经是LLM生成的(而实际上这个数字显然接近于零)。 在所有设置中,使用PU学习(或正负无标签,PNU)训练的测试时适应分类器对这些漂移具有鲁棒性,例如,即使在面对策略性选择的人性化工具时也能保持近乎完美的性能。总体而言,我们的工作阐明了**持续**变化的分布,无论是对抗性的还是自然性的,是鲁棒LLM检测的关键瓶颈——而现有的监督检测方法在同分布数据上表现良好(即使对于短至一个句子的文本),但在分布外文本上性能大幅下降。我们实验表明,测试时适应通过利用潜在同质性,有潜力减轻LLM文本检测中分布漂移的影响。 ## 2 概念框架:AI文本检测的测试时适应 为了激发测试时适应的动机,我们首先阐明LLM文本检测中分布漂移的特征:(1) 它们持续发生,(2) 来自漂移分布的标注数据可能稀缺。这种动态在对抗性适应中最为尖锐,可通过**策略分类**和**表现性预测**的视角来审视(Dalvi et al., 2004 (https://arxiv.org/html/2606.25152#bib.bib9); Hardt et al., 2016 (https://arxiv.org/html/2606.25152#bib.bib27); Perdomo et al., 2020 (https://arxiv.org/html/2606.25152#bib.bib74))。如图1所示,首先,检测器发布一个分类器。然后,主体(规避者)策略性地改变其特征(提交的文本)以获得有利的分类。(1) 分布漂移持续发生,检测器无法实时响应;即检测器“先行动”,因而处于劣势。像Pangram这样的检测模型通过API(或作为开源模型发布)公开发布模型预测。因此,在标准监督学习范式中,该模型是固定的(在重训练之间),而规避者可以实时响应这个固定模型;例如,用户可以在生成文本后不断编辑,直到获得有利评分。我们表明,只要对模型拥有黑盒API访问权限,构建一个击败固定模型的人性化工具也很简单;相比之下,监督模型重训练是一个缓慢的过程,需要获取新的关于人性化策略的数据并进行标注。因此,如果规避者能够将AI生成文本的分布转移到固定决策边界的另一侧,他们就总能获胜(将AI文本伪装成人类书写)。检测器仅仅适应一次并发布一个新的分类器是不够的,因为规避者可以简单地适应新的分类器。这种劣势同样适用于假设固定目标域的迁移学习或领域适应方法。直观地说,在这个框架下,检测器需要“最后行动”,即**在测试时适应规避者最新的策略性回应**。(2) 像Pangram这样公开发布的检测器无法获取发送到其API的文本的真实标签,因此无法使用监督学习框架实时重训练其模型。充其量,如果流行的人性化策略是公开可用的,检测器可以使用它们生成人性化的AI生成文本,然后定期重训练监督模型来检测它们的输出。 这些特征在自然分布漂移中同样存在。LLM不断发布和更新,持续生成标注数据并据此重训练模型的成本可能很高,或耗时较长。虽然速度较慢,但人类分布漂移可能更难应对:2022年之前的人类文本日益过时,而更近期的文本又不能保证是人工书写的。因此,获取经过验证的、近期的人工书写文本可能成本高昂(例如,需要付费雇佣写手并设法确保他们不使用LLM)。 #### 理论观察。 我们用一个简单模型将上述直觉形式化(证明见附录C)。令人类文本和初始AI文本分别从分布 \( \mathcal{H} \) 和 \( \mathcal{A} \) 中抽取。函数 \( h \) 表示分布漂移,将 \( \mathcal{A} \) 映射到 \( h(\mathcal{A}) \)。部署前,我们观察到来自 \( \mathcal{H} \) 和 \( \mathcal{A} \) 的标注样本,但未观察到来自 \( h(\mathcal{A}) \) 的样本。测试时的任务是对来自(未知)混合分布 \( \mathcal{U} \) 的样本进行分类:\( \mathcal{U} = \lambda_H H + \lambda_A A + \lambda_h h(A) \),其中 \( \lambda_A, \lambda_h > 0 \)。
相似文章
泛化动态图异常检测的在线测试时自适应方法
本文提出OTTA-DGAD,一种用于动态图异常检测的在线测试时自适应方法,它使用动态原型和记忆缓冲区来处理未见过的目标域,无需重新训练。
用于叙述生成中分布外去偏差的预调节测试时适应
本文提出 CAP-TTA,一个测试时适应框架,利用由偏差风险分数触发的预调节 LoRA 更新,在叙述生成过程中缓解大语言模型的毒性和偏差问题,实现更快的优化和相比标准基线更好的流畅性。
稀疏MLLM锚点,密集适应:打破野外测试时适应中的自指循环
本文介绍了MASA方法,该方法使用冻结的多模态大型语言模型,通过提供结构化语义描述来打破野外测试时适应中的自指循环,实现更可靠的适应。
MELD:用于AI生成文本的多任务均衡学习检测器
本文介绍了MELD,这是一种用于AI生成文本的检测器,它通过使用辅助头进行多任务学习(涵盖生成器家族、攻击类型和源域)来提高鲁棒性。MELD在RAID基准测试中表现出色,并在对抗攻击下保持低误报率。
BP-TTA: 动态场景下基于平衡与原型指导的测试时自适应
提出BP-TTA,一种通过结合批次平衡采样与原型指导约束来处理类别不平衡和持续域偏移的测试时自适应方法,在动态流式场景中实现了最先进的性能。