机器生成文本中隐藏的类人本质:理论与检测增强

arXiv cs.CL 论文

摘要

本文揭示了机器生成文本中隐藏的类人片段的存在,并提出了一种与模型无关的堆叠增强框架,通过减少这些片段的影响来改进现有检测器。

arXiv:2605.23190v1 Announce Type: new 摘要: 大型语言模型(LLMs)生成的机器文本(MGTs)在各类应用中日益普遍,但它们在虚假新闻传播和网络钓鱼中的潜在滥用引发了严重关切,凸显了机器文本检测的必要性。现有的段落级检测方法通常将机器文本视为完全机器化的,忽视了机器生成文本中隐藏的类人本质:即使是完全由机器生成的文本也可能包含与人类写作高度一致的片段。为此,我们首先揭示了这种隐藏类人片段的存在,然后从理论上分析了它们对检测的影响。我们的分析表明,这些片段增加了检测的句子复杂度,从而使机器文本检测在本质上更加困难。基于这一发现,我们提出了一种与模型无关的堆叠增强框架,通过减少隐藏类人片段的影响来改进现有检测器。具体来说,我们将片段级别的保留决策建模为潜在变量问题,并通过一种受硬EM启发的过程来实现优化,其中检测器迭代地过滤出置信度高的类人子序列,并在剩余文本上自我优化。在各种大型语言模型和实际场景中的大量实验表明,所提出的框架能够持续增强现有检测器。值得注意的是,该框架还可以在无需训练的情况下工作,为实际部署提供了灵活性和可扩展性。
查看原文
查看缓存全文

缓存时间: 2026/05/25 09:00

# 机器生成文本隐藏的类人本质:理论与检测增强

**来源**:https://arxiv.org/html/2605.23190

陈望武,张耀明,韩波,连德富

陈望武,张耀明和韩波隶属于香港浸会大学计算机科学系,香港,中国。电子邮件:{cscwwu, ymc, bhanml}@comp.hkbu.edu.hk。连德富隶属于中国科学技术大学计算机科学与技术学院,安徽合肥230000,中国。他还隶属于认知智能国家重点实验室。电子邮件:[email protected]。通讯作者:张耀明。

###### 摘要

大型语言模型 (LLM) 生成的机器生成文本 (MGT) 在各种应用中日益普遍,但其在虚假新闻传播和网络钓鱼中的潜在滥用已引发严重担忧,凸显了 MGT 检测的必要性。现有的段落级检测方法通常将 MGT 视为完全机器化,忽略了机器生成文本隐藏的类人本质:即使是完全由机器生成的文本也可能包含与人类写作高度一致的片段。为此,我们首先揭示了此类隐藏类人片段的存在,然后从理论上分析了它们对检测的影响。我们的分析表明,这些片段增加了检测的句子复杂性,从而使 MGT 检测在本质上更加困难。基于这一发现,我们提出了一种与模型无关的堆叠增强框架,通过减少隐藏类人片段的影响来改进现有检测器。具体来说,我们将片段级的保留决策建模为潜变量问题,并使用受硬 EM 启发的过程实例化优化,其中检测器迭代地过滤出确信为类人的子序列,并在剩余文本上进行自我优化。跨越各种 LLM 和实际场景的大量实验表明,所提出的框架能够持续增强现有检测器。值得注意的是,该框架还可以在无需训练的情况下工作,为实际部署提供了灵活性和可扩展性。

## I. 引言

大型语言模型 (LLM)[1, 34]的快速发展导致机器生成文本 (MGT) 激增。尽管 MGT 可以支持广泛的应用,但其潜在滥用已引发对虚假新闻传播[55]、网络钓鱼[21]和学术欺诈[2]的严重担忧。例如,网络犯罪分子可以创建逼真的网络钓鱼电子邮件进行诈骗。这些风险凸显了有效 MGT 检测的必要性,以确保安全透明的 AI 系统[8]。句子级检测本质上具有挑战性,因为单个句子通常包含不足的上下文线索,并且容易与人类书写的文本混淆。因此,本文关注基于段落的检测,它能够更好地利用上下文信息实现鲁棒检测[41]。

现有的检测方法大致可分为两类:(1) 基于特征的检测方法通过利用生成文本的独特属性来识别 MGT,例如输出对数概率[31, 38]、语言的客观性和情感[15]、交叉熵[16]和内在维度[41]。然而,由于文本数据的复杂性,从有限数据中手动提取的特征通常无法完全捕捉复杂的模式和结构,从而导致在跨生成模型时泛化能力差。(2) 基于模型的检测方法将整个文本作为输入,使检测器能够在训练过程中隐式地学习区分特征。这类方法比特征工程方法更灵活,并受到越来越多的关注。经典例子包括基于能量的模型[41]、小型语言模型[30]、LLM[42]和图神经网络[62]。此外,数据表示的质量对于学习检测模型至关重要,例如使用预训练文本特征[9]和来自开源 LLM 的概率列表[43]的方法。

通常,上述方法通常将机器生成文本视为完全机器化的。然而,这种简化的假设忽略了 MGT 隐藏的类人本质:即使是完全由机器生成的文本也可能包含与人类写作高度一致的片段。这些类人片段削弱了检测器可用的判别性证据,并使人类书写文本与机器生成文本之间的边界更难以分离。在这种情况下,自然会出现三个关键研究问题:
- • **RQ1**:完全由机器生成的文本是否普遍包含与人类写作一致的隐藏类人片段?
- • **RQ2**:如果 RQ1 的答案是肯定的,这些隐藏的类人片段如何影响 MGT 检测,处理它们能获得什么好处?
- • **RQ3**:针对 RQ2 的挑战,我们如何改进检测模型以克服它们?

本文旨在通过解决这三个问题来研究 MGT 检测。

图 1:人类与 LLM 之间一致句子的比例。虽然有些比例很小,但跨数据集的非零值为隐藏类人片段的存在提供了经验证据。

首先,与关注人机协作产生的显式混合文本的工作[60, 44]不同,我们研究了一个更隐性的现象:即使是看似纯粹的 MGT 也可能包含隐藏的类人片段(RQ1,第 III-A 节)。具体来说,即使文本完全由 LLM 生成而非人类与机器协作编写,其某些片段仍然可能与人类写作高度一致。图 1 显示了四个数据集中机器与人类文本中一致句子的比例。这个比例提供了隐藏类人片段存在的保守下限;值大于 0 表明此类片段存在(更多讨论见第 III-A 节)。这些结果表明,完全由机器生成的文本不一定完全是机器化的。由于精确匹配仅提供保守下限,隐藏类人片段的实际出现率可能被低估。

MGT 中隐藏类人成分的存在要求我们分析其对检测的影响(RQ2,第 III-C 节)。因此,我们从理论上揭示了最佳可能检测器为实现给定 AUROC 所需的句子复杂性。结果表明,所需复杂性随着 MGT 中类人片段比例的增加而增加,并在该比例为 0 时达到最小值。这表明 MGT 隐藏的类人本质本质上阻碍了检测。

为了解决这个问题(RQ3,第 IV 节),我们首先推导出一个理论驱动的过滤原则,然后将其实现为一个实用的堆叠增强框架。具体来说,由于实践中无法观察到片段级的保留决策,我们引入了潜保留变量,以确定每个序列是应该保留用于检测还是作为确信的类人序列进行过滤。这种表述自然导致了一种受硬 EM 启发的优化策略,其中在实用的堆叠增强框架内交替进行潜掩码估计和检测器精化。在硬 E 步中,检测器过滤掉确信为类人的序列,产生更简单的后过滤分布。在硬 M 步中,使用剩余序列精化同一个检测器。改进后的检测器在下一个 E 步中再次使用,从而实现迭代的自我增强。

我们的贡献总结如下:
- • **我们揭示了机器生成文本隐藏的类人本质(第 III-A 节)。** 我们表明,即使是完全由机器生成的文本也可能包含难以与人类书写区分的类人片段。这揭示了 MGT 的一个更一般且被忽视的特性,使检测比之前认识到的更具挑战性。
- • **我们从理论上分析了隐藏类人成分对检测的影响(第 III-C 节)。** 我们提供了理论证据,证明 MGT 内部的类人成分会增加检测难度。这一分析解释了先前的经验观察,并激励对这类隐藏成分进行显式建模。
- • **我们提出了一个理论驱动的检测增强框架(第 IV 节)。** 受理论发现的启发,我们首先建立了一个基于过滤的增强原则,然后通过将片段级保留决策建模为潜变量,将其实例化为一个实用的堆叠框架。其关键贡献在于一个通用框架,该框架还可以支持其他推理和优化策略。
- • **大量实验证明了所提出的检测增强框架的有效性(第 V 节)。** 我们在跨 LLM、跨领域、释义文本和显式混合等实际场景中进行了实验,结果证明了我们的框架在增强现有检测器方面的潜力。

## II. 相关工作

在本节中,我们概述检测工作,这些工作可分为基于水印、基于特征和基于模型的方法[12]。隐藏在文本中的水印指示其是 AI 生成的。现有工作[25]建议在文本生成过程中适度推广预定义的“绿色”令牌,并提出了一种统计检验方法来检测水印。Unigram-Watermark[61]通过扩展现有方法并采用简化的固定分组策略提出。然而,基于水印的方法需要模型具有高权限,这限制了其广泛适用性。此外,最近的工作[59, 24]表明,强水印难以实现且易受水印攻击。

基于特征的方法利用统计和语言特征来区分人类书写和机器生成文本,无需在特定数据集上训练。早期研究主要使用令牌级概率统计,如对数似然[38]、熵[13]及其变体[39, 63],基于生成文本通常表现出独特概率模式的观察。DetectGPT[31]进一步观察到,生成文本的微小扰动通常会导致比原始样本更低的 log 概率。后续工作通过更高效或任务特定的扰动、重写、续写和比较策略扩展了这一想法[3, 52, 53, 32, 64]。除基于概率的分数外,近期研究探索了生成文本更丰富的内在信号,包括内在维度[41]、代理模型激活特征[6]、时间概率模式[51]、相对概率谱[50]和风格感知的不确定性[48]。最近的方法进一步考虑了层次关系、修复努力、分布外泛化、提示推理和多级语言分布[20, 65, 56, 7, 17]。尽管这些方法揭示了 MGT 的多种属性,但它们通常依赖于特定的可观察特征或模型依赖的信号,难以全面捕捉生成文本复杂的、隐藏的类人特征。

基于模型的方法代表了 MGT 检测的经典范式,其中检测器作为人类书写和机器生成文本上的二元分类器进行训练。与显式的基于特征的方法不同,基于模型的检测器通常将整个文本作为输入,并在训练过程中学习隐式的判别模式[4]。代表性系统,如 OpenAI Detector[38]、ChatGPT Detector[15]、GPTZero[14]和 G3 Detector[58],收集由不同 LLM 生成的文本来训练统一分类器。近期研究进一步表明,较小或部分训练的语言模型可以作为有效的通用检测器[30],并且检测器应针对日益先进的生成模型进行评估[33]。除了原始文本分类外,一些方法设计了替代输入或辅助信号。GLTR[13]使用令牌排名特征进行逻辑回归,而 SeqXGPT[43]将 logit 序列视为类似波形的信号。LLMDet[49]结合了代理模型的困惑度,基于图的方法对事实结构进行建模以捕捉文档级一致性[62]。最近的研究探索了先进的训练范式,包括 GPT-Pat[54]中的混合解码策略、MPU[40]中的正-无标记学习、RADAR[22]中的对抗训练、Ghostbuster[42]中针对未知来源检测的代理模型训练。

相似文章

基础模型被AI检测器视为人类

arXiv cs.CL

这篇论文揭示,GPTZero和Pangram等商用AI检测器将基础语言模型生成的文本判定为几乎完全是人类撰写,而经过指令微调的模型输出则被标记为AI生成。作者提出了HIP,一种与检测器无关的迭代改写流程,能在保持语义的同时提升文本的类人性。

聚光灯与盲区:机器生成文本检测的评估

arXiv cs.CL

# 聚光灯与盲区:机器生成文本检测的评估 来源:[https://arxiv.org/html/2604.16607](https://arxiv.org/html/2604.16607) ###### 摘要 随着生成式语言模型的兴起,机器生成文本检测已成为一项关键挑战。尽管模型种类繁多,但不一致的数据集、评估指标和评估策略使得模型有效性的比较变得模糊。为此,我们从...

对机器文本检测器的攻击保留风格指纹

Hugging Face Daily Papers

本文研究了对机器文本检测器的规避攻击,发现虽然当前攻击会降低检测器性能,但风格指纹仍然存在。一种模仿人类风格的新型释义方法能够规避甚至基于风格的检测器,但多文档分析可恢复可检测性。

对数似然、辛普森悖论与机器生成文本的检测

arXiv cs.CL

本文通过指出基于似然的机器生成文本检测器在 token 分数聚合中存在的辛普森悖论,解决了此类检测器性能下降的问题。本文提出了一种学习到的局部校准步骤,显著提升了各种模型和数据集上的检测性能。