MD-ProTector:为LLM生成文本检测定位多个数据驱动原型

arXiv cs.CL 论文

摘要

MD-ProTector是一篇研究论文,提出了一种基于原型的LLM生成文本检测方法,每个类别使用多个可训练参考向量来捕获类内差异,并提高跨领域、生成器、语言和对抗性编辑的鲁棒性。

arXiv:2608.10459v1 公告类型:新增 摘要:随着LLM生成内容变得越来越复杂,用于区分这些文本与人类撰写文本的检测系统必须在大规模运行的同时,处理多样化的写作风格、领域、语言和生成器模型。仅输入编码器检测器适用于实际部署场景,但标准的二分类仅提供类别标签,并未显式组织任一类别内部的显著差异。我们提出MD-ProTector,该方法在编码器嵌入空间中用多个可训练参考向量表示每个类别,这些向量称为原型。这些原型为同一类别内不同文本组提供独立的决策边界。然而,仅添加多个原型并不能确定每个原型应代表哪种差异。MD-ProTector通过原型定位损失解决这一问题,该损失将类别级结构与区分各个原型的类内差异分离开来。在来自三个大规模基准的五个设置上进行的评估,涵盖领域、生成器、语言和对抗性变化,MD-ProTector在MAGE CDCM和RAID上取得了最高的AvgRec,在所比较的基于编码器的方法中,在RAID上取得了最高的AUROC和最低的FPR95。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:35

# MD-ProTector:为LLM生成文本检测定位多个数据驱动原型

来源:https://arxiv.org/html/2608.10459
Jinmo Han Jimin Hong Chanyeong Moon Ju Yeon Kang Seonuk Kim Nam Soo Kim  
首尔大学电气与计算机工程系及INMC,韩国首尔  
\{jinmo, jimin, chanyeong\}@hi\.snu\.ac\.kr  
\{juyeon, seonuk\}@hi\.snu\.ac\.kr  
nkim@snu\.ac\.kr

###### 摘要

随着LLM生成内容日益复杂,用于区分这些文本与人类书写文本的检测系统必须在大规模场景下运行,同时处理多样的写作风格、领域、语言和生成器模型。仅基于输入的编码器检测器适合实际部署场景,但标准的二分类仅提供类别标签,并未显式组织每一类内部的大量变化。我们提出MD-ProTector,它在编码器嵌入空间中用多个可训练参考向量(称为原型)来表示每个类别。这些原型为同一类别内的不同文本组提供独立的决策边界。然而,仅增加多个原型并不能决定每个原型应表示哪种类别内变化模式。MD-ProTector通过原型定位损失(Prototype Positioning loss)解决该问题,该损失将类别级结构与区分单个原型的类内变化分离开来。在覆盖领域、生成器、语言和对抗变异的三个大规模基准的五个设置上评估,MD-ProTector在MAGE CDCM和RAID上取得最高的AvgRec,并在RAID上取得最高的AUROC和最低的FPR95,优于所比较的基于编码器的方法。

MD-ProTector:为LLM生成文本检测定位多个数据驱动原型

Jinmo Han Jimin Hong Chanyeong Moon  
Ju Yeon Kang Seonuk Kim Nam Soo Kim  
首尔大学电气与计算机工程系及INMC,韩国首尔  
\{jinmo, jimin, chanyeong\}@hi\.snu\.ac\.kr  
\{juyeon, seonuk\}@hi\.snu\.ac\.kr  
nkim@snu\.ac\.kr

## 1 引言

随着大语言模型日益复杂且广泛可用,检测文本是人类书写还是LLM生成已成为确保数字通信可信度的关键(Kwon和Jang, 2025 (https://arxiv.org/html/2608.10459#bib.bib24))。这对于阻止自动化假新闻和钓鱼攻击以及维护学术诚信尤为关键(Najjar等, 2025 (https://arxiv.org/html/2608.10459#bib.bib33))。在大规模部署场景中,检测系统必须应用于覆盖多样写作风格、领域和生成器模型的海量内容(Li等, 2024 (https://arxiv.org/html/2608.10459#bib.bib25))。处理这种多样性对于运行在真实世界场景(包括各种领域、写作风格、生成器和对抗性编辑情况)中的实用检测系统至关重要(Wu等, 2024 (https://arxiv.org/html/2608.10459#bib.bib45))。

参见图注
图1:基于原型的推理。给定输入文本xx,MD-ProTector将其编码为归一化嵌入zz,并与机器原型库和人类原型库进行比较。检测分数为S(z)=s1(z)−s0(z)S(z)=s_{1}(z)−s_{0}(z),其中s0(z)s_{0}(z)和s1(z)s_{1}(z)分别是对机器原型和人类原型的最大相似度。在这些实际部署设置中,水印或模型内部评分(如对数似然)并不能保证可用(Christ等, 2024 (https://arxiv.org/html/2608.10459#bib.bib6);Mitchell等, 2023 (https://arxiv.org/html/2608.10459#bib.bib32))。在这些条件下,基于轻量级文本编码器的检测器提供了实用的解决方案。它们直接操作输入文本,无需访问生成流程或模型内部(Kuznetsov等, 2024 (https://arxiv.org/html/2608.10459#bib.bib23))。这也允许一个编码器流水线在不访问生成器内部的情况下适配目标领域(Rodriguez等, 2022 (https://arxiv.org/html/2608.10459#bib.bib35))。

基于编码器的检测器最简单的设计之一是附加一个二分类头,并使用交叉熵损失进行训练(Ippolito等, 2020 (https://arxiv.org/html/2608.10459#bib.bib20))。尽管写作风格和领域存在这种类内多样性,但在这种设计下,所有文本在训练期间都被简化为两个类别。标准的二分类目标是一种粗粒度的监督信号,它没有显式考虑这种类内多样性(Cui等, 2016 (https://arxiv.org/html/2608.10459#bib.bib7))。先前的一些工作试图通过增加结构约束来超越标准二分类公式,但仍在至少一个类别中忽视了类内多样性,这可能限制检测性能(Guo等, 2024b (https://arxiv.org/html/2608.10459#bib.bib15);Zeng等, 2025 (https://arxiv.org/html/2608.10459#bib.bib49))。这一观察促使检测器使用多个局部代表而非单一全局类别表示来表示人类书写文本和LLM生成文本。

一个自然的扩展是在嵌入空间中使用多个可训练参考向量来表示每个类别,我们将其称为原型。然而,仅凭原型数量并不能决定每个原型应表示哪种类内变化模式。如果没有针对原型的特定目标,不同的原型可能保持冗余或捕获重叠的模式。

因此,我们提出MD-ProTector,一种仅基于输入的编码器检测器,它为分离的人类原型和机器原型学习数据驱动的位置。MD-ProTector将每个类别内共享的方向与区分该类别内样本组的变异分开。原型定位损失利用这种变异赋予不同原型不同的角色,而互补的目标则保持每个原型与相应的人类或机器类别对齐。学习到的原型库直接定义了图1 (https://arxiv.org/html/2608.10459#S1.F1)所示的人类–机器检测分数。

我们在混合领域和生成器条件、对抗扰动、多语言泛化、留出领域和留出生成器模型下评估MD-ProTector。在与相同数据、主干网络和验证协议下训练的所有输入编码器检测器中,MD-ProTector在全部五个设置中AvgRec均排名前二。它在MAGE CDCM和RAID上取得最高的AvgRec,并在RAID上同时取得最高的AUROC和最低的FPR95,而DeTeCtive在M4上仍然更强。消融研究表明,原型定位(Prototype Positioning)优于其他原型多量化方法,例如直接原型排斥以及在移除类别共享方向之前进行定位。

我们的贡献如下:

- •我们开发了一种仅基于输入的LLM生成文本检测器,其中分离的人类原型库和机器原型库直接定义检测分数。
- •我们引入了原型定位损失,以数据驱动的方式将每个原型放置在捕获类内变异的位置。
- •我们在五个受控的仅输入编码器设置中评估MD-ProTector,它在MAGE和RAID上领先AvgRec,并在RAID上获得最高的AUROC和最低的FPR95。

## 2 相关工作

### 2.1 LLM生成文本检测

先前关于LLM生成文本检测的工作包括水印、零样本统计方法和有监督分类器,具体取决于模型访问权限和所用检测信号类型(Wu等, 2025a (https://arxiv.org/html/2608.10459#bib.bib44))。水印在生成期间注入可识别的模式,使模型提供商能够验证内容来源(Kirchenbauer等, 2023 (https://arxiv.org/html/2608.10459#bib.bib34))。零样本统计检测器,如GLTR、DetectGPT、Fast-DetectGPT和Binoculars,在不进行任务特定训练的情况下使用词元概率、概率曲率或跨模型似然比(Gehrmann等, 2019 (https://arxiv.org/html/2608.10459#bib.bib13);Mitchell等, 2023 (https://arxiv.org/html/2608.10459#bib.bib32);Bao等, 2024 (https://arxiv.org/html/2608.10459#bib.bib3);Hans等, 2024 (https://arxiv.org/html/2608.10459#bib.bib16))。BISCOPE、ImBD、DetectAnyLLM和PAWN进一步通过记忆化、风格对齐差异、任务导向差异学习或学习到的词元加权来细化基于模型的评分(Guo等, 2024a (https://arxiv.org/html/2608.10459#bib.bib14);Chen等, 2025 (https://arxiv.org/html/2608.10459#bib.bib5);Fu等, 2025 (https://arxiv.org/html/2608.10459#bib.bib11);Miralles-González等, 2026 (https://arxiv.org/html/2608.10459#bib.bib31))。基于重写的方法则使用辅助LLM产生的变化量或变化模式(Mao等, 2024 (https://arxiv.org/html/2608.10459#bib.bib29);Hao等, 2025 (https://arxiv.org/html/2608.10459#bib.bib17))。这些方法可以提供很强的检测信号,但需要访问评分语言模型、辅助生成调用或生成器的配合。

作为大规模部署场景中的实用替代方案,有监督检测器可以直接操作输入文本,适用于现实环境中的部署(Bakhtin等, 2019 (https://arxiv.org/html/2608.10459#bib.bib2);Uchendu等, 2020 (https://arxiv.org/html/2608.10459#bib.bib37);Wang等, 2023 (https://arxiv.org/html/2608.10459#bib.bib39))。这些检测器通常依赖编码器架构,如BERT(Devlin等, 2019 (https://arxiv.org/html/2608.10459#bib.bib8))或RoBERTa(Liu等, 2019 (https://arxiv.org/html/2608.10459#bib.bib27))。Ghostbuster使用多个较弱语言模型提取的特征构建分类器,RADAR通过对抗训练提高释义鲁棒性,MoSEs通过输入相关阈值估计建模风格参考(Verma等, 2024 (https://arxiv.org/html/2608.10459#bib.bib38);Hu等, 2023 (https://arxiv.org/html/2608.10459#bib.bib19);Wu等, 2025b (https://arxiv.org/html/2608.10459#bib.bib46))。尽管这些有监督检测器很高效,但当领域或生成器分布变化时,它们仍可能性能下降(Bakhtin等, 2019 (https://arxiv.org/html/2608.10459#bib.bib2);Li等, 2024 (https://arxiv.org/html/2608.10459#bib.bib25);Wu等, 2024 (https://arxiv.org/html/2608.10459#bib.bib45))。

因此,近期工作在表示空间上施加更强的结构。DeTeCtive通过作者和风格感知的对比监督来组织文本实例,并执行KNN推理(Guo等, 2024b (https://arxiv.org/html/2608.10459#bib.bib15))。DSVDD采用单类方法,压缩机器生成嵌入并将人类书写文本视为分布外数据(Zeng等, 2025 (https://arxiv.org/html/2608.10459#bib.bib49))。SAMP使用源模型监督,用多个原型表示两个类别(Xu等, 2026 (https://arxiv.org/html/2608.10459#bib.bib48))。尽管这些方法引入了实例级结构、单类紧凑性或源感知原型,但仅靠二分类监督并不能指定内部变异应如何为多个人类原型和机器原型形成不同的训练目标。MD-ProTector通过从其关联样本的集线器移除残差中为每个原型构建独立的定位目标来解决这一空缺。

### 2.2 基于原型的表示学习

基于原型的方法在嵌入空间中使用一个或多个代表点来表示每个类别,并根据输入与这些原型的相似度进行分类。一个典型例子是原型网络(Prototypical Networks),它计算支持样本的均值嵌入作为类别原型,并在度量学习框架中按距离对查询进行分类(Snell等, 2017 (https://arxiv.org/html/2608.10459#bib.bib36))。ProtoFewRoBERTa将该情景公式应用于AI生成评论的小样本检测,而ProtoryNet学习句子级参考模式并从原型轨迹中对文档进行分类(Agrahari等, 2025 (https://arxiv.org/html/2608.10459#bib.bib1);Hong等, 2023 (https://arxiv.org/html/2608.10459#bib.bib18))。这些方法将原型确立为数据驱动的类别摘要或可解释的参考模式。

基于原型的表示也已应用于标准分类之外。原型对比学习(Prototypical Contrastive Learning)将原型估计为用于表示学习的潜在聚类变量(Li等, 2021 (https://arxiv.org/html/2608.10459#bib.bib26))。OOD方法使用类别原型、多样化原型或原型混合来表示已知数据分布并对不熟悉的输入进行评分(Chen等, 2024 (https://arxiv.org/html/2608.10459#bib.bib4);Jia等, 2025 (https://arxiv.org/html/2608.10459#bib.bib21);Lu等, 2024 (https://arxiv.org/html/2608.10459#bib.bib28))。多个正常原型同样已被用于异常检测,多原型建模也已应用于开放集噪声标签学习(Dong等, 2024 (https://arxiv.org/html/2608.10459#bib.bib9);Zhang等, 2025 (https://arxiv.org/html/2608.10459#bib.bib50))。

先前的多原型方法从完整样本嵌入中学习原型,或通过分配和分离目标进行学习,这使得类别共享方向与区分单个原型的变异之间的各自角色未被充分确定。没有这种区分,学习目标就无法指定哪个分量应保留类别决策,哪个分量应组织类别内的多个代表。MD-ProTector通过保留类别共享方向作为类别集线器,并使用分配加权、与集线器正交的残差来定位每个原型,从而解决了这一歧义。

## 3 提出的方法

参见图注
图2:训练目标概览。圆圈表示类别集线器,星号表示可学习原型,点表示样本嵌入,菱形表示样本残差的分配加权聚合。原型到类别(Prototype-to-Class)将原型与其类别集线器对齐。样本到原型(Sample-to-Prototype)将样本与其真实类别的原型库相关联。原型定位(Prototype Positioning)在移除类别集线器方向后,将每个原型的残差向量与为该原型构造的聚合对齐。在面板(c)中,pc,s⟂p_{c,s}^{\perp}表示另一个原型在s≠rs\neq r时的残差向量。MD-ProTector联合学习一个编码器和用于人类书写文本与LLM生成文本的分离原型库。原型定位根据其关联样本的残差变异来组织每个原型,而原型到类别和样本到原型则保持类别对齐和样本关联。学习到的原型库直接用于检测。

### 3.1 问题建模与编码器

给定输入文本xix_{i},每个样本具有二值标签yi∈{0,1}y_{i}\in\{0,1\},其中yi=0y_{i}=0表示LLM生成的文本,yi=1y_{i}=1表示人类书写的文本。轻量级编码器fθf_{\theta}将输入映射为词元级表示,然后进行均值池化和归一化,得到

zi=norm(fθ(xi)),z_{i}=\mathrm{norm}\left(f_{\theta}(x_{i})\right),(1)
其中norm(v)=v/∥v∥2\mathrm{norm}(v)=v/\lVert v\rVert_{2}表示l2\ell_{2}归一化。

对于一个小批量BB,其中两个类别均有表示,设Bc={i∈B:yi=c}B_{c}=\{i\in B:y_{i}=c\}。类别

相似文章

MELD:用于AI生成文本的多任务均衡学习检测器

arXiv cs.CL

本文介绍了MELD,这是一种用于AI生成文本的检测器,它通过使用辅助头进行多任务学习(涵盖生成器家族、攻击类型和源域)来提高鲁棒性。MELD在RAID基准测试中表现出色,并在对抗攻击下保持低误报率。

多层次上下文Token关系建模用于机器生成文本检测

arXiv cs.CL

本文提出了一种用于机器生成文本检测的多层次上下文Token关系建模框架,融合局部马尔可夫信息校准与全局规则支撑推理,以低计算开销提升跨大语言模型和跨领域场景下的检测性能。