PAN 2026的DACTYL团队:贝叶斯数据混合与经验X风险最小化在AI文本检测中的应用

arXiv cs.CL 论文

摘要

本文介绍了使用贝叶斯数据混合和经验X风险最小化检测AI生成文本的方法,通过ModernBERT-large和MCGrad分类器在OOD检测上取得了高性能。

arXiv:2607.17382v1 公告类型:新 摘要:现有研究表明,AI生成文本检测分类器在分布内(ID)数据上表现良好,但在分布外(OOD)文本上未能保持相同性能,表明存在对数据集特定特征的过拟合。然而,组合不同训练数据集并不总能提升性能,有时甚至可能促进捷径学习。为解决此问题,我们使用贝叶斯分类头微调BERT-tiny模型,从三个不同数据集中选择文本,构建合并训练集。我们训练了三个不同的分类器:通过经验X风险最小化微调的DeBERTa-V3-large-large和ModernBERT-large分类器,以及一个校准ModernBERT-large分类器预测的MCGrad模型。DeBERTa-V3-large-large分类器在PAN 2026测试集的五个指标(AUROC、$F_1$、C@1、Brier分数和$F_{0.5u}$)上平均得分为0.882。ModernBERT-large得分为0.96,而MCGrad以平均得分0.974获得三者最佳,在排行榜上排名第二。我们的结果强调,仔细的数据集整理可以带来强大的OOD性能。我们在https://huggingface.co/collections/ShantanuT01/panclef-2026 发布我们的ModernBERT-large和DeBERTa-V3-large模型。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:45

# PAN Lab 在 CLEF 2026 的工作笔记
来源:https://arxiv.org/html/2607.17382
\copyrightclause

本文版权归作者所有。允许在知识共享署名 4.0 国际许可协议 (CC BY 4.0) 下使用。

\conference

CLEF 2026 工作笔记,2026 年 9 月 21–24 日,德国耶拿

\[orcid=0009-0004-8470-0713, email=st980\[at\]cantab.ac.uk, url=https://shantanuthorat.io, \]\cormark\[1\]

\cortext

\[1\]本工作独立于作者在德克萨斯农工大学的雇佣关系完成。

(2026)

###### 摘要

现有研究表明,AI 生成文本检测分类器在分布内 (ID) 文本上表现出色,但在分布外 (OOD) 文本上无法保持同等性能,这表明模型过度拟合了数据集特有的特征。然而,组合不同的训练数据集并不总能提升性能,有时甚至可能鼓励捷径学习。为解决此问题,我们使用带有贝叶斯分类头的 BERT-tiny 模型进行微调,从三个不同的数据集中筛选文本,以构建一个统一的训练集。我们训练了三种不同的分类器:通过经验 X-风险最小化微调的 DeBERTa-V3-large 和 ModernBERT-large 分类器,以及一个通过 MCGrad 校准 ModernBERT-large 预测结果的模型。DeBERTa-V3-large 分类器在 PAN 2026 测试集上的五个指标 (AUROC、F1、C@1、Brier 分数和 F0.5u) 的平均得分为 0.882。ModernBERT-large 得分为 0.96,而 MCGrad 得分最高,平均分为 0.974,在排行榜上排名第二。我们的结果强调,精心的数据集筛选可以带来强大的 OOD 性能。我们将我们的 ModernBERT-large 和 DeBERTa-V3-large 模型发布在 https://huggingface.co/collections/ShantanuT01/panclef-2026。

###### 关键词:

贝叶斯神经网络\sep经验 X-风险最小化\sep多重校准\sepAI 生成文本检测

## 1 引言

PAN at CLEF 2026 的 Voight-Kampff 2026 任务聚焦于二分类 AI 生成 (AIG) 文本检测:识别一段文本是由大语言模型 (LLM) 还是人类撰写 [1 (https://arxiv.org/html/2607.17382#bib.bib1)、2 (https://arxiv.org/html/2607.17382#bib.bib2)、3 (https://arxiv.org/html/2607.17382#bib.bib3)、4 (https://arxiv.org/html/2607.17382#bib.bib4)]。尽管许多分类器在面对与其训练分布相似的文本时表现优异,但 AIG 文本检测器难以泛化到分布外 (OOD) 文本 [5 (https://arxiv.org/html/2607.17382#bib.bib5)]。我们怀疑 AIG 文本检测数据集可能包含虚假相关性——例如,文本中偶然包含一些无意的人为痕迹,恰好被映射为 AI 生成内容或人类撰写内容。例如,根据经验,我们观察到对于 RAID 基准测试集,一个 400 万参数的 (BERT-tiny) 模型取得了与更大规模分类器相当的有竞争力的 AUROC 分数 (0.967) [6 (https://arxiv.org/html/2607.17382#bib.bib6)]。在另一个 AIG 文本检测数据集 DACTYL 测试集上,BERT-tiny 取得了 0.99 的 AUROC 分数 [5 (https://arxiv.org/html/2607.17382#bib.bib5)]。这些结果表明,AIG 文本检测数据集可能包含表层特征,使得较小的模型能够获得具有误导性的高分。解决数据集特有问题的朴素方法是将数据集合并。然而,这种方法并不总能帮助机器学习模型,有时甚至会 *强化* 模型对这些虚假相关性的依赖 [7 (https://arxiv.org/html/2607.17382#bib.bib7)]。

先前解决这些问题的工作包括困难挖掘——即用模型难以处理的文本重新训练分类器——这在提升鲁棒性方面取得了一些成功 [8 (https://arxiv.org/html/2607.17382#bib.bib8)]。然而,这种技术不一定能区分真正困难的文本和仅仅是噪声的文本 (例如,损坏/幻觉生成)。这种不可区分性导致另一个问题——分类器的分数 (从 0 到 1 缩放,其中 0 表示人类撰写,1 表示 AIG) 不一定是校准的,这意味着分数本身可能不是评估分类器对某个示例信心程度的可靠信号。此外,单个 (即使是校准的) 分数也不能指示模型对输入的*不确定性*。最后,大多数基于 BERT 的分类器使用经验风险最小化 (ERM):训练循环优化交叉熵损失或其变体,如焦点损失。经验风险最小化虽然在许多分类任务和领域中取得了成功,但倾向于鼓励捷径学习,导致分类器难以泛化到 OOD 文本 [9 (https://arxiv.org/html/2607.17382#bib.bib9)]。

为了解决这些问题,我们贡献了系统以下部分:

- • 我们构建了 DACTYLv2,这是原始 DACTYL 数据集的扩展版本。
- • 为了更好地选择用于训练的文本,我们训练了带有贝叶斯神经网络 (BNN) 分类头的弱 BERT-tiny 模型 (我们将此架构称为 Bayesian BERT-tiny),该模型可以对给定文本输出不同分数,从而让我们可以计算 μ (平均分数) 和 σ (标准差)。利用这些特征,我们可以从不同数据集中筛选出用于训练的文本。这些筛选步骤使我们能够将不同数据集混合成一个最终的训练集。
- • 代替传统的 ERM,我们使用经验 X-风险最小化 (EXM),具体是通过 LibAUC 库 [10 (https://arxiv.org/html/2607.17382#bib.bib10)] 进行双向部分 AUROC 优化。EXM 在泛化能力方面显示出有希望的结果,尤其是在较大模型上 [5 (https://arxiv.org/html/2607.17382#bib.bib5)]。
- • 我们生成了三种不同的分类器:一个 ModernBERT-large 和一个 DeBERTa-V3-large 分类器 [11 (https://arxiv.org/html/2607.17382#bib.bib11)、12 (https://arxiv.org/html/2607.17382#bib.bib12)]。对于第三个分类器,我们使用弱 Bayesian BERT-tiny 分类器的不确定性 (σ) 作为特征,通过 MCGrad [13 (https://arxiv.org/html/2607.17382#bib.bib13)] 校准 ModernBERT-large。

## 2 使用的数据集

### 2.1 训练

#### 2.1.1 DACTYLv2

基于 [5 (https://arxiv.org/html/2607.17382#bib.bib5)] 的工作,我们构建了第二个版本的 DACTYL,记为 DACTYLv2——我们将 DACTYL-complete 称为 DACTYLv1 和 DACTYLv2 的组合。我们通过一次性提示生成所有 AIG 文本:我们给 LLM 提供一个人类撰写的示例作为其生成的基础。DACTYLv2 包含以下领域:

- • 博客文章 [14 (https://arxiv.org/html/2607.17382#bib.bib14)]
- • 网络文章 [15 (https://arxiv.org/html/2607.17382#bib.bib15)]
- • Medium 文章 [16 (https://arxiv.org/html/2607.17382#bib.bib16)]
- • 电影剧本 [17 (https://arxiv.org/html/2607.17382#bib.bib17)]
- • NBER 经济论文摘要 [18 (https://arxiv.org/html/2607.17382#bib.bib18)]
- • Yelp 评论 [19 (https://arxiv.org/html/2607.17382#bib.bib19)]

我们使用以下模型构建数据集:

- • Claude Haiku 4.5 [20 (https://arxiv.org/html/2607.17382#bib.bib20)]
- • Claude Sonnet 4.6 [21 (https://arxiv.org/html/2607.17382#bib.bib21)]
- • GPT 5.4 [22 (https://arxiv.org/html/2607.17382#bib.bib22)]
- • GLM 5.1 [23 (https://arxiv.org/html/2607.17382#bib.bib23)]
- • MiniMax M2.5 [24 (https://arxiv.org/html/2607.17382#bib.bib24)]
- • Mercury M2 [25 (https://arxiv.org/html/2607.17382#bib.bib25)]

我们对博客、网络文章和 Medium 文章使用了镜像提示来创建 LLM 提示,具体如 [8 (https://arxiv.org/html/2607.17382#bib.bib8)] 所述。我们向 GPT 5.4 Nano 模型提供人类文章,并要求其生成一个可能的提示,该提示可能启发了这篇文章 [26 (https://arxiv.org/html/2607.17382#bib.bib26)]。对于电影剧本,给定两个随机选择的电影剧本,我们从每个剧本中随机抽取一段 4096 个字符的摘录。我们提示 LLM 模仿第二个随机摘录的风格重写第一个随机摘录。对于 NBER 摘要,我们让 LLM 复制一个随机摘要的风格,并仅根据另一个随机选择的论文标题生成一个新摘要。对于 Yelp 评论,我们随机选择一家企业、其行业和一条随机评论,并要求 LLM 以所选评论为风格参考生成另一条评论。仅对于 Yelp 评论,我们还包含了由 Kimi-K2.5 [27 (https://arxiv.org/html/2607.17382#bib.bib27)] 生成的文本。在手动检查 Kimi-K2.5 的生成结果后,我们观察到该特定模型在风格模仿方面相比其他 LLM 存在困难,因此我们没有将该模型用于其他领域。我们在去重后,按生成器 (LLM 或人类) 和领域在表 1 中报告聚合计数。

对于开源 LLM,我们使用了 TogetherAI 和 FireworksAI 平台提供的模型 [28 (https://arxiv.org/html/2607.17382#bib.bib28)、29 (https://arxiv.org/html/2607.17382#bib.bib29)]。

表 1:DACTYLv2 按领域/模型划分的文本计数 (所有划分)
| 模型 | NBER 摘要 | Yelp | 网络文章 | 博客 | Medium 文章 | 剧本 (电影) | 文本总数 |
|------|------------|------|----------|------|--------------|--------------|----------|
| GLM 5.1 | 1,400 | 1,400 | 160 | 1,150 | 5,996 | 275 | 10,381 |
| GPT 5.4 | 1,400 | 1,400 | 160 | 1,150 | 6,000 | 275 | 10,385 |
| Sonnet 4.6 | 1,399 | 1,400 | 158 | 1,143 | 5,994 | 274 | 10,368 |
| Haiku 4.5 | 1,400 | 1,400 | 160 | 1,150 | 6,000 | 275 | 10,385 |
| Mercury 2 | 1,400 | 1,397 | 159 | 1,076 | 5,985 | 274 | 10,291 |
| Kimi-K2.5 | 0 | 1,387 | 0 | 0 | 0 | 0 | 1,387 |
| Qwen3.5-397B-A17B | 1,400 | 1,337 | 160 | 1,150 | 5,986 | 275 | 10,308 |
| MiniMax-M2.5 | 1,388 | 1,396 | 160 | 1,133 | 5,954 | 229 | 10,260 |
| Human | 30,600 | 90,078 | 21,123 | 97,727 | 156,362 | 2,200 | 398,090 |
| 总计 | 40,387 | 101,198 | 22,240 | 105,679 | 198,277 | 4,077 | 471,858 |

#### 2.1.2 外部数据集

由于 DACTYL-complete 仅包含一次性生成,我们纳入了来自其他现有数据集的文本。扩充我们的训练集也确保了最终分类器不会无意中过拟合到 DACTYL 特有的人为痕迹。我们选择了 LLMTrace (仅英文) [30 (https://arxiv.org/html/2607.17382#bib.bib30)]、Personagen 和 Stack Exchange [31 (https://arxiv.org/html/2607.17382#bib.bib31)、32 (https://arxiv.org/html/2607.17382#bib.bib32)]、MAGA-Bench (仅英文) [33 (https://arxiv.org/html/2607.17382#bib.bib33)] 以及 DetectRL [34 (https://arxiv.org/html/2607.17382#bib.bib34)] 作为额外的*候选*训练数据集,以补充 DACTYL-complete。LLMTrace 的英文划分包含多种提示类型,例如修改人类撰写的文本以及混合文本。Personagen 包含一种特定的提示风格——LLM 在生成回复前扮演特定的人类角色。MAGA-Bench 包含来自不同 LLM “对齐” (例如,角色扮演、黑盒提示优化等) 的生成。DetectRL 包含混合的 LLM 生成文本,其中单个 AIG 文本可能由不同的 LLM 贡献生成。由于 Personagen 仅包含 AIG 文本,我们对其补充了 Stack Exchange 帖子的一个子集。对于每个社区 (非元社区),我们在 2022 年 11 月 1 日之前随机抽取最多 10,000 个帖子。

### 2.2 校准

我们对其中一个模型 (ModernBERT-large) 执行额外的校准层,因为 PAN CLEF 2026 的评分指标包括 Brier 分数损失。我们使用以下表 2 中列出的数据集。对于每个数据集,我们随机抽取 2,000 个文本样本,然后进行去重,以避免较大的数据集主导我们的校准集。由于 AIG 文本相对于人类文本的不平衡,我们纳入了仅含人类文本的数据集样本:CC-News 和 Stack Exchange。我们未对 DeBERTa-V3-large 进行校准,因为它已在校准集上取得了强劲的性能。

表 2:按数据集和生成器划分的校准计数。
| 数据集 | 文本总数 | AI 文本 | 人类文本 |
|--------|----------|---------|----------|
| DACTYLv1 (验证) | 1,997 | 738 | 1,259 |
| Personagen | 2,000 | 2,000 | 0 |
| AIGC Text Bank [35 (https://arxiv.org/html/2607.17382#bib.bib35)] | 2,000 | 1,913 | 87 |
| AuthorAware | 2,000 | 2,000 | 0 |
| OpenTuringBench [36 (https://arxiv.org/html/2607.17382#bib.bib36)] | 1,995 | 1,995 | 0 |
| DACTYLv2 (验证) | 2,000 | 469 | 1,531 |
| PAN-CLEF 2025 (训练) [37 (https://arxiv.org/html/2607.17382#bib.bib37)] | 2,000 | 1,252 | 748 |
| CC News [38 (https://arxiv.org/html/2607.17382#bib.bib38)] | 1,961 | 0 | 1,961 |
| NY Times AI [39 (https://arxiv.org/html/2607.17382#bib.bib39)] | 2,000 | 1,713 | 287 |
| Stack Exchange | 2,000 | 0 | 2,000 |
| SAGE [40 (https://arxiv.org/html/2607.17382#bib.bib40)] | 1,985 | 1,523 | 462 |
| LLMTrace (英文, 验证) | 2,000 | 1,210 | 790 |
| Detect AI [41 (https://arxiv.org/html/2607.17382#bib.bib41)] | 2,000 | 1,346 | 654 |
| 总计 | 25,938 | 16,159 | 9,779 |

### 2.3 测试

我们在多个测试集上评估模型以评估泛化能力,因为今年没有像往年那样发布更新的验证集 [37 (https://arxiv.org/html/2607.17382#bib.bib37)]。我们使用下列表 3 中列出的数据集。我们纳入了 ID 测试集 (DACTYL-complete, MAGA-Bench, LLMTrace) 以及 OOD 测试集。

表 3:使用的外部测试集。
| 数据集 | 领域数量 | 使用的 LLM 数量 |
|--------|----------|----------------|
| BEEMO [42 (https://arxiv.org/html/2607.17382#bib.bib42)] | 5 | 10 |
| CoCONUTS [43 (https://arxiv.org/html/2607.17382#bib.bib43)] | 6 | 7 |
| DACTYL-complete (DACTYLv2 和 DACTYLv1 [5 (https://arxiv.org/html/2607.17382#bib.bib5)]) | 12 | 25 |
| DetectRL | 4 | 4 |
| Dolly-Cosmopedia [44 (https://arxiv.org/html/2607.17382#bib.bib44)、45 (https://arxiv.org/html/2607.17382#bib.bib45)] | 2 | 11 |
| LLMTrace (英文) | 9 | 19 |
| MAGA-Bench (英文) | 10 | 12 |
| OriginalityAI [46 (https://arxiv.org/html/2607.17382#bib.bib46)] | 未指定 | 4 |
| PAN 2025 Val [37 (https://arxiv.org/html/2607.17382#bib.bib37)] | 32 | 2 |
| Personagen + StackExchange | 4 | 6 |
| RealDet (英文) [47 (https://arxiv.org/html/2607.17382#bib.bib47)] | 15 | 22 |
| UChicago [48 (https://arxiv.org/html/2607.17382#bib.bib48)] | 6 | 4 |

## 3 数据筛选

### 3.1 贝叶斯 BERT-Tiny 分类器

为了估算数据集的泛化能力,我们在这些数据集的一个样本上训练小型分类器。每个小型分类器都是一个 BERT-tiny 模型,使用贝叶斯变体的线性层作为分类头 [49 (https://arxiv.org/html/2607.17382#bib.bib49)、50 (https://arxiv.org/html/2607.17382#bib.bib50)、51 (https://arxiv.org/html/2607.17382#bib.bib51)]。贝叶斯头的输入维度等同于 BERT-tiny 模型的隐藏大小,输出维度大小为 1。贝叶斯神经网络 (BNN) 允许估计特定输入上预测的 σ (标准差)。这种不确定性建模源于 BNN 表示其内部权重的方式——BNN 不是使用单个标量,而是将每个标量替换为一个分布 [52 (https://arxiv.org/html/2607.17382#bib.bib52)]。在推理时,我们采样一组参数用于预测。经过 n 次采样后,我们可以计算 (μ, σ),即平均分数和标准差。

训练用于分类的贝叶斯 BERT-tiny 与标准 BERT 模型的训练几乎相同,区别在于它优化的是 ELBO (证据下界) 损失。我们可以将 ELBO 损失定义为

\[
\text{ELBO} = L + \frac{\beta}{b} \text{KL} \left[ q(w|\theta) || P(w) \right]
\]
(1)

其中 \( L \) 是我们选择的损失函数,\( q(w|\theta) \) 是我们对后验的变分近似,\( P(w) \) 是我们的先验。\( \theta \) 是表征我们模型中权重 \( w \) 分布的参数。KL 散度项防止模型的权重偏离先验过远。分数 \( \beta/b \) 是一个缩放因子,以避免 KL 项主导 ELBO 损失。\( \beta \) 是一个正值 (在我们的实验中,我们将其设为 1),\( b \) 是训练期间的 mini-batch 大小。

对于五个训练集中的每一个,我们在 t 的随机样本上训练一个贝叶斯 BERT-tiny 分类器。

相似文章

MELD:用于AI生成文本的多任务均衡学习检测器

arXiv cs.CL

本文介绍了MELD,这是一种用于AI生成文本的检测器,它通过使用辅助头进行多任务学习(涵盖生成器家族、攻击类型和源域)来提高鲁棒性。MELD在RAID基准测试中表现出色,并在对抗攻击下保持低误报率。

Counter Turing Test 的发现:AI生成文本检测

arXiv cs.CL

本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。

AI生成文本检测中语言特征的系统性分析:跨领域与跨模型研究

arXiv cs.CL

一项大规模实证研究对284个语言特征在27个大语言模型和10个文本领域中的表现进行了分析,以评估哪些特征能够可靠地检测AI生成文本。研究发现,词汇丰富度指标是跨领域和跨模型最稳健的信号,而许多其他已提出的指标则高度依赖具体上下文。