ARB:用于AI文本检测器评估的匹配作者重写基准数据集

arXiv cs.CL 论文

摘要

介绍ARB,一个用于评估AI文本检测器的匹配作者重写基准,表明尽管对直接LLM生成的文本具有高召回率,但当人类文本被LLM重写时,检测器性能显著下降。

arXiv:2607.29539v1 公告类型:新 摘要:标准的AI文本检测基准将人类撰写的文本与大型语言模型(LLMs)直接生成的文本进行比较。尽管先前的研究表明重写和改写会降低检测器性能,但尚不清楚在此传统基准上测量的性能能否预测当人类撰写的内容被LLM重写时检测器的表现。为解决这一差距,我们引入了作者重写基准(ARB),该基准由1,800篇人类源文本(分别来自XSum、WritingPrompts和OpenWebText各600篇)和四个开放权重生成器(Llama-3.2-3B、Qwen2.5-7B、Mistral-7B、Gemma-2-9B)构建而成。每个源项目产生四种匹配变体:人类撰写(HUMAN)、直接LLM生成(Free-LLM)、LLM重写的人类文本(H2L)以及同一生成器LLM重写的LLM文本(LLM2L)。我们在严格的1%假阳性工作点(TPR@1%FPR)下评估了五个检测器(FastDetectGPT、Binoculars-falcon-7b、RADAR、BERT-Defense、RoBERTa-Defense)。FastDetectGPT和Binoculars-falcon-7b检测到了91.2%和93.5%的直接LLM文本,但仅检测到30.8%和15.1%被LLM重写的人类文本,下降了60-78个百分点。当LLM文本被同一模型重写时,这两个检测器分别保持了78.3%和83.0%的召回率,下降幅度小得多,仅为10-13个百分点。RADAR遵循了同样的模式(从66.8%降至12.2%),而BERT-Defense和RoBERTa-Defense在所有情况下召回率均低于3%。这些结果表明,在传统人与LLM基准上测量的检测器性能并不能迁移到由LLM修改过的人类撰写文本上,尽管相同的检测器对仅LLM重写仍然基本保持鲁棒。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:37

# ARB:用于AI文本检测器评估的匹配作者身份-改写基准数据集

来源:https://arxiv.org/html/2607.29539  
\[type=author, orcid=0000\-0001\-7511\-2910\] 1\]organization=Department of Electrical Engineering and Information Technology, University of Napoli Federico II, addressline=Via Claudio 21, city=Naples, postcode=80125, country=Italy \[bioid=1\] \\cortext \[cor1\]通讯作者

###### 摘要

标准的AI文本检测基准将人类撰写的文本与大语言模型(LLM)直接生成的文本进行比较。虽然已有研究表明改写和释义会降低检测器性能,但尚不清楚在这种常规基准上测得的性能是否能预测检测器在人类撰写的内容被LLM改写时的行为。为弥补这一空白,我们提出了ARB:作者身份-改写基准(Authorship\-Rewriting Benchmark),它基于1,800篇人类源文本(XSum、WritingPrompts和OpenWebText各600篇)和四个开放权重生成器(Llama\-3\.2\-3B、Qwen2\.5\-7B、Mistral\-7B、Gemma\-2\-9B)构建。每个源条目产生四个匹配变体:人类撰写(Human)、直接LLM生成(Free\-LLM)、LLM改写的人类文本(H2L)以及同一生成器LLM改写的LLM文本(LLM2L)。我们在严格的1%假阳性工作点(TPR@1%FPR)上评估了五个检测器(FastDetectGPT、Binoculars\-falcon\-7b、RADAR、BERT\-Defense、RoBERTa\-Defense)。FastDetectGPT和Binoculars\-falcon\-7b对直接LLM文本的检出率为91.2%和93.5%,但对经LLM改写的人类文本仅为30.8%和15.1%,下降了60–78个百分点。当LLM文本被同一模型改写时,这两个检测器分别保留了78.3%和83.0%的召回率,降幅小得多,仅为10–13个百分点。RADAR呈现相同模式(从66.8%降至12.2%),而BERT\-Defense和RoBERTa\-Defense在所有情境下的召回率均低于3%。这些结果表明,在常规人类vs\.LLM基准上测得的检测器性能并不能迁移到由LLM修订的人类撰写的文本上,尽管同一批检测器对仅涉及LLM的改写基本保持鲁棒。

###### 关键词:
AI文本检测\sep定量基准\sep大语言模型\sep作者身份情境\sep改写鲁棒性\sep低假阳性评估

\{highlights\}
- 新的四情境基准将AI作者身份与AI中介改写区分开来
- 顶级检测器对直接AI生成文本的召回率达到91\-94%
- 当人类文本被AI改写时,检测器召回率降至15\-31%
- 用同一模型改写AI文本时召回率保持在78\-83%附近
- 标准人类vs\.AI基准高估了对AI改写的鲁棒性

## 1 引言

大语言模型(LLM)如今被广泛用于各类写作流程,包括起草、改写、摘要、润色和风格迁移。其下游用途不仅限于自由生成,还包括辅助写作和对现有文本的转换(Yang et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib52))。然而,AI文本检测的评估往往仍被构造成一个二分类问题:区分人类撰写的文本和模型直接生成的文本(Gehrmann et al\.,2019 (https://arxiv.org/html/2607.29539#bib.bib10); Ippolito et al\.,2020 (https://arxiv.org/html/2607.29539#bib.bib18); Mitchell et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib30); Li et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib23))。这一标准基准是必要的基线,但作为对检测器鲁棒性的实证检验并不充分。因此,本文探讨的是一个基准有效性问题,而不仅仅是释义鲁棒性问题。

核心局限在于,标准的人类vs\.LLM基准混淆了两个因素。第一个因素是*内容来源*(content origin):思想、事实、话语结构和语义内容究竟源自人类作者还是LLM。第二个因素是*语言表面*(linguistic surface):最终措辞是由人类撰写、由LLM自由生成,还是由LLM通过改写进行中介。这两个因素在真实工作流中可能发生分离。学生、记者、分析师或软件工程师可能会先写初稿,再用LLM提升流畅度。在这种情况下,最终文本具有人类来源的内容,但语言表面经过LLM中介。反过来,LLM生成的文本可能再次通过同一个LLM,但仍然保持LLM来源。因此,检测器分数可能反映直接的机器作者身份、机器中介改写、领域伪迹、解码伪迹、特定生成器线索,或这些信号的交互作用。

面向释义的基准已经表明,改写、人类化和对抗性转换可以大幅降低检测器性能(Krishna et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib21); Sadasivan et al\.,2025 (https://arxiv.org/html/2607.29539#bib.bib36); Pu et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib33); Shi et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib40); Masrour et al\.,2025 (https://arxiv.org/html/2607.29539#bib.bib27))。包含人类释义、LLM释义或人机混合文本的基准在大规模上证实了这一模式(Lau and Zubiaga,2025 (https://arxiv.org/html/2607.29539#bib.bib22); Wang et al\.,2024a (https://arxiv.org/html/2607.29539#bib.bib44); Wu et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib48); Zha et al\.,2025 (https://arxiv.org/html/2607.29539#bib.bib53))。大规模评估进一步表明,检测器性能随生成器家族、领域、语言和攻击类型而变化(Wang et al\.,2024b (https://arxiv.org/html/2607.29539#bib.bib45); Dugan et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib7); Li et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib23); Ayoobi et al\.,2025 (https://arxiv.org/html/2607.29539#bib.bib1); Stowe and Patil,2026 (https://arxiv.org/html/2607.29539#bib.bib41))。这些工作确立了释义和改写可以击破检测器这一事实,但它们主要评估的是检测器在变换文本下的性能下降。它们并没有直接检验:在常规的Humanvs\.Free\-LLM基准上测得的性能,是否能均匀地迁移到匹配的作者身份—表面情境中。

因此,主要的实证贡献并不是再次证明改写会降低检测器性能,而是证明:在常规Humanvs\.Free\-LLM基准下测得的性能,并不能均匀迁移到匹配的LLM中介改写情境中。ARB:作者身份\-改写基准(Authorship\-Rewriting Benchmark)在匹配的基准迁移设计下,将内容来源与LLM中介表面情境进行了操作性对比。它并不估计来源来源的纯因果效应。每个匹配的源条目锚定一个Human参考、一个直接Free\-LLM生成、一个人类来源的LLM中介改写(H2L),以及对应LLM输出的同一生成器二次改写(LLM2L)。这一设计将改写从一种泛化的攻击条件转变为一种诊断性比较:如果H2L性能下降而LLM2L仍接近Free\-LLM,那么常规的直接生成基准并不能可靠地代表人类来源的LLM中介写作。

我们主要在保守的低假阳性工作点评估性能,并将全局排序可分性作为次要视角,因为在教育、科学和组织场景中,对人类撰写或人类来源文本的假阳性可能代价高昂(Liang et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib24); Kirchner et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib20))。

本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.29539#S2)阐述研究目标和贡献。第3节 (https://arxiv.org/html/2607.29539#S3)回顾先前关于AI文本检测、改写鲁棒性、基准混杂和低假阳性评估的工作,并将目标与最接近的现有基准进行定位。第4节 (https://arxiv.org/html/2607.29539#S4)描述匹配的四情境基准设计。第5节 (https://arxiv.org/html/2607.29539#S5)定义所评估的检测器家族、指标、块级估计流程、配对差异和不确定性分析。第6节 (https://arxiv.org/html/2607.29539#S6)报告跨情境、检测器、数据集和生成器的实证结果,直接回应研究目标。第7节 (https://arxiv.org/html/2607.29539#S7)讨论对检测器鲁棒性和基准设计的启示,包括有效性威胁和伦理考量。最后是主要发现和建议的结论。

## 2 研究目标

本研究的基本目标是检验:在常规Humanvs\.Free\-LLM基准下测得的检测器性能,是否能够作为检测器在LLM中介改写条件下性能的有效代理;并采用一种将*内容来源*(人类或LLM撰写)与*语言表面*(直接生成或LLM中介改写)分离开来、而不是将它们合并为单一“改写”类别的设计来实现这一目标。目标如下:

- ·确定直接生成(Humanvs\.Free\-LLM)基准下估计的性能是否迁移到匹配的LLM中介改写情境,还是高估了鲁棒性。
- ·设计一个匹配的四情境基准,以数据集—生成器块内的共享源条目为锚点,将人类来源的LLM中介改写(H2L)与同一生成器、LLM来源的二次改写(LLM2L)分离开来。
- ·在固定的、保守的低假阳性工作点上量化操作的H2L–LLM2L差距,同时考虑全局排序可分性,并确定该差距可归因于来源来源、转换强度还是两者兼有。
- ·刻画检测器鲁棒性如何随检测器家族、数据集领域和生成器模型而变化,从而以分层、块级估计而非单一聚合分数的形式报告结论。

ARB:作者身份\-改写基准正是为实现这些目标而开发的基准。它在匹配的基准迁移设计下,对内容来源和LLM中介表面情境进行操作性对比;它并不估计来源来源的纯因果效应。每个匹配的源条目锚定一个Human参考、一个直接Free\-LLM生成、一个人类来源的LLM中介改写(H2L),以及对应LLM输出的同一生成器二次改写(LLM2L)。这一设计将改写从一种泛化的攻击条件转变为一种诊断性比较:如果H2L性能下降而LLM2L仍接近Free\-LLM,那么常规的直接生成基准并不能可靠地代表人类来源的LLM中介写作。我们主要在保守的低假阳性工作点评估性能,并将全局排序可分性作为次要视角,因为在教育、科学和组织场景中,对人类撰写或人类来源文本的假阳性可能代价高昂(Liang et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib24); Kirchner et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib20))。

本研究的主要贡献如下:

- ·概念贡献:提出AI文本检测器评估的基准迁移框架,将内容来源与语言表面分离,而不是将所有涉及LLM的文本合并为一个类别。
- ·设计贡献:设计了一个匹配的四情境作者身份—表面设计,在XSum、WritingPrompts和OpenWebText上包含Human、Free\-LLM、H2L以及同一生成器的LLM2L。
- ·评估贡献:使用块级配对差异、宏平均、bootstrap置信区间以及TPR@1%FPR作为主要操作端点,同时辅以AUROC。
- ·实证贡献:证明强检测器在LLM2L上保持较高的低FPR召回率,但在H2L上急剧下降,表明标准Humanvs\.Free\-LLM基准高估了对人类来源的LLM中介写作的鲁棒性。
- ·诊断贡献:通过文本变换分析以及检测器、数据集和生成器层面的异质性结果,表明操作的H2L–LLM2L差距既与来源来源相关,也与转换强度相关,并且在不同检测器家族之间并不均匀。

ARB旨在通过以下方式推进当前的AI文本检测基准评估:在四个情境中联合匹配源条目、引入同一生成器的LLM2L对照、使用配对块级差异、共享Human参考,以及在严格低FPR端点下评估的基准迁移框架;第3.4节 (https://arxiv.org/html/2607.29539#S3.SS4)在回顾完最接近的先前基准后,对该设计进行了定位。与在单一改写攻击下报告检测器性能下降的释义鲁棒性和人类化研究不同,ARB将改写视为两种不同的、匹配的作者身份—表面条件,并追问:基于一种条件(Free\-LLM)构建的基准是否能预测另一种条件(H2L、LLM2L)上的性能。这有助于更精确地理解AI文本检测器在何时、对谁仍然可靠。第6节 (https://arxiv.org/html/2607.29539#S6)直接回应这些目标:首先确立Humanvs\.Free\-LLM下的基线可检测性,然后量化H2L和同一生成器LLM2L下的性能下降,接着比较两种LLM中介情境以分离操作的H2L–LLM2L差距,最后刻画检测器家族、数据集领域和生成器模型之间的异质性。第7节 (https://arxiv.org/html/2607.29539#S7)结合上述目标对所得证据进行解读。

## 3 相关工作

本节将本研究置于先前关于AI文本检测、改写鲁棒性、基准设计和低假阳性评估的工作背景中。目标不是穷尽式地调查所有检测器变体,而是识别标准人类vs\.LLM基准的实证局限,并论证匹配四情境评估的必要性。

### 3.1 AI文本检测家族

AI文本检测已经通过多个检测器家族得到研究。最近的一项综述沿着被动/主动轴组织这一领域:被动检测器仅根据文本事后推断作者身份,而主动方法(主要是水印和生成日志检索)要求生成流程本身的配合(Xiang et al\.,2026 (https://arxiv.org/html/2607.29539#bib.bib50))。ARB仅限于被动的、事后检测器;水印不在范围内,因为它针对的是不同的部署场景,即检测器控制生成器或对其具有特权访问权限。

在被动检测内部,GLTR等统计检测器暴露了token排名的不规则性(Gehrmann et al\.,2019 (https://arxiv.org/html/2607.29539#bib.bib10));监督式检测器对BERT或RoBERTa等编码器进行微调(Ippolito et al\.,2020 (https://arxiv.org/html/2607.29539#bib.bib18); Zhuang et al\.,2021 (https://arxiv.org/html/2607.29539#bib.bib56); Li et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib23));基于似然和曲率的零样本检测器使用参考模型的概率结构,如DetectGPT和FastDetectGPT(Mitchell et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib30); Bao et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib3));对比式零样本检测器(如Binoculars)比较配对的观测者/执行者似然(Hans et al\.,2024 (https://arxiv.org/html/2607.29539#bib.bib13));面向鲁棒性的监督式检测器(如RADAR)则针对对抗性释义进行训练(Hu et al\.,2023 (https://arxiv.org/html/2607.29539#bib.bib15))。一个较新的“改写即探针”家族则使用LLM自身对候选文本的改写或修正来

相似文章

MELD:用于AI生成文本的多任务均衡学习检测器

arXiv cs.CL

本文介绍了MELD,这是一种用于AI生成文本的检测器,它通过使用辅助头进行多任务学习(涵盖生成器家族、攻击类型和源域)来提高鲁棒性。MELD在RAID基准测试中表现出色,并在对抗攻击下保持低误报率。

AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现

arXiv cs.AI

AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。

AEyeDE:一种基于注意力归因的AI生成文本检测框架

arXiv cs.CL

AEyeDE是一个基于注意力归因的框架,它使用代理Transformer模型从文本中提取注意力图,并训练轻量级CNN来区分人类撰写与AI生成的文本,性能优于纯文本基线,并且在各种设置下表现出鲁棒性。