Pangram 4 技术报告
摘要
Pangram Labs 推出 Pangram 4,这是一款最先进的 AI 文本检测模型,AUROC 达到 0.9916,误报率和漏报率极低,并且提高了对对抗性攻击的鲁棒性以及混合作者身份的检测能力。
arXiv:2607.27183v1 公告类型:新论文
摘要:我们介绍了 Pangram 4,这是 Pangram Labs 最新的基于深度学习的 AI 文本分类模型。我们实现了 0.9916 的 AUROC,误报率为 0.0041%,漏报率为 0.3396%。与 Pangram 3 相比,Pangram 4 不仅整体准确率更高,还在分布外泛化能力和对抗性攻击鲁棒性方面表现更优。Pangram 4 的另一项新贡献是改进了对细粒度编辑和混合 AI-人类合著文本的区分能力。我们展示了对边界检测任务和交错式 AI 辅助检测的改进。最后,我们报告了标准 AI 检测基准上的指标,显示 Pangram 4 在多种设置和领域下的 AI 文本检测任务上达到了最先进的性能。
查看缓存全文
缓存时间: 2026/07/30 10:00
# Pangram 4 技术报告 来源:https://arxiv.org/html/2607.27183 ###### 摘要 我们推出了Pangram Labs最新基于深度学习的AI文本分类模型——Pangram 4。该模型的AUROC达到0.9916,假阳性率为0.0041%,假阴性率为0.3396%。与Pangram 3相比,Pangram 4不仅在整体准确率上有所提高,还展现出卓越的分布外泛化能力和对抗攻击鲁棒性。Pangram 4的另一项创新贡献在于其提升了区分细粒度编辑和AI-人类合著文本的能力。我们展示了在边界检测任务和交错式AI辅助检测方面的改进。最后,我们报告了标准AI检测基准上的指标,显示Pangram 4在广泛设置和领域下的AI文本检测任务中达到了最先进水平。11脚注文本:同等贡献。## 1 引言 世界正被前所未有的大量AI生成文本所淹没。超过三分之一的新互联网材料(Dolezal 等,2026(https://arxiv.org/html/2607.27183#bib.bib4))、26%的长篇社交媒体帖子(Pangram Labs,2026(https://arxiv.org/html/2607.27183#bib.bib11))、9%的新闻文章(Russell 等,2026a(https://arxiv.org/html/2607.27183#bib.bib2))以及21%的机器学习会议审稿(Pangram Labs,2025(https://arxiv.org/html/2607.27183#bib.bib10))都基本上是或完全是AI生成的。“AI垃圾”(AI slop)一词用于描述那些明显由AI生成(Shaib 等,2026(https://arxiv.org/html/2607.27183#bib.bib51))或将认知负担转嫁给读者的文本。111https://ampblog.substack.com/p/what-makes-slop-slop AI是一种能够自动化许多长周期任务的强大工具,但也很容易被误用和过度使用,从而带来社会危害。虽然已有研究表明经常使用AI的人可以通过目视检测出AI文本(Russell 等,2025(https://arxiv.org/html/2607.27183#bib.bib61)),但这是一项耗时且需要经验才能做好的艰巨任务。这造成了读者与写作者之间的努力不对称:AI几乎可以免费生成看似专家写就的、结构良好的文本,但读者仍需承担理解所摄入内容是否有意义、有根据且经过充分研究的负担。这给那些缺乏可靠区分人类与AI文本能力的现有系统带来了压力。此外,人们正在将AI融入自己的写作流程中,产生混合作者身份的文件。这些用法虽然合法,但并未减少由LLM驱动的机器人和未公开的全AI生成内容污染信息生态系统所造成的社会危害(Raj 等,2026(https://arxiv.org/html/2607.27183#bib.bib9);Drayson 等,2025(https://arxiv.org/html/2607.27183#bib.bib55);Yu 等,2026(https://arxiv.org/html/2607.27183#bib.bib56))。为了有效减轻这些危害,理解书面文件中人类和AI的参与程度至关重要。这一任务推动我们创建一个高精度、细粒度检测AI、人类以及AI辅助文本的AI文本检测模型。 我们推出Pangram Labs开发的最强大的AI文本检测模型——Pangram 4。该模型专为检测Claude Fable 5(Anthropic,2026a(https://arxiv.org/html/2607.27183#bib.bib12))和GPT-5.6 Sol(OpenAI,2026c(https://arxiv.org/html/2607.27183#bib.bib13))等前沿模型而设计,在AI文本检测任务中达到了最高准确率,同时保持假阳性率仅为0.0041%(大约每24,000个样本中有一个)。我们基于Pangram 3(一种基于EditLens架构的AI检测模型,Thai 等,2026(https://arxiv.org/html/2607.27183#bib.bib53))进行数据与架构改进。Pangram 4代表了AI文本检测技术的新前沿,具有最先进的精确率和召回率、在混合作者文本上的性能、细粒度跨度预测以及对人类化攻击的鲁棒性。参见图注图1:Pangram 4架构概览。目录 ## 2 数据 在本节中,我们报告训练集的构成。我们在广泛的领域来源、语言和生成器模型分布上进行训练。训练数据集中的人类书写源数据经过各种转换,包括合成镜像、AI编辑和翻译,以生成数据集中出现的AI生成和AI编辑文本。 ### 2.1 人类书写数据集 Pangram使用多个来源、领域和语言的人类写作数据集进行训练,类似于用于训练大型语言模型的语料库。所有用于训练Pangram的数据集要么是商业使用开放许可的,要么其权利归公司所有。Pangram 4不使用用户提交的数据、API用户的客户数据或通过未经授权的互联网爬取获得的数据。用于训练模型的文本类别的大致分布如图2(https://arxiv.org/html/2607.27183#S2.F2)所示。参见图注图2:按类别划分的人类源文本大致分布。 ### 2.2 AI生成数据集与合成镜像 与之前的Pangram模型一样,我们数据集中的AI示例完全由内部生成,来自最广泛使用的LLM分布。我们的合成镜像算法在原始Pangram技术报告中有描述(Emi and Spero,2024(https://arxiv.org/html/2607.27183#bib.bib52))。该方法用于生成多样化的AI文本数据集,并确保主题不变性。我们希望模型学习“这段文本是如何被写成的?”,而不是“这段文本是关于什么的?”。合成镜像的示例如下: ##### 合成镜像示例 合成镜像通过两个步骤生成: 1. 1. 提示:“这篇文章的主题是什么?⟨⟨原文⟩⟩” LLM响应:主题XX 2. 2. 提示:“写一篇关于XX的文章” LLM响应:原文的*合成镜像* 在可用时,合成镜像会通过额外的元数据(如文章标题或关键词)进行限定。对于问答数据集,问题本身可能就足以作为合成镜像的提示。为防止合成镜像重复人类文本,最后一步会将生成的文本与原始源进行比较,并丢弃那些原文本中有很大部分被逐字重复的示例。 ### 2.3 AI辅助文本 最近的一些工作(Zhang 等,2024(https://arxiv.org/html/2607.27183#bib.bib43);Saha and Feizi,2025(https://arxiv.org/html/2607.27183#bib.bib49);Artemova 等,2025(https://arxiv.org/html/2607.27183#bib.bib60);Saha 等,2026(https://arxiv.org/html/2607.27183#bib.bib42);Quaremba 等,2026(https://arxiv.org/html/2607.27183#bib.bib50);Dycke 等,2026(https://arxiv.org/html/2607.27183#bib.bib77);Bsharat 等,2026(https://arxiv.org/html/2607.27183#bib.bib76))评估了AI检测器检测AI润色、混合或以其他方式共同撰写(不完全属于人类书写或AI生成类别)的写作能力。我们的数据集除了人类书写文本和完全AI生成文本之外,还包含AI辅助文本。我们根据EditLens论文中描述的方法(Thai 等,2026(https://arxiv.org/html/2607.27183#bib.bib53))生成AI辅助文本。 ## 3 任务形式化 ### 3.1 什么是AI生成文本? 为了定义一个可处理的问题,我们必须首先限定我们对AI生成文本的定义。我们不能将其定义为“任何由大型语言模型产生的文本”。大型语言模型可以简单记忆并复述人类文本,无论是来自其训练集还是来自其上下文窗口。此外,大型语言模型也可以产生纯事实性信息,例如“法国的首都是什么?”或“马丁·路德·金的生日是什么?”这两个问题的答案都可能是含糊的,因此必须视为范围之外。Pangram将AI生成文本定义为:由LLM响应开放式写作任务或问题而产生的、有实质内容的原创自然语言散文。Pangram旨在检测对开放式提示和问题的响应,而不是对只有单一正确答案的问题的响应。 除了开放生成标准外,我们还要求对于AI文本,输出token的数量大于输入token的数量。虽然AI摘要是常见的编辑任务,但如果AI没有添加任何自己的原创token,则必须将输出视为人类文本。最后,我们要求文本长度至少为50个单词才能进行分析。这是模型有足够信号做出可靠预测的必要条件。这将短对话式回复排除在Pangram的范围之外。 ### 3.2 异质混合文本与同质混合文本 参见图注图3:异质混合文本与同质混合文本的区别。在异质混合文本中,每个token都有明确定义的作者。在同质混合文本中,作者归属是混合且模糊的。 为了说明我们的标注和架构选择,我们首先引入异质混合文本与同质混合文本的概念,该概念最初在EditLens论文中提出(Thai 等,2026(https://arxiv.org/html/2607.27183#bib.bib53))。在异质混合文本中,每个token都有清晰的作者标签,每个片段可以直接归属于单一作者(人类或AI)。一个例子是人类写了一段,然后让AI继续。在同质混合文本中,作者身份因编辑过程而纠缠在一起。这类混合文本的一个例子是,人类写了一段,然后与AI来回修改。在这种情况下,段落不再有明确的作者;双方都有贡献。此外,文本表面风格的来源可能与其底层思想的来源不同(Russell 等,2026b(https://arxiv.org/html/2607.27183#bib.bib59))。人类可能有一个非常成型、具体的想法,然后由AI助手措辞和改写:这也是合著的一个例子。我们以此来推动我们的标注方案,旨在区分完全AI生成的文本与那些人类提出原始想法、而AI负责最终出现在写作中的词汇选择的文本。 ### 3.3 任务定义 据我们所知,Pangram 4是第一个能够一次性同时识别同质和异质混合写作的AI检测模型。Pangram 4接收一个包含NN个token的输入序列,并为每个token在类别{human, ai-assisted, ai-generated}上生成logits Ztok∈R^(N×3)的输出。 1. 1. human表示文本完全由人类撰写,或者AI的贡献非常之低以至于可以忽略不计(例如,轻微的文案编辑、字面翻译、拼写和语法修正)。 2. 2. AI-Assisted表示文本是合著且同质混合的。尽管这个标签对于单个token来说是模糊的,但连续token的AI-Assisted标签段表明了人类与AI之间真正的合著关系。 3. 3. AI-Generated表示文本完全由AI撰写,或者文本中AI撰写的比例显著高于人类撰写——在这种情况下,我们会将预测为AI-Generated的文本定义为来自LLM的新颖文本,且与允许LLM完全原创的开放式提示一致。 由于这三个标签是逐token预测的,因此异质混合文本的预测就表示为这些标签在序列中的组合。我们还注意到,作为这种形式的推论,文本可以同时是异质和同质混合的:可能有些部分是合著的,有些部分有单一作者。 ### 3.4 人类化作为辅助任务 随着Pangram成为更强大的AI检测器,对抗性行为者逃避它的动机也更大。我们将*人类化*定义为故意转换或混淆AI生成的文本以逃避AI文本检测(Masrour 等,2025(https://arxiv.org/html/2607.27183#bib.bib70))。辅助输出估计文档是否表现出与人类化一致的特征。我们将人类化检测形式化为一个四类、文档级别的分类任务,类别为{human, ai-generated, humanized-ai, mixed-authorship}。当Pangram 4检测到存在AI生成内容的证据时,会应用这个辅助分类器。它识别逃避技术,如故意注入拼写错误、改变大小写、同义词替换、同形字攻击以及由宣传人类化或AI检测器逃避的服务所产生的转换。偶然的产物,如PDF提取错误、复制粘贴损坏、OCR错误以及编码或Unicode规范化问题,不会归类为人类化。 ### 3.5 软N-gram标注 我们事先没有混合文本的真实逐token标签。因此,我们使用算法1(https://arxiv.org/html/2607.27183#alg1)中描述的方法(称为软N-gram标注)来计算AI辅助文本的逐token标签。遵循EditLens中的假设,我们通过从确认的人类文档开始并对这些文本应用AI编辑,合成生成混合人类和AI作者文本的示例。软n-gram标注器的输入是一个人类文档SS及其对应的AI编辑文档TT,我们分别称之为源文本和目标文本。 算法1:Pangram软n-gram标注 1:源文本 SS,编辑文本 TT 2:编辑文本的标签和AI分数 fAIf_{\mathrm{AI}} 3:将 SS和 TT分割成子句 4:对于 TT中的每个子句 yy: 5: 在 SS中找到最相似的跨度 xx 6: 使用token和字符n-gram计算词汇相似度 L(x,y)L(x,y) 7: 使用文本嵌入计算语义相似度 E(x,y)E(x,y) 8: 如果 L(x,y)L(x,y) 高: 9: 将 yy标记为 Human 10: 否则如果 L(x,y)L(x,y) 或 E(x,y)E(x,y) 指示大量重写: 11: 将 yy标记为 AI-Assisted 12: 否则: 13: 将 yy标记为 AI-Generated 14: 结束如果 15:结束循环 16:令 CHC_{\mathrm{H}}、CAAC_{\mathrm{AA}} 和 CAGC_{\mathrm{AG}} 为每个标签的字符数 17: D←CH+CAA+CAGD\leftarrow C_{\mathrm{H}}+C_{\mathrm{AA}}+C_{\mathrm{AG}} 18: fAI←0.5CAA+CAGDf_{\mathrm{AI}}\leftarrow\dfrac{0.5C_{\mathrm{AA}}+C_{\mathrm{AG}}}{D} 19:返回子句标签和 fAIf_{\mathrm{AI}} 然而,我们在标注器的分辨率上与EditLens不同。EditLens(以及Pangram 3)使用LLM嵌入空间中的标量距离度量来计算SS和TT之间的相似度;而在Pangram 4中,我们转而使用子句级别的222子句被定义为一组包含主语和动词的单词。软n-gram方法,该方法松散地受到ROUGE中提出的评估指标启发(Ng and Abrecht,2015(https://arxiv.org/html/2607.27183#bib.bib65))。 ##### 子句级n-gram 软n-gram标注器的目标是提取目标TT中每个子句的细粒度来源。在选择标注器单元时,我们观察到子句是能够追溯来源的最小原子单元,对应一个可表达的“想法”。我们首先使用Claude Haiku 4.5(Anthropic,2025(https://arxiv.org/html/2607.27183#bib.bib14))将目标TT分割成子句。我们也尝试了c相似文章
推出Pangram 4(2分钟阅读)
Pangram Labs宣布推出Pangram 4,这是其迄今为止最强大的AI检测器,大幅降低了假阳性率和假阴性率,在前沿模型上实现稳健检测,并新增图像扫描功能。
探索Pangram 3.3.2的内部表示
Pangram Labs探索其AI检测模型Pangram 3.3.2的内部表示,分析模型如何在不同层中区分人工文本与AI文本,使用来自多种来源的5,000份文档的平衡数据集。
随着AI内容充斥互联网,Pangram筹集900万美元用于检测
Pangram筹集900万美元用于检测AI生成内容,推出新的文本和图像检测模型,识别AI辅助写作的准确率超过99%。
基础模型被AI检测器视为人类
这篇论文揭示,GPTZero和Pangram等商用AI检测器将基础语言模型生成的文本判定为几乎完全是人类撰写,而经过指令微调的模型输出则被标记为AI生成。作者提出了HIP,一种与检测器无关的迭代改写流程,能在保持语义的同时提升文本的类人性。
Triospect:一种面向多种攻击的鲁棒统计AI生成文本检测的三维框架
提出Triospect,一种三维框架,增强AI生成文本检测对17种攻击的鲁棒性,相较于基线实现了22.3%的AUROC提升。