面向机器生成文本鲁棒水印检测的稳定性感知特征设计

arXiv cs.CL 论文

摘要

本文介绍了模式稳定性得分(PSS),一种用于机器生成文本鲁棒水印检测的新框架,在AUC上实现了10-15个百分点的提升,并能在不同的LLMs和改写器之间泛化。

arXiv:2608.18102v1 公告类型:新 摘要: 大型语言模型(LLMs)的广泛应用加剧了对区分人类与机器生成文本的规范方法的需求。水印技术提供了一条有前景的途径,但现有检测器在多次改写下以及应用于较短文本时性能急剧下降。我们引入了模式稳定性得分(PSS),一种新颖的检测框架,利用局部统计特征和跨改写变体的稳定性动态。具体来说,该方法结合全局和局部z分数特征与运行长度模式的高阶统计,通过自相关信号和基于改写深度的稳定性得分进行丰富。在三个基准数据集(PG-19、CNN/DailyMail和WikiText)上使用多个LLMs(Llama-3-8B、Qwen2-7B)和改写器(Mistral-7B、Qwen2-7B、Gemma-7B)进行数值评估,系统地对多达八轮改写下的鲁棒性进行压力测试。与先前的z分数阈值基线和一些最先进的深度学习方法相比,我们的方法在不同令牌长度下将检测AUC(受试者工作特征曲线下面积)提高了超过10-15个百分点。此外,广泛的跨领域实验证明,一个单一的通用分类器能够在不同的LLMs、改写器和文本领域之间泛化,无需重新训练,即使所有组件与训练不同,也能保持超过87.8%的AUC。
查看原文
查看缓存全文

缓存时间: 2026/08/20 09:59

# 面向机器生成文本稳健水印检测的稳定性感知特征设计  
来源:https://arxiv.org/html/2608.18102  

###### 摘要  
大型语言模型 \(LLMs\) 的广泛应用加剧了对可靠方法以区分人类文本与机器生成文本的需求。水印技术提供了一条极具前景的途径,但现有检测器在多次改写后以及应用于较短文本时,性能会急剧下降。我们提出了**模式稳定性分数** \(PSS\),这是一种新型检测框架,它利用跨改写变体的局部统计特征与稳定性动态。具体而言,所提方法结合了全局与局部z分数特征、运行长度模式的高阶统计量,并通过自相关信号以及基于改写深度计算的稳定性分数进行增强。我们在三个基准数据集(\(PG\-19\)、CNN/DailyMail 和 WikiText)上,使用多种LLMs(Llama\-3\-8B、Qwen2\-7B)和改写器(Mistral\-7B、Qwen2\-7B、Gemma\-7B)进行了数值评估,系统性地测试了高达八轮改写下的鲁棒性。与先前的z分数阈值基线以及一些先进的深度学习方法相比,我们的方法在不同令牌长度下,将检测AUC(受试者工作特征曲线下面积)提高了超过10-15个百分点。此外,广泛的跨域实验表明,一个单一的通用分类器无需重新训练即可泛化适用于不同的LLMs、改写器和文本领域,即使所有组件与训练时不同,仍能保持高于87.8%的AUC。  
水印,大型语言模型,机器生成文本检测,改写鲁棒性  

## 1 引言  
大型语言模型 \(LLMs\) 现已在消费者和企业应用中大规模部署。随着它们日益融入写作工作流程,识别机器生成内容的需求已从主要的学术探讨转变为教育(Susnjak 和 McIntosh,2024 (https://arxiv.org/html/2608.18102#bib.bib20);Cotton 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib21))、新闻业(Chen 和 Shu,2024 (https://arxiv.org/html/2608.18102#bib.bib22);Zhou 等人,2023 (https://arxiv.org/html/2608.18102#bib.bib23))以及科学政策(Blau 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib24);Gao 等人,2023 (https://arxiv.org/html/2608.18102#bib.bib25))等多个领域的实际要求。*事后*检测已有悠久的研究历史。例如,GLTR(Gehrmann 等人,2019 (https://arxiv.org/html/2608.18102#bib.bib13))利用参考语言模型的排名直方图来突出那些不成比例地使用高概率令牌的文本。这种方法效率高,但其对排名特征的依赖使其容易受到改写和领域变化的影响。类似地,Grover(Zellers 等人,2019 (https://arxiv.org/html/2608.18102#bib.bib45))联合训练生成器-判别器对,使用域内分类器进行检测。然而,当生成器或领域发生变化时,性能会下降,改写会进一步削弱鲁棒性。更近期的工作,如Binoculars(Hans 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib46)),比较两个开放语言模型下的似然度,并应用似然比准则进行零样本检测。这改善了跨域泛化能力,但对改写和短输入仍然敏感。其他方法,包括基于曲率和排名的测试,如DetectGPT及其变体(Mitchell 等人,2023 (https://arxiv.org/html/2608.18102#bib.bib6)),同样依赖于一个或多个LLM的概率访问,并且仍然容易受到改写平滑的影响。  

相比之下,我们的重点是*水印*,它具有几个独特优势:它能够在零假设下实现具有可控假阳性率的密钥假设检验,达到学习的事后分类器难以实现的统计精度水平(其错误率随领域变化),仅在检测端需要令牌身份(消除了对专有概率分布的依赖),并将归因锚定在提供者的密钥而非学习到的风格特征上。从高层次上看,水印的工作原理如下:生成器偏向于将令牌选择引向一个隐藏的“绿名单”,使得下游文本表现出可检测的统计结构,同时保持人类可读性(Kirchenbauer 等人,2023 (https://arxiv.org/html/2608.18102#bib.bib4);Qu 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib9);He 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib10);Lau 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib11))。虽然提出了其他水印方案,包括通过逆变换采样实现的无失真方案(Kuditipudi 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib54))、指数采样方法(Aaronson,2022 (https://arxiv.org/html/2608.18102#bib.bib55))和密码学不可检测的水印(Christ 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib56)),但我们的范围是绿名单家族,因为它的变体已在生产规模上部署(Dathathri 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib26))。  

标准检测器将证据汇总为一个*全局*z分数,并与阈值进行比较。然而,一个坚定的攻击者可以改写文本,稀释或局部重排此信号(Sadasivan 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib8);Cheng 等人,2025b (https://arxiv.org/html/2608.18102#bib.bib18);Mitchell 等人,2023 (https://arxiv.org/html/2608.18102#bib.bib6);Bao 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib5))。存在多种修改水印方案以使其对某些对抗性攻击(如改写)更具鲁棒性的方法(参见第2节 (https://arxiv.org/html/2608.18102#S2) 了解其他类型水印方案的综述)。这些研究促使了我们的设计选择:不是改变生成器以抵抗改写,而是改变检测器以利用改写仅不完美保留的信号,即局部结构和跨重写的稳定性。这种以检测器为中心的方法比修改水印方案具有五个实际优势。首先,它提供*部署兼容性*:简单的绿名单方案已在生产规模上采用(Dathathri 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib26)),仅检测器改进无需更改生成管道、模型架构或服务基础设施。其次,它实现*追溯适用性*:增强的检测器无需重新生成即可识别先前生成内容中的水印,为大量已加水印文本以及历史归因重要的法律、教育和新闻环境立即提供价值。第三,它通过*纵深防御*实现*鲁棒性*:将水印视为固定信号,并通过多个统计视角(局部、全局、基于稳定性)提取证据,避免了攻击者在更复杂方案中可利用的新攻击面和特定于方案的模式(Ren 等人,2024 (https://arxiv.org/html/2608.18102#bib.bib28);Yu 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib30);Diaa 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib35))。第四,它*保留生成质量和效率*,无需多比特和自适应方案所要求的强偏置或辅助模型(Xu 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib42);Feng 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib44))。最后,它通过更好的统计分析接近固定水印方案的*理论最优性极限*(Li 等人,2025a (https://arxiv.org/html/2608.18102#bib.bib40)),这与在宣布需要更强水印之前提取所有可用信息的原则一致。  

近期关于水印的工作反复强调两个未解决的差距:对*多步改写*的鲁棒性和在*短文本*上的稳定性(Sadasivan 等人,2025 (https://arxiv.org/html/2608.18102#bib.bib8);Cheng 等人,2025b (https://arxiv.org/html/2608.18102#bib.bib18))。为解决这些差距,我们研究了一个黑盒攻击者,该攻击者可以使用一个强大的指令调优LLM对任何给定文本进行多达K步的改写。攻击者*不*知道水印密钥或参数,并将保留原始语义和近似长度。设x^{(0)}表示原始段落(可能已加水印),{x^{(k)}}_{k=1}^{K}表示深度D_{1},\ldots,D_{K}下的改写版本。检测器在测试时接收单个文本(任何k=0,1,\ldots,K的x^{(k)})。我们的目标是在改写下和跨不同文本长度时保持检测能力,同时控制人类撰写内容的假阳性。  

#### 为何全局z分数在改写下失效。  
绿名单水印(Kirchenbauer 等人,2023 (https://arxiv.org/html/2608.18102#bib.bib4))在令牌上诱导了一个二元指示序列(绿色/非绿色)和一个相应的z分数,用于衡量偏离零假设的程度。二元指示序列构建如下:对于生成的文本中的每个令牌s^{(t)},如果该令牌属于绿名单G^{(t)}则赋值1,如果属于红名单R^{(t)}则赋值0。具体而言,在每个位置t,一个由前一个令牌s^{(t-1)}种子化的哈希函数确定性地将词汇表划分为大小为γ|V|的绿名单和大小为(1-γ)|V|的红名单,其中γ通常为0.25或0.5。在加水印生成期间,来自绿名单的令牌通过在其logits上添加偏置δ得到软提升。在检测时,我们通过检查每个观察到的令牌s^{(t)}是否落在其对应的绿名单G^{(t)}(赋值1)或红名单R^{(t)}(赋值0)中来重建此二元序列,使用相同的哈希函数和种子。全局测试将所有令牌汇总为一个统计量(例如z分数),该统计量仅取决于绿色令牌的总数,而不取决于绿色令牌在序列中的出现位置。改写用非绿色令牌替换一些绿色令牌,关键是,这种替换*空间上是非均匀的*:某些区域保留了强烈的水印信号,而其他区域则被大量编辑。全局z分数在完整序列上取平均,因此,存活区域中集中的证据被大量编辑的区域所稀释,即使局部证据仍然强劲,也会降低聚合统计量。相比之下,局部检测器可以通过识别水印证据集中的窗口来恢复这种异构信号,这是我们的核心动机。这种失效是结构性的:单一聚合丢弃了证据*在哪里*集中以及*如何*在编辑下表现的信息。  
参见标题图1:端到端PSS流程。人类和AI加水印文本经历最多八轮改写,在每次迭代(D0–D8)中提取二元序列。加水印文本在迭代中保持稳定的模式,而人类文本显示随机变化。XGBoost分类器使用这些稳定性特征以及静态特征进行最终分类。  

#### 关键思想:稳定性感知的局部检测。  
所提方法**模式稳定性分数** \(PSS\),是一个检测框架,它(i)通过滚动窗口提取*局部*水印证据,以及(ii)量化该证据在改写深度上的*稳定性*。具体而言,我们在0-1序列上滑动窗口,并在每个窗口内计算多个局部统计量。请注意,当窗口分割一个连续的1序列/运行时,我们最小程度地扩展窗口,以使运行不被碎片化,同时缩小尾部窗口以覆盖所有剩余令牌。对于每个窗口,我们计算20维特征集:跨窗口z分数序列的六个汇总统计量(均值、方差、最小值、最大值、偏度和峰度)、z分数的滞后1和滞后2自相关、二元序列中最长运行长度的六个汇总统计量以及最长运行频率的相同六个汇总统计量。聚合这些逐窗口特征可获得稳健的*局部*统计量。然后我们计算*模式稳定性*泛函PSS,基于轨迹x^{(j)}\to\cdots\to x^{(K)},其中D_j是给定的文本,对应某个j=0,1,\ldots,K-1。PSS的计算方式是:提取所有参与改写版本(D_j到D_K)的逐窗口局部z分数,将它们对齐到最小窗口数以保持一致性,并计算跨深度的标准差。具体而言,对于每个窗口位置w_i,我们计算\text{PSS}_i=\text{std}(z_i^{(j)},\ldots,z_i^{(K)}),其中z_i^{(k)}表示深度k下窗口i的局部z分数(k=0,1,\ldots,K),而\text{std}(\.)表示标准差函数。这个逐窗口的变异性信号随后与20个静态特征连接以形成完整的特征向量(更多细节请参见第3.4节 (https://arxiv.org/html/2608.18102#S3.SS4))。然后,一个简单的分类器(例如XGBoost或逻辑回归)在这些混合特征上使用70/30分层训练/测试分割产生最终决策。  

所提检测器背后的原理是,为了提高在潜在多步改写下的检测能力,该方法融合了两个主要成分:(i)*局部*滚动窗口统计量,保留了水印证据的空间结构(局部z分数的矩、短程自相关、最长运行长度和频率),以及(ii)不确定性度量(PSS),它跨改写深度聚合这些特征以捕获集中趋势和变异性(深度方差和可选的协调性)。局部特征暴露了被全局测试平均掉的集中绿色证据的口袋,而PSS降低了脆弱的深度特定工件的权重,并奖励在改写下持续存在的信号。这种组合将改写不变的规律性转化为可分离的特征,在高深度和短长度下产生稳定的AUC(受试者工作特征曲线下面积)(参见第4节 (https://arxiv.org/html/2608.18102#S4))。图1 (https://arxiv.org/html/2608.18102#S1.F1)可视化了端到端流程,而附录中的算法1 (https://arxiv.org/html/2608.18102#alg1)提供了伪代码。  

评估在由三个基准数据集构建的平衡语料库上进行:PG-19(长篇书籍)(Rae 等人,2020 (https://arxiv.org/html/2608.18102#bib.bib7))、CNN/DailyMail(新闻文章)(Hermann 等人,2015 (https://arxiv.org/html/2608.18102#bib.bib51))和WikiText(维基百科内容)(Merity 等人,2017 (https://arxiv.org/html/2608.18102#bib.bib50))。我们使用包括Llama-3-8B和Qwen2-7B在内的多种LLMs,采用绿名单水印方法(Kirchenbauer 等人,2023 (https://arxiv.org/html/2608.18102#bib.bib4))生成加水印段落,配置参数γ=0.25,0.5(绿名单比例)、δ=1.5(偏置)和固定的哈希密钥。为评估鲁棒性,每个段落最多改写K=9次迭代(评估在D1–D8上进行;D9用于在D8处计算PSS),使用三个不同的改写器(Mistral-7B-Instruct、Qwen2-7B-Instruct,以及

相似文章

通过句法可预测性的语言学感知型LLM水印技术

arXiv cs.CL

本文介绍了STELA,一个语言学感知的LLM水印框架,通过POS n-gram的句法可预测性来平衡文本质量和检测鲁棒性。该方法无需访问模型logits即可实现公开可验证的水印检测,在类型学多样化的语言(英语、中文、韩语)上展示了优异性能。

基于双重语义嵌入的大语言模型鲁棒文本水印

arXiv cs.CL

本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。