语言模型水印中的跨语言公平性审计
摘要
本文提出了一种针对语言模型水印跨语言公平性的评估框架,揭示了语言间的差异是语言类型学结构所致,而非特定语言的个别现象。
arXiv:2608.20047v1 公告类型:新
摘要:大型语言模型输出的水印方案几乎只使用英语文本进行评估,依赖于每个方案的检测阈值和有限的质量测量。多语言部署暴露了评估设计上的选择,这些选择在英语中无关紧要,但在跨语言环境中决定了结论。我们提出一个包含四个部分的评估框架:基于部署上下文的经验校准检测阈值、一个阈值独立的伴随测量以区分校准失败与检测失败、三个互不相交的质量测量范式(分布式、成对语义和参考困惑度),以及一个基于类型学家族划分的跨语言差异广义熵分解。将该框架应用于六种水印方案、三个开放权重生成器、十一种涵盖四种文字和八个类型学家族的语言,以及基础和指令微调两种模式,揭示了单一语言单一范式评估无法显现的失败模式。在检测和质量方面,观察到的差异主要体现在类型学划分中的家族之间,表明水印中的跨语言公平性差距是语言属性的结构所致,而非特定语言的个别现象。
查看缓存全文
缓存时间: 2026/08/21 10:16
# 审计语言模型水印中的跨语言公平性
来源:https://arxiv.org/html/2608.20047
Alexander Nemecek, Osama Zafar, Debargha Ganguly, Vikash Singh,
致谢:通讯作者。单位:Vipin Chaudhary, Erman Ayday 单位:凯斯西储大学 邮箱:[\{ajn98,oxz23,dxg512,vxs465,vxc204,exa208\}@case\.edu](mailto:)
###### 摘要
针对大语言模型输出的水印方案几乎完全在英语文本上进行评估,仅使用每个方案自身的检测阈值和有限的质量测量指标。多语言部署暴露了评估设计选择中的问题——这些选择在英语环境下无关紧要,但在跨语言评估时却会影响结论。我们提出了一个包含四个组件的评估框架:根据部署环境经验校准的检测阈值、与阈值无关的伴随测量(用于区分校准失败与检测失败)、三种互斥的质量测量范式(分布范式、配对-语义范式和参考-困惑度范式),以及基于类型学家族划分的跨语言差异广义熵分解。该框架应用于六种水印方案、三个开源权重生成模型、涵盖四种书写系统和八个类型学家族的十一种语言,以及基础模型和指令微调两种模式。框架揭示了单一语言、单一范式评估无法发现的失败模式。在检测和质量方面,观察到的差异主要存在于类型学划分的家族之间,这表明水印中的跨语言公平性差距源于语言本身的结构性特征,而非特定语言的个别特性。
## 1引言
大语言模型的最新进展使得人工智能生成的文本难以与人类撰写的内容区分。这引发了对错误信息、网络内容信任度下降以及模型崩溃(即模型在部分机器生成数据上训练后,性能随代际更迭而下降)的担忧。错误信息问题尤其并非假设性的。NewsGuard 已识别出超过 3000 个以 16 种语言发布的人工智能生成新闻和信息网站,这些网站常使用听起来合法的名称,且几乎没有或完全没有人类监督。
文本水印通过嵌入可恢复的统计签名到模型输出中,提供了一种缓解措施。水印方案以依赖密钥的方式修改生成过程,最常见的是通过将下一个词元的概率分布偏向伪随机选择的词汇子集。配对检测器随后依据此签名检测候选文本并返回一个分数,经阈值判定后给出检测结果。方案通常在可检测性、生成质量(流畅度、连贯性以及与未加水印输出的分布相似性)以及对下游扰动的鲁棒性方面进行评估。
然而,这些评估几乎完全在英语提示和英语生成文本上进行。其隐含假设是,在英语上可靠检测且保持质量的方案在其他语言上也能同样表现,但这一假设尚未经过大规模实证检验。这一差距在实际中至关重要,因为水印技术已经部署在用户以数十种语言进行提示和生成的场景中,而上述多语言错误信息生态系统正是促使该技术产生的威胁面。
**我们的工作**。我们首次对大语言模型文本水印中的跨语言公平性进行系统性审计。我们的贡献是方法论和实证性的:提出一个将多语言公平性作为首要测量对象而非英语中心基准的后续切片的评估框架,并描述当前方案在该框架下的表现。
- **框架**。我们提出了四个为跨语言场景设计的评估组件:经验校准的检测阈值、与阈值无关的伴随测量(用于区分校准失败与检测失败)、三种互斥的质量范式(分布、配对-语义和参考-困惑度),以及基于预先注册的类型学划分的差异广义熵分解。
- **审计**。我们将该框架应用于六种水印方案、三个开源权重生成模型、涵盖四种书写系统和八个类型学家族的十一种语言,以及两种生成模式(并行续写和母语者指令),产生约 200,000 对在相同提示下匹配的有水印/无水印生成结果。
- **发现**。跨语言差异巨大,具有方案特异性,并且在类型学划分上主要体现为家族间差异而非特定语言的个别特性,这在检测和质量方面均成立。每个方案的排名取决于将哪种评估选择(阈值、范式、提示模式)作为标准,我们还识别出了单一语言、单一范式评估无法发现的失败模式。
## 2相关工作
**水印方案**。近期的大语言模型文本水印研究主要围绕两个设计家族展开。绿色列表对数偏差家族通过将下一个词元的概率分布偏向伪随机选择的词汇子集来工作,其变体在划分构建方式上有所不同:根据前序词元的滑动窗口按位置生成、在整个词汇表上静态生成,或通过跨语言语义聚类查找以在翻译下保持可检测性。无失真家族旨在不改变边际下一个词元的预期分布,通过置换重参数化、密钥条件锦标赛采样或针对伪随机均匀流的逆变换采样在采样时进行干预。
**水印评估**。现有的水印评估框架共享一个方法论模板:报告检测结果时使用每个方案默认的、针对理论假阳性率的阈值;报告质量时使用单一范式;提示和生成内容均为英语。MarkMyWords 和 WaterBench 在基准规模上实例化了该模板,专门的鲁棒性研究将其扩展到对抗性扰动,同时保留相同的阈值和质量约定。近期工作已认识到这一差距,呼吁进行跨语言和人口统计学上的分类评估。在单一范式报告下,这些选择在英语上无关紧要,但在跨语言评估时变得至关重要。先前的跨语言水印评估关注翻译鲁棒性,询问嵌入一种语言中的信号在经过翻译后是否存活,而非询问原始生成语言不同的情况下检测和质量是否得以保留。
**公平性方法**。水印检测器是一个二元分类器,质量测量是一个实值性能分数,因此每种语言的检测和质量向量是经典公平机器学习评估中每组性能向量在水印领域的类比。我们借鉴了该文献中的三种工具:操作点校准(为每组而非全局设置检测阈值,以暴露由校准驱动的差异);五分之四规则(将每组性能比率与最大值进行阈值比较以标记差异影响);广义熵分解(根据组的预先注册划分,将每组离散统计量分解为划分内和划分间成分)。每种工具都可以直接迁移,以语言作为组属性,类型学家族作为划分。
## 3实验网格
我们评估了一个 11 种语言 × 6 种方案 × 3 个生成器 × 2 种模式网格中的每个单元格,每个单元格中 n=500 对匹配对(一个有水印,一个无水印,基于相同提示)。网格轴的选择旨在:使 §4.4 的类型学分解有明确界定(每种书写系统和形态类别包含多种语言);能够识别基础模型与指令微调之间的敏感性(每个生成器出现在两种模式中);并且方案家族效应不会与任何单一词元分词器混淆(每个方案在三个独立词汇表上运行)。
**语言**:十一种评估语言跨越四种书写系统、八个类型学家族和两个 Joshi 等人的资源层级。表 1 列出了具体分配。该集合是广义熵分解(§4.4)的划分间成分在不止一个非单例家族上可识别的最小配置:日耳曼语族和罗曼语族均包含划分内信号,其余六个家族作为单例加入。
表 1:十一种评估语言及其书写系统、类型学家族和 Joshi 资源层级。
**水印方案**:我们评估六种方案,涵盖了 §2 介绍的两个设计家族。来自绿色列表对数偏差家族:KGW(按位置滑动窗口)、Unigram(静态绿色列表)和 XSIR(跨语言语义聚类查找,旨在翻译下保持可检测性)。来自无失真家族:DIP(置换重参数化)、SynthID-Text(密钥条件锦标赛采样)和 EXPEdit(逆变换采样)。对于 EXPEdit,我们使用其发布的快速路径检测器,它用闭式分数替代了原始的排列检验;我们验证了快速路径与慢速路径的一致性。这六种方案在以下轴线上变化,这些轴线与跨语言生成的交互是研究对象:按位置与静态绿色列表构建、对数偏差与采样时干预,以及英语训练与跨语言划分。
**生成器和模式**:我们使用三个具有不同词元分词器且对我们十一种语言有有意义覆盖的开源权重生成器家族:Mistral-NeMo-12B、Gemma-3-4B 和 Qwen2.5-7B。每个生成器都在其基础版本和指令微调版本中运行。两种生成模式旨在控制不同的跨语言混淆源。**基础模式**向每个基础生成器输入来自 FLORES++ devtest 的一个句子作为续写提示;FLORES++ 提供了同一源句在所有十一种语言上的平行翻译,因此提示内容在不同语言间保持恒定,任何检测或质量上的跨语言差异都不能归因于提示内容的变化。**指令模式**向每个指令微调生成器输入来自 AYA 数据集的母语者提示(仅使用原始标注子集,无机器翻译);AYA 提供了由目标语言使用者撰写的语言学上自然的提示分布,因此跨语言差异反映了现实部署中的输入。报告两种模式使我们能够检查跨语言差异是否在受控内容的基模型续写和其调优模型的母语指令跟随中均稳健,还是仅局限于其中一种。
**生成协议与语言识别门控**:对于每个单元格,我们生成 n=500 个有水印的输出和额外的 n=500 个无水印输出(共享相同提示和随机种子),固定 temperature=0.7、max_new_tokens=200 和 min_new_tokens=100。无水印基线在每个 (l, m, r) 三元组内的六种方案之间共享,因此单元格内的检测比较是匹配提示的。每个生成结果都经过 GlotLID-v33 进行语言标识;§5 中的总结性汇总计算时使用全集(无语言识别过滤),以避免对差异统计量的事后选择效应,针对目标和非目标语言的切片分析见附录 B。单元格中语言识别通过的无水印生成结果少于 200 个的,在 α=0.01(α=0.05 时为 100 个)水平下被排除在分位数校准之外;配对集质量测量要求每侧至少 100 个样本。
## 4评估框架
我们提出了一个包含四个组件的框架:经验校准的检测阈值(§4.1)、与阈值无关的伴随测量(用于区分校准失败与检测失败,§4.2)、三种互斥的质量范式(§4.3),以及基于类型学划分的跨语言差异广义熵分解(§4.4)。§4.5 规定了四个差异测量指标(M1-M4),对称地应用于检测和质量两侧。
### 4.1经验 FPR 阈值校准
我们将每个评估单元格索引为 c=(l,s,m,r):语言、方案、生成器、模式。每个方案 s 定义了一个分数函数 S_s: T→ℝ,其中加水印的文本获得系统性高于未加水印文本的分数。在单元格 c 内,我们观察到加水印集 X_c⁺ 和匹配提示的未加水印集 X_c⁻。六种方案中每一种都内置了一个针对独立同分布(IID)词元零假设的理论假阳性率(FPR)的硬编码阈值,但跨语言生成并不满足该零假设。在 §5 中,我们展示了一个方案-语言对,其零假设尾部在分数上限处饱和,导致没有加水印文本能超过默认阈值。因此,我们改为经验校准:在水平 α∈(0,1) 下,
τ_c(α) := Quantile_{1-α}({S_s(x) : x ∈ X_c⁻}), l相似文章
语言感知的非失真性LLM水印
介绍了LUNA,一种语言感知的LLM水印方法,实现了跨多语言的非失真嵌入和无模型检测,显著提升了AUROC和困惑度保持。
通过句法可预测性的语言学感知型LLM水印技术
本文介绍了STELA,一个语言学感知的LLM水印框架,通过POS n-gram的句法可预测性来平衡文本质量和检测鲁棒性。该方法无需访问模型logits即可实现公开可验证的水印检测,在类型学多样化的语言(英语、中文、韩语)上展示了优异性能。
语言和乐性与统计水印:意义保持变换的内在几何
本文通过使用语言和乐性形式化意义保持变换,分析了语言模型中的统计水印,证明了水印检测依赖于种子窗口的存活,并建立了水印信号的衰减定律。
基于双重语义嵌入的大语言模型鲁棒文本水印
本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。
通过语义感知偏差估计衡量 Large Audio Language Models 中的公平性
本文介绍一种语义感知混合效应回归框架,用于衡量 Large Audio Language Models 中的公平性,通过控制语义变化和说话人身份,以获得更稳健和可解释的偏差估计。