语言和乐性与统计水印:意义保持变换的内在几何

arXiv cs.CL 论文

摘要

本文通过使用语言和乐性形式化意义保持变换,分析了语言模型中的统计水印,证明了水印检测依赖于种子窗口的存活,并建立了水印信号的衰减定律。

arXiv:2608.19369v1 Announce Type: new 摘要:语言模型的统计水印存在于能指的自由度中:它们在意义几乎等价的令牌中选择,因此会被那些改变文本形式而保留内容的变换所侵蚀。文献通过端点来测量这些变换,即原始文本和改写文本之间的语义相似度。我们证明端点是错误的统计量。采用语言循环的形式主义,我们证明了一系列意义保持变换的不变量可以典型地分解为端点部分和初始状态稳定子中的和乐性,后者是语义赤字无法看到的;循环旋转是嵌入空间单位球面上的平行移动,因此与Wilson环的类比成为一个定理,而非比喻。在检测器方面,我们证明了一个精确的恒等式:残差统计量与种子窗口完整存活的位置数量成正比,由此独立编辑推论得出衰减定律 $\rho^{h+1}$。这个恒等式有一个令人不安的后果,我们已确认到三位小数:在相同的保留率下,存活的信号可能是原始信号的一半、四分之一,或完全没有,这仅取决于编辑发生的位置。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:02

# 语言学完整群与统计水印:保义变换的内在几何
来源:https://arxiv.org/html/2608.19369

Daniele Corradetti  
所属机构:数学物理组,里斯本理工学院  
所属机构:Av. Rovisco Pais, 1049-001 Lisboa, Portugal  
所属机构:阿尔加维大学数学系  
所属机构:Campus de Gambelas, 8005-139 Faro, Portugal  
电子邮件:[[email protected]](mailto:)

###### 摘要
语言模型的统计水印存在于能指的自由度中:它们在意义几乎等价的词元间进行选择,因此恰好被那些保持内容不变而改变文本形式的变换所侵蚀。现有文献通过语义相似度来衡量这些变换的终点效应。我们证明终点是错误的统计量。通过调整语言环的形式化框架,我们证明保义变换链的不变量可典范分解为终点部分与初始状态稳定子群中的完整群两部分,语义赤字无法感知后者;环旋转是嵌入空间单位球上的平行移动,因此与威尔逊环的类比不再是修辞手法而成为定理。在检测器方面,我们证明了一个精确恒等式:残余统计量与播种窗口完整无缺的位置数量成正比,由此推导出独立编辑下的衰减规律 ρ<sup>h+1</sup>。该恒等式导致一个令人困惑的结论(经验证精确到小数点后三位):在相同保留率下,存活信号可能为原始值的二分之一、四分之一或完全归零,这仅取决于编辑发生的位置。

## 1 引言与动机
当雷蒙·格诺于1947年发表《文体练习》时(受巴赫《赋格的艺术》启发),他将同一个琐碎轶事改写了九十九次。一个男人在公交车上被挤到;两小时后朋友建议他移动大衣上的一粒纽扣。除此之外再无其他事件。变化的是其他一切:语体、时态、人称、字母表、十四行诗格式、数学家的语言。内容通过约定保持固定,形式则被允许自由演变。格诺自认为在进行本质上几何的操作,并将该作品的早期版本命名为《十二面体》;正如文献[4]所论证的,这种直觉绝非偶然。八十年后,同一操作获得了对抗性用途。自2026年8月2日起,至少一个主要语言模型的输出携带机器可读标记,以响应欧盟人工智能法案第50条的透明度要求[1]。此类标记的公开描述十分谨慎:标记不改变意义、质量或可读性,能经受复制和轻度编辑,但据称在转述、重度编辑、翻译及与其他文本混合时会丢失。因此,任何希望移除标记的人,都被邀请进行一次"文体练习"。该练习能保留多少标记,正是本文的研究对象。

### 研究图景
主流构造是Kirchenbauer等人提出的"绿名单"水印[7]:每一步都根据密钥和前h个词元,将词表中相对比例为γ的伪随机子集标记为"绿名单",并提升绿名单词元的logit值δ<sub>b</sub>。检测器通过计算绿名单词元数量获得z分数。令h=0即得Zhao等人的单字符方案[15],其鲁棒性可证。另一系列方法由Aaronson开创,经Kuditipudi等人[10]及Christ、Gunn与Zamir[2]发展,在数学上保持输出分布不变,转而替换采样器的随机源——这些是"无失真"方案。文献[5]描述了采用锦标赛采样的大规模生产部署。全景概览见表1。表1 *文本水印系列概览表。最后一列对本文至关重要:除单字符方案外,每个系列中的一次编辑不仅影响其所及位置,还影响所有以其作为播种上下文的位置。第4节的几何与第5节的恒等式精确刻画了这种不对称性。* 与此对立的是攻击研究文献。Krishna等人[9]提出了专用转述器;Sadasivan等人[13]进行了迭代;最近的大规模研究[3]将重写链延伸至五层,报告检测率从原始输出的87.9%下降至五次跳转后的4.86%。Kirchenbauer等人[8]已凭经验观察到,更长的播种上下文会降低水印对编辑的鲁棒性。所有研究共享一种测量习惯:攻击通过终点效应评分——即原文与最终文本的语义相似度,以及两者间隔的词元或跳转次数。中间状态被视为脚手架。

### 研究缺口
这种习惯并非无害。考虑从同一文本出发、最终指向相同语义文本的两条重写链。一条直捷;另一条辗转三种语言后回归。按任何终点度量,它们是相同攻击。但果真如此?要提出这个问题,就需要一种将中间状态视为研究对象本身而非工具的形式化框架。这种框架确实存在。文献[4]将"语言环"定义为保持语义核心而移动能指的变换链,将其"语义赤字"定义为首尾嵌入状态的余弦距离,并通过连续状态间最小旋转的复合,将旋转R<sub>𝒰</sub>∈SO(n)与整条链关联。该文提出用由R<sub>𝒰</sub>构建的二次型签名作为环的不变量,并将该构造与格点规范理论的威尔逊环进行类比。我们沿用该框架,并发现三点:首先,所提不变量退化了。表示矩阵I<sub>n</sub>−R<sub>𝒰</sub><sup>*</sup>总是半正定,其西尔维斯特签名为(2p,0,n−2p),所含信息不超过其秩。负指数(签名通常在此承载信息)恒为零。其次,与威尔逊环的类比不再是类比。文献[4]的最小旋转**就是**沿单位球测地线的平行移动;R<sub>𝒰</sub>是沿链的测地多边形进行平行移动;而语义赤字丢弃的量恰好是一个完整群——SO(n−1)中固定初始状态的元素。终点与路径典范分离且相互独立:任一方均不约束另一方。第三,在检测器侧存在精确规律,且并非该领域一直假设的规律。攻击后的残余统计量与播种窗口完整无缺的已评分位置数量成正比。当编辑独立时,这给出ρ<sup>h+1</sup>,以闭式解释了文献[8]报告的趋势。当编辑不独立时(现实编辑永远如此),保留率ρ根本无法决定残余量。

### 本文贡献
在本研究中,我们证明语言环的不变量典范分解为R<sub>𝒰</sub>=R<sub>dir</sub>H(H属于基点的稳定子群),语义赤字仅取决于第一因子,且两因子函数独立;我们识别H为链的测地多边形的黎曼完整群,在二球面上即为内接三角形面积;我们证明文献[4]的签名不变量退化为秩,已被角度谱取代;并对绿名单与指数检测器证明了完整窗口恒等式,其推论为:知晓上下文宽度h的攻击者可在保留1−1/(h+1)比例词元的同时消除信号。所有陈述均通过我们掌握密钥的精确检测器进行数值验证,几何工具应用于真实机器翻译往返链。第2节以自足形式回顾语言环的框架。第3节证明签名的退化性。第4节包含分解定理、平行移动识别及高斯-博内推论。第5节转向检测器并证明完整窗口定律。第6节报告实验,包括预注册测试(无论结果如何均如实报告)。第7节讨论结果所允许及不允许的推论。

## 2 语言环及其不变量
我们回顾文献[4]的框架,并采用本文所需的形式。熟悉该文的读者可跳至第3节;不熟悉的读者可在此找到后续所需的一切。

语言不是度量空间,但其嵌入映射下的像是度量空间。*可度量化语言空间*是三元组(𝒜,ψ,d),其中𝒜是相关上下文中的语言元素集(词、短语、完整命题),而
ψ:𝒜⟶ℝⁿ, λ⟼ψ(λ),  (2.1)
是嵌入映射,通常既非单射也非满射。ℝⁿ上的距离d<sub>*</sub>通过复合在𝒜上诱导*语义距离*
d(λ,ν):=d<sub>*</sub>(ψ(λ),ψ(ν)),  (2.2)
且本文始终取d<sub>*</sub>为余弦距离
d<sub>*,cos</sub>(x,y)=1−x⋅y/(‖x‖‖y‖).  (2.3)
该选择并非无关紧要,我们将在评注3.2中重述:正是它使整个构造正交自然而非线性自然。

*语言变换*U是从𝒜到自身的映射,在控制下保持语义核心的同时作用于能指。文献[4]提出三项要求:封闭性,U(λ)∈𝒜;可逆性,存在近似逆U<sup>−1</sup>使得对固定阈值ε有d(U<sup>−1</sup>(U(λ)),λ)<ε;相干性,要求相似元素具有相似映像。语言间翻译、肯定转否定或疑问、方言或文体适配、扩展与综合以及转述都是语言变换;而创作故事则不是,因其生成性内容过于庞大,无法从原始内容重构。

给定变换序列𝒰={𝟙,U₁,...,U<sub>L</sub>}和初始元素λ,迭代复合在𝒜中产生链,其在ψ下的像为向量链
ψ(𝒰(λ))={v₀,v₁,...,v<sub>L</sub>}, v₀=ψ(λ), v<sub>i</sub>=ψ((U<sub>i</sub>∘⋯∘U₁)(λ)).  (2.4)
链的*语义赤字*是首尾距离
δ<sub>𝒰</sub>(λ):=d<sub>*</sub>(v₀,v<sub>L</sub>),  (2.5)
当δ<sub>𝒰</sub><ξ(固定阈值ξ)时,序列称为*语言环*。小赤字意味着意义回归;而形式可能在此期间游历各处。为捕捉其去向,将链重写为旋转序列。

对ℝⁿ中非零非对径的x,y,记x̂=x/‖x‖,并令
R̃<sup>x,y</sup>:=I<sub>n</sub>+(ŷx̂<sup>T</sup>−x̂ŷ<sup>T</sup>)+ (1/(1+x̂<sup>T</sup>ŷ))(ŷx̂<sup>T</sup>−x̂ŷ<sup>T</sup>)² ∈ SO(n)  (2.6)
为将x̂映至ŷ的*最小旋转*。其最小性表述为:仅在x,y张成的平面内旋转,在正交补空间上恒等作用。整条链由有序乘积概括
R<sub>𝒰</sub>:=R̃<sup>v<sub>L−1</sub>,v<sub>L</sub></sup>R̃<sup>v<sub>L−2</sub>,v<sub>L−1</sub></sup>⋯R̃<sup>v₀,v₁</sup> ∈ SO(n),  (2.7)
它满足R<sub>𝒰</sub>v̂₀=v̂<sub>L</sub>,且与赤字不同,它保留了中间状态信息。记R<sub>𝒰</sub><sup>*</sup>=(1/2)(R<sub>𝒰</sub>+R<sub>𝒰</sub><sup>T</sup>)为对称部分,简单计算可恢复赤字为二次型
δ<sub>𝒰</sub>(λ)=Q<sub>𝒰</sub>(v̂₀,v̂₀), Q<sub>𝒰</sub>(v̂,v̂):=v̂<sup>T</sup>(I<sub>n</sub>−R<sub>𝒰</sub><sup>*</sup>)v̂,  (2.8)
其表示矩阵为实对称矩阵I<sub>n</sub>−R<sub>𝒰</sub><sup>*</sup>。文献[4]提出将此矩阵的西尔维斯特签名作为环的不变量,理由是它比赤字本身探测更精细的结构属性。它确实探测更精细的属性,但精细程度是下一节的主题。

## 3 签名及其退化性
签名通过正负指数的相互作用保存信息;西尔维斯特惯性律具有启发性,因为二次型可正定、可负定。然而,语言环产生的二次型却不能。

相似文章

语言模型水印中的跨语言公平性审计

arXiv cs.CL

本文提出了一种针对语言模型水印跨语言公平性的评估框架,揭示了语言间的差异是语言类型学结构所致,而非特定语言的个别现象。

通过句法可预测性的语言学感知型LLM水印技术

arXiv cs.CL

本文介绍了STELA,一个语言学感知的LLM水印框架,通过POS n-gram的句法可预测性来平衡文本质量和检测鲁棒性。该方法无需访问模型logits即可实现公开可验证的水印检测,在类型学多样化的语言(英语、中文、韩语)上展示了优异性能。

线性集成消除水印:论LLM中分布扰动的脆弱性

arXiv cs.CL

本文揭示了LLM水印的一个基本漏洞:当用户能够访问多个模型时,对其输出分布进行平均会抵消水印扰动,从而规避检测。作者提出了WASH方法,并通过实验证明,对3-5个模型进行平均可将检测z分数抑制在阈值以下,同时提升文本质量。

语言感知的非失真性LLM水印

arXiv cs.CL

介绍了LUNA,一种语言感知的LLM水印方法,实现了跨多语言的非失真嵌入和无模型检测,显著提升了AUROC和困惑度保持。

基于双重语义嵌入的大语言模型鲁棒文本水印

arXiv cs.CL

本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。