水印/检索式AI文本检测的碰撞熵下限:在进一步推进之前寻求合理性检查 [D]

Reddit r/MachineLearning 论文

摘要

一位研究者提出了一个理论界限,表明基于相似性的AI文本检测器(水印、检索)面临由文本分布碰撞熵决定的假阳性率下限,并请求社区对证明及其与先前工作的联系提供反馈。

大家好!我一直在研究为什么基于相似性的AI文本检测器(水印、基于检索的匹配)会在假阳性率上撞上硬性下限,并希望在投入更多时间之前有人能帮我挑挑毛病。目前仅经过自我验证,没有外部评审。下面你可以看到内联的核心论证,但如果感兴趣,我可以提供带证明的完整PDF链接。 SETUP(设定) 固定一个在给定约束C(一个主题、一组事实、一种体裁)下可能文本的分布P。基于相似性的检测器从候选文本计算某个统计量T,并将其与参考值比较。水印的绿色列表计数和检索的嵌入向量都是T的实例;实现不同,抽象动作相同:将文本粗粒化到可比较的程度。 THE BOUND(界限) 对于任何确定性T,令H2表示Rényi-2(碰撞)熵。如果X、Y是来自P的i.i.d.抽取,那么对两者应用T会得到来自前推T*P的i.i.d.抽取,且:H2(T*P) ≤ H2(P)。证明只有三行:用T的原像划分定义域,注意对于非负p_i,(Σp_i)² ≥ Σp_i²(交叉项非负),然后在划分上求和。就是这样,没有隐藏机制。 WHY THIS MATTERS FOR DETECTION(为何这对检测很重要) 对于任何离散分布Q,i.i.d.抽取的碰撞概率恰好是2^(-H2(Q))。不是渐近近似,而是精确值。因此,任何基于统计量T构建的检测器的假阳性率满足:FPR_T(C) ≥ 2^(-H2(原始文本 | C)),对于每个可能的T都成立,包括那些还没人设计出来的T。随着约束收紧(H2 → 0,即主题只允许少数几个“正确”输出——比如带有固定事实列表的产品规格表),这个下限会同时上升到1,对所有检测器都是如此。TPR ≤ 1始终成立,所以TPR − FPR → 0:任何基于碰撞的检测器的ROC曲线都会塌缩到随机水平,而重新校准阈值也救不了,因为问题不在阈值,而在于被比较的底层分布已经收敛了。 与现有工作的关系(如果这里我特别漏掉了什么,请告诉我) 这个问题的token级特例已经在Kirchenbauer等人2023年的论文中出现了(尖峰熵,低熵文本既难以加水印,也难以与人类续写区分)——我不是说这部分是新的,只是把机制推广到token层之外。更相关的是:我在写完大部分内容后发现了Silva(2026,SSRN),他通过人类与模型分布之间的总变差距离证明了一个更完整的不可行性框架,并在他自己的分类表中明确将水印检测标记为其框架范围之外。我的主张是,这正是那个空白:他的是分类博弈(两个固定总体),我的是匹配博弈(一个分布,这个特定文本是否源自那个特定参考)。我可以展示这两者是相通的:匹配博弈的最优值等于在随机抽取的参考上对他固定参考分类优势的期望,并且我进一步把它推广到了更现实的释义(paraphrase)情形,此时界限分裂为互信息项(参考中有多少在释义信道中幸存)和总变差项(正是Silva的量)。因此,这两个框架最终成为一个界限的两个加性分量,而不是相互竞争的叙述。这是我最不确定能否经得起真正审视的部分。 WHAT I'M ASKING(我的问题) 核心的数据处理论证(粗粒化下H2不能增加)真的像我想象的那么干净吗,还是我漏掉了一个边界情况?Silva的桥接是否成立,还是我自欺欺人地用了某个便利的特例(点质量参考,仅精确推导)?有没有专门将Rényi-2/碰撞熵应用于检测的先前工作,我应该引用但还没找到?请注意:我不是想过度推销这个:token级基础情况是Kirchenbauer的,分类不可行性是Silva和Sadasivan的。我认为真正可能属于我的贡献是匹配博弈的形式化以及两者之间的桥接。如果被告知这也不是新的,我很乐意接受。感谢你的时间,我非常感激任何对我工作的贡献。
查看原文

相似文章

AI检测器是个糟糕的想法

Reddit r/ArtificialInteligence

本文认为,AI检测器和水印技术存在问题,因为它们忽视了作品背后的人类努力,并降低了AI生成文本的质量。

AI水印证据未能通过取证准备:一项实证评估

arXiv cs.CL

本文实证评估了三种LLM水印方法(KGW、Unigram、SynthID-Text)在取证可采性标准下的表现,发现没有一种方法达到法院要求的证据标准:在保留语义的改写后,水印几乎100%被移除,甚至在攻击前假阴性率就很高。

AI文本水印的工作原理

Hacker News Top

一份温和的视觉化讲解,说明统计水印如何通过微妙地偏向令牌选择,在AI生成的文本中隐藏秘密标记,以及编辑如何能抹除它。