实现语言模型水印技术 [P]

Reddit r/MachineLearning 工具

摘要

作者基于SynthID-Text实现了一个简化的、教育性的语言模型水印版本,并在Anthropic发布公告后受到启发,在GitHub上分享了代码。

我最近实现了一个最小化、教育性的SynthID-Text风格语言模型水印版本。我看到Anthropic发布关于他们将在模型响应中添加水印的帖子,这让我非常好奇他们会怎么做,以及这里的水印到底是什么意思。比如,我们会在模型响应中间开始收到随机广告或什么的吗?然后决定阅读他们的文章,发现水印根本不是可见的消息。它是在模型选择标记时引入的一种微妙的统计模式。我的实现并非原始SynthID-Text系统的精确复现。我简化了或以不同方式实现了一些组件以保持项目可理解,但我认为主要思想是存在的。Github: https://github.com/Saad1926Q/llm-watermark 如果你觉得有趣的话,可以给仓库加星!!
查看原文

相似文章

语言模型水印中的跨语言公平性审计

arXiv cs.CL

本文提出了一种针对语言模型水印跨语言公平性的评估框架,揭示了语言间的差异是语言类型学结构所致,而非特定语言的个别现象。

基于双重语义嵌入的大语言模型鲁棒文本水印

arXiv cs.CL

本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。

通过句法可预测性的语言学感知型LLM水印技术

arXiv cs.CL

本文介绍了STELA,一个语言学感知的LLM水印框架,通过POS n-gram的句法可预测性来平衡文本质量和检测鲁棒性。该方法无需访问模型logits即可实现公开可验证的水印检测,在类型学多样化的语言(英语、中文、韩语)上展示了优异性能。

语言感知的非失真性LLM水印

arXiv cs.CL

介绍了LUNA,一种语言感知的LLM水印方法,实现了跨多语言的非失真嵌入和无模型检测,显著提升了AUROC和困惑度保持。