From deepfakes to DNA: the science of watermarking AI
摘要
本文介绍 Google DeepMind 的 SynthID 水印体系:从图像扩展到文本、视频、音频,通过在生成内容中嵌入不可察觉的数学标记来溯源来源,并已延伸到生物安全领域,用于区分 AI 设计的分子序列与自然界序列;文中还解释了文本水印基于词元分布偏向与密钥的原理及其局限。
暂无内容
查看缓存全文
缓存时间: 2026/10/02 00:51
# 从深伪到 DNA:AI 水印背后的科学
**TL;DR:** 当生成式 AI 已能产出以假乱真的图像、文本、音频甚至自然界从未存在过的分子时,如何在内容生成之前就知道它的来源?Google DeepMind 的答案是数学意义上的水印——一套从图像扩展到文本、视频、音频,并被 Google 之外的合作伙伴广泛采用的 SynthID 体系;同一套思路,如今也被移植到生物安全领域。
## 一个问题:这是真的吗?
设想这样的场景:你正在刷社交媒体,看到一些令人惊叹的画面——一座火山近距离的慢镜头喷发,或是一场龙卷风肆虐村庄,又或者是一些抗议活动的影像。我想我们很多人都会问同样的问题:这是真的吗?这是由人类还是机器制作的?
随着 AI 在生成文本、图像、音频和视频方面变得越来越强,这个问题正在成为我们这个时代最具挑战性的问题之一,只不过现在,答案变得复杂得多。
问题的另一面同样严峻。我们正在进入这样一个世界:AI 能够设计出自然界中从未存在过的生物分子和结构,其中一些甚至可能被设计来造成危害。那么,如何在某样危险的东西被制造出来之前就阻止它呢?
答案,事实证明,可能就藏在明面上——它无形地嵌入在你正在看的画面里,或是你即将合成的那个分子中。是一种水印,但不是你在图库照片上看到的那种方块形 logo,而是一种远为微妙的、数学意义上的东西。
本集播客邀请了两位从不同角度研究这一问题的人:Google DeepMind 科学副总裁 **Pushmi Kohley**(SynthID 水印系统的缔造者之一),以及生物安全研究员 **Jeremy Radcliffe**——他的团队已将同样的技术应用于生物学。
## 为什么要给内容加水印?
### 生物学视角:来源溯源
对生物学来说,给内容加水印的动机在于,这样我们就能拥有**来源溯源能力**,可以明确说明某条序列究竟来自哪里。Jeremy 团队真正想要区分的,是来自自然界事物的序列与来自 AI 系统产物的序列。
具体来说,他们担心的风险是:某个 AI 生成的序列可能具备我们已知存在问题的特性,但我们或许无法仅凭序列本身识别出它带有这些特性。
### 普适视角:让人能信任自己看到的内容
在 DeepMind 开启整个水印项目的首要原因(大约八年前),是让用户对自己所看到的内容有一种来源溯源感。无论是文本、图像还是视频,十年前很难想象我们今天会讨论这样一些系统:它们能够生成图像、视频、音频、文本,以及与人类创作或自然界中存在的东西难以区分的蛋白质或酶。
让用户产生"我真的可以相信我所看到的内容"这一认知,是一个非常重要的元素。
## 什么才算好的水印?
### 生物安全领域的三条要求
- **人眼不可察觉性**:要让人极难分辨出数据的哪一部分被加了水印——否则它很容易被抹掉。
- **高可检测性**:要有某种系统能够遍历数据,以高置信度识别出水印。
- **良好的泛化性**:至少需要一种水印方法能够适用于许多不同的系统,而不是为每一种数据类型单独定制方案。
### DeepMind 的三项特性
1. **不降低内容质量**:否则整个目的就落空了,人们就不会去用它。
2. **对攻击或变换的鲁棒性**:如果人们想要移除水印,那应该很难移除——即使你对信号做了修改,水印依然会留存。
3. **易于使用**:它应该容易嵌入信号之中,也容易检测。
整个理念就是让用户对自己所看到或所使用、所设计的内容拥有更强的控制力和更清晰的认知,所有水印系统都是围绕不可察觉性、鲁棒性和可扩展性来设计的。
## 为什么是现在?
生成式 AI 向公众开放已经好几年了,为什么水印话题直到今年夏天才变得火热?
当图像编辑软件开始变得非常复杂时,人们就对一个问题相当担心:这是一张真实的照片,还是被篡改过的?当时有很多研究和专门的系统,能够真正地分析一张图像,找出篡改图像中存在的细微差别,然后说"这是一张假图"。
但随着生成式 AI 变得越来越复杂,那些细微的差别消失了。
这自然引出了一个令人不安的问题:游戏是不是结束了?人类是否将不再具备判断某样东西是否由 AI 生成的能力?而这就是水印出现的地方——要确保人类始终有能力理解某个信号的来源,办法就是向其中注入信号,使其带有某种偏向,这样它就不会消失。
即使模型完美无缺,即使它们有能力生成与相机所捕捉到的、或与人类所写出的文字难以区分的图像,我们也会特别地嵌入一些人眼不可察觉的东西,让用户日后可以检测出"这来自我的 AI 模型"。
## 为什么图像先行,文本最难
DeepMind 团队在这上面已经工作了差不多八年,**从图像开始**——因为人们担心这些图像会被用于假新闻、虚假信息。而且,尽管问题极其具有挑战性(鲁棒性、不可察觉性、效率和可扩展性),图像毕竟是一份非常庞大的数据:一张一百万像素的图像,包含大约一百万个数字(或三百万个数字,取决于它是如何编码的),要在不改变内容的前提下隐藏信息,空间相对宽裕。
后来团队不得不面对这样的挑战:如何为其他模态做这件事?比如文本——它的维度远没有那么高。文本信号量其实非常小,一个句子并不是一百万个数字,就那么几个词。你不能随意改动那几个词,而且必须非常小心,不要改变内容的含义。
所以**文本水印的方法,与用于图像、视频甚至音频这些高维信号的水印方法截然不同**。
## 水印如何写进法律
但你们所开创的这种水印理念,如今已经写入了法律。在欧盟范围内,任何生成式内容都必须带有某种形式的水印,这已成为强制要求。
监管机构以及世界各国已经认识到,他们希望向用户传递这样的信息:他们所消费的内容究竟从何而来。而被视为一种可靠、可扩展的解决方案的关键技术之一,就是水印。这也是为什么这一理念在整个行业中被采纳——SynthID 被 Nvidia 使用,也被 OpenAI 等其他合作伙伴使用。生成式 AI 领域的许多合作伙伴都采用了这项技术,这实在是一件了不起的事情。
## 生物学与媒体:同一套原理,甚至同一段代码
两种应用之间的解决方案相似吗?Jeremy 的回答是肯定的:它们基于相似的原理,团队能够沿用大量已经完成的工作,包括直接使用开源的 **SynthID Text** 库,并把它嵌入到另一个系统中。所以不只是同样的技巧,有时甚至就是同一段代码——至少是从同一段代码开始,然后再在其上做一些调整。
## AI 检测器与水印的区别
网上已经有一些软件,声称能够判断你手中的文本是 AI 生成的还是不是。这与 DeepMind 开发的东西有什么区别?
传统方法是训练机器学习模型来解决一个分类问题:区分什么是模型生成的、什么是自然界中捕捉到的。这需要在海量数据上训练这些模型。当早期的大语言模型和对话式智能体刚出现时,你大致能看出破绽——比如某个词用得太多,"quietly"这个词用得有点太多之类。但随着这些模型变得越来越复杂,那些破绽出现得越来越少。所以如果你训练的是这样一个机器学习分类器,**随着生成式 AI 模型越来越擅长复制其目标特征,这个分类器的准确率就会随时间下降**。
水印走的是另一条路:不是事后判断,而是事先注入标记。
## 文本水印的运作原理
### 词元分布中的"选择空间"
大语言模型在生成文本时,本质上对它能生成哪些词元、哪些词有一个分布。比如问"你今天早餐吃了什么",你可以选择以"我"这个词开头,也可以选择以别的词开头。如果这些选项是同样有效的起点,那你就有了**选择空间**。
文本水印正是利用这种选择空间。
### 密钥带来的"偏向"
关键在于:后台存在一把密钥,它规定偏向某些词,而不是其他词。然后当你把所有文本放在一起看时,如果你看到那些词一遍又一遍地反复出现,你就可以确信这是 AI 生成的。
所以关键不在于具体的词,而在于这些词构成的**模式**。那些特定的词不需要一再重复,但检测器所利用的正是这种模式——它们如何串联起来出现。
而且,如果不同的 AI 模型使用不同的密钥,我们还可以判断这段内容是由这个模型还是那个模型生成的——你能分辨出这是 Gemini,这是另一个可能的模型。
### 无法回避的局限
如果可供选择的词很少呢?那就用不了。如果你有一段非常短的文本——比如"法国的首都是哪里?""是巴黎。"——这里几乎没有可以改动的余地,所以它就不会被加水印。这是这种方法在极端情况下的局限性。
## 我们能否百分百检测 AI 内容?
整个生态系统整体正在朝水印的方向发展,正如从其他一些实验室的公告中看到的那样。但这并不意味着它们都会公开自己的检测器。
即便有一个公开可用的检测器,这也可能成为人们研究如何绕过它的动机。就像那些基于机器学习的分类检测系统一样——它们使用大量已被加水印的文本示例。**如果检测器是公开的,你可以一遍又一遍地查询它,或许就能反推出一种能绕过该检测器所采用的那套特定密钥配置的方法。**
所以,我们还没有一个万无一失的、铁板钉钉的检测方法来识别任何 AI 生成内容——至少不适用于"为每个公开发布的密钥版本都提供公开检测系统"这种方法。这确实是朝着那个方向迈出的一大步。
## 图像与视频:神经网络协同训练
图像和视频用的是同样的思路吗?空间是不是更大、更容易藏东西?
图像上的方法与文本水印截然不同。在图像中,团队会先获取一张尚未加水印的图像,然后**有一个神经网络观察这张图像,并以非常微妙的方式修改它,以嵌入信号**。
这个负责嵌入水印的特定模型,是与一个**检测器神经网络协同训练**的。两者都在尝试实现以下效果:你得到一张未加水印的图像,水印生成器注入一个极小的、人眼不可察觉的信号。如果这个信号是可察觉的,我们就说那不太好——用户会看到它,那就降低了图像的质量。
生成与检测被当作一个联合目标来优化:嵌入器学会在不留下可见痕迹的前提下留下可被检测器找到的痕迹,检测器则学会在各种变换之后仍然读出这个信号。
---
**Source:** [From deepfakes to DNA: the science of watermarking AI — Google DeepMind Podcast](https://www.youtube.com/watch?v=HIUzrxQxTtw)
相似文章
@GoogleDeepMind: Watch → https://goo.gle/4de3fiR Spotify → https://goo.gle/4dKZwte Apple Podcasts → https://goo.gle/4dQqKyH Or listen wh…
Google DeepMind 的一期播客讨论 SynthID AI 水印技术:从文本、图像水印的原理(通过秘密密钥在词元分布中注入偏置)到其在生物序列溯源与生物安全领域的应用,以及水印对短文本、公开检测器等场景的局限。
Google找到了为AI设计的蛋白质添加水印的方法
Google DeepMind发表了一篇关于蛋白质水印系统的研究论文,将SynthID风格的概率偏置水印技术应用于AI设计的蛋白质序列,使可信的研究用蛋白质能够被识别,有助于缓解AI蛋白质设计工具带来的生物安全风险。
Google DeepMind 今日发布 SynthID Bio,为 AI 设计的蛋白质添加水印并实现检测
Google DeepMind 宣布推出 SynthID Bio,这是一种水印技术,可在保留生物功能的前提下,为 AI 设计的蛋白质嵌入可验证签名。该技术已通过湿实验验证,并集成到 AlphaFold 3 的扩散网络中。
@GoogleDeepMind:当AI生成的内容逼真到以假乱真,我们该如何验证某样东西是人类、机器还是自然造就的?我们探讨……
Google DeepMind 的播客节目探讨了 SynthID 等人眼难以察觉的水印技术如何帮助验证内容是出自人类、机器还是自然之手,内容涵盖媒体水印以及面向生物设计的 SynthID Bio。
谷歌的SynthID水印难以破解,但无法解决AI虚假信息问题
谷歌的SynthID水印对退化具有很强的鲁棒性,但无法完全解决AI虚假信息问题;本文测试了其耐久性,并讨论了水印和元数据方法的局限性。