假名末日
摘要
文章认为,大型语言模型(LLMs)通过分析写作风格,越来越能够将化名身份关联起来,并预测未来所有高带宽交互都会留下可追踪的独特指纹。
暂无内容
查看缓存全文
缓存时间: 2026/07/16 22:54
# 伪名启示录
来源:https://dynomight.net/pseudpocalypse/
DYNOMIGHT (https://dynomight.net/) 最佳话题关注关于 (https://dynomight.net/about)
这里有一个猜想:如果你以不同的名字在互联网上发布任何大量文本,这些身份可以仅通过文本本身被关联起来。这是可能的(我猜想),因为你在所写的一切中都留下了统计上的“指纹”。
想象一个网站,你可以粘贴某人刚刚写下的全新文本。作为回报,该网站会提供该写作者以任何名字发表过的所有文本的链接。它不是完美的,但相当不错。据我所知,这样的网站还不存在——至少不在公共互联网上。但我怀疑它是可能的,并且很快就会变得容易。这将对化名博客写作构成一些困难。
*注*:我大部分是在2025年中期写的这篇文章,之后愚蠢地搁置了一年,摆弄你们没人会读的定理陈述。¹ (https://dynomight.net/pseudpocalypse/#fn:1)与此同时,LLM从文本猜测作者的能力已经大大提高。(给定本文草稿的前1000个单词,Claude 4.8 知道是我。)不过,我认为我们才刚刚开始。我预计会看到越来越多的不知名写作者被从越来越小的文本片段中识别出来。我预计即使人们以不同的语域写作或谈论不相关的主题,这种识别也能奏效。而且我预计,我以任何化名写过的一切都将很快链接到我的真名。² (https://dynomight.net/pseudpocalypse/#fn:2)
一个更强的猜想是,我们正走向一种广义的伪名启示录。也许,在未来,如果你通过*任何*高带宽渠道与世界互动,那么你就会暴露自己的身份。假设你在公共场合戴着面具,只通过将声音压入变声器来说话。没问题,你仍然会通过你的体型、步态或化学特征被识别。或者假设你不喜欢你的车被到处跟踪,所以你不带手机,并设法说服立法者禁止车牌。没问题,你的车仍然会通过微小的划痕或发动机发出的独特砰砰声被跟踪。或者假设你不喜欢在互联网上被跟踪,所以你锁定了你的浏览器配置文件,只用门罗币购物,并通过三个VPN的链条连接。那也没关系。你仍然会通过你滚动页面时手指的摆动方式被识别。我们都太独特了,信息理论的极限正在向我们逼近。
## 基础信息
让我们从基本原理开始。想象一下,每个人出生时都被分配了一个随机的二进制字符串。每当你在互联网上发布任何东西时,你都需要用那个字符串签名。如果字符串非常短,比如 `0110`,那么很多其他人会和你拥有相同的字符串。但如果字符串非常长,那么你的字符串几乎肯定是唯一的,并且链接你所有的化名将变得轻而易举。
转变点在哪里?如果你只知道作者目前还活着并生活在英语世界的某个地方,那么转变点大约在29比特。这是因为如果有K位数字,那么就有2^K种可能的二进制字符串,而如果K = 28.86,那么2^K ≈ 490,000,000,即目前生活在英语世界的人数。如果字符串少于29位,那么很可能会有其他人共享你的字符串。如果字符串多于29位,那么你的字符串很可能是唯一的。
我们(还没?)必须在写的东西上签署由政府颁发的不可变字符串。但你写作的方式仍然通过你的语气、个性、用词选择等提供了大量关于你的线索。
从理论上讲,我认为它*必定*有可能链接任何写作足够多的人的身份。再次想象一下,每个人出生时都被分配了一个随机的二进制字符串,但你不是需要用你的字符串签署你写的东西,而是每次你写一个词,都有一定的概率从你的字符串中泄露一个随机比特,并作为签名添加到你的消息中。例如,可能会添加一个签名 `bit[129]=1`,表明你的字符串在第129个位置的值是1。
把你的字符串想象成代表你所有写作风格上的怪癖,而一个比特被泄露代表你写了一些能揭示偏好的东西。例如,也许比特18表示你是否更喜欢用那种可怕的空格写破折号 —— 像这样 —— 或者不用空格写破折号——像这样。如果你使用了一个破折号,那个比特就被泄露了。
所以想象一下,你在化名A下写了很多东西,足以让完整的比特字符串被泄露。可能是这样:
```
化名 A:
110000001111001101110000100001
010100100101011110111001101000
100111110010101001101010111010
```
现在假设你开始在化名B下写作。一开始,没有一个比特是已知的:
```
化名 B:
??????????????????????????????
??????????????????????????????
??????????????????????????????
```
但慢慢地,你会开始泄露一些比特:
```
化名 B:
?????00???1????1????????1??0??
?????01??1?????????11????01???
???1??????1???10??????????????
```
最终你会泄露很多比特:
```
化名 B:
???0?00?1?11??110??1????10?0??
?10?001?0101?11???11100?101???
???11?1??010??10?1?01??011????
```
现在从“攻击者”的角度思考,他想知道A和B是否同一个人。我们假设他*只*看到了上面的比特,并且没有关于其他人的任何信息。那么攻击者知道的是:
1. A和B泄露了K个重叠的比特,并且全部匹配。
2. 不同的人在任何一个泄露的比特上匹配的概率是50%。
3. 非不同的人在任何一个泄露的比特上匹配的概率是100%。
4. 有490,000,000人。
直觉上,如果K是5,那么所有比特都匹配这一事实并不能证明什么,因为在4.9亿人中,很多人会偶然在这些比特上匹配。但如果K是70,那么两个不同的人共享所有比特的可能性极低,即使初始池如此巨大。事实证明,如果有N个其他拥有随机比特的人,你选择你的K个比特,那么*存在某个人*匹配所有这些比特的概率是 1 - (1-2^(-K))^N。当N是4.9亿时,情况是这样的:
看,29又出现了。(数学不是很美妙吗?)一般来说,转变点发生在K比特的数量使得2^K ≈ N的附近,即K = log₂(N)。
如果你在化名B下泄露的比特远少于29个,那么几乎可以保证存在其他某个人匹配所有这些比特。但如果你泄露的比特远多于29个,那么几乎不可能存在其他任何人匹配所有这些比特。所以攻击者本质上知道A和B是同一个人。我再次强调:他们知道这一点,甚至不需要查看其他4.9亿人的任何信息。
当然,我们并不是在写作时真的泄露不可变特征字符串的比特。但是你可以让模型更真实,同样的问题依然存在。如果你想反映文本只提供关于写作者的噪声信息,那么你可以在比特被泄露之前给它们添加噪声。如果你想反映某些写作风格比其他更常见,那么你可以使比特字符串的分布非均匀。如果你想反映某些怪癖比其他更明显,那么你可以给不同的比特赋予不同的泄露概率。所有这些都让数学变得更复杂。但它们并没有改变基本结论:如果你的写作风格包含至少29比特的信息,并且你写了足够多,那么你就完了。
这就是我关于伪名启示录是可能的论点。但我不仅仅是想声称它*可能*最终会发生。我认为它*很可能会*很快发生,并且你需要的文本量不会很大。为了论证这一点,我们需要具体化:人们有哪些特征会反映在他们的写作中?这些特征包含多少比特的信息?这些比特能从书面文本中被多准确地猜测出来?
*注*:为了避免变成一场巨大的信息论讲座,我大部分时候会使用“比特”和“信息”这样的词,而不会100%精确地说明它们的意思。我这样做是因为我预料大多数阅读本文的人不是“比特定义”的迷恋者,而且无论如何,过于技术化会掩盖大局。如果你是信息论爱好者并且/或者怀疑我知道自己在做什么,我建议你参考下面的“给持怀疑态度的信息论爱好者部分”。在那之前,用你的直觉和信心。
## 特征空间
假设你除了我写了上面的文字之外对我一无所知。并且假设你必须猜测我的年龄、宗教或职业。你可以*猜*,对吧?不会完美,但比起*不能*阅读这些文字,你会做得好得多。因此,不知何故,这些文字包含了我的人口统计学特征信息。所以我试图列出类似的东西,这些你可以合理地、至少比随机好一点地从文本中猜测出来。以下是我想到的:
- 年龄
- 教育程度
- 种族
- 家庭状况
- 收入
- 婚姻状况
- 心理健康
- 母语
- 职业
- 身体健康
- 政治倾向
- 地区
- 宗教信仰
- 性别
同样地,如果你只读了上面的文字,你能猜测我有多外向或多尽责吗?再次强调,不完美。(当我遇到读这个博客的人时,他们通常似乎对我能忍受直射阳光感到惊讶。)但尽管如此,我确定你会做得不错。所以,再次强调,这些文字包含了我个性的信息。
个性有哪些特征?HEXACO模型 (https://en.wikipedia.org/wiki/HEXACO_model_of_personality_structure) 列出了六个,即诚实-谦逊、情绪性、外向性、宜人性、尽责性和经验开放性。我怀疑这些都可以从足够长的写作样本中以合理的准确性猜测出来。但你能猜得更多吗?对于这六个因素中的每一个,HEXACO模型列出了四个“方面”。抽象地说,试图从文本中猜测6×4=24种不同的个性特征听起来很荒谬,但看看它们:
- 诚实-谦逊
- 真诚
- 公平
- 贪婪规避
- 谦虚
- 情绪性
- 恐惧
- 焦虑
- 依赖
- 多愁善感
- 外向性
- 社会自尊
- 社交胆量
- 社交性
- 活力
- 宜人性
- 宽恕
- 温和
- 灵活性
- 耐心
- 尽责性
- 条理性
- 勤奋
- 完美主义
- 审慎
- 经验开放性
- 审美欣赏
- 探究心
- 创造力
- 非传统性
如果你思考具体的人,我认为可以说服自己这24个方面代表了真实的东西,并且从文本中猜测它们是可行的。(例如,你最喜欢的生存焦虑+科学博主,可能在“谦虚”上的得分低于其他诚实-谦逊的方面。)不同的子因素肯定是相关的,但并非完全相关。
当然,从人们的写作中学到的最大的东西是*他们如何写作*。他们是否倾向于无谓地拆分不定式?他们是否使用连字符连接的词?他们是否,错误地,放置他们的状语从句?
使用写作风格特征来确定作者身份的想法至少可以追溯到1440年,当时洛伦佐·瓦拉证明《君士坦丁献土》(https://en.wikipedia.org/wiki/Donation_of_Constantine)——君士坦丁大帝据称将罗马帝国捐赠给天主教的文件——使用的白话文来自君士坦丁死后400年,因此是伪造品。1851年,奥古斯都·德·摩根观察到平均词长对于同一个作者往往是稳定的。第一次“现代”尝试似乎在1964年,当时莫斯特勒和华莱士发表了《作者问题中的推断》(https://doi.org/10.2307/2283270):
> 本研究试图解决《联邦党人文集》的作者问题; [...] 词频被用作区分的变量。由于写作主题强烈影响单词使用的频率,因此选择词语时需要谨慎。语言中的虚词如 *an*,*of* 和 *upon*,更一般地说,冠词、介词和连词提供了相当稳定的使用频率,而像 *war*,*executive* 和 *legislature* 这样更有意义的词则不然。在对这些计数的分布进行调查之后,作者基于贝叶斯方法进行了分析 [...]。关于作者问题的结论是:所有12篇有争议的论文都是麦迪逊而非汉密尔顿所写。
明白了吗?这个想法是,你对*war*这个词的使用主要取决于你是否恰好正在谈论战争。但你对*upon*的使用主要取决于你有多喜欢*upon*这个词。为了证明这一点,他们拿了汉密尔顿写的48篇论文和麦迪逊写的50篇论文,制作了这张他们使用*by*,*from*和*to*的次数表:
麦迪逊喜欢*by*。汉密尔顿则更倾向于*to*。利用这类统计数据,他们得出结论,有争议的联邦党人文集一定是由麦迪逊撰写的。
所以我做了一些研究,寻找其他被认为在不同主题写作时是稳定的写作风格特征。我发现有很多。太多了,以至于我甚至难以将它们组织成有意义的组别:
**低级频率:**
- 词长
- 句长
- 段落长度
- 标点符号频率(逗号、冒号、破折号、括号)
- 功能词频率(*the*,*of*,*and*,*to*)
- 副词频率
- 强化词(*very*,*really*,*quite*,*pretty*,*so*)
- 证词标记(*apparently*,*evidently*,*obviously*)
- 弱化词(*somewhat*,*fairly*,*rather*)
- 代词使用
- 总体偏好(*I*/*we* 对比 *you* 对比 *he*/*she*/*they*)
- 第三人称单数偏好(*he*,*she*,*he or she*,*they*,*one*)
- 情态动词(*can*,*could*,*might*,*must*,*should*,*will*,*would*)
- 模糊限制语(*perhaps*,*maybe*,*possibly*,*probably*)
- 连词(*and*,*but*,*yet*,*so*)
- 已知的稳定比率(*the*/*a*,*this*/*that*,*these*/*those*,*I*/*me*/*my*)
- 字符 N 元语法(3-gram 和 4-gram)
- 单词 N 元语法(通常是 3-gram)
**词汇特征:**
- 词汇量
- 词汇多样性/类符-形符比(不同单词的数量除以单词总数)
- 罕见词频率
- 语义密度
- 话语标记位置、组合(*So*,*anyway*,*so anyway*)
- 缩写和首字母缩略词的使用
- 对拉丁语源词与日耳曼语源词的偏好(*The majestic creature traversed the terrain* 对比 *the mighty beast strode across the land*)
**句法特征:**
- 句法复杂度
- 从属指数
- 平均解析树深度
- 被动语态的使用
- 名词化(*She was shocked I ate the pizza* 对比 *My pizza consumption shocked her*)
- 动词时态和体(*I walk* 对比 *I walked* 对比 *I was walking* 对比 *I have walked*)
- 句子结构偏好:
- 分支偏好(笨拙的 *everyone had a good time when Alice taught some cool dogs I met and brought to dinner to juggle* 对比 笨拙但可读的 *I met some dogs and they were cool and I took them to dinner and Alice taught them to juggle and everyone had a good time*)
- 状语从句位置(*Suddenly I was hungry* 对比 *I was, suddenly, hungry* 对比 *I was hungry, suddenly*)
- 句末权重(*Your plan won't work because of the dyslexic bears* 对比 *Dyslexic bears mean your plan won't work*)
- 连词叠用(*I like dogs, cats, and ferrets* 对比 *I like dogs and cats and ferrets*)
- 重复/打破
相似文章
多智能体LLM能否识别其同行?角色约束政治分析中的风格化指纹识别
本文研究了LLM是否能够从角色约束政治分析文本中的风格化指纹识别出自己的模型家族,即使在提示层面匿名化后也是如此。研究结果证实匿名化不足,并对欧盟AI法案合规性和多智能体系统验证有影响。
通过行为识别:利用UI痕迹对LLM浏览器代理进行指纹识别
本文证明,网站可以通过分析浏览代理的行为模式和时序数据,识别其背后的大语言模型,在14个前沿LLM上实现了高达96%的F1分数。本文正式定义了这一攻击面,并表明随机时序延迟不足以阻止识别。
写作的社会契约
本文讨论了LLM如何使写作同质化,并违反了作者与读者之间的社会契约,引用了Oxide的RFD 576以及一项关于ChatGPT影响口语的研究。
为了内容而内容
作者探讨了LLM如何影响编码和日常语言中的用词,发现LLM偏好的词汇在编程会话和Google Trends中出现的频率均有所增加,这引发了人们对人类开始采用LLM写作风格的担忧。
通过预注册下一个LLM来减轻基于LLM的p值操纵
提出一种协议,通过预注册实验并在预注册后第一个符合条件的模型上运行实验,来减轻基于LLM的研究中的p值操纵,并在多个模型上展示了显著的减轻效果。