网络匿名已悄然消亡,却无人提及
摘要
本文表明,大型语言模型可以通过跨平台匹配非结构化文本,对化名在线账户执行完全自动化的大规模去匿名化,在90%精确率下实现高达68%的召回率,使先前的实际匿名性变得过时。
暂无内容
查看缓存全文
缓存时间: 2026/07/29 15:56
# 基于大规模语言模型的在线大规模去匿名化 来源:https://arxiv.org/html/2602.16800 Simon Lermen\*MATS Daniel Paleka\*ETH Zurich Joshua SwansonETH Zurich Michael AerniETH Zurich Nicholas CarliniAnthropic Florian TramèrETH Zurich ###### 摘要 我们展示了大规模语言模型可用于进行大规模去匿名化。在拥有完全互联网访问权限的情况下,我们的代理能够仅凭假名在线资料和对话,以高精度重新识别 Hacker News 用户和 Anthropic Interviewer 参与者,其效果相当于专门的人类调查员花费数小时的工作。然后,我们为封闭世界场景设计了攻击。给定两个假名个体的数据库,每个数据库包含该个体撰写或关于该个体的非结构化文本,我们实现了一个可扩展的攻击流程,该流程使用 LLM 来:(1) 提取与身份相关的特征,(2) 通过语义嵌入搜索候选匹配,以及 (3) 对顶部候选进行推理以验证匹配并减少误报。与需要结构化数据的经典去匿名化工作(例如 Netflix 奖)相比,我们的方法直接处理任意平台上的原始用户内容。我们构建了三个具有已知真实标签的数据集来评估我们的攻击。第一个数据集将 Hacker News 与 LinkedIn 个人资料关联起来,使用了个人资料中出现的跨平台引用。第二个数据集匹配 Reddit 电影讨论社区中的用户;第三个数据集将单个用户的 Reddit 历史按时间分割,创建两个需要匹配的假名资料。在每种情况下,基于 LLM 的方法都显著优于经典基线,在 90% 的精确度下实现了高达 68% 的召回率,而最佳非 LLM 方法的召回率接近 0%。我们的结果表明,保护在线假名用户的实际模糊性已不再成立,需要重新考虑在线隐私的威胁模型。 11footnotetext:同等贡献。 ## 1 引言 几十年来,人们已经知道个体可以通过少得惊人的属性被唯一识别。Sweeney 的开创性工作表明,仅凭邮政编码、出生日期和性别,87% 的美国人口可以被唯一识别[34 (https://arxiv.org/html/2602.16800#bib.bib34)]。Narayanan 和 Shmatikov 证明,只需少量的电影偏好,匿名的 Netflix 评分就能与公共 IMDb 个人资料关联起来[24 (https://arxiv.org/html/2602.16800#bib.bib24)],而 De Montjoye 等人[6 (https://arxiv.org/html/2602.16800#bib.bib6)] 证明,四个时空点足以唯一识别移动电话数据集中 95% 的个体。尽管存在这些攻击,假名在线账户(Reddit 回帖、匿名论坛、评论资料等)在很大程度上仍未受到去匿名化尝试的影响。原因很简单:在实践中应用此类攻击需要结构化的数据,以便进行算法匹配,或者需要熟练的调查员投入大量的手动工作,这些工作通常只针对高价值目标[13 (https://arxiv.org/html/2602.16800#bib.bib13)]。去匿名化本质上是一个两步过程,包括根据匿名者的帖子对其进行画像,然后将其与已知身份匹配。众所周知,大型语言模型 (LLM) 可以从在线论坛的文本中推断出个人属性[29 (https://arxiv.org/html/2602.16800#bib.bib29),8 (https://arxiv.org/html/2602.16800#bib.bib8),38 (https://arxiv.org/html/2602.16800#bib.bib38)]。鉴于此,我们不禁要问:LLM 在完整的端到端去匿名化方面表现如何?这对假名账户是否构成了实际威胁? #### 我们的贡献。 我们证明,LLM 从根本上改变了局面,实现了完全自动化的去匿名化攻击,可以在非结构化文本上大规模操作。我们通过将去匿名化表述为一个匹配问题,并展示 LLM 能够执行匹配账户所需的所有步骤来证明这一点:从任意文本中提取身份相关信号,高效搜索数百万候选资料,并推理两个账户是否属于同一个人。我们表明,长期以来保护假名用户的实际模糊性(即去匿名化虽然在理论上可行,但大规模执行成本过高的假设)已不再成立。 参见图注 图 1:基于一份面试记录[2 (https://arxiv.org/html/2602.16800#bib.bib2)](*细节已修改以保护受试者身份*)的端到端去匿名化。一个 LLM 代理从对话中提取结构化的身份信号,自主搜索网络以识别候选个体,并验证该候选者是否与所有提取的声明匹配。 我们在三个去匿名化场景中验证了这一论点:(1) 将在线账户与其真实身份匹配;(2) 将身份与未知的假名账户关联;(3) 跨平台或跨时间段关联同一人的假名账户。这些场景代表了不同的威胁模型(例如,对在线账户进行人肉搜索、跟踪狂锁定受害者、或对手整合用户活动),并带来了不同的技术挑战。在第一个场景中,我们证明最先进的 LLM 代理已经具备在开放网络上完全自主地进行端到端去匿名化的合理能力。这是我们考虑的最具挑战性的设置:仅给定一个匿名在线资料,我们的 LLM 代理自主搜索网络、查询数据库、枚举潜在候选身份,并对证据进行推理,以确定该资料属于谁。在一项针对 Hacker News 和 Reddit 资料的研究中,这些代理在 70–90% 的精确度下实现了 25–67% 的召回率,在几分钟内重现了专门的人类调查员需要数小时才能完成的工作。图 ~1 (https://arxiv.org/html/2602.16800#S1.F1) 展示了对 Anthropic Interviewer 数据集[2 (https://arxiv.org/html/2602.16800#bib.bib2),21 (https://arxiv.org/html/2602.16800#bib.bib21)] 中一名参与者的成功去匿名化,该数据集包含了 125 位科学家关于如何将 AI 融入工作的讨论。我们估计,我们的代理正确地重新识别了该数据集中至少 9/125 的参与者。*这种能力是现成的*:我们只需将在线资料的摘要提供给前沿代理,并要求其揭示背后的身份。 为了更细致地研究 LLM 如何在第二和第三种场景(将假名账户与身份关联或跨平台关联)中改进先前的去匿名化攻击,我们随后设计了一个可扩展的去匿名化流程,该流程包含四个 LLM 增强阶段: - • **提取**:与先前的工作[29 (https://arxiv.org/html/2602.16800#bib.bib29),8 (https://arxiv.org/html/2602.16800#bib.bib8)] 类似,我们要求 LLM 从非结构化帖子中识别并结构化相关特征:人口统计信息、写作风格、兴趣、偶然披露等。 - • **搜索**:我们将提取的特征编码为密集嵌入,从而能够在数千或数百万个候选资料中高效搜索。 - • **推理**:我们对搜索步骤中的顶部候选者进行扩展推理,以在所有可用上下文中识别最可能的匹配; - • **校准**:我们提示 LLM 提供所识别匹配的置信度(绝对或相对于其他匹配),这使得我们可以将攻击校准到所需的误报率。 我们的流程显著优于经典去匿名化技术的改编版[24 (https://arxiv.org/html/2602.16800#bib.bib24)]。例如,在将 Hacker News 账户与 LinkedIn 资料关联时,我们在 99% 精确度下将召回率从 0.1% 提高到 45.1%;在将 Reddit 用户跨电影子版块关联这一具有挑战性的任务中,我们在相同的精确度阈值下将召回率从 0% 提高到 2.8%。消融实验证实每个流程阶段都有贡献:特别是,**推理**步骤在 99% 精确度下将召回率从 4.4%(仅搜索)提高到 45.1%。 我们的工作引入了一个大规模去匿名化攻击的评估框架,我们认为这对于后续研究具有广泛的用途。事实上,大规模评估去匿名化攻击本身就具有固有的挑战性,因为在不损害真实用户隐私的情况下很难获得真实标签。因此,先前的工作通过合成数据[25 (https://arxiv.org/html/2602.16800#bib.bib25)] 来评估规模,并依赖手动验证或猜测工作来验证对真实数据的攻击[24 (https://arxiv.org/html/2602.16800#bib.bib24),5 (https://arxiv.org/html/2602.16800#bib.bib5)]。我们提出了两种方法来平衡真实世界的有效性与研究伦理。我们的第一种方法是识别**不是**匿名的资料(例如,一个 Hacker News 账户的“关于”字段链接到一个 LinkedIn 资料),然后通过移除所有直接标识符将其伪装成假名以用于评估目的。然后我们衡量我们的攻击是否能恢复被移除的链接。虽然这种方法可能无法捕捉到最具隐私意识用户的行为,但它大规模提供了可验证的真实标签,并能够对不同方法进行严格比较。我们的第二种方法是将单个用户的活动跨社区或跨时间分割,合成创建两个具有已知链接的用户资料,然后我们的攻击尝试推断该链接。这缓解了选择偏差的担忧,但也带来了稍后讨论的其他局限性。 #### 影响。 我们的发现对在线隐私具有重大影响。普通在线用户长期以来一直处于一种隐式威胁模型之下,他们假设假名性提供了足够的保护,因为定向去匿名化需要大量的努力。LLM 推翻了这一假设。正如 Staab 等人[29 (https://arxiv.org/html/2602.16800#bib.bib29)] 也观察到的,它们不一定会通过超越人类的**能力**——我们的模型利用的信号与熟练调查员会识别的信号相同——但通过降低成本来达成这一点。我们的实验为去匿名化场景中的这一点提供了定量证据。我们在第 ~7 (https://arxiv.org/html/2602.16800#S7) 节讨论了与在线画像和隐私相关工作的关系;并在第 ~8 (https://arxiv.org/html/2602.16800#S8) 节讨论了记忆化问题。过去的研究指出,针对“匿名化”结构化数据的隐私攻击唯一有效的缓解措施通常就是根本不要发布这些数据[24 (https://arxiv.org/html/2602.16800#bib.bib24)]。我们的发现表明,非结构化文本数据也值得类似的重新考虑。然而,正是这些文本使在线社区有价值。因此,我们认为,管理在线假名参与的隐私期望、平台政策和社会规范需要重新考虑。我们希望这项工作能够引发这场讨论。 ## 2 LLM 代理可以自主重新识别匿名在线资料 为了最好地凸显 LLM 在在线去匿名化中带来的范式转变,我们首先直接评估前沿 LLM 是否能够自主执行端到端的去匿名化——从匿名资料到现实世界身份。迄今为止,即使使用 LLM 进行属性提取,该场景也需要大量的手动成分[8 (https://arxiv.org/html/2602.16800#bib.bib8)]。为了评估 LLM 是否具备这种能力,我们首先需要构建一个在线资料评估集,并附带已知的真实身份。我们通过收集**非匿名**的在线资料,然后使用 LLM 移除任何直接标识信息来实现这一点。表 ~2 (https://arxiv.org/html/2602.16800#A1.T2) 总结了我们使用的匿名化规则:我们移除个人 URL、社交媒体账号、GitHub 仓库(这些直接标识所有者),并保留机构、人口统计信息、兴趣和联系人的姓名(这些范围太广,无法单独标识资料所有者)。目标是创建一个对有动力的人类来说并非微不足道的任务。然后我们测试 LLM 代理是否能够通过执行网络搜索来解决这个任务。这种人为的匿名化仅用于评估(以建立真实标签);任何真实的攻击都会针对已经假名的资料。我们向代理提供一个人的文本描述(源自其假名帖子的推断),并要求其通过搜索网络、交叉引用来源和推理证据来确定其真实身份。我们的流程如下: 1. 1. 将用户的帖子总结为一个资料,包含关于人口统计、职业历史、兴趣等可能推断的事实。 2. 2. 根据资料生成一个搜索提示。匿名化搜索提示,移除姓名、账号和允许直接搜索的唯一标识符。 3. 3. 将匿名化的搜索提示传递给配备了网络搜索工具的 LLM 代理。代理自主搜索、推理发现,并尝试识别用户。 遵循 Li [21 (https://arxiv.org/html/2602.16800#bib.bib21)] 的做法,为了防止滥用,我们在高层次上描述我们的攻击,并且不公开代理、具体提示或使用的工具配置。在每个资料上运行代理的成本在 1 到 4 美元之间;使得以下实验的总成本不到 2000 美元。 ### 2.1 结果 我们首先在基于 Hacker News 和 Reddit 资料的三个真实标签数据集上评估我们的代理流程。出于研究伦理的考虑,我们不评估我们的方法在 Hacker News 和 Reddit 上任何真正假名的账户。我们另外报告了对真正假名的 Anthropic Interviewer 记录的去匿名化结果,这些记录是先前去匿名化研究的主题[21 (https://arxiv.org/html/2602.16800#bib.bib21)]。 #### Hacker News→\\toLinkedIn。 我们收集了 338 名在公开可见的 HN 个人简介中链接了 LinkedIn 资料的 Hacker News (HN) 用户,提供了可验证的真实世界身份作为真实标签。我们首先将每个用户的 HN 活动(评论和故事)总结成一个结构化资料。然后我们创建一个搜索提示并对其匿名化(详见附录 ~A (https://arxiv.org/html/2602.16800#A1)),并将其传递给代理。代理在 90% 精确度下正确识别了 338 个目标中的 226 个(67%)(95% CI: 86–93%;25 个错误识别,86 个弃权)。我们注意到,这些经过编辑的资料比大多数假名账户更容易识别;我们在第 ~3.3 (https://arxiv.org/html/2602.16800#S3.SS3) 节讨论这种偏差。我们还在两个较小的 Reddit 数据集上评估了代理(学术用户和职业讨论发帖者),在 72–90% 精确度下实现了 25–52% 的召回率;我们在附录 ~B (https://arxiv.org/html/2602.16800#A2) 中报告了全部细节。 #### Anthropic Interviewer 记录。 Anthropic 公开了 125 份由 AI 对科学家进行的采访记录[16 (https://arxiv.org/html/2602.16800#bib.bib16),2 (https://arxiv.org/html/2602.16800#bib.bib2)],其中参与者描述了他们在研究中使用 AI 的情况。这些记录为保护参与者隐私而进行了部分编辑。Li [21 (https://arxiv.org/html/2602.16800#bib.bib21)] 表明,具有网络搜索功能的 LLM 代理可以将这些记录中的项目描述与已发表的论文匹配;具体来说,他们使用任务分解方法[18 (https://arxiv.org/html/2602.16800#bib.bib18)] 将攻击分解为各个良性的任务,从而绕过安全措施。他们最终对 24 位科学家的对话运行了攻击,并恢复了 6 个身份。我们在相同的数据集上使用我们的流程进行攻击,**没有使用任务分解**。具体来说,我们以类似于处理 Hacker News 的方式
相似文章
假名末日
文章认为,大型语言模型(LLMs)通过分析写作风格,越来越能够将化名身份关联起来,并预测未来所有高带宽交互都会留下可追踪的独特指纹。
AI语言模型有偏爱的人名,我们绘制了它们的分布 [R]
这项研究论文表明,大型语言模型会产生相关的名字集合(例如,针对Claude的Elena Vasquez和Marcus Chen),这些名字会出现在独立生成的文档中,并揭示这些幽灵名字已渗透到Zenodo等学术仓库,有1,655条虚假记录生成了真实的DOI。
大型语言模型中用于隐私和数据审计的自然标识符
本文介绍了自然标识符(NIDs),用于大型语言模型的事后隐私审计和数据集推断,无需重新训练或保留数据集。
语言模型能够自主攻击和自我复制
本文展示语言模型能够自主攻击漏洞网站并自我复制,无需人类干预,凸显新出现的安全风险。
多智能体LLM能否识别其同行?角色约束政治分析中的风格化指纹识别
本文研究了LLM是否能够从角色约束政治分析文本中的风格化指纹识别出自己的模型家族,即使在提示层面匿名化后也是如此。研究结果证实匿名化不足,并对欧盟AI法案合规性和多智能体系统验证有影响。