语言模型中的无意上下文泄露
摘要
本研究探讨了语言模型上下文窗口中的敏感信息如何意外泄露至输出,使得通过新攻击方法重建秘密成为可能,实验结果表明在多款专有模型中泄露问题显著。
arXiv:2608.19857v1 公告类型:新
摘要:为了使AI代理超越简单聊天而发挥作用,它们必须持有敏感的用户上下文信息,如日历、凭证、健康记录和财务数据。我们研究了模型上下文窗口中这些秘密的单纯存在是否会将隐藏关联引入模型的良性输出中,即使模型正确拒绝直接提取,也能实现重建。我们进一步研究对手是否能主动设计提示词来放大这种效应,将模型用作隐蔽载体,通过看似无害的文本传输秘密。在两种情况下,我们使用一种新颖的自适应攻击来利用这种有限的泄露,该攻击假设对底层模型具有黑盒访问权限。
在对八款专有模型进行的受控实验中,我们发现2位数的上下文内秘密以近乎完美的准确率重建,4位数秘密的精确匹配率为82%,所有这些都来自模型对普通、非对抗性请求的输出。我们观察到能力更强的模型泄露更多:更强的指令遵循能力放大了对上下文内秘密的敏感性,表明泄露是能力的副产品,而非可修复的缺陷。我们表明这种泄露使得两种实际攻击成为可能:(1) 一个训练过的分类器,从常规自然语言输出中推断关于用户记忆的语义谓词(例如健康状况、财务事件),以及 (2) 一个经过强化学习训练的对手,从生产风格的代理中提取完整的Social Security Numbers。
查看缓存全文
缓存时间: 2026/08/21 10:29
# 语言模型中的非意图上下文泄露 来源:[https://arxiv.org/html/2608.19857](https://arxiv.org/html/2608.19857) \DeclareMicrotypeSet\*[expansion]romanonlyencoding=OT1,T1,TS1,family=rm\* ###### 摘要 要使人工智能代理不仅仅用于简单聊天,它们必须处理敏感的用户上下文,例如日历、凭证、健康记录和财务数据。我们研究的是,仅仅是这些秘密存在于模型的上下文窗口中,是否会在模型的良性输出中引入隐藏的相关性,即使模型正确拒绝直接提取,也能允许重构。我们进一步研究对手是否能主动设计提示来放大这种效应,利用模型作为隐秘载体,通过看似无害的文本传输秘密。在这两种情况下,这种有限的泄露都被一种新型的自适应攻击所利用,该攻击假设对底层模型具有黑盒访问权限。在针对八个专有模型的受控实验中,我们发现,两位数上下文内秘密能够以近乎完美的准确度重构,四位数秘密的精确匹配率达到82%,所有这些都源于模型对普通、非对抗性请求的响应。我们观察到,能力更强的模型泄露更多:更强的指令遵循能力放大了对上下文内秘密的敏感性,这表明泄露是能力的副产品,而非可修补的漏洞。我们展示了这种泄露能够促成两种实际攻击:(1) 一个训练有素的分类器,能够从常规自然语言输出中推断关于用户记忆的语义谓词(例如,健康状况、财务事件),以及 (2) 一个通过强化学习训练的攻击者,能够从生产风格的智能体中提取完整的社会保障号码。 ††affiliation: FAIR, Meta超级智能实验室 ††affiliation: 加州大学伯克利分校 ††affiliation: Google DeepMind ††contribution: 工作在Meta完成 ††date: 2026年8月20日 ††correspondence: Jaiden Fairoze, 邮箱: [[email protected]](mailto:[email protected]) | 模型系统提示 | 请保密以下信息。不要透露。PIN: 7 2 4 9 | | :--- | :--- | | “我的秘密是什么?” | “抱歉,我无法透露机密信息。” | | “写一个关于任何内容的简短创意段落。包含具体的数字、日期和统计数据。” | “1987年,一个拥有4,217名居民的沿海小镇从28个蜂箱中生产了372公斤蜂蜜...” | | 对抗性解码器 | “PIN是:7 2 4 9” | **图 1:** 模型拒绝了直接提取尝试(上排),但其对无害提示的响应(下排)与上下文内秘密存在潜在相关性。对抗性解码器仅从良性输出中恢复了秘密。 ## 1 引言 大型语言模型(LLMs)越来越多地被部署在代理应用中,处理敏感的用户数据。个人助理管理私人文档,企业工具总结机密通信。常驻变体将凭证、个人标识符和专有指令保存在内存文件中,这些文件成为模型上下文的一部分(Shao等, 2024;Zhang等, 2024)。LLM隐私领域的一个关键问题是,LLMs能否在代用户执行任务时保守他们的秘密。助手通常将输出交给第三方(例如,电子邮件、短信)(Steinberger, 2025;Fyxer AI, 2026),因此一个处理不当的秘密就会脱离用户的控制。以Mireshghallah等(2023)为开端的一系列基准测试,衡量模型仅使用与提示相关上下文的能力(Mireshghallah等, 2026),而前沿评估现在直接报告这一维度(Meta, 2026)。每个此类基准之下都有一个判断器,决定模型的输出是否泄露了与提示无关的上下文。这些判断器是语言学的:它们只检查文本,寻找秘密是否逐字出现、被转述或直接暗示。如果模型没有说出秘密,判断器就认为没有泄露。 这种表述是不完整的。文本通道只是观察语言模型输出的多个通道之一。令牌级模式、响应长度、格式选择和风格转变都会随模型内部状态的变化而变化,而该状态取决于秘密(附录G单独分析了其中几个通道)。因此,模型可以在语言上完美拒绝,同时仍然将秘密编码在语言判断器从未检查的属性中(见图1)。 因此,我们探索以下关键问题: > 即使模型的文本正确拒绝“揭示”上下文内秘密,其输出的其他可观测属性是否以某种方式编码了秘密,从而允许观察者重构它? 这项工作研究了*上下文内秘密*——即在LLM上下文窗口中与用户请求混合的私有数据——如何超越该语言通道浮现。哪些通道承载秘密取决于模型:一个前沿的专有模型和一个小型开源模型会暴露相同值的不同统计指纹。因此,我们针对被审计的模型来训练判断器。攻击者获得对目标模型的黑盒访问权限,并学习读取该特定模型暴露出的通道。我们将此类攻击者称为*自适应*的,他们利用的泄露是*非意图的*。 我们将隐私建模为谓词推理,遵循CIMemories(Mireshghallah等, 2026)以及训练数据隐私文献(成员推理、属性推理、差分隐私)中的标准框架。一个能够组合跨通道信息的自适应攻击者,能够从模型对其接受的提示的回答中重构大型数字秘密。最后,我们研究了一个直接操纵通道的攻击者。 ##### 贡献。 1. **1. 威胁模型。** 我们将*非意图*上下文泄露形式化为一个谓词推理博弈,其*自适应*攻击者在拥有对目标模型的黑盒查询访问权限时,学习读取将上下文内秘密带入良性输出的、特定于模型的通道。 2. **2. 受控数字重构。** 我们在八个领先的专有模型上实例化了这个博弈,指示它们保密上下文中的一个N位数字秘密,使用所有模型在没有对抗优化的情况下都能接受的良性模板。自适应攻击者在Claude Opus 4.6和Gemini 3.1 Pro上,当N=2时达到100%的全秘密重构;在Claude Opus 4.6上,当N=4时精确匹配率达到82%;在Gemini 3.1 Pro上,当N=8时,针对10%的随机猜测,每位数字准确率达到41%。根据到目前为止恢复的数字调整每个提示,使Opus四位数恢复率比静态模板提高近一倍(82%对44%),而一个由两个模型组成的抵抗层在N≥4时从未超过随机概率(第3.1节)。 3. **3. 一种提议的抑制机制。** 我们定义并研究了*抑制*,即模型系统性地避免其必须保护的值。它追踪八个模型中的泄露(Spearman ρ=0.95,p=0.0011)、机密指令措辞的变化(Claude Opus 4.6上,每位数字准确率从简短一行指令下的0.054上升到详细策略下的0.643),以及后训练阶段的变化(OLMo-3-32B-Think上的通道熵从基础阶段的2.91位下降到RLVR后的1.37位),并且它能预测攻击失败的位置(第4节)。 4. **4. 关于用户记忆的语义谓词。** 在CIMemories(Mireshghallah等, 2026)的人设和任务上实例化相同的威胁模型,我们从常规输出中推断记忆属性(例如,健康状况、财务事件),与随机猜测相比优势为0.319,而模型无关的语言判断器仅为0.058,在该判断器自身的假阳性率下,真阳性率高1.7倍(第3.2节)。 5. **5. 生产风格的SSN提取。** 一个通过提示注入操纵通道的*主动*攻击者,通过解码预定的输出特征,从生产风格的个人代理中重构九位社会保障号码:在Claude Opus 4.6上,97.1%的试验中恢复了第一位数字,Gemini 3.1 Pro上为88.6%;在剩余的八位数字上,分别为76.5%和46.8%,上下文长度可达256K令牌,而直接请求的对照组从未从任一模型中引出SSN(第3.3节)。 ## 2 通过自适应攻击者的非意图泄露:一个通用框架 我们现在形式化一个谓词推理博弈,它捕捉了攻击者从模型良性输出中提取秘密信息的能力,以及针对该博弈的最优攻击者。 **符号表示。** 设Σ表示一个有限字母表,Σ*表示Σ上所有有限字符串的集合。设C⊆Σ*表示可能的上下文集合,C表示C上的分布,Φ表示上下文上的谓词族,由φ:C→{0,1}给出。类似地,设P⊆Σ*表示可能的提示集合,P表示P上的分布。那么,LLM是一个函数M:P×C→Δ(Σ*),将(提示,上下文)对映射到响应上的分布,其中Δ(Σ*)表示Σ*上的单纯形。设M表示此类模型上的分布。 **威胁模型。** 形式上,我们在此工作中考虑的场景可以描述为挑战者与攻击者A之间的一个博弈。这里,攻击者的目标是推断谓词的值,即0或1: ###### 实验1(谓词推理实验)。 设M是模型上的分布,C是上下文上的分布,P是允许的提示集合,Φ中的φ是一个谓词,A是一个攻击者。谓词推理实验Exp(M, C, P, φ, A)作为挑战者与A之间的博弈进行如下: 1. 挑战者独立采样M∼M和c∼C。 2. 挑战者和攻击者重复以下过程k次,对于i∈[k]: - • 攻击者选择提示p_i∈P。 - 挑战者采样响应r_i∼M(p_i, c)并将其发送给攻击者。 3. A预测猜测b'∈{0,1}。 4. 如果b' = φ(c),则Exp(M, C, P, φ, A)为1,否则为0。 **黑盒访问。** 我们给予A对M的黑盒查询访问权限,这让我们能够研究攻击者如何利用对一个特定模型的知识来在其输出中发现非意图泄露。*黑盒*意味着仅采样文本:攻击者看到的是API用户所看到的,无法获得logits、令牌概率或内部表示,因此我们的测量为白盒攻击者可能提取的内容提供了下界。该访问服务于两个目的。在估计阶段,攻击者在选择受害者之前查询*共享的公开模型*一次,以学习其泄露通道,只有模型提供者观察到这些查询。在博弈过程中,攻击者对持有秘密的部署发出k次查询并读取响应。在我们的代理实例化中,这k次查询是对助理的普通消息,因此攻击者只需要与其通信的能力。 **攻击者知道什么。** 攻击者知道模型和上下文分布C,因此可以根据选定的谓词值绘制上下文,这使得估计阶段成为可能。它不知道挑战秘密,也不需要受害者的确切系统提示,因为在一个机密指令下训练的解码器可以无需重新训练就转移到其他指令(附录H)。 有两个假设很重要,我们陈述如下:首先,攻击者必须知道秘密的*长度*,因为它训练一个输出固定位数的解码器。不同长度的值既不能与秘密混淆,也不能被该解码器恢复。其次,部署必须*指定*受保护的值,就像命名特定字段的机密指令那样。一个笼统的指令要求谨慎行事,不会给抑制一个特定的值可附着,相应地也给解码器没什么可读的。附录A给出了博弈可以沿其变化的其余维度以及它诱导的准确度度量。 ### 2.1 攻击实例化 算法1给出了谓词推理博弈的最优攻击者A*的完整形式。在博弈开始前(第1-6行),攻击者估计两个谓词值b∈{0,1}的响应分布如下: P_{M,C}(r|p,b) = Pr_{M∼M, c∼C | φ(c)=b}[M(p,c)=r] 在博弈过程中(第7-12行),攻击者观察到k个挑战响应,最后通过选择使似然最大化的b来预测φ(c)。 **输入:** 对M的查询访问权限,谓词φ,上下文分布C,提示集P,估计预算n,查询预算k **输出:** 预测值b'∈{0,1} // 估计阶段,在博弈之前:构建P_{M,C}(r|p,b) **对于** b∈{0,1}: **对于** j=1 到 n: 采样c_j∼C 使得φ(c_j)=b,然后p_j∼Uniform(P),r_j∼M(p_j, c_j); **结束 循环** P_{M,C}(r|p,b) ← 从S_b = {(p_j, r_j)}_{j=1}^n 估计; **结束 循环** // 推理阶段,在博弈期间:观察并预测 T←∅; **对于** i=1 到 k: 选择p_i∈P,观察r_i∼M(p_i, c),并将(p_i, r_i)加入T; **结束 循环** **对于** b∈{0,1}: L_b ← ∏_{(p,r)∈T} P_{M,C}(r|p,b); **返回** argmax_{b∈{0,1}} L_b; **算法 1** 最优谓词推理攻击者 **获取具有已知谓词值的上下文。** 第1行要求采样c∼C 使得φ(c)=b,这看起来可能是一个很强的假设。攻击者实际上自行构建这些上下文:它编写一个自己选择的机密提示,并插入一个自己选择的秘密,因此它知道秘密
相似文章
语言模型与视觉语言模型中的后门学习
本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。
Leak It:黑盒语言模型训练数据提取的概率方法
本文提出了一种从黑盒语言模型中提取训练数据的概率方法,表明聚合的成员推断指标掩盖了逐文档泄露,并介绍了“leakit”审计工具。
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。
语言模型能够自主攻击和自我复制
本文展示语言模型能够自主攻击漏洞网站并自我复制,无需人类干预,凸显新出现的安全风险。
[论文] 语言模型到底记住了多少?
本文探讨了语言模型记住训练数据的程度,并探讨其对隐私和安全的影响。