MIRAGE:大语言模型代理中的极性翻转编码子空间
摘要
本文在大语言模型代理的残差流中确定了一个极性翻转编码子空间,该子空间能够实时检测隐蔽数据窃取,在注入场景中达到AUC=0.918,且大幅优于仅输出检测器。
查看缓存全文
缓存时间: 2026/06/10 06:10
# MIRAGE:LLM Agent 中一个极性翻转的编码子空间
来源:https://arxiv.org/html/2606.10304
Kargi Chauhan、Jihye Kim、Sadiba Nusrat Nur、Vincent Siu、Chenguang Wang
###### 摘要
当 LLM Agent 被强制以隐蔽方式编码敏感数据(Base64、ROT13、藏头诗、同义词链等)时,生成的输出能够规避输出侧的检测,但其底层计算却无法隐藏。在九种编码家族和来自五个架构家族的八种模型中,该计算由残差流中一个共享的低维**编码子空间**支持。一个在八种编码家族上训练的逻辑回归探针,在留一编码(LOEO)评估中能够以 AUC 0.975–1.000 恢复被排除的第九种编码——它读取的是计算过程而非表面特征。该同一方向在规划令牌处表现出第二种机制性特征:极性翻转,当模型将**在线模拟**编码时正向激活,当模型将**外包**给工具调用时负向激活,从而在编码文本出现之前区分两种执行策略。我们构建了 **Mirage**(Model-Internal Readout of Agentic Generation Exfiltration,Agent 生成行为数据外泄的模型内部读取器),这是一个利用这两种信号的双通道实时监控器。在 126 个 Agent 外泄场景中,它达到 **AUC = 0.918**,大幅优于仅输出检测(AUC = 0.518)。监控器性能从根本上取决于宿主模型的几何结构:良性编码的假阳性率在 Qwen-7B 上为 0%,在 Phi-3.5 上为 100%,这表明探针忠实反映的是模型几何结构是否能够区分隐蔽编码与公开编码。在所有测试的对抗预算下,每个压制该子空间的攻击同时也破坏了编码保真度——这是在评估预算内观察到的经验规律,并非结构性不可能性声明。
LLM Agent、数据外泄、表示探针、隐写检测、Agent 安全
## 1 引言
攻击者会污染 LLM Agent 将要检索的文档。其中隐藏着一条指令:对凭证进行编码并通过工具调用发送出去。模型服从了;文本看起来流畅自然。语言模型输出中的隐蔽编码很难检测(Motwani 等人,2024(https://arxiv.org/html/2606.10304#bib.bib31);Roger 和 Greenblatt,2023(https://arxiv.org/html/2606.10304#bib.bib70);Greenblatt 等人,2024(https://arxiv.org/html/2606.10304#bib.bib30));输出侧防御失效:基于困惑度的检测(Alon 和 Kamfonas,2023(https://arxiv.org/html/2606.10304#bib.bib16))达到 AUC = 0.518,而微调后的 DeBERTa-v3-base 在保留的编码家族上降至 AUC = 0.295。信号不在表面文本中,而在计算过程中。在九种编码家族(密钥凯撒、十六进制、列换位、藏头诗、同义词链、叙述性释义、情感极性、词长隐写、同音替换;LOEO 探针集,见 §3.1(https://arxiv.org/html/2606.10304#S3.SS1))和来自五个架构家族的八个开源模型(Qwen(Yang 等人,2024(https://arxiv.org/html/2606.10304#bib.bib34))、Mistral(Jiang 等人,2023(https://arxiv.org/html/2606.10304#bib.bib35))、Llama(Dubey 等人,2024(https://arxiv.org/html/2606.10304#bib.bib67))、DeepSeek(DeepSeek-AI,2024(https://arxiv.org/html/2606.10304#bib.bib68))、Phi(Abdin 等人,2024(https://arxiv.org/html/2606.10304#bib.bib69)))中,编码计算共享一个低维的**编码子空间**(残差流中的)。Base64 和 ROT13 在端到端注入协议下分别评估(§5.3(https://arxiv.org/html/2606.10304#S5.SS3);八个表面编码)。一个在八个家族上训练的逻辑回归探针,在留一编码(LOEO)评估中恢复被排除的第九个家族,AUC 为 0.975–1.000。同一模型作为静态文本编码器处理相同的输出(聊天模板匹配),AUC 落后 9.4 个点,这表明判别信号位于计算过程中,而非文本中。该子空间并非架构特定。Qwen-7B 和 Mistral-7B(没有共享权重、训练数据或分词器的模型)之间的逐编码 LOEO 秩排序相关性为 Spearman ρ=0.957 (p<0.0001);跨种子的探针方向余弦相似度超过 0.998。最简单的解读是,该子空间是这些模型解决的编码任务的属性,而非任何特定运行的属性。
参考图注
图 1:Agent 监控案例研究。一个 Agent 摄取检索到的内容 (a),其中包含一个对抗性间接提示注入(第三方编写,旨在强制隐蔽外泄),试图在线模拟 (c) 或通过工具委托 (d) 执行。Mirage 在生成时读取编码子空间 (e) 以及在最后一个输入令牌处读取 (f),此时极性在模拟和外包之间翻转。输出侧监控器得分接近随机(AUC≈0.52);双通道监控器在 126 个场景的 Agent 测试集上达到 AUC = 0.918(§7.1(https://arxiv.org/html/2606.10304#S7.SS1))。
图 1(https://arxiv.org/html/2606.10304#S1.F1)展示了 Mirage 处理的 Agent 监控案例研究。九个编码共享的方向仍可能是表示的巧合。因此,我们要求该子空间完成一件巧合无法做到的事:在同一令牌处区分同一目标的两种执行策略。在最后一个输入令牌处,子空间进行极性翻转:当模型即将**在线模拟**编码时正向激活,当模型即将**外包**给工具调用时负向激活。这种模拟与外包的区分在 Qwen-7B 的**每个解码器层**中都是线性可分的(在 40 个场景的受控集上,平均每层 AUC = 1.000;在凭证和最后令牌匹配的控制条件下 AUC ≥0.977)。一次简单扫描显示在嵌入层 AUC = 1.000;匹配的控制条件将其降至机会水平(0.500),正确识别了一个表面混淆因素。跨架构头部消融将写入电路定位在 Qwen-7B 的五个 Layer-0 头以及 Mistral-7B 的分布层 1–15。
Mirage(Model-Internal Readout of Agentic Generation Exfiltration)实时读取这两个信号。在 126 个场景的 Agent 外泄测试集上,它达到 AUC = 0.918(95% CI: [0.857, 0.957]);在分层 50 份设计/测试重验证下,测试半 AUC = 0.913±0.029,与 0.918 在统计上无显著差异。性能受限于宿主模型:良性编码任务上的假阳性率在 Qwen-7B 上为 0%,在 Mistral-7B 上为 18.8%,在 Phi-3.5 上为 100%:这是宿主模型几何结构的属性,而非探针的属性。当模型本身不区分“解释 Base64”和“对此凭证进行 Base64 编码”时,任何线性探针都无法做到;这使得监控器兼容性成为可审计的宿主模型属性。我们也不声称对规避具有结构性不可能性:在 300 步 GCG 与四种损失规范、N≤50 黑盒采样以及跨 24 种策略的 120 个提示自适应试验中,每个压制子空间的配置同时也破坏了编码保真度。我们将此报告为在评估预算内的经验规律。通篇中,“间接提示注入”(IPI)指其对抗性子集,即第三方编写的、旨在强制隐蔽外泄的检索内容;Mirage 将编码**计算**作为该对抗意图的代理进行读取,而非适用于一般 IPI(良性 IPI 不在范围内)。
#### 贡献。
1. 1. **编码计算的跨架构通用性。** 跨九个表面形式的编码计算在来自五个架构家族的八个模型中共享一个低维残差流子空间(LOEO AUC 0.975–1.000;在匹配聊天模板下的静态文本编码器;9.4 个点差距)。Qwen-7B 和 Mistral-7B 之间的逐编码 LOEO 秩排序相关性为 Spearman ρ=0.957 (p<0.0001),表明该子空间是任务级别的,而非训练伪影。
2. 2. **模拟与外包作为机制性特征。** 在规划令牌处,编码子空间翻转极性:当模型将**在线模拟**编码时正向激活,当将**外包**给工具调用时负向激活。该极性翻转在 Qwen-7B 的**每个解码器**层中都是线性可分的(平均每层 AUC = 1.000;在匹配控制条件下 AUC ≥0.977)。表面可见的嵌入层可分性(AUC = 1.000)在凭证匹配控制条件下降至机会水平,揭示了一个表面混淆因素(附录 L.3(https://arxiv.org/html/2606.10304#A12.SS3))。头消融将写入电路定位在 Qwen-7B 的五个 Layer-0 头以及 Mistral-7B 的分布层 1–15(附录 L.5(https://arxiv.org/html/2606.10304#A12.SS5))。
3. 3. **宿主模型几何结构作为可审计的部署属性。** 监控器性能从根本上由宿主模型的残差流几何结构决定:良性编码假阳性率在 Qwen-7B 上为 0%,在 Mistral-7B 上为 18.8%,在 Phi-3.5 上为 100%。这使得监控器兼容性成为可审计的模型属性,而部署测试集可用于筛选(第 7.2 节(https://arxiv.org/html/2606.10304#S7.SS2);图 3(https://arxiv.org/html/2606.10304#S7.F3))。
4. 4. **一个实时的双通道 Agent 监控器。** Mirage 同时利用编码子空间和极性翻转,在工具执行前检测外泄意图。在 126 个 Agent 外泄场景中,AUC = 0.918(95% CI: [0.857, 0.957]);重验证测试半 AUC = 0.913±0.029(附录 L.4(https://arxiv.org/html/2606.10304#A12.SS4)):机制性发现转化为实践。
## 2 相关工作
#### 提示注入与输出侧防御。现有防御措施过滤输入(Greshake 等人,2023(https://arxiv.org/html/2606.10304#bib.bib1);Perez 和 Ribeiro,2022(https://arxiv.org/html/2606.10304#bib.bib2))或对工具调用进行沙箱隔离(Zhan 等人,2024(https://arxiv.org/html/2606.10304#bib.bib3);Yi 等人,2023(https://arxiv.org/html/2606.10304#bib.bib5)),或者对输出文本进行评分(Alon 和 Kamfonas,2023(https://arxiv.org/html/2606.10304#bib.bib16);Inan 等人,2023(https://arxiv.org/html/2606.10304#bib.bib15))。
#### 线性探针与激活导向。线性探针恢复真实、拒绝和恶意意图的低维子空间(Marks 和 Tegmark,2024(https://arxiv.org/html/2606.10304#bib.bib20);Arditi 等人,2024(https://arxiv.org/html/2606.10304#bib.bib59);Burns 等人,2023(https://arxiv.org/html/2606.10304#bib.bib47));激活导向(Zou 等人,2023a(https://arxiv.org/html/2606.10304#bib.bib21);Turner 等人,2024(https://arxiv.org/html/2606.10304#bib.bib46))对此类方向进行因果验证,但标准探针(Belinkov,2022(https://arxiv.org/html/2606.10304#bib.bib27))不要求跨表面形式迁移。
#### Agent 安全基准与威胁模型。测试集(Ruan 等人,2024(https://arxiv.org/html/2606.10304#bib.bib12);Debenedetti 等人,2024(https://arxiv.org/html/2606.10304#bib.bib13);Wu 等人,2024(https://arxiv.org/html/2606.10304#bib.bib45))衡量攻击成功率;Mirage 读取内部状态,补充了欺骗(Hubinger 等人,2024(https://arxiv.org/html/2606.10304#bib.bib49);Park 等人,2024b(https://arxiv.org/html/2606.10304#bib.bib50))和工具滥用(Chen 等人,2024(https://arxiv.org/html/2606.10304#bib.bib48))威胁。
## 3 编码子空间
### 3.1 设置
令 h_t^(ℓ) ∈ R^d 为令牌 t、层 ℓ 处的残差流隐藏状态(Vaswani 等人,2017(https://arxiv.org/html/2606.10304#bib.bib51);Elhage 等人,2021(https://arxiv.org/html/2606.10304#bib.bib52))。大型语言模型中的表示在关键方向上表现出线性(Park 等人,2024a(https://arxiv.org/html/2606.10304#bib.bib63);Tigges 和 Tegmark,2023(https://arxiv.org/html/2606.10304#bib.bib64);Gurnee 等人,2024(https://arxiv.org/html/2606.10304#bib.bib26)),我们利用这一特性,将编码子空间(图中标签记为 EIS)作为低维线性方向。对于九种编码风格 s——密钥凯撒、语音(同音替换)、列换位、藏头诗、同义词链、叙述性释义、情感极性、词长隐写、十六进制——我们构建配对的正样本和负样本。隐藏状态从最终 Transformer 层的每个生成令牌处提取,涵盖模型:Qwen2.5-{1.5B, 3B, 7B, 14B}-Instruct(Yang 等人,2024(https://arxiv.org/html/2606.10304#bib.bib34))、Mistral-7B-Instruct-v0.3(Jiang 等人,2023(https://arxiv.org/html/2606.10304#bib.bib35))、Llama-3-8B-Instruct(Dubey 等人,2024(https://arxiv.org/html/2606.10304#bib.bib67))、DeepSeek-7B(DeepSeek-AI,2024(https://arxiv.org/html/2606.10304#bib.bib68))和 Phi-3.5-mini-instruct(Abdin 等人,2024(https://arxiv.org/html/2606.10304#bib.bib69))。探针训练、提示多样性以及我们采用的 Liu 等人注入模板描述于 §4.3(https://arxiv.org/html/2606.10304#S4.SS3)和附录 C(https://arxiv.org/html/2606.10304#A3)。
### 3.2 经验性声明
对于每种编码风格 s,定义均值差方向
v_s = h̄_s^+ − h̄_s^-, (1)
其中 h̄_s^± 是正样本和负样本的隐藏状态均值。
**经验性声明。** 来自公式 (1) 的所有九种编码风格的方向 {v_s} 共享正的成对余弦相似度(0.32–0.64),并集中在一个维度 ≤5 的子空间中(在 3584 维度中五个随机方向约 0.14% 的预期),解释了 20–40% 的类间方差。这是在所有八个测试模型中观察到的经验规律,而非理论保证。在任何子集上训练的探针会迁移到保留的风格,使用约 3% 的隐藏维度(稀疏度 ≥0.965)。图 2(https://arxiv.org/html/2606.10304#S3.F2)显示了在同一模型上区分外泄响应与代码生成、数学推理、外语输出和高熵文本的子空间得分:句法复杂度、熵值和非英语输出不会产生高的子空间得分。
参考图注
图 2:Qwen-2.5-7B 上的编码子空间几何结构(种子 42)。(a) 五个任务类别的子空间得分:外泄在阈值 τ=0.307 之上,良性混淆因素(代码、数学、外语、高熵)在阈值之下;AUC = 1.000,稳健边际 0.99(q10 vs q90)。(b) 前两个主成分:外泄聚类(红色)与每个良性类别线性分离。在该模型上,句法复杂度、熵值和非英语输出不会产生高的子空间得分。
### 3.3 跨架构一致性
编码子空间在没有共享权重、训练数据或分词器的架构之间重复出现——这是它属于编码任务属性而非特定模型属性的最强证据。先前工作已记录了跨模型任务不变计算的出现(Chughtai 等人,2023(https://arxiv.org/html/2606.10304#bib.bib62);Gurnee 和 Tegmark,2024(https://arxiv.org/html/2606.10304#bib.bib65)),这为表示沿有意义的任务维度对齐提供了假设基础。我们的发现将这种通用性特别扩展到编码子空间。在我们测试的八个模型(Qwen2.5-1.5B/3B/7B/14B、Mistral-7B、Llama-3-8B、DeepSeek-7B、Phi-3.5-mini)中,LOEO 探针达到平均 AUC = 0.975–1.000(表 2(https://arxiv.org/html/2606.10304#S5.T2))。Qwen-7B 和 Mistral-7B 之间的逐编码秩排序相关性为 Sp相似文章
内存增强型LLM智能体中的状态污染
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。
缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。
PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。
领域伪装注入攻击规避多智能体LLM系统检测
本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。