零样本嵌入漂移检测:一种针对LLM中提示注入的轻量级防御方法

arXiv cs.AI 论文

摘要

本文介绍了零样本嵌入漂移检测(ZEDD),这是一种轻量级框架,通过测量嵌入空间中的语义偏移来检测LLM中的提示注入攻击,在多种架构上实现了超过93%的准确率和低于3%的假阳性率。

arXiv:2601.12359v1 公告类型: cross 摘要:提示注入攻击已成为LLM应用中日益严重的漏洞,对抗性提示利用间接输入通道(如电子邮件或用户生成内容)来规避对齐防护,并引发有害或意外输出。尽管在对齐方面取得了进展,但即使是最先进的LLM仍然普遍易受对抗性提示的攻击,这突显了需要稳健、高效且可泛化的检测机制,而非低效、特定模型的补丁。在这项工作中,我们提出了零样本嵌入漂移检测(ZEDD),这是一种轻量级、低工程开销的框架,通过量化良性输入与可疑输入之间嵌入空间的语义偏移来识别直接和间接的提示注入尝试。ZEDD无需访问模型内部、无需攻击类型的先验知识、也无需任务特定的重新训练,即可在多种LLM架构上实现高效的零样本部署。我们的方法使用对抗-干净提示对,并通过余弦相似度测量嵌入漂移,以捕捉现实注入攻击中固有的细微对抗性操作。为确保稳健评估,我们整理并重新标注了全面的LLMail-Inject数据集,该数据集涵盖了源自公开来源的五种注入类别。大量实验表明,嵌入漂移是一种稳健且可迁移的信号,在检测精度和操作效率上优于传统方法。在Llama 3、Qwen 2和Mistral等模型架构上,分类提示注入的准确率超过93%,假阳性率低于3%,我们的方法提供了一种轻量级、可扩展的防御层,可集成到现有LLM流水线中,解决了保护LLM驱动系统以抵御自适应对抗威胁的关键缺口。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:15

# 零样本嵌入漂移检测:针对LLM提示注入的轻量级防御机制
来源:https://arxiv.org/html/2601.12359
Anirudh Sekar Mrinal Agarwal Rachel Sharma Akitsugu Tanaka Jasmine Zhang Arjun Damerla22footnotemark:2Kevin Zhu22footnotemark:2 Algoverse AI Research anirudhsekar2008@gmail\.com, arjundamerla@berkeley\.edu, kevin@algoverse\.us

###### 摘要

提示注入攻击已成为LLM应用程序日益严重的漏洞,攻击者利用间接输入通道(如电子邮件或用户生成内容)规避对齐安全机制,诱导模型产生有害或非预期的输出。尽管对齐技术取得了进展,但即便最先进的LLM在面对对抗性提示时仍普遍存在脆弱性,这凸显了超越低效、模型特定补丁方案,开发鲁棒、高效且可泛化的检测机制的迫切需求。本文提出**零样本嵌入漂移检测(ZEDD)**,一种轻量级、低工程开销的框架,通过量化良性输入与可疑输入在嵌入空间中的语义偏移,识别直接和间接提示注入攻击。ZEDD无需访问模型内部结构、无需预知攻击类型、也无需针对特定任务重新训练,可在多种LLM架构上实现高效的零样本部署。本方法利用对抗性-干净提示对,通过**余弦相似度**测量嵌入漂移,以捕捉真实注入攻击中固有的微妙对抗性操纵。为确保评估的稳健性,我们整理并重新标注了涵盖五种注入类别的综合**LLMail-Inject**数据集(源自公开资源)。大量实验表明,嵌入漂移是一种稳健且可迁移的信号,在检测准确率和运行效率上均优于传统方法。在Llama 3、Qwen 2和Mistral等模型架构上,我们对提示注入的分类准确率**超过93%**,**假阳性率低于3%**,该方法提供了一种轻量级、可扩展的防御层,可集成到现有LLM流水线中,弥补了在应对自适应对抗威胁时保障LLM驱动系统安全的关键缺口。

††footnotetext:本项目所有代码公开于:https://github.com/AnirudhSekar/ZEDD/blob/main/Zero_Shot_Embedding_Drift_Detection_A_Lightweight_Defense_Against_Prompt_Injections_in_LLMs.ipynb

## 1 引言与相关工作

大型语言模型(LLMs)已迅速成为广泛应用程序的核心,涵盖对话式AI、内容生成、软件开发及研究辅助等领域[21 (https://arxiv.org/html/2601.12359v1#bib.bib23)]。然而,对这些系统的日益依赖也暴露了重大的安全隐患,特别是提示注入攻击的威胁[18 (https://arxiv.org/html/2601.12359v1#bib.bib4)]。此类攻击通过构造输入,操纵LLM绕过其对齐安全机制,从而产生有害、误导性或违反政策的输出[16 (https://arxiv.org/html/2601.12359v1#bib.bib21)]。

尽管通过人类反馈强化学习(RLHF)及其他微调技术,LLM在避免明显危险行为方面取得了显著进展,但这些模型仍易受到对抗性提示的攻击[24 (https://arxiv.org/html/2601.12359v1#bib.bib24)]。近期研究表明,无论是手动还是自动的基于提示的攻击,都能持续诱导最先进的商业模型生成包括非法活动指导、虚假信息和仇恨言论在内的不良内容[10 (https://arxiv.org/html/2601.12359v1#bib.bib7)]。特别是,通过基于梯度的优化方法生成的对抗性提示,在规避现有安全措施方面成功率很高,并且常常能在不同模型和架构间迁移,如文献[6 (https://arxiv.org/html/2601.12359v1#bib.bib8)、12 (https://arxiv.org/html/2601.12359v1#bib.bib10)]所示。

然而,尽管对提示注入风险的认识不断提高,现有的大多数防御措施在有效性或实用性上仍有局限[2 (https://arxiv.org/html/2601.12359v1#bib.bib30)、22 (https://arxiv.org/html/2601.12359v1#bib.bib31)、20 (https://arxiv.org/html/2601.12359v1#bib.bib32)]。嵌入漂移已被探索过,但这些方法利用逻辑回归、XGBoost、随机森林等优化方式,而非对LLM的嵌入空间进行微调以产生优化的分类结果[3 (https://arxiv.org/html/2601.12359v1#bib.bib2)]。此外,一些不同的方法也已被探索,但许多方法并不轻量[18 (https://arxiv.org/html/2601.12359v1#bib.bib4)、19 (https://arxiv.org/html/2601.12359v1#bib.bib22)],引入了不可忽视的计算和延迟开销,阻碍了在延迟敏感应用中的可扩展部署,如文献[17 (https://arxiv.org/html/2601.12359v1#bib.bib18)]所讨论。

## 2 我们的贡献

当前检测直接和间接提示注入(IPI)的方法依赖于额外的大模型和基于规则的过滤器,在高层面对注入进行分类,这造成了沉重的计算和集成负担[11 (https://arxiv.org/html/2601.12359v1#bib.bib19)、7 (https://arxiv.org/html/2601.12359v1#bib.bib20)、26 (https://arxiv.org/html/2601.12359v1#bib.bib1)]。

在这项工作中,我们引入了一种简单而有效的防御机制:**零样本嵌入漂移检测(ZEDD)**。我们的关键洞察是:对抗性提示会在嵌入空间中微妙地改变输入的语义表征,即使表面文本看起来干净,这使得我们能够在保持准确性的同时,对提示进行更快速、更轻量级的分析。

通过测量干净提示与候选提示之间向量嵌入的漂移(即变化),我们可以以极其轻量级的方式检测注入尝试。我们的方法高效、与模型无关,并且兼容开源嵌入模型和商业API。这些特性消除了模型重新训练、内部模型访问或预先了解特定攻击模式的需要。

我们的贡献如下:

1. 1. 一种基于嵌入漂移的零样本提示注入检测方法,无需重新训练、模型访问或预知攻击类型。
2. 2. 一种利用**高斯混合模型(GMM)**和**核密度估计(KDE)**分析嵌入分布的方法,以充分标记被注入的提示,同时最小化误报。
3. 3. 全面的实证评估表明,嵌入漂移可作为不同LLM架构下提示注入的信号,在保持高准确率的同时,在速度上优于许多传统方法。

最终,本工作旨在通过引入一个轻量级、无需训练的检测层,以最小工程开销高效集成到现有LLM流水线中,从而增强对提示注入的防御能力。

## 3 威胁模型

攻击者目标:攻击者试图将对抗性指令注入到由LLM集成的电子邮件助手所处理的电子邮件内容中。目标映射到常见的语义操纵模式:

1. 1. 越狱:通过角色扮演、假设场景或隐含角色采纳来绕过安全机制。
2. 2. 系统泄露:通过看似无害的邮件查询提取系统提示、配置细节或内部模型参数。
3. 3. 任务覆盖:将助手从其预定义任务重定向到执行未经授权的操作。
4. 4. 编码操纵:使用特殊字符、格式技巧或混淆语言来逃避检测,同时保留恶意意图。
5. 5. 提示混淆:引入复杂、多步骤的指令,旨在误导模型的指令遵循过程。

由于LLM通常运行在半结构化输入(如用户消息或系统模板)之上,它们容易受到提示注入攻击,其中对抗性内容被放置在输入中,以操纵LLM的行为[8 (https://arxiv.org/html/2601.12359v1#bib.bib28)]。

攻击者知识:我们假设攻击者能够获取关于目标LLM集成应用程序的公开或可推断信息。这包括了解电子邮件内容如何被格式化和整合到提示中,用户面向的摘要或响应如何生成,以及底层LLM的整体行为(通过文档、逆向工程或试探性交互获取)。此外,攻击者可以访问公开的提示注入技术和方法,包括可能在LLMail-Inject等数据集中记录的那些。根据提示注入攻击的构造,我们假设攻击者无法访问私有模型权重或内部应用程序架构,只能访问标准外部用户可用的相同接口。

攻击者能力:攻击者的能力仅限于电子邮件媒介,具体来说,是能够构造和发送恶意电子邮件内容,这些内容将由LLM集成的助手处理。他们可以操纵电子邮件的结构、元数据和内容以嵌入对抗性指令,并根据可观察的系统响应迭代改进攻击策略。这反映了间接提示注入:攻击者依赖宿主应用程序(例如电子邮件助手)[25 (https://arxiv.org/html/2601.12359v1#bib.bib11)]自动检索并将电子邮件内容拼接到模型输入中。尽管无法控制模型的基础设施,但这一访问级别足以实施有效的攻击,因为许多现实世界的系统依赖于未经信任的内容(如电子邮件)来驱动基于LLM的自动化工作流。LLMail-Inject通过由公众设计的绕过系统级防御的示例,捕获并测试了这种威胁模型。

## 4 ZEDD流水线

我们提出一个模块化流水线,通过量化良性提示与对抗性提示变体之间的语义漂移来检测提示注入攻击。设计在保持不同嵌入模型和Transformer架构间检测精度的同时,优先考虑高效计算。该设计在对编码器进行微调后也是零样本的,这意味着编码器需要训练一次,然后即可零样本使用。

参见图注

图1:ZEDD流水线概览

如图1(ZEDD流水线)所示,该方法包含三个核心阶段:

1. 1. 使用微调编码器提取嵌入
2. 2. 通过余弦相似度计算语义漂移
3. 3. 通过GMM和KDE标记可疑提示

通过分析嵌入空间而非表面形式的变化,ZEDD能够捕捉绕过词汇过滤器的微妙操纵。这种抽象实现了与模型无关的检测,借鉴了推理时鲁棒性方法[4 (https://arxiv.org/html/2601.12359v1#bib.bib12)]的思想,但无需任务特定微调的计算开销。

### 4.1 嵌入提取

对于每个匹配的干净/注入提示对(见章节F.1),我们使用来自Sentence BERT All MPNET Base V2、Llama 3 8B Instruct、Mistral 7B Instruct和Qwen 2 7B Instruct的微调嵌入表示来提取向量表征。有关URL和许可证的更多信息,请参见附录A。

在微调过程中,模型利用每个干净-注入和干净-干净提示对的嵌入表征,以更好地在嵌入空间中分类和识别注入提示与干净提示之间的差异,从而使ZEDD表现显著提升。

### 4.2 漂移测量与检测

为了量化对抗性提示如何改变模型的内部理解,我们利用**余弦相似度**测量每个注入提示与其干净对应物之间的**语义漂移**。使用从语言模型编码器提取的向量嵌入,我们计算余弦距离作为语义变化的代理。距离越大表示含义变化越大,可能指示注入。与章节1中提到的其他方法相比,这种方法显著更轻量。

我们将该嵌入漂移分数定义为:

Drift\(x,x'\)=1−\(f\(x\)·f\(x'\)\)/\(||f\(x\)||·||f\(x'\)||\)  (1)

该公式量化了注入提示与其干净对应物之间的偏离程度,但与章节1中提到的先前方法相比,它显著更轻量。

为了正确分析我们的提示数据集,我们将数据集分为训练集和测试集,大约**70%**为训练集,其中包含完全干净(干净-干净)提示对和部分干净(注入-干净)提示对,并保持与原始数据集中注入-干净提示对一致的精确类别分布。然后我们执行**二元分类评估**:我们测试的模型根据提示对的类别进行微调,如果类别为干净则得分为1,否则为0,以正确建立基线,使模型能够学习提示之间的关系以优化嵌入方式。我们使用大约**10%**的训练数据集(如前所述,占总数据集的70%)来微调所测试的模型,以减少微调时间并防止模型过拟合。

### 4.3 漂移检测框架

为了在没有标注真实标签的情况下准确检测对抗性提示注入,我们开发了一种**集成标记方法**,利用每个模型嵌入的漂移分数对可疑的注入提示对进行分类。

#### 4.3.1 分布建模与阈值校准

采用层次化方法,我们的标记算法首先使用**高斯混合模型(GMM)**,并将**核密度估计(KDE)**作为后备机制。

**高斯混合模型(GMM)**:系统在漂移分数分布上拟合一个双分量GMM,利用均值分离来区分干净和注入的漂移分数群体:较低的均值分数对应于干净-干净提示对(因为它们具有较低的语义漂移),较高的均值分数对应于注入-干净提示对(具有较高的语义漂移)。

最优决策阈值计算如下:

f_clean\(x\)·w_clean = f_injected\(x\)·w_injected  (2)

其中 f_i\(x\) 表示分量 i 的高斯密度函数,w_i 表示混合权重。

**KDE 后备机制**:当 GMM 无法收敛或产生不稳定结果时,标记算法回退到基于 KDE 的方法,识别分布中的峰值和谷值,以区分注入-干净和干净-干净提示对。

#### 4.3.2 检测性能的约束优化

阈值优化部分旨在同时优化假阳性率和被标记项的总数。这些值分别预设为 **3%** 和 **50%**,因为我们发现这些值能产生最佳性能,但可根据需要修改。

用于标记值的最终阈值通过**迭代二分搜索**确定。

相似文章

领域伪装注入攻击规避多智能体LLM系统检测

Hacker News Top

本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。

不要让LLM说话,直接探测它(8分钟阅读)

TLDR AI

本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。