TopoGuard:基于图论的RAG Split-Knowledge攻击防御

arXiv cs.CL 论文

摘要

介绍了TopoGuard,这是一种基于图论的防御方法,用于抵御RAG系统中的Split-Knowledge攻击。该攻击中,多个单独无害的文档组合后会产生有害输出。该方法通过构建语义相似度图来检测恶意上下文,性能显著优于现有的逐文档过滤器(如LlamaGuard)。

arXiv:2607.20437v1 公告类型:新 摘要:生产级检索增强生成(RAG)系统依赖聚合多个外部文档来回答复杂查询。然而,检索到的文档引入了一个新的威胁面,可被利用发起分知识攻击(split-knowledge attacks)。在此攻击中,攻击者注入的文档单独看是无害的,但组合并输入语言模型后会产生虚假关联。本文表明,这种新攻击对于现有逐文档过滤器(如LlamaGuard)在结构上是不可见的。为解决RAG中的这一问题,本研究引入了TopoGuard,这是一系列基于图论的方法,专门针对分知识攻击,通过从检索文档构建语义相似度图并检测具有恶意拓扑的上下文。基于理论分析,TopoGuard系列已被证明即使在有噪声输入时也有效且鲁棒。在两个检索数据集上进行了大量实验,并与多种基线方法进行了比较。具体来说,在HotpotQA数据集上,TopoGuard-$\lambda_2$+Entity在1%假阳性率下捕获的攻击次数比LlamaGuard-2-8B多21倍(召回率32.6% vs 1.5%)。与使用大型语言模型的生产级RAG检测系统相比,所提出的TopoGuard变体以亚毫秒延迟高效运行,并且在面对自适应对手和良性跨领域查询时保持鲁棒。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:15

# TopoGuard:基于图论的分裂知识攻击防御方法(针对RAG系统)

来源:https://arxiv.org/html/2607.20437
Chahana Dahal¹, Zuobin Xiong¹

¹ 内华达大学拉斯维加斯分校计算机科学系  
{chahana.dahal, zuobin.xiong}@unlv.edu

###### 摘要

生产级检索增强生成(RAG)系统依赖聚合多个外部文档来回答复杂查询。然而,检索到的文档引入了一个新的威胁面,可被利用来发起**分裂知识攻击**。在这种攻击中,攻击者注入的文档单独看是良性的,但合并后输入语言模型时会产生虚假关联。本文表明,这种新型攻击在结构上对现有的单文档过滤器(如LlamaGuard)是不可见的。为解决RAG中的这一问题,本文引入了**TopoGuard**,这是一系列基于图论的方法,专门针对分裂知识攻击,通过从检索文档构建语义相似图并检测具有恶意拓扑的上下文。基于理论分析,TopoGuard系列已被证明即使在有噪声输入时也是有效且鲁棒的。我们在两个检索数据集上进行了大量实验,并与多种基线方法进行了比较。具体而言,在HotpotQA数据集上,TopoGuard-λ₂+Entity在1%假阳性率下捕获的攻击数量是LlamaGuard-2-8B的21倍(召回率32.6% vs 1.5%)。与使用大型语言模型的生产级RAG检测系统相比,所提出的TopoGuard变体在亚毫秒延迟下高效运行,并且对自适应对手和良性跨域查询保持鲁棒。

## 1 引言

检索增强生成(RAG)已广泛用于为大型语言模型(LLM)提供外部知识基础,因为RAG通过将外部文档等知识整合到提示中来减少幻觉Shuster等人 (2021)(https://arxiv.org/html/2607.20437#bib.bib3)。最近,基于RAG的系统已大规模部署在企业搜索、客户支持、编码助手和消费级聊天机器人中。在生产级RAG系统的流水线中,它在查询时从大型外部语料库中检索前k个文档Lewis等人 (2020)(https://arxiv.org/html/2607.20437#bib.bib18)作为外部知识。然而,这种朴素的检索策略容易受到恶意意图的影响,使得RAG系统本身成为一个攻击面。具体来说,攻击者可以通过开放提交、自动摄取或网络爬虫,在具有低级访问权限的情况下向检索语料库注入有害内容Zou等人 (2025)(https://arxiv.org/html/2607.20437#bib.bib1)。为应对此类攻击,现有的RAG安全防御主要部署在文档层面。例如,LlamaGuardLlama Team (2024b)(https://arxiv.org/html/2607.20437#bib.bib5), a(https://arxiv.org/html/2607.20437#bib.bib6)、Perspective APILees等人 (2022)(https://arxiv.org/html/2607.20437#bib.bib2)和LLM-as-a-JudgeZheng等人 (2023)(https://arxiv.org/html/2607.20437#bib.bib9)等系统独立地对每个检索到的文档进行评分以识别恶意内容。然而,这种设计在实践中并不鲁棒,因为它假设威胁是可见的且仅存在于单个文档内容中。在这项工作中,我们强调现有防御被一种新形式的攻击——**分裂知识攻击**——所穿透,其中恶意负载分布在多个文档中,这些文档单独检查时看似良性,但在被一起检索并组合时变得有害。

**分裂知识攻击示例**。考虑一个回答查询的RAG系统:“*西雅图有哪些主要制造商?*”理想情况下,系统会检索到一个逻辑推理链:

> 文档1:“波音是一家领先的航空航天制造商...”  
> 文档2:“波音的主要设施位于西雅图...”

然而,通过插入事实正确但在上下文中具有欺骗性的文档,攻击者可以利用这种组合逻辑。例如:

> 文档A:“波音的主要设施位于西雅图...”  
> 文档B:“西雅图是国际毒品贩运的主要枢纽...”

请参阅图注图1:分裂知识攻击:良性文档合并成有害关联。  
上述每个文档都会通过标准内容过滤器,因为它们单独看都是正确的。然而,它们的组合检索会产生一个人工相关性,可能导致LLM产生波音与非法活动之间的幻觉联系。分裂知识攻击不需要模型权重操纵或敌对提示,不同于传统的越狱或对抗性示例。相反,它利用RAG的组合结构将检索语料库转变为攻击向量。

**为什么现有防御会失败?** 当前的RAG安全护栏独立地对每个检索到的文档进行评分。一个标量过滤器\(f(d_i)\)对每个文档\(d_i\)单独评分,无法检测到仅在文档组合时才出现的信号。由于对抗信号存在于检索文档之间的语义间隙中,单文档防御机制在结构上无法捕获分裂知识攻击。为了评估现有防御面对分裂知识攻击的表现,我们在基于HotpotQA构建的10,000个分裂知识攻击上评估了三种最先进的内容过滤器(LlamaGuard-2-8B、LlamaGuard-3-8B和LLM-as-a-Judge)Yang等人 (2018)(https://arxiv.org/html/2607.20437#bib.bib4)。所有三种防御均表现接近随机猜测(例如,AUROC在0.50到0.58之间),完整结果见第4.2节(https://arxiv.org/html/2607.20437#S4.SS2)。

为解决现有防御的失败,本文提出了一种基于拓扑检测的过滤方法:**TopoGuard**。概括而言,我们将检索到的上下文表示为一个语义相似图\(G\),其中节点是检索到的段落,边是余弦相似度。合法的推理链会形成具有桥接实体的密集连接子图。然而,分裂知识攻击将语义不相关的领域(例如,波音∪毒品)组合在一起,产生连接松散的簇,具有较低的图传导性。差异导致图拓扑中的谱分割,基于此我们可以在有理论保证的情况下检测分裂知识攻击。

我们的贡献如下:

- •据我们所知,这是首篇正式定义RAG系统中分裂知识攻击的工作,并为谱检测性能提供了理论界限(定理3.2(https://arxiv.org/html/2607.20437#S3.Thmtheorem2)):谱隙\(\lambda_2\)将攻击与合法查询分离,失败概率有界于\(\exp(-\Omega(n\Delta^2/\sigma^2))\)。
- •我们设计了四种基于谱隙(\(\lambda_2\))、Fiedler传导性、模块度以及实体增强混合(TopoGuard-\(\lambda_2\)+Entity)的分裂知识攻击检测器,它们对检索文档进行评分,能够比现有基线实现更高的准确率。
- •我们在两个多跳QA基准上评估了所提出的TopoGuard的鲁棒性,针对自适应对手和良性跨域查询。与基于LLM的检测相比,TopoGuard在两种设置下均保持较低的假阳性率,并以亚毫秒延迟运行。

## 2 问题形式化

我们对分裂知识攻击进行形式化,并为实际的攻击和防御提供验证。

**语义相似图**。给定检索文档集\(D=\{d_1,...,d_n\}\),其嵌入\(\{x_1,...,x_n\}\subset \mathbb{R}^d\),其中\(d_i\)是检索到的上下文(例如,一个段落)。语义相似图\(G=(V,E,w)\)被定义为**对称化k-NN图**,其中\(V\)是每个检索上下文的节点集,\((i,j)\in E\)如果\(j\)是\(i\)的k个最近邻居之一**或**\(i\)是\(j\)的k个最近邻居之一,权重\(w_{ij}=\max(0,\langle x_i,x_j\rangle)\)(即\(x_i,x_j\)之间的余弦相似度裁剪为非负值,以满足归一化拉普拉斯矩阵和Cheeger不等式的要求)。

检索文档集\(D\)分为两种情况:

(1) **合法多跳查询**,如果 (i) 文档形成推理链\(d_i \leadsto d_{i+1}\),(ii) 答案需要综合\(D\)中的信息,且 (iii) 语义相似图\(G\)具有高传导性\(\phi(G) \geq \epsilon\)。

(2) **分裂知识攻击**,如果 (i) \(D = D_1 \cup D_2 \cup ... \cup D_k\),且每个不相交的子集\(D_i \in D\)是良性的,(ii) 它们的并集看起来回答了查询,且 (iii) 语义相似图\(G\)具有低传导性\(\phi(G) \leq \delta\)。

最小情况(\(k=2\),子集\(D_1\)和\(D_2\))是对抗性最自然的,因为它需要攻击者构建最少数量的不连通分量。\(k>2\)会进一步分割图,增强谱信号。

**威胁模型**。我们考虑三方:**操作者**\(O\)部署RAG流水线,使用编码器\(\mathbb{E}\)、检索器\(\mathbb{R}\)和单文档过滤器;**攻击者**\(A\)污染检索语料库。我们假设攻击者\(A\)知道公开的RAG架构和编码器家族。因此,他们可以通过操作者公开的任何入口点向语料库注入单独良性的文档Zhong等人 (2023)(https://arxiv.org/html/2607.20437#bib.bib14);Zou等人 (2025)(https://arxiv.org/html/2607.20437#bib.bib1)。攻击者不能在注入后修改文档、更改模型权重、篡改\(\mathbb{E}\)、\(\mathbb{R}\)或运行时查询。攻击者的**目标**是使LLM在回应良性查询时输出目标虚假关联。

在查询时,操作者\(O\)观察到检索到的上下文\(D=\{d_1,...,d_n\}\)及其嵌入,并可以启动现有防御机制。此外,\(O\)有一小部分良性开发查询用于阈值校准,但没有标记的攻击(附录J(https://arxiv.org/html/2607.20437#A10))。

**威胁验证**。我们通过实验表明,即使提供了完整的拼接检索上下文,现有的防御过滤器对分裂知识攻击仍然无效。例如,我们在Llama-3-8B-Instruct上评估了50个对抗样本,以确认分裂知识攻击在实践中操纵LLM输出。合法上下文实现了96%的准确率,而攻击成功率为34%(17/50,\(p<0.001\))。完整细节见附录A(https://arxiv.org/html/2607.20437#A1)。

## 3 理论分析

我们提供了一个理论框架,描述拓扑检测何时成功。

### 3.1 嵌入噪声下的稳定性

###### 定理3.1(谱稳定性)

设\(G\)是由观测嵌入\(\{x_i\}\)构建的k-NN相似图,\(G^*\)是由噪声嵌入\(\{x_i^*\}\)构建的参考图,对所有\(i\)有\(\|x_i - x_i^*\|_2 \leq \sigma\)。设\(L\)和\(L^*\)分别表示\(G\)和\(G^*\)的归一化拉普拉斯矩阵,第二小特征值(谱隙)分别为\(\lambda_2(G)\)和\(\lambda_2(G^*)\)。则以下等式成立:

\[
|\lambda_2(G) - \lambda_2(G^*)| = O\left(\frac{k\sigma}{\delta_{\min}^2}\right),
\]

其中\(\delta_{\min}\)是\(G^*\)的最小加权节点度。

**证明概要**。我们限定了归一化拉普拉斯矩阵的算子范数扰动\(\|L - L^*\|_2\),并应用Weyl不等式Horn和Johnson (2012)(https://arxiv.org/html/2607.20437#bib.bib22)。余弦相似度扰动从边权重传播到加权度,再到对角逆平方根\(D^{-1/2}\)(其中\(D\)是对角度矩阵),产生的拉普拉斯扰动尺度为\(O(k\sigma / \delta_{\min}^2)\)。我们请读者参考附录D(https://arxiv.org/html/2607.20437#A4)中的完整证明。定理3.1(https://arxiv.org/html/2607.20437#S3.Thmtheorem1)保证了\(\lambda_2\)上的谱隙在编码器噪声或更新下是稳定的,因为嵌入空间中的小扰动会导致\(\lambda_2\)的小扰动。这是将\(\lambda_2\)用作真实编码器缺陷下鲁棒检测信号的基础。

### 3.2 检测保证与样本复杂度

###### 定理3.2(检测证书)

设\(\phi(G)\)表示观测图\(G\)的传导性(图连通性度量,范围从0(完全断开)到1(完全连通))。假设参考攻击图的传导性\(\phi(G^*) \leq \delta\),合法图的传导性\(\phi(G^*) \geq \epsilon\),且分离条件\(\epsilon \geq 2\sqrt{\delta}\)。假设子高斯嵌入噪声参数为\(\sigma\),以及定理3.1(https://arxiv.org/html/2607.20437#S3.Thmtheorem1)证明中的k-NN边缘条件。设\(n\)表示文档集\(D\)中检索到的段落数量(相似图\(G\)的节点大小)。设\(\tau_\lambda = \delta + \epsilon^2/4\)表示\(\lambda_2\)空间中的阈值,对应的分数空间阈值\(\tau = 1 - \min(\tau_\lambda, 1)\),间隙\(\Delta = (\epsilon^2 - 4\delta)/4\)。则攻击检测得分\(s(D) := 1 - \min(\lambda_2(G), 1)\)满足:

\[
\Pr_{D \sim \text{Attack}}[s(D) > \tau] \geq 1 - \exp\left(-\Omega\left(\tfrac{n\Delta^2}{\sigma^2}\right)\right),
\]
且
\[
\Pr_{D \sim \text{Legit}}[s(D) > \tau] \leq \exp\left(-\Omega\left(\tfrac{n\Delta^2}{\sigma^2}\right)\right).
\]

**证明概要**。条件\(\epsilon \geq 2\sqrt{\delta}\)确保了攻击上限\(2\delta\)与合法下限\(\epsilon^2/2\)之间的严格分离。我们将\(\tau_\lambda\)设置在此间隙的中间点,每侧间隙为\(\Delta = (\epsilon^2 - 4\delta)/4\)。定理3.1(https://arxiv.org/html/2607.20437#S3.Thmtheorem1)限定了噪声\(\lambda_2(G)\)与参考\(\lambda_2(G^*)\)之间的偏差。拉普拉斯矩阵算子范数扰动的标准集中论证随后给出了攻击和合法状态之间的高概率分离。我们将其视为启发式界限。我们请读者参考附录D(https://arxiv.org/html/2607.20437#A4)中的完整证明。

**从传导性到谱隙**。传导性\(\phi(G)\)是一个NP难问题,因此我们使用谱隙\(\lambda_2\)和Cheeger不等式Cheeger (1970)(https://arxiv.org/html/2607.20437#bib.bib24)(\(\lambda_2(G^*) \leq 2\delta\) 且 \(\lambda_2(G^*) \geq \epsilon^2/2\))将传导性转换为谱隙进行计算,从而得到从\(\phi(G) < \delta\)到\(s(D) > \tau\)作为阈值的转换。

第一个界限是当检索文档集\(D\)为攻击时,在阈值\(\tau\)下的真阳性率(TPR)。

相似文章