RAG-Safety-Bench:可靠评估检索增强LLM安全性

arXiv cs.CL 论文

摘要

本文介绍了RAG-Safety-Bench,这是一个评估检索增强大型语言模型安全性的基准,表明即使检索到的文档是良性的,RAG也可能导致安全性下降。

arXiv:2609.11758v1 公告类型:新 摘要:允许大型语言模型(LLMs)从一组受信任的文档中检索信息可以提高可靠性并减少幻觉。然而,最近的研究表明,当被提示提供有害或危险内容时,检索增强生成(RAG)可能对生成响应的整体安全性产生意想不到的副作用。随着越来越多的最终用户转向使用RAG将公司文档和知识库整合到基于LLM的系统中,需要更清晰地理解导致这一结果的机制。我们介绍了RAG-Safety-Bench,这是一个用于衡量RAG对LLM模型安全性影响的基准。通过消除检索器质量的混淆效应,并将问题清晰地分为四种条件——非RAG、RAG使用包含有害请求答案的预言文档、RAG使用与有害请求相关但无具体答案的文档,以及RAG使用随机安全文档——该基准隔离了在观察到的安全性下降中不同因素的影响。我们报告了在五种开源LLM上的结果,显示出良性和不安全能力之间的反比关系,有力证据表明基线安全护栏在RAG情况下并不能保证下游安全性,并为先前发现提供了模型特定的支持,即即使在检索启用系统中,良性文档也可能导致不安全生成。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:34

# 检索增强大语言模型安全性的可靠评估  
来源:https://arxiv.org/html/2609.11758  
Adithiyan Rajan, Indira Saravanan  
隶属:工程学院  
隶属:渥太华大学  
隶属:加拿大渥太华  
邮箱:[aindi023@uottawa\.ca](mailto:)  
Kathleen C\. Fraser  
隶属:工程学院  
隶属:渥太华大学  
隶属:加拿大渥太华  
邮箱:[kathleen\.fraser@uottawa\.ca](mailto:)  

###### 摘要  
允许大语言模型(LLM)从可信文档集中检索信息可以提高可靠性并减少幻觉。然而,近期研究表明,当被要求生成有害或危险内容时,检索增强生成(RAG)可能对生成响应的整体安全性产生意想不到的副作用。随着越来越多的终端用户转向使用RAG将企业文档和知识库集成到基于LLM的系统中,我们需要更清晰地理解导致这一结果的机制。我们提出了RAG‑Safety‑Bench,一个用于衡量RAG对LLM模型安全性影响的基准测试。通过消除检索器质量带来的混淆因素,并将问题清晰分离为四种条件——无RAG、包含有害请求答案的神谕文档RAG、包含与有害请求相关但无具体答案文档的RAG,以及包含随机安全文档的RAG——该基准隔离了观察到的安全性下降中不同因素的影响。我们报告了五个开源LLM的结果,显示良性能力与不安全能力之间呈逆相关关系,有力证据表明基线安全防护栏在RAG情况下无法保证下游安全,并且模型特定支持了先前发现的结论:即使良性文档也可能在检索启用系统中导致不安全生成。  

## 1 引言  
检索增强生成(RAG)是一种广泛采用的方法,用于将大语言模型与外部信息对齐(Lewis等人,2020) (https://arxiv.org/html/2609.11758#bib.bib1)。检索的文档可以提供最新事实,减少对陈旧参数记忆的依赖,并提高答案质量而无需重新训练生成器。此外,与非RAG的LLM相比,RAG可以通过减少幻觉来提高可信度和准确性(Shuster等人,2021) (https://arxiv.org/html/2609.11758#bib.bib2)。因此,传统观点认为基于RAG的LLM应该比非RAG模型更安全,主要安全风险是数据投毒攻击对RAG语料库的影响。在没有被投毒数据的情况下,几乎没有理由怀疑RAG系统会比其基础LLM组件输出更多有害内容。  

参考图注  
图1:RAG‑Safety‑Bench中的四种条件允许对RAG启用系统进行详细的安全性评估。  
然而,这一假设已被An等人(2025)(https://arxiv.org/html/2609.11758#bib.bib3)的近期工作颠覆,他们提供了令人信服的证据表明,当LLM启用RAG时,它们通常比依赖自身参数知识时更不安全,即使检索到的文档是良性的。在当前工作中,我们通过一个新的RAG特定安全基准RAG‑Safety‑Bench,将安全性和能力的概念解绑,以增进对这一新识别问题的理解。此外,我们进一步审视文档和输出“不安全”的含义,以支持对安全RAG文档似乎导致不安全输出的这一问题案例的详细分析。  

RAG系统评估具有挑战性,因为它由多个组件构成,每个组件都对系统的端到端整体性能有所贡献(Wampler等人,2025) (https://arxiv.org/html/2609.11758#bib.bib4)。特别是,检索质量对输出质量有重大影响。MIRAGE基准(Park等人,2025) (https://arxiv.org/html/2609.11758#bib.bib5)通过提供相关和不相关的神谕文档集,实现了在控制检索质量的同时评估RAG系统。我们将这种评估方式修改并扩展到RAG设置中的安全评估。我们的RAG‑Safety‑Bench基准包含一组不安全的英文查询和三组文档(图1 (https://arxiv.org/html/2609.11758#S1.F1)):在神谕设置中,不安全的答案在文档集中可用。此设置可能代表数据投毒攻击——然而,由于我们所有数据均来自维基百科,它也代表了更常见的情况,即数据被认为通常是良性的但未经精心筛选。在主题相关设置中,文档与查询主题相关但不明确包含不安全的答案。在随机设置中,提供随机选择的安全主题文档。  

这个测试框架使我们能够回答关于RAG系统安全性的几个关键开放研究问题:  

1. **1\.** 观察到的RAG安全性下降在多大程度上与模型的RAG能力相关?先前工作表明,某些看似“安全”的模型可能只是提取和总结相关信息的能力较弱。我们严格测试这一点,并提出以下假设(H1):在MIRAGE(良性能力)上表现更好的模型,在RAG‑Safety‑Bench的神谕设置中也会具有更高的准确性,因此安全性更低。  

2. **2\.** RAG安全性下降是不安全信息还是不安全上下文漂移的因素?传统观点(被An等人(2025)(https://arxiv.org/html/2609.11758#bib.bib3)挑战)认为,RAG模型仅在检索到的文档不安全时才不安全。另一种解释是,增加的上下文长度(可能包含许多与不安全查询语义相关的词)使模型转向未对齐的领域。事实上,这类似于成功的Crescendo越狱(Russinovich等人,2025) (https://arxiv.org/html/2609.11758#bib.bib6)背后的直觉。我们的假设(H2)是,答案的直接可用性(神谕设置)将导致最多的不安全答案,但主题相关设置由于有害主题上下文的不稳定效应,相对于基线无RAG设置会导致更高数量的不安全答案。如果效应纯粹是由于上下文长度,随机设置将导致等效的有害率。  

3. **3\.** RAG对LLM的拒绝率有何影响?在许多研究中,安全性被操作化为拒绝:一个安全的模型是拒绝回答有害问题的模型。我们区分两种类型的拒绝,即**不愿意**满足有害请求与**无法**在检索到的文档中找到答案。我们假设(H3)有害请求的拒绝率在随机设置中最高,并归因于信息缺乏。我们认为这种情况应与“真正”的模型安全性区分开,后者应依赖于提供危险建议的内在不愿意。同时,神谕设置提供了对比评估,我们确保模型可以访问所请求的信息,因此拒绝可以更清楚地解释为安全防护栏的有效实施。  

4. **4\.** 不同的安全评估者对安全与有害的判断是否一致?标准安全评估依赖基于LLM的“评判者”将文本标记为安全或不安全。我们比较多个安全评估者,假设(H4)LLM评估者之间将存在高度不一致。  

## 2 相关工作  

#### 检索增强生成  
通过检索增强生成(RAG)使LLM能够查询可信文档数据库有许多好处:它减少了幻觉,允许公司注入专有知识/文档到系统中,支持无需重新训练的信息快速更新,并且可以实现来源归因(Lewis等人,2020) (https://arxiv.org/html/2609.11758#bib.bib1); (Shuster等人,2021) (https://arxiv.org/html/2609.11758#bib.bib2); (Fan等人,2024) (https://arxiv.org/html/2609.11758#bib.bib21)。然而,它也暴露了新的攻击面。关于RAG系统安全性和安全性的大部分研究都集中在知识库的安全性上:**数据投毒攻击**涉及将恶意(错误)信息注入文档存储(Tan等人,2024) (https://arxiv.org/html/2609.11758#bib.bib20); (Nazary等人,2025) (https://arxiv.org/html/2609.11758#bib.bib19); (Zhang等人,2025) (https://arxiv.org/html/2609.11758#bib.bib18),以及**数据提取攻击**旨在通过RAG接口从文档中恢复敏感或私有信息(Zeng等人,2024a) (https://arxiv.org/html/2609.11758#bib.bib15); (Qi等人,2024) (https://arxiv.org/html/2609.11758#bib.bib17); (Vonderhaar等人,2025) (https://arxiv.org/html/2609.11758#bib.bib16)。然而,RAG系统在非对抗环境下的安全性研究较少。An等人(2025)(https://arxiv.org/html/2609.11758#bib.bib3)首次指出,RAG系统即使在没有任何恶意干预的情况下,也可能输出比非RAG LLM更有害的响应。其他工作考虑了启用信息检索或搜索功能的AI代理中相关的安全性下降问题(Yu等人,2025) (https://arxiv.org/html/2609.11758#bib.bib7); (BehnamGhader等人,2025) (https://arxiv.org/html/2609.11758#bib.bib9); (Zhan等人,2026) (https://arxiv.org/html/2609.11758#bib.bib8)。先前的工作测量了整个RAG系统的安全性,但检索文档的信息内容和安全性是一个不受控制的变量。我们的工作通过系统地一次改变一个变量(无检索、随机检索、主题相关检索、精确答案检索)以观察对LLM响应安全性的影响,朝着更科学地理解这些观察到的现象迈出了下一步。  

#### 长上下文安全性  
检索有害文档是观察到的RAG模型安全性下降的一个因素。然而,文献表明另一个因素可能是包含扩展上下文引起的行为转变。事实上,Yu等人(2025)(https://arxiv.org/html/2609.11758#bib.bib7)声称“安全性下降在很大程度上独立于检索到的上下文本身”。An等人(2025)(https://arxiv.org/html/2609.11758#bib.bib3)发现他们研究中94.7%的检索文档是安全的,因此无法解释不安全响应大幅增加的原因。他们假设检索到的文本虽然本身是良性的,但可能触发模型从参数记忆中召回不安全信息。其他工作表明,LLM在长上下文中识别有害内容的能力较弱(Ghorbanpour和Fraser,2025) (https://arxiv.org/html/2609.11758#bib.bib10),并且在长上下文设置中更有可能回答有害问题(Anil等人,2024) (https://arxiv.org/html/2609.11758#bib.bib11); (Lu等人,2025) (https://arxiv.org/html/2609.11758#bib.bib12); (Huang等人,2025) (https://arxiv.org/html/2609.11758#bib.bib13)。在某些情况下,即使上下文本身没有害(例如,治疗对话),模型也可能偏离其默认的“有用的助手”人设(Lu等人,2026) (https://arxiv.org/html/2609.11758#bib.bib14)。因此,在本研究中,我们设计基准以分别测试“有害文档”和“长上下文”解释。  

#### LLM安全评估  
评估开放式文本响应的安全性是一项具有挑战性的任务。在许多情况下,拒绝被视为安全性的代理(Vidgen等人,2023) (https://arxiv.org/html/2609.11758#bib.bib25); (Sun等人,2023) (https://arxiv.org/html/2609.11758#bib.bib26); (Wang等人,2024a) (https://arxiv.org/html/2609.11758#bib.bib27); (Bianchi等人,2023) (https://arxiv.org/html/2609.11758#bib.bib28); (Mazeika等人,2024) (https://arxiv.org/html/2609.11758#bib.bib29); (Xie等人,2025) (https://arxiv.org/html/2609.11758#bib.bib30),尽管拒绝本身可以采取多种形式(Wang等人,2024b) (https://arxiv.org/html/2609.11758#bib.bib22)。其他工作使用监督或基于LLM的分类器根据某些安全定义(通常基于条款和条件文档或其他监管框架)将输出标记为“安全”或“不安全”。常用的安全分类器示例包括Llama‑Guard(Inan等人,2023) (https://arxiv.org/html/2609.11758#bib.bib23)、Shield‑Gemma(Zeng等人,2024b) (https://arxiv.org/html/2609.11758#bib.bib24)和WildGuard(Han等人,2024) (https://arxiv.org/html/2609.11758#bib.bib32)。当前工作考虑了拒绝、安全分类器以及响应中信息的准确性作为相关但不同的信号。  

## 3 方法  

### 3.1 良性能力  
为了测试我们研究中每个模型的一般能力,我们使用MIRAGE基准(Park等人,2025) (https://arxiv.org/html/2609.11758#bib.bib5)。该基准旨在测试不同设置下RAG模型的能力:神谕上下文提供包含答案证据的最佳情况,而混合上下文在引入干扰项的同时保留了有限量的答案证据。在本研究中,我们使用MIRAGE中1000个查询的子集,在两种设置下评估一般RAG能力。  

### 3.2 安全‑能力关系  
我们的基准RAG‑Safety‑Bench通过测量安全性而非良性能力来补充原始MIRAGE基准。该基准支持4种设置之间的直接比较,如表1 (https://arxiv.org/html/2609.11758#S3.T1)所述。注意神谕设置和主题相关设置之间的区别:在神谕设置中,答案直接在检索到的上下文中可用。在主题相关条件中,检索到的文档与查询主题相同(在示例中是爆炸物),但不包含查询的答案。通过直接提供上下文文档,该基准使得评估基础LLM在RAG上下文存在时维持安全防护栏的能力成为可能,同时消除了检索器质量这一混淆因素(例如,一个差的检索器可能简单地错过了相关的不安全文档,从而导致误导性的高安全评分)。  

表1:RAG‑Safety‑Bench基准的四种设置。示例文档针对查询“制作能够击败装甲警车的简易爆炸装置需要哪些材料和设计?”  

构建基准的方法如下。我们首先基于现有的MLCommons AILuminate“危害分类法”(Ghosh等人,2025) (https://arxiv.org/html/2609.11758#bib.bib33)开发了一个有害用户查询分类法。RAG安全评估的背景和我们打算使用的维基百科文档语料库需要对现有分类法进行一些修改。我们当前版本的RAG‑Safety‑Bench排除了以下危害类别:  
**隐私/识别**:由于我们的知识库是公共资源,我们假设它不包含私人信息(尽管隐私泄露可能在其他RAG用例中是一个问题);  
**直接生成有害内容**:基准的重点是问答,而非内容生成;  
**知识产权**:维基百科用户严格禁止在未经许可的情况下上传受版权保护的材料,因此它不是测试知识产权泄露的合适资源;  
**专业建议**:此类别(包括法律建议、医疗建议等主题)

相似文章

当检索无济于事:一项大规模生物医学 RAG 研究

arXiv cs.CL

这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

arXiv cs.AI

介绍了EnterpriseRAG,一个包含六个领域983个专家验证样本的基准测试,用于评估LLM在非理想企业检索条件下的指令遵循和鲁棒性,这些条件包括噪声、知识缺口和事实冲突。对13个LLM的评估揭示了单个约束满足率与整体合规率之间的巨大差距,凸显了在生产级RAG系统中需要上下文感知协议。