通过向外部LLM隐藏敏感信息的隐私保护RAG
摘要
本文介绍了SEAG,一种用于RAG的隐私保护框架,通过在将查询和文档转发给外部LLM之前,将敏感实体替换为别名来隐藏敏感实体,实现了超过80%的用户准确率和强大的实体隐藏性能。
arXiv:2608.12675v1 公告类型:新
摘要:检索增强生成(RAG)被广泛用于提高大语言模型(LLM)在回答用户查询时的性能。现有的RAG隐私研究主要关注防止未经授权的用户访问敏感数据。然而,RAG隐私研究中另一个常被忽视的重要问题是,外部生成器可以访问查询和检索到的文档,这些内容可能包含机密信息,有可能被滥用或用于非预期目的。在本文中,我们介绍了敏感实体别名生成器(SEAG),这是一种隐私保护框架,使用户能够在不泄露敏感信息的情况下使用强大的第三方生成器。SEAG引入了一个轻量级模型,用于定位敏感实体、生成相应别名并构建实体替换表。该表用于在将用户查询和检索到的文档转发给外部生成器之前,替换其中的敏感词。为此,我们构建了两个数据集:一个用于微调SEAG模型以生成实体替换表,另一个用于评估整个SEAG框架。实验结果表明SEAG框架是成功的。在用户指标(衡量模型在向外部生成器隐藏敏感信息的同时向用户提供正确回答的能力)方面,所有SEAG模型均达到了80%以上的准确率。进一步分析还评估了SEAG模型Qwen-3、LLaMA-3.2和Phi-4在给定文档中隐藏所有敏感实体的能力。结果显示其性能良好,总准确率分别为77.83%、76.73%和74.91%。
查看缓存全文
缓存时间: 2026/08/14 09:27
# 隐私保护RAG:向外部LLM隐藏敏感信息 来源:https://arxiv.org/html/2608.12675 ## 隐私保护RAG:向外部LLM隐藏敏感信息期刊:基于知识的系统 Saad AlmohaimeedMousa JariFahad AlotaibiKhalid A\. Alobaid所属机构:1\. 沙特国王大学应用计算机科学学院,利雅得,沙特阿拉伯所属机构:2\. 公共管理研究所数字化转型系,利雅得,沙特阿拉伯 ###### 摘要 检索增强生成(RAG)被广泛用于提升大型语言模型(LLM)在回答用户查询时的性能。现有的RAG隐私研究主要集中于防止未授权用户访问敏感数据。然而,RAG隐私研究中另一个常被忽视的重要问题是,外部生成器可以访问查询和检索到的文档,其中可能包含机密信息,这些信息有可能被滥用或用于非预期目的。在本文中,我们提出了敏感实体别名生成器(SEAG),这是一个隐私保护框架,使用户能够利用强大的第三方生成器,而无需泄露敏感信息。SEAG引入了一个轻量级模型,用于定位敏感实体、生成相应的别名,并构建实体替换表。该表用于在用户查询和检索文档被转发到外部生成器之前,替换其中的敏感词。为此,我们构建了两个数据集:一个用于微调SEAG模型以生成实体替换表,另一个用于评估整个SEAG框架。实验结果表明SEAG框架取得了成功。就用户指标(衡量模型在向外部生成器隐藏敏感信息的同时向用户提供正确响应的能力)而言,所有SEAG模型均达到了80%以上的准确率。进一步的分析评估了SEAG模型Qwen-3、LLaMA-3.2和Phi-4在给定文档中隐藏所有敏感实体的能力。结果显示性能良好,总准确率分别为77.83%、76.73%和74.91%。 ###### 关键词: 检索增强生成(RAG);隐私保护人工智能;大型语言模型(LLM);敏感实体替换;参数高效微调(PEFT) ## 1 引言 检索增强生成(RAG)已被证明能够提升大型语言模型(LLM)的性能。具体而言,RAG通过将LLM的内部知识与来自外部数据源的外部知识相结合,使LLM能够更有效地响应用户查询。RAG系统的两个主要组件是检索器(负责检索相关信息)和生成器(利用检索到的信息生成准确响应)。这使得LLM成为公司搜索、客户支持和问答系统中非常有效的工具。 尽管如此,RAG仍然面临许多隐私问题,这些问题可以从两个角度来看。首先,用户威胁,因为用户可能访问到来自外部数据源中其未被授权的敏感信息。这个问题已在许多研究论文[32 (https://arxiv.org/html/2608.12675#bib.bib1)][34 (https://arxiv.org/html/2608.12675#bib.bib2)][33 (https://arxiv.org/html/2608.12675#bib.bib3)]中被广泛讨论。具体来说,用户可能有意或无意地提交问题,导致RAG系统检索并泄露外部数据源中的敏感信息。因此,RAG生成的响应中包含用户无权访问的机密数据,例如财务细节[20 (https://arxiv.org/html/2608.12675#bib.bib4)]、患者医疗记录[28 (https://arxiv.org/html/2608.12675#bib.bib5)]或合同信息[12 (https://arxiv.org/html/2608.12675#bib.bib6)]。 第二个被以往研究忽视的隐私问题是LLM生成器的可信度。在某些应用中,用户可能完全有权访问外部文档中的所有数据,例如当医生查询自己的患者记录时。然而,外部第三方生成器(如GPT-5[22 (https://arxiv.org/html/2608.12675#bib.bib30)]或Claude-4 sonnet[4 (https://arxiv.org/html/2608.12675#bib.bib29)])仍然可能访问和滥用这些信息。一些文章已经报道了这一风险[15 (https://arxiv.org/html/2608.12675#bib.bib7)]、[9 (https://arxiv.org/html/2608.12675#bib.bib8)]、[24 (https://arxiv.org/html/2608.12675#bib.bib9)]。这种威胁可以通过在本地安装生成器来缓解,这可以确保敏感数据保持在组织内部,不会暴露给第三方提供商。 然而,在本地搭建高性能LLM可能非常昂贵。例如,一块NVIDIA H100[21 (https://arxiv.org/html/2608.12675#bib.bib10)] GPU的起始价格约为25,000美元。部署一个超过1000亿参数的LLM通常需要多块H100 GPU。此外,GPU成本只是整体部署成本的一部分。还有其他考虑因素,如推理延迟、并发用户数、网络设备和持续维护。这使得许多组织无法在本地托管高性能LLM。或者,可以部署参数小于300亿的小型LLM。但是,生成器的效率将显著降低。 在本文中,我们提出了敏感实体别名生成器(SEAG)框架,使组织能够利用强大的外部第三方大型语言模型(LLM),如GPT-5[22 (https://arxiv.org/html/2608.12675#bib.bib30)]和Claude-4 sonnet[4 (https://arxiv.org/html/2608.12675#bib.bib29)],同时仅部署约30-40亿参数的轻量级本地模型。如图1 (https://arxiv.org/html/2608.12675#S3.F1)所示,传统的检索增强生成(RAG)流程如下:当用户提交查询时,检索器识别并返回来自外部数据源的最相关文档。然后,查询和检索到的文档被直接发送给生成器,生成器产生最终响应。 相比之下,我们的SEAG框架在检索器和生成器之间引入了一个额外的组件。在检索之后,用户查询和相关文档都通过SEAG模型,该模型创建一个包含敏感实体别名的实体替换表。利用此表,查询和检索文档中的所有敏感实体都被适当地替换为对应的别名。 然后,匿名化的查询和文档被转发给外部第三方生成器。由于SEAG模型经过微调以保持语义并确保文档间的一致性,生成器可以在不知道敏感实体已被替换的情况下处理信息。 一旦生成器产生响应,输出将再次通过实体替换表。生成响应中出现的任何别名都将被映射回其原始实体,从而产生一个既保留外部LLM效用又保护敏感信息隐私的最终答案。 许多方法可用于隐藏文档中的敏感词。尽管如此,在我们的工作中,我们微调了一个模型来定位敏感实体,并为每个实体生成保持语义一致的新别名。为了实现这一目标,我们生成了两个数据集。一个用于微调LLM,另一个用于评估整个框架。第一个数据集包含来自8个领域的640个样本,第二个数据集包含来自6个领域的600个样本。评估领域与微调期间使用的领域不同,除了两个(法律和金融)。通过这种设置,我们可以比较微调后的模型在其训练过的领域与微调期间未遇到的领域上的表现。 我们使用一种称为QLoRA[7 (https://arxiv.org/html/2608.12675#bib.bib33)]的参数高效微调(PEFT)技术对三个LLM(Qwen-3[29 (https://arxiv.org/html/2608.12675#bib.bib26)]、LLaMA-3.2[19 (https://arxiv.org/html/2608.12675#bib.bib27)]和Phi-4[1 (https://arxiv.org/html/2608.12675#bib.bib28)])进行了微调,所有这些模型的规模均为3B,但Qwen-3[29 (https://arxiv.org/html/2608.12675#bib.bib26)]为4B。然后,该框架在两种流行的模型GPT-5[22 (https://arxiv.org/html/2608.12675#bib.bib30)]和Claude-4 sonnet[4 (https://arxiv.org/html/2608.12675#bib.bib29)]上进行了评估。我们的SEAG框架通过两个主要指标来衡量。第一个指标是隐私指标,用于衡量模型是否通过将敏感信息替换为有意义的词来正确隐藏它们。结果表明,作为微调模型,LLaMA-3.2表现最佳,得分为89.67%。第二个指标称为用户指标,用于衡量整个SEAG框架是否成功实施。这意味着敏感信息已被隐藏,并且向用户显示了正确的结果。基于该指标,最佳结果由LLaMA-3.2作为SEAG模型和Claude-4-sonnet作为生成器的组合实现,得分为83.67%。 此外,我们进行了一项研究,以确定每个微调后的SEAG模型在隐藏敏感信息方面的性能,结果表明Qwen-3[29 (https://arxiv.org/html/2608.12675#bib.bib26)]和LLaMA-3.2[19 (https://arxiv.org/html/2608.12675#bib.bib27)]表现相当,分别为77.83%和76.73%。最后,在局限性部分展示了两大主要限制,包括文档长度和文档中的敏感实体数量。 我们的主要贡献是: - 1.据我们所知,我们首次引入了一个框架,用于保护私有文档不与RAG系统中的外部第三方生成器共享。 - 2.构建了两个数据集:第一个用于微调SEAG模型,以定位给定文档中的敏感实体并生成语义一致的别名。第二个用于在三个不同指标下评估SEAG框架。 - 3.在第一个数据集上微调了三个模型Qwen-3、LLaMA-3.2和Phi-4,并比较它们在隐藏敏感信息方面的表现。 - 4.使用两个第三方生成器GPT-5和Claude-4 sonnet评估SEAG框架。 ## 2 相关工作 在本节中,我们将从三个角度介绍与我们工作相关的以往研究。首先,RAG应用及其隐私问题。其次,以往识别文本中敏感实体的解决方案以及我们提出的解决方案。第三,LLM的参数高效微调。 ### 2.1 RAG应用及其隐私问题 近年来,RAG已被广泛应用于许多组织和私人实体,因为它可以应用于任何存储有数据的应用,如金融[20 (https://arxiv.org/html/2608.12675#bib.bib4)]、医疗[28 (https://arxiv.org/html/2608.12675#bib.bib5)]和法律应用[12 (https://arxiv.org/html/2608.12675#bib.bib6)]。 RAG框架存在许多隐私问题;最常见的问题是敏感私人数据的泄露。在[32 (https://arxiv.org/html/2608.12675#bib.bib1)]、[16 (https://arxiv.org/html/2608.12675#bib.bib11)]和[25 (https://arxiv.org/html/2608.12675#bib.bib12)]中,他们提出了不同的攻击方法来从数据库中提取敏感信息。在[32 (https://arxiv.org/html/2608.12675#bib.bib1)]中,他们精心设计了一个结构化、精心构造的提示来攻击患者的医疗记录。在HealthCareMagic[17 (https://arxiv.org/html/2608.12675#bib.bib13)]数据集中,使用250个提示,他们能够提取89个医疗对话片段。在[16 (https://arxiv.org/html/2608.12675#bib.bib11)]中,他们使用基于代理的攻击,迭代生成对抗性提示以从私有RAG知识库中提取数据。在[25 (https://arxiv.org/html/2608.12675#bib.bib12)]中,他们设计了一种提示注入提取攻击,指示LLM重现检索到的文档,从而实现大规模数据泄露。此外,还有其他不使用结构化提示的攻击,例如成员推断攻击[27 (https://arxiv.org/html/2608.12675#bib.bib14)][18 (https://arxiv.org/html/2608.12675#bib.bib15)][25 (https://arxiv.org/html/2608.12675#bib.bib12)],这些攻击不直接提取文档。相反,它们推断特定记录或文档是否存在于RAG知识库中。另一种攻击是数据投毒攻击[35 (https://arxiv.org/html/2608.12675#bib.bib16)][5 (https://arxiv.org/html/2608.12675#bib.bib17)],这些是针对RAG的知识破坏攻击,攻击者可以向RAG系统的知识数据库中注入少量恶意文本,以诱导LLM针对攻击者选择的目标问题生成攻击者选择的目标答案。 ### 2.2 敏感实体识别 另一方面,为了对抗这些攻击并保护RAG系统中检索文档中的敏感信息,已经做出了许多努力。一种流行的技术是使用合成数据[32 (https://arxiv.org/html/2608.12675#bib.bib1)][31 (https://arxiv.org/html/2608.12675#bib.bib18)][30 (https://arxiv.org/html/2608.12675#bib.bib19)]。在[31 (https://arxiv.org/html/2608.12675#bib.bib18)]中,他们生成了原始数据的隐私保护版本,并且只将合成版本提供给LLM。他们使用一种称为SAGE的两阶段生成和精炼范式,在第一阶段,他们利用基于属性的提取和生成方法来生成合成数据。然后,他们提出了一种基于代理的迭代精炼方法来增强对私人信息的保护。他们的结果表明,使用他们生成的合成数据作为RAG数据,在有效缓解相关隐私问题的同时,实现了与使用原始数据相当的性能。另一种解决方案是应用差分隐私技术[26 (https://arxiv.org/html/2608.12675#bib.bib20)][10 (https://arxiv.org/html/2608.12675#bib.bib21)],通过仅向LLM生成器提供来自检索文档的重要概念的隐私保护列表来保护文档中的敏感信息。以往工作中未充分解决的一个主要问题是RAG系统中敏感文档的处理。例如,文档可能包含患者的医疗记录,而授权用户(如医生)需要查询这些信息。然而,我们可能不希望外部生成器LLM直接访问敏感内容。在我们的工作中,我们设计了SEAG框架来处理这些问题,同时返回高质量的答案。 ### 2.3 LLM的参数高效微调 在RAG在全球许多应用中被广泛采用之后,许多研究人员开始探索使用参数高效微调(PEFT)技术来提高RAG效率,这些技术在最小化计算成本的同时改善了领域适应性。传统的微调方法需要更新所有模型参数,这对于大型语言模型(LLM)来说变得过于昂贵。PEFT方法,如LoRA[13 (https://arxiv.org/html/2608.1267
相似文章
RAG-CT:通过扫描提示分布缓解检索增强生成系统的隐私风险
RAG-CT是一种新颖的防御方法,通过分析熵和边缘分布来识别恶意查询,从而缓解检索增强生成系统的隐私风险,显著减少PII泄露。
SchemaRAG: 面向LLM驱动的结构化信息提取的动态大规模模式简化
SchemaRAG是一个检索增强生成框架,能够动态缩减面向LLM驱动的结构化信息提取的输出模式空间,在医疗健康和电子商务数据集上实现了性能提升和效率优化。
RAG-Safety-Bench:可靠评估检索增强LLM安全性
本文介绍了RAG-Safety-Bench,这是一个评估检索增强大型语言模型安全性的基准,表明即使检索到的文档是良性的,RAG也可能导致安全性下降。
PRA-RAG:检索增强生成中针对检索损坏的可证明鲁棒聚合
PRA-RAG是一种用于检索增强生成的可证明鲁棒的聚合算法,旨在抵御对检索文本的投毒攻击。它利用嵌入空间中的几何结构来识别鲁棒子集,并提供攻击影响的理论界限,将攻击成功率降低至1%,同时保持准确率。
通过基于关键词的事实替换缓解RAG系统中的数据库泄漏
本文提出了KFS-RAG,一种通过用基于关键词的事实替换检索上下文来缓解RAG系统中数据库泄漏的方法,以防御提示注入攻击,同时保持响应准确性。