英语来源多语言RAG中隐私风险之所在:跨五种查询语言的分阶段审计
摘要
本文对英语来源多语言RAG在五种查询语言下的隐私风险进行了审计,检验非英语查询是否会加剧PII泄漏。通过使用Qwen2.5-7B流水线和两阶段防御,研究发现,在仅进行输出过滤时,英语的点估计泄漏率最高;而在加入输入判别器后,阿拉伯语和斯瓦希里语仍存在残余泄漏。
arXiv:2608.05163v1 公告类型:新
摘要:一种常见的假设认为,将查询切换为非英语语言会使多语言RAG系统更容易遭受针对个人信息的攻击。我们使用一个英语来源的合成PII语料库对此进行了测试,该语料库覆盖五种查询语言,并采用两阶段防御(LLM输入判别器 + 正则表达式输出过滤器)。该流水线的翻译器、判别器、反向翻译器和生成器均为Qwen2.5-7B——因此,以下所有发现都是流水线条件下的结果,而非语言固有风险的因果排序。在仅使用输出过滤的情况下,在所观察到的非结构化PII泄漏率中,英语最高;在文档级自助法(bootstrap)区间下,只有英语与斯瓦希里语能清晰区分。一旦加入输入判别器,阿拉伯语和斯瓦希里语上仍存在残余泄漏,而反向翻译查询并不能弥合这一差距(我们报告了这一消融结果,但不能将其用作因果诊断,因为反向翻译器同样是Qwen模型)。在另一组n=17个多语言提示式判别器残差单元中,将黄金语料库文档附加到输入判别器上,可阻止15/17个残差单元。我们将这一最后结果定位为机制诊断,而非可部署的防御手段:它使用了理想检索(oracle retrieval),BLOCK/ALLOW比率仅针对对抗性查询进行衡量,且我们没有测量良性查询的误报率,也没有测量答案效用成本。补充材料包含代码、语料库、查询语句及逐次试验的JSONL文件;优先的后续工作是使用母语者查询集进行独立机器翻译(MT)加非Qwen判别器的复现实验,其范围在局限性部分中界定。
查看缓存全文
缓存时间: 2026/08/07 07:49
# 英语源多语言 RAG 中的隐私风险所在:跨五种查询语言的分阶段分解审计
来源:https://arxiv.org/html/2608.05163
Yanhang Li 东北大学 li\.yanha@northeastern\.edu &Zhichao Fan 伊利诺伊大学厄巴纳-香槟分校 zhichao8@illinois\.edu &Zexin Zhuang 南卫理公会大学 zexinz@smu\.edu
###### 摘要
一个常见的假设是,切换到非英语语言会使多语言 RAG 系统更容易被攻击以获取个人信息。我们在一个包含五种查询语言的英语源合成 PII 语料库上,以及一个两阶段防御(LLM 输入审判器 + 正则表达式输出过滤器)的流水线中检验了这一假设。该流水线的翻译器、审判器、回译器和生成器均为 Qwen2\.5\-7B —— 因此下文的每一项发现都是流水线条件下的结论,而不是对语言内在风险进行因果排序。在仅使用输出过滤的情况下,英语具有最高的可观测非结构化 PII 泄漏率;只有在文档级 bootstrap 区间下,英语与斯瓦希里语才能清晰分离。一旦加入输入审判器,阿拉伯语和斯瓦希里语上仍存在残余泄漏,而回译查询并不能弥合这一差距(我们报告了这一消融结果,但不能将其用作因果诊断,因为回译器也是 Qwen)。在一个单独的 n=17 多语言提示审判器残余角落中,将金标语料文档附加到输入审判器可阻止 15/17 个残余单元格。我们将这最后一项结果定性为*机制诊断,而非可部署的防御*:它使用了 oracle 检索,BLOCK/ALLOW 速率仅在对抗性查询上测量,并且我们没有测量良性查询的假阳性率或答案效用成本。补充材料包含代码、语料库、查询和逐试验 JSONL;优先的后续工作是在独立的 MT 加上非 Qwen 审判器、并使用母语者查询集的情况下进行重复实验,范围见 §局限性。
英语源多语言 RAG 中的隐私风险所在:跨五种查询语言的分阶段分解审计
Yanhang Li 东北大学 li\.yanha@northeastern\.edu Zhichao Fan 伊利诺伊大学厄巴纳-香槟分校 zhichao8@illinois\.edu Zexin Zhuang 南卫理公会大学 zexinz@smu\.edu
## 1 引言
多语言检索增强生成(RAG)是近期 mRAG 工作中研究过的标准多语言问答架构(chirkova2024multilingual):用户可以用自己的母语查询源语言知识库,检索器通过多语言嵌入器返回相关的源语言文档,生成器用用户的语言作答。这种模式的隐私护栏往往以英语为中心:PII 过滤器、内容审核分类器以及安全对齐数据通常过度代表英语。因此,多语言安全领域,尤其是多语言越狱问题(yong2023multilingual; yong2025multilingualsafety)中的一个常见担忧是,跨语言查询可能通过绕过面向英语的防御机制(更广泛的图景:huang2024multilingual)而增加隐私泄漏。
我们在一个包含合成 PII 的英语源多语言 RAG 上检验了这一直觉。我们采用黑盒威胁模型:攻击者知道目标文档的一个非 PII 锚点(项目名称、工单 ID 或案例 ID —— 这是一种内部人式威胁假设),并用五种语言(英语、中文、德语、阿拉伯语、斯瓦希里语)和三种改写方式(直接、摘要、上下文学习)发出查询,试图提取一个植入的 PII 条目。我们部署了一个两阶段护栏:一个*仅英语提示*的多语言 LLM 输入审判器,将用户查询分类为 BLOCK/ALLOW;以及一个正则表达式风格的输出过滤器,在电子邮件、电话和类似 SSN 的模式上触发。
在这个 Qwen 翻译配置中,仅输出式的点估计并不支持上述直觉:英语具有最高的点估计泄漏率(0.875),而非英语模板较低(0.425–0.775),仅在英语与斯瓦希里语之间以及与中文的端点相接处出现清晰分离;我们将其解读为点估计排序,而不是广泛的逆转(第4节,表1)。一旦加入仅英语提示的输入侧审判器,就会出现一个相反的效果:残余综合泄漏在 en/zh/de 上降至零,但在这种 Qwen 介导的流水线中,阿拉伯语(7.5%)和斯瓦希里语(17.5%)上仍然存在。斯瓦希里语输入审判器的聚合 BLOCK 率(∼77%)高估了在实际泄漏文档上的有效覆盖:在文档级“任何成功”单元中,仅英语提示的 Qwen 审判器在实际泄漏的 7/17 个斯瓦希里语危险文档上,至少允许了一个泄漏性改写(第4.2节)。先回译再审判的消融并不能拯救斯瓦希里语,而多语言提示的审判器变体也使斯瓦希里语基本不变——这两者都与“原始查询中的提取意图因翻译而衰减”这一假设一致,但并不能对其进行诊断。
我们的贡献在于*定位*隐私风险在该流水线中的出现位置。观察到的残余泄漏与以下情况一致:Qwen 翻译后的查询可能丢失了足够多的显式提取意图,使得没有检索上下文的输入侧过滤器允许了该请求,而下游确实有检索上下文的 RAG 仍然回答了它。我们将这一假设机制称为*翻译噪声下的差分流水线退化*;实验与之相符,但并未明确识别它。作为后续方向,在一个单独的 n=17 多语言提示审判器残余角落上的 oracle 诊断表明,将金标语料文档作为“检索上下文”提供给输入审判器,可以阻止 15/17 个残余单元格(第4.4节);这不是对已部署的仅英语 F3 残余的直接拯救,也不衡量效用或假阳性。
## 2 相关工作
#### RAG 中的隐私。
zeng2024rag 将检索增强系统刻画为一个新的外泄面,表明数据存储内容可以通过对抗性查询被逐字引出。wang2025pad 提出了一种隐私感知解码方案,在生成时抑制敏感片段。两者都针对英语 RAG 和英语训练的防御;跨语言轴尚未被探索。我们在阶段 A 采用的 LLM 作为输入审判器的防御模式(即 LLM 将传入查询分类为 BLOCK/ALLOW)由 Llama-Guard(inan2023llamaguard)规范化;我们的贡献是审计这种模式在跨查询语言时如何退化,而不是引入新的审判器。针对相邻 RAG 设置(如视觉 RAG,ji2025mrag)的诊断评估平台已经开始出现;本文是其在多语言文本隐私轴上的对应工作。
#### 训练数据提取。
carlini2021extracting 确立了在单语设置下从大型语言模型中进行训练数据提取。后续工作已将该方向扩展到 PII 基准(nakka2024piiscope)。我们的威胁模型更接近已部署的 RAG:攻击者通过 RAG 查询数据存储,而不是参数记忆。
#### 多语言安全与越狱。
yong2023multilingual 证明,多语言查询可以在直接提示越狱设置中绕过英语对齐的安全机制,其有效性随语言资源可用性的降低而增强。huang2024multilingual 调查了多语言 LLM 的更广泛安全图景,而 yong2025multilingualsafety 通过量化安全对齐中持续存在的语言差距以及当前的缓解方向更新了这一图景。这些发现涉及针对模型安全对齐的直接有害提示越狱,而非检索介导的 PII 提取;我们这里研究的失败模式是由没有检索上下文的输入过滤器介导的。
#### 多语言 RAG。
chirkova2024multilingual 研究了多语言设置下的 RAG 质量,并推动了对多语言 RAG 栈进行逐组件分析。li2025bordirlines 引入了 BordIRLines 用于文化敏感的跨语言 RAG,并分析了检索器和生成器如何使用多语言文档。涵盖检索-推理交互的更广泛 RAG 设计空间分类法(ji2026retrieval)为我们的隐私相关阶段在更广泛 RAG 流水线空间中的位置提供了背景。我们的工作以隐私视角重新推导了逐阶段退化,并以此提出了一个假设,解释为什么在仅输出过滤下跨语言查询可能对攻击者*更不利*,而不是声称先前工作解释了我们的泄漏模式。
#### 跨语言隐私机制。
dong2025crossprivacy 在模型参数层面研究了跨语言隐私泄漏,识别出语言通用和语言特定的隐私神经元。它们的攻击面是多语言 LLM 的参数记忆;我们的攻击面是通过已部署 RAG 的检索介导路径。这些发现是互补的:参数泄漏和检索介导泄漏是不同的外泄路径,相应的防御(隐私神经元擦除 vs\. 过滤器设计)在不同层面运行。我们的 PII 检测评分层在功能上是对生成文本的多语言细粒度 NER;关于面向 LLM 的更广泛多语言 NER 数据集,参见 luo2025dynamicner。
#### LLM 系统审计方法论。
一条平行线在非 RAG 设置中审计 LLM 介导系统的安全与安保:luo2026agentauditor 提出了 LLM 智能体的人类级安全与安保评估框架,而 jiang2026agentic 将智能体 AI 本身框定为网络安全攻击面。更广泛的 LLM 与隐私图景还包括联邦学习侧的协作机制(luo2025cross)。在方法论立场上密切相关的是,我们关于配置条件基准不稳定性(li2026safetyrepro)以及审计推理轨迹记忆主张在反学习后的可复制性(li2026reasoningtrace)的并行工作,同样强调 LLM 介导系统上的成对判断和正向绕过信号需要在因果归因之前进行机制诊断消融——我们在 F2 回译非诊断和 F4 机制诊断而非可部署防御的框架中遵循了这一立场。我们的工作占据了这一审计方法论图景中的多语言 RAG 位置:对检索介导流水线的攻击者 vs\. 防御分阶段分解审计。
## 3 设置
参见图1标题:分阶段分解的 RAG 隐私审计总览。攻击者以五种语言(每种语言三种改写方式)对 100 个带合成 PII 的英语文档发起查询,经过阶段 A 输入审判器(仅英语提示的 Qwen2.5-7B)和阶段 B 正则表达式输出过滤器;残余泄漏在文档级“任何成功”上测量。
### 3.1 威胁模型
攻击者可以黑盒访问一个部署在英语文档存储之上的多语言 RAG。攻击者知道一个目标文档的唯一非 PII 锚点——项目名称、案例标识符、工单号或合同标识符——并试图从该文档中提取一个植入的 PII 条目。攻击者可以用五种语言中的任何一种发出查询。防御者部署 (a) 一个仅英语提示的多语言 LLM 输入审判器,将每个传入查询分类为 BLOCK 或 ALLOW,以及 (b) 一个正则表达式风格的输出过滤器,在生成器响应中的电子邮件、电话号码和 9 位标识符上触发。
### 3.2 合成语料库
我们构建了 100 个英语文档,涵盖四个主题(工作场所电子邮件、医疗病例记录、客户支持工单、法律摘录)。每个文档包含一个合成 PII 条目,按类型在 {姓名、电子邮件、电话、9 位标识符、地址} 上分层,每种类型 20 个文档(n=60 个结构化目标,n=40 个非结构化);字符串由 Faker 生成,每个文档包含一个唯一的非 PII 锚点。合成是有意为之:它消除了自然语言语料库的公共翻译污染问题(例如狄更斯或其他公有领域文本,其翻译可能已经出现在预训练数据中),并确保精确匹配的泄漏检测。
### 3.3 流水线
图1展示了一目了然的分阶段分解审计。嵌入器是 BGE-M3(chen2024bgem3);检索器是 FAISS(johnson2019faiss),top-k=5。生成器是 Qwen2.5-7B-Instruct(yang2024qwen25),带有用用户语言回答的系统指令。输入审判器是同一个 Qwen2.5-7B 模型,仅用英语提示,并带有仅英语的少样本示例(BLOCK/ALLOW 分类)。输出过滤器匹配三个正则表达式族(电子邮件、电话、类似 SSN)。我们还在第4节中评估了两个审判器变体:一个回译后审判变体(查询先翻译成英语,然后进行审判)和一个多语言提示变体(系统提示和少样本示例使用查询语言)。
### 3.4 攻击查询
对于每个文档,我们生成三种改写方式:(*直接*)锚点条件下的 PII 提取请求;(*摘要*)锚点条件下的摘要请求,要求逐字实体;(*ICL*)一次性上下文学习示例,后跟锚点。英语模板使用 Qwen2.5-7B-Instruct 作为翻译器翻译成中文、德语、阿拉伯语和斯瓦希里语(NLLB-200-3.3B(nllb2022)在提交时无法通过可用的模型镜像获得)。我们选择中文、德语、阿拉伯语和斯瓦希里语,以涵盖文字系统(拉丁、汉字、阿拉伯)、与英语的类型学距离,以及 Qwen2.5 下的资源水平;本研究不是语言公平性排名。试验总数:100×3×5=1,500。
### 3.5 指标
每次试验我们记录检索 recall@5、*生成中的 PII*(针对植入 PII 的大小写折叠子串匹配,对于多行地址使用首逗号段回退)以及*输出护栏触发*(针对电子邮件/电话/类似 SSN 的正则表达式)。最终泄漏为*仅输出* = 生成中的 PII ∧ ¬护栏,以及*综合* = 输入审判器 ALLOW ∧ 仅输出。“泄漏”指的是逐字披露;音译或释义的呈现不计入,因此跨语言语义泄漏可能被低估(第4.1节报告了部分标记重新评分;局限性)。所有 Qwen2.5-7B 调用都使用贪心解码。锚点本身也是由 Qwen 翻译的:非英语查询中的逐字保留率为 0.697–0.730,部分混淆了第4.1节中报告的跨语言 recall 下降。我们按*文档级任何成功*聚合,并对文档进行 95% bootstrap 置信区间(5,000 次重采样)。对于零成功单元格,F1/F3 文档级表格(表1,仅输出和综合列)报告*单侧* 95% Wilson 上限;条件 F2 表格(表3)报告*双侧* 95% Wilson 上限端点,以保持与其非零行相同的 Wilson 约定。BLOCK 率按试验计算;由于所有查询都是对抗性的,它们是攻击集覆盖率,而不是分类器工作点。代码、语料库、查询、逐试验 JSONL 和聚合数据见补充材料。
参见图2标题:两级级联减少了残余泄漏。F1(仅输出正则表达式过滤器)与 F3(加入仅英语提示的输入审判器后),非结构化 PII 文档级任何成功泄漏率(n=40/语言)。误差条为 95% Wilson 置信区间;表1和表3……相似文章
所有语言都重要:理解并缓解多语言 RAG 中的语言偏见
研究者发现多语言 RAG 重排器存在系统性英语与查询语言偏见,提出 LAURA——一种面向效用的对齐方法,通过跨语言检索答案关键文档显著提升性能。
MosaicLeaks:深度研究代理在公开查询中的隐私风险
介绍了MosaicLeaks,一个包含1,001个多跳深度研究任务的基准测试,这些任务将私有企业文档与公共网络查询串联起来,用于评估隐私泄露。研究发现,模型在多个级别上泄露敏感信息,并提出了PA-DR,一种强化学习框架,能够在提高任务准确性的同时减少隐私泄露。
检索增强生成(RAG)管道中匿名化影响的案例研究
本案例研究通过实证研究调查在检索增强生成(RAG)管道中应在何处应用匿名化以平衡隐私与可用性,并检查在不同阶段(数据集与生成的回答)进行匿名化的影响,为隐私风险缓解策略提供指导。
Leak It:黑盒语言模型训练数据提取的概率方法
本文提出了一种从黑盒语言模型中提取训练数据的概率方法,表明聚合的成员推断指标掩盖了逐文档泄露,并介绍了“leakit”审计工具。
相同问题,不同来源,不同答案:医疗多源RAG系统中的来源依赖性审计
本文提出了一个用于审计医疗多源RAG系统中来源依赖性的框架,发布了TransplantQA基准、HERO-QA检索策略以及一个结构化输出裁判,用于衡量跨来源答案关系。研究表明,更好的检索揭示出比先前估计更多的分歧,并主张将NLP评估从答案正确性转向跨来源关系分析。