在合成英语RAG探测中文化标记谓词触发的个人身份信息放大效应的探索性分析与未检测:谓词资源混淆审计

arXiv cs.CL 论文

摘要

本研究探讨了针对文化标记个体的刻板印象查询是否会导致RAG系统比中立查询泄露更多个人信息,发现在统计校正后未发现此类放大效应的证据。

arXiv:2608.20351v1 Announce Type: new 摘要:我们探究针对文化标记人群的刻板印象查询是否会比其他等价的中立查询从检索增强生成(RAG)系统中泄露更多个人信息。我们在一个合成英语PII语料库上预注册了一项四种文化审计(en-Anglo、es-LATAM、阿拉伯语、印地语),比较五个查询臂,我们称之为刻板印象触发泄露差异(STLD)。首先有两个注意事项。我们锁定的确认估计器从未运行,因此本文中的所有测试都是探索性或敏感性的,所有计划偏差都列在附录中。而且名称泄露指标受到了提示回声伪影的污染:模型通常只是重发我们询问的名称,这在没有任何检索的情况下夸大了表面上的泄露。在更清洁的通道(电子邮件、电话、类SSN、地址)中,经过多重比较校正后,我们未发现任何四种文化中由刻板印象驱动的放大。因为我们的样本仅对中等效应有统计功效,而且文化标记探测混合了刻板印象内容、文化标记和传统实践,我们将此呈现为未检测,而非无效应的证据,其中文化标记谓词泄露与基础资源混淆。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:09

# 合成英语RAG探测中文化标记谓词触发的PII扩增探索性分析性无检测:谓词-资源混淆审计  
**来源**: https://arxiv.org/html/2608.20351  
**作者**: 严杭·李(东北大学) [email protected] & 志超·范(伊利诺伊大学厄巴纳-香槟分校) [email protected] & 泽鑫·庄(南方卫理公会大学) [email protected]  

###### 摘要  
我们探究:关于文化标记人群的、充满刻板印象的查询,是否比其他等效的中立查询从检索增强生成(RAG)系统中泄露更多个人信息。我们在一个合成英语PII语料库上预先注册了涵盖四种文化(英语盎格鲁、西班牙语拉美、阿拉伯语、印地语)的审计,通过五个查询组进行比较,我们称之为“刻板印象触发泄露差值(STLD)”。需提前说明两点:我们锁定的确认性评估器从未运行,因此本文中的所有测试均为探索性或敏感性分析,所有计划偏差均在附录中列出。此外,“姓名泄露”指标受到提示回声伪影的污染:模型通常只是重复我们询问的姓名,这会在完全未进行检索的情况下夸大表观泄露量。在更干净的通道(电子邮件、电话、类SSN号码、地址)中,经过多重比较校正后,我们在所有四种文化中均未发现刻板印象驱动的扩增。由于我们的样本仅对中等效应有统计效力,且文化标记探测混合了刻板印象内容、文化标记与传统实践,我们将其呈现为*无检测*——而非无效应证据——这种与底层资源混淆的文化标记谓词泄露。  

**探索性分析性无检测:合成英语RAG探测中文化标记谓词触发的PII扩增——谓词-资源混淆审计**  
严杭·李(东北大学) [email protected]  
志超·范(伊利诺伊大学厄巴纳-香槟分校) [email protected]  
泽鑫·庄(南方卫理公会大学) [email protected]  

## 1 引言  
文化刻板印象塑造了语言模型的输出,传播关于文化标记群体的描述性和规定性判断(Blodgett等人,2021;Mostafazadeh Davani等人,2025;Ma等人,2025;Jha等人,2023);多语言扩展跨越数十种语言(Bhutani等人,2024;Neplenbroek等人,2024;Huang和Xiong,2024),并已开始与检索增强生成(RAG;Lewis等人,2020)交互——其中检索到的文档会放大刻板印象输出(Zhang等人,2026),且检索器操纵可能暴露公平性漏洞(Bagwe等人,2025)。  
本研究提出一个不同的问题:***文化刻板印象是否不仅塑造模型输出的观点,还塑造其泄露的内容?*** 从偏差扩增文献中可得出一个自然的预测:是的——关于文化标记人群的、充满刻板印象的查询应比内容等效的中立查询提取更多个人可识别信息(PII)。我们将此预测形式化为**刻板印象触发泄露差值(STLD)**,并在一个带有文化标记姓名的合成英语源RAG语料库上预先注册了经验测试;查询语言与文档语言全程一致。  
我们预先注册了假设(H1: STLD > 0)、配对五组设计、每文化N=100、配对McNemar检验与四路邦弗朗尼α=0.0125,以及谓词无害化审计。在计划锁定与执行之间,对表述、防护栏和标题指标进行了实质性替换,并调整了谓词库规模。我们明确指出这是一个**估计目标转变**,而非表面上的操作调整:锁定计划中将使用Llama-Guard-3和摘要重述的、防护栏后的最终泄露率作为主要端到端隐私风险估计器,但并未运行;以下标题指标是使用正则表达式防护栏和直接重述的、防护栏前的生成器发射率。我们将结果视为在分析性估计器下的探索性结果。所有八个偏差(D1–D8)均在附录E中列出。  

**标题(更干净的不含姓名\text{name}指标)**  
在不含姓名\text{name}的指标(电子邮件、电话、类SSN号码、地址;每文化n=80)上,在四路α=0.0125下,所有文化中的所有单元格均未达到邦弗朗尼显著性。被污染的含姓名\text{name}的预先注册指标确实标记了一个显著的西班牙语拉美单元格(-10 pp),但匹配组分解显示,该差异来自升高的对照组L(Q_C) = 80%,而非处理组L(Q_S):其他组均在67-75%左右,且计划的合理性规则L(Q_C) - L(Q_N) < 3 pp方向被违反(未校正p=0.180)。  

**D8 敏感性分析**  
事后构建的7谓词文化中立Q_C v2池(相同文档、相同模型、相同长度匹配)将对照组速率从80%降至70%(p=0.013),并将单元格级STLD在谓词库标注的子池上均降至0 pp。由于D8仅重运行对照组,这是在谓词重抽样下对Q_C稳定性的敏感性测试,而非因果替代;我们并列报告v1和v2。与这些数据一致的解读是v1下小池Q_C的抽样伪影,而非Q_S效应。  

**提示回声混淆**  
在西班牙语拉美的Q_S中,20个“姓名泄露”响应中有17个包含查询中已出现的被查询人名,因此姓名\text{name}“泄露”主要是身份回声,而非检索提取。在更干净的不含姓名\text{name}的指标(4类PII:电子邮件/电话/类SSN号码/地址;每文化n=80)上,v1的西班牙语拉美单元格为-8.75 pp(p=0.039,未在0.0125下邦弗朗尼显著),v2为0 pp(p=1.000),且在v1或v2中均无单元格达到校正后显著性。匹配的西班牙语拉美整体拒绝不对称性(从19%增至29%,+10 pp)在拒绝转换单元格的逐次试验配对McNemar检验中显著(0次下降 vs. 10次上升,p=0.002);该检验在英语盎格鲁、阿拉伯语、印地语上不显著。逐谓词、留一谓词法和谓词聚类自助分析(§4.5)与符号稳健性一致,同时表明单元格级效应是**谓词-资源混淆的**;我们明确**不**将其归因于对齐数据组成,也不推断超出抽样谓词集之外。  

**无检测 vs. 无效应**  
阴性结果需要统计效力声明。在每文化N=100、配对McNemar检验α=0.0125下,单个单元格在80%功率下的最小可检测效应(MDE)在平衡不一致假设下约为±11 pp;在不含姓名\text{name}的指标(n=80)上,MDE升至±13 pp。这与近期关于可检测效应/MDE预算(Zhuang等人,2026)和配置条件基准敏感性(Li等人,2026b)的基准审计工作相符。因此,我们将结果表述为“在每文化N=100下**未检测到**刻板印象触发的PII扩增”,而非证明无效应存在。我们在附录B中提供了每个McNemar检验对应的配对Wald 95%置信区间。  

这种表述很重要,因为先前关于RAG隐私(Zeng等人,2024)、跨语言隐私泄露(Dong等人,2025)和线索控制多语言PII记忆(Luo等人,2026)的研究将查询语言(或检索/线索表面)视为攻击者的杠杆;而这里我们测试的是**固定语言内的查询框架**作为一个可分离的杠杆,并且我们在该样本量下未检测到预测方向上的泄露扩增。  

**推断状态**  
本文未报告确认性终点。锁定但未执行的预先注册终点定义了原始目标估计目标并组织偏差;所有报告的推断检验均为探索性分析性或敏感性分析。  

**贡献**  
(i) 我们预先注册了刻板印象作为隐私侧通道的假设;由于D1–D3改变了终点,我们报告**无确认性检验**。在使用探索性替代估计器(正则表达式/直接/防护栏前)和更干净的不含姓名\text{name}有效性过滤指标上,我们**未检测到**在任何四种文化中的扩增。  
(ii) 我们诊断了两个混淆当前分析单元格的因素:Q_C对照不稳定性(D8敏感性、单种子、谓词不平衡)和姓名\text{name}-PII提示回声伪影。  
(iii) 接收后,我们将发布合成语料库、带有构念标注(刻板印象加载/文化标记/传统实践)的谓词库、五组查询生成器、无害化审计、原始试验JSONL、偏差日志和分析脚本;我们保留“STLD”作为预先注册标签,但将证据解读为**文化标记谓词框架**,而非刻板印象内容本身。  

## 2 相关工作  

#### 跨文化刻板印象基准  
StereoSet和CrowS-Pairs(Nadeem等人,2021;Nangia等人,2020)开启了以英语为中心的刻板印象测量;Blodgett等人(2021)编录了概念局限,Goldfarb-Tarrant等人(2021);Lum等人(2025)显示内在分数与现实使用行为分歧。GULL多语言版(Bhutani等人,2024)、MBBQ(Neplenbroek等人,2024)、KoBBQ(Jin等人,2024)、CBBQ(Huang和Xiong,2024)和EspanStereo(Ma等人,2025)提供了跨语言-区域对、国家/文化变体和多语言扩展的文化或语言情境刻板印象和偏差资源;我们采用其谓词来源先例,并不对这些库作为总体做出任何声称,仅针对我们抽样的谓词。  

#### RAG端偏差扩增与隐私  
Zhang等人(2026)表明检索到的刻板印象加载文档在英语/日语/中文RAG中放大偏差输出;Bagwe等人(2025)形式化了对RAG检索器后门攻击的公平性漏洞。这些工作将刻板印象视为系统*输出*;我们将刻板印象加载的*查询*视为杠杆,并测量隐私输出。Zeng等人(2024)确立RAG为隐私攻击面;Dong等人(2025)将其扩展到六种语言的跨语言PII泄露及隐私神经元缓解;Luo等人(2026)在32种语言的线索控制下重新评估PII泄露,并认为当线索匹配时语言依赖性较弱。我们的设计与线索控制批评一致:我们在固定查询语言、生成器、检索器和目标人物的同时,改变刻板印象框架。相邻的RAG评估工作审计检索推理、上下文合规性,以及相关证据是否支持生成的主张(Ji等人,2026;Chen等人,2026;Qian等人,2026);我们的配对比较遵循了该谨慎原则。  

#### 记忆、MIA与多语言安全  
LLM以可作为隐私攻击利用的方式逐字记忆训练数据的部分内容(Carlini等人,2021,2023),且数据侧干预如去重可降低此风险(Kandpal等人,2022)。特定主张的记忆审计同样将探测和解码条件作为主张的一部分(Li等人,2026a)。我们设定中的PII通过检索而非预训练进入,但记忆文献解释了为何检索到的PII不应被假定为无害。Duan等人(2024)表明经典的基于损失/困惑度的MIA在LLM预训练上仅略优于随机;Shao等人(2024)证明LLM关联在非MIA设定中转化为隐私泄露。Panda等人(2025)审计人口属性推断并发现刻板印象一致的推理;Wei等人(2025)记录少数群体数据在遗忘学习中不成比例地更易泄露。Deng等人(2024)描述了多语言越狱风险,Yong等人(2025)更广泛地调查了英语中心的LLM安全研究分布。我们固定查询语言(qlang = doclang)以分离刻板印象触发与跨语言效应,并通过查询*框架*而非损失阈值进行攻击,分离个体内的配对差值而非群体间差异。我们旨在测试文化索引查询框架作为RAG中PII泄露的潜在可控杠杆,明确控制长度、内容承载谓词容量、拒绝不对称性和检索线索混淆。  

## 3 方法  
**4文化探测库**(每文化N=100)  
**英语盎格鲁 | 西班牙语拉美 | 阿拉伯语 | 印地语**  

**五组配对设计**  
Q0:裸查询  
Q_R:随机  
Q_N:中立  
Q_C:中立对照  
Q_S:刻板印象处理  
STLD = L(Q_S) - L(Q_C)  

**RAG系统**  
检索:BGE-M3 (k=5)  
生成:Qwen-2.5-7B Instruct  
DLP提示:拒绝PII查询  
防护栏:Llama-Guard-3  
防护栏后:摘要重述(**未运行**,D1–D3)  
锁定终点:防护栏后最终泄露率  

**PII正则表达式防护栏**  
直接重述  
**分析性路径**  
防护栏前发射率  
含姓名指标(提示回声混淆)  
不含姓名指标(电子邮件/电话/类SSN/地址)  

**按文化计算CMPLD/STLD**  
配对McNemar检验  
四路邦弗朗尼校正  
更干净:无检测  

**图1:方法概览。** 四文化探测库将五组配对查询设计(Q_S处理 vs. Q_C对照)输入共享RAG系统。锁定的确认性路径(Llama-Guard-3 + 摘要,虚线)**未运行**;我们报告使用正则表达式防护栏和直接重述的防护栏前发射率。跟踪两个泄露通道:含姓名指标(受提示回声污染)和更干净的不含姓名指标(标题指标)。  

### 3.1 威胁模型与STLD  
我们假设一个RAG系统提供英语文档...

相似文章

英语来源多语言RAG中隐私风险之所在:跨五种查询语言的分阶段审计

arXiv cs.CL

本文对英语来源多语言RAG在五种查询语言下的隐私风险进行了审计,检验非英语查询是否会加剧PII泄漏。通过使用Qwen2.5-7B流水线和两阶段防御,研究发现,在仅进行输出过滤时,英语的点估计泄漏率最高;而在加入输入判别器后,阿拉伯语和斯瓦希里语仍存在残余泄漏。

检索增强生成(RAG)管道中匿名化影响的案例研究

arXiv cs.CL

本案例研究通过实证研究调查在检索增强生成(RAG)管道中应在何处应用匿名化以平衡隐私与可用性,并检查在不同阶段(数据集与生成的回答)进行匿名化的影响,为隐私风险缓解策略提供指导。