差分隐私语言模型中的隐私-幻觉权衡
摘要
本文揭示了差分隐私语言模型中的隐私-幻觉权衡,其中更严格的隐私预算会增加幻觉风险,并探讨了缓解策略。
arXiv:2609.00492v1 公告类型: 新
摘要:隐私和事实准确性在医疗保健等高风险领域都至关重要。令人担忧的是,我们发现并研究了差分隐私(DP)语言模型中的隐私-幻觉权衡。首先,我们通过实证表明,使用DP预训练或微调的模型往往比非DP对应模型产生更多的幻觉,且随着隐私预算变得更严格,严重程度增加。其次,我们研究了驱动这种权衡的模型属性,表明DP机制会扁平化输出分布,可能将概率质量重新分配给事实不正确的替代方案。第三,通过控制训练数据中事实频率的实验,我们描述了信息频率如何能够降低DP模型中的幻觉风险。总体而言,我们的发现强调了需要更细致的隐私保护干预措施,这些措施能在不损害事实准确性的情况下提供严格的隐私保证。
查看缓存全文
缓存时间: 2026/09/02 06:04
# 差分隐私语言模型中的隐私与幻觉权衡问题 来源:https://arxiv.org/html/2609.00492 Krishna Pillutla 单位:印度理工学院马德拉斯分校 邮箱:[[email protected]](mailto:) Danish Pruthi 单位:印度科学学院 邮箱:[[email protected]](mailto:) Anjalie Field 单位:约翰霍普金斯大学 邮箱:[[email protected]](mailto:) ###### 摘要 在医疗等高风险领域,隐私保护与事实准确性都至关重要。令人担忧的是,我们发现并研究了差分隐私语言模型中存在的*隐私-幻觉权衡*现象。首先,通过实证表明:使用差分隐私技术进行预训练或微调的模型,比非差分隐私模型更容易产生幻觉,且随着隐私预算收紧,问题严重性显著加剧。其次,我们深入探究了导致该权衡的模型特性,揭示差分隐私机制会平滑输出分布,可能使概率质量向事实错误的选项重新分配。最后,通过控制训练数据中事实出现频率的实验,我们分析了信息频率如何能够降低差分隐私模型的幻觉风险。总体而言,研究结果强调需要开发更精细化的隐私保护方案,在提供严格隐私保证的同时不牺牲事实准确性。 ## 1 引言 大型语言模型在高风险场景中的开发与部署,对隐私保护和事实准确性提出了不可妥协的标准。在训练过程中接触敏感信息的LLM,可能在后续交互中再现这些信息,从而导致隐私侵犯(Carlini等人,2021;Chu等人,2024;Meeus等人,2024;Kandpal等人,2024),即使在非对抗性环境下也存在风险(Aerni等人,2025)。在涉及敏感数据的医疗和法律等高风险领域,这种行为在法律和伦理上都是不可接受的。由于简单匿名化无法提供充分保护(Staab等人,2024;Xin等人,2024;Pang等人,2024),差分隐私技术已成为减轻语言模型隐私风险的事实标准范式(Dwork等人,2006;Carlini等人,2019;Li等人,2022;Xu等人,2023;Yan等人,2024;Hu等人,2024)。 与此同时,LLM已知会产生*幻觉*,即生成事实错误的内容(Wang等人,2024;Jiang等人,2024a;Das等人,2022;Asgari等人,2025)。¹¹1 我们将"幻觉"定义为LLM生成错误信息的行为。除特别说明外,本文特指训练数据(预训练或微调)中未包含的信息。附录B给出了具体定义。这一问题在生成患者出院摘要等高风险任务中(Chung等人,2025)带来严重风险。这些担忧推动了评估和提升LLM事实准确性的研究(Ji等人,2023;Li等人,2024a等)。虽然此前研究分别探讨了隐私保护和事实准确性问题,但尚未有工作研究两者之间的相互作用——尽管在高风险场景中同时实现这两者具有明确需求。 本研究实证探究了这两个关键特性之间的权衡关系,核心问题是:差分隐私训练是否会增加模型的事实幻觉?研究动机源于两种特性可能相互矛盾的实现条件:隐私保护策略本质上旨在对抗记忆效应(Miranda等人,2025;Kassem等人,2023;Hans等人,2024),这可能阻碍模型获取和输出事实信息(Lu等人,2024;Merullo等人,2025)。特别是,由于样本级差分隐私限制了单个训练样本对模型的影响,人们可能预期经过隐私训练的模型在再现*稀有事实*(即在微调数据中仅出现少数次的事实)时会表现不佳,而对更频繁出现且隐私敏感性较低的信息仍能有效捕捉。然而,我们的发现与这一预期相悖:隐私训练不仅减少了稀有事实的生成,反而导致幻觉问题显著增加——模型并非简单地省略未能学习的内容,而是主动生成错误信息。 本研究具体探讨以下问题: 1. (RQ1) 差分隐私训练对模型输出幻觉有何影响? 2. (RQ2) 差分隐私训练对模型的幻觉相关特性有何影响? 3. (RQ3) 在何种条件下使用差分隐私能避免增加幻觉? **研究发现:** - • 在RQ1中,我们发现一致证据表明:无论在微调还是预训练场景中,差分隐私训练都会增加幻觉,且预训练场景中的性能下降更为显著。 - • 在RQ2中,我们发现差分隐私噪声导致预测分布更平滑,使下一个词元的概率质量分散到更多候选词上,从而增加了生成事实错误内容的风险。 - • 最后,在RQ3中我们证明:事实必须重复出现多次,差分隐私训练模型才能习得该事实;并且在更严格的隐私预算下,即使在我们测试的高得多的出现频率下,模型也无法习得这些事实。 研究结果警示:在高风险场景中依赖差分隐私作为隐私解决方案时需更加谨慎,并呼吁进一步研究如何在不增加幻觉的情况下使用差分隐私技术。²²2 代码开源地址:https://github.com/kr-ramesh/privacy-hallucination-tradeoff ## 2 实验设计 我们的目标是测量模型在不同隐私预算下受差分隐私影响的程度。为此,我们精心构建实验设置:能够微调有效的差分隐私模型,控制微调与预训练数据的重叠,评估开放式模型输出的事实准确性。研究基于隐私保护方法与语言模型事实性的相关研究展开,详细综述见§A.1。 ### 2.1 模型与训练设置 **差分隐私微调:** 我们微调LLM以实现可控文本生成,类似此前提出的差分隐私在LLM中的应用,特别是隐私保护的合成文本与开放式文本生成(Yue等人,2023;Mattern等人,2022;Ramesh等人,2024)。所有微调(包括差分隐私与非差分隐私)均采用低秩适应技术以提高计算效率(Hu等人,2022)。差分隐私的具体细节见§A.2,LoRA的详细说明见§C.2,包括所有超参数设置。微调实验使用的基础语言模型是GPT-J 6B(Wang与Komatsuzaki,2021),这是一个仅基于解码器的Transformer模型。选择该模型的关键原因在于:其预训练数据集The Pile完全开源且已知截止日期,确保GPT-J未在2020年后的任何数据上进行预训练。对预训练数据混合与截止日期的了解,使我们能选择与预训练数据无重叠的微调数据(参见§2.2)。 **差分隐私预训练:** 我们使用差分隐私预训练模型VaultGemma(VaultGemma Team,2025)研究差分隐私预训练对事实性的影响。这是一个10亿参数的开放权重模型,完全采用差分隐私预训练(ε=2)。我们将VaultGemma与VaultGemma Team (2025)中的两个模型进行对比:Gemma3-1B(可视为"非隐私对应模型")和GPT-2 XL(15亿参数),后者在标准基准测试中表现与VaultGemma相当,但由于2019年发布,其知识截止日期更早。同时评估数据匹配的非隐私模型Gemma2-2B和Gemma-2B作为额外基线。 ### 2.2 数据集 我们使用维基百科数据进行微调和评估,因其满足两个关键标准:首先,元数据允许我们选择2020年后创建的文章,确保这些文章未被纳入GPT-J 6B的预训练语料。与预训练数据的重叠会破坏差分隐私保证并人为提升性能(Tramèr等人,2024;Cummings等人,2024;Igamberdiev等人,2022)。其次,内容构建包含可验证的事实而非观点或推测,且维基百科上已有成熟的自动化事实核查方法(Min等人,2023),确保实验设置能够回答RQ1。 我们使用三个数据集进行事实性评估,详见表1及其说明。数据集包含的主题完整列表见附录C.4。 **维基百科科学类:** 我们收集了231篇在GPT-J 6B预训练数据截止日期后创建的科学主题维基百科文章,通过维基百科元数据关键词搜索识别科学文章。聚焦科学主题是因为它们包含详细的技术语言,这在敏感数据场景(如临床记录)中也很常见。虽然2020年前不存在这些主题的维基百科文章,但我们预计某些概念会出现在其他预训练数据源中,使差分隐私模型即使在不记忆单个数据点的情况下也能生成相关事实。 **维基百科AI类:** 我们收集了124篇AI主题的维基百科文章,手工整理了2020年前不存在的产品和模型,以及预计会提及它们的相关文章。与科学类文章不同,GPT-J 6B在微调前无法获知大多数此类概念的知识,因为这些概念不可能存在于预训练数据中。但通过构建包含重叠主题的文章数据集,我们确保差分隐私模型能够学习这些知识。例如,若数据集仅包含DeepSeek(聊天机器人),差分隐私机制会阻碍模型学习局限于单个数据点的信息。而通过同时包含DeepSeek(聊天机器人)、DeepSeek和DeepSeek(消歧义),差分隐私模型理论上可以学习到关于DeepSeek的知识,因为该信息出现在多个数据点中。 **维基百科预训练类:** 为研究差分隐私微调对预训练阶段习得知识的影响,我们随机抽取250篇未被纳入微调数据的GPT-J预训练数据中的维基百科文章。微调数据方面,由于差分隐私需要足够大的数据集和批大小(McMahan等人,2018;Ponomareva等人,2023),我们将精心策划的评估文章与20,000篇随机抽样的维基百科文章交错排列(确保与预训练评估集无重叠)。数据被划分为512个词元序列作为隐私保护单位。我们微调模型使其在收到文章标题提示时生成完整文章。 表1:用于评估和微调的数据集。 ### 2.3 开放式文本生成的事实准确性评估 参考标题(a)平均困惑度 参考标题(b)平均事实分数 图1:维基百科科学类数据集上每个主题的平均困惑度(a)和平均事实分数(b),ε=16与ε=∞对比。差分隐私微调模型通常获得更低的平均困惑度(位于y=x线上方的点),但非差分隐私模型在所有主题上获得更高的平均事实分数——表明低困惑度并不意味着更好的事实性。 我们在开放式文本生成设置中评估事实准确性:向模型提供标题提示,生成完整的维基百科文章,然后衡量生成文章的事实准确性(准确率越高,幻觉率越低)。这种设置反映了评估开放式生成事实性的现代范式,区别于传统基于完形填空或简短响应查询的事实性评估方法(Youssef等人,2023;Petroni等人,2019)。 我们注意到,效用度量(如困惑度——先前研究评估差分隐私方法有效性的常用指标:Yu等人,2022;Thareja等人,2026;Ma与Rajtmajer,2026)不能作为幻觉的替代指标,因此无法捕捉事实不准确问题(见图1;更多细节见D.4节)。 我们采用自动化与人工双重评估方式: **基于FactScore的自动化评估:** 给定生成文本$d_i$,FactScore(Min等人,2023)分两个阶段操作:(i)原子声明提取——将$d_i$分解为一组最小可验证声明$\mathcal{AF}_{d_i}$;(ii)声明验证——每个声明$\alpha_j^{(d_i)} \in \mathcal{AF}_{d_i}$通过验证器$\mathcal{V}$进行事实性评估,该验证器同时基于内在语言模型判断和从外部知识源$\mathcal{K}$检索的证据,具体流程见算法1(附录A.3)。我们使用原始维基百科文章作为验证生成声明的外部知识源。由于声明分解方法可能产生冗余声明从而人为抬高分数,
相似文章
当隐私损害可合并性:差分隐私下的几何感知模型合并 (DP-GeometryMerge)
该论文研究了融合差分隐私任务模型时遇到的几何挑战,并提出了DP-Merging框架,在维持隐私保障的同时增强了模型的可融合性。
从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
理解语言模型为何产生幻觉:测试推理与先验知识之间的对抗
本文研究语言模型产生幻觉的原因,提出幻觉通常源于有偏的潜在推理(推理失配),而非知识缺失。它引入了TrapQA,一个受控的诊断测试平台,用于测试推理与先验知识之间的对抗,并证明幻觉可能源于误导性的潜在关联。
通过语义等价的对抗性攻击诱发LLM的内在幻觉
本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。
LegalHalluLens:类型化幻觉审计与校准的多智能体辩论,实现可信赖的法律AI
本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。