揭秘LLM交互中的隐私-效用权衡

arXiv cs.AI 论文

摘要

本文分析了LLM交互中的隐私-效用权衡,揭示了底层机制,并引入了一个意图驱动的本地保护框架,使用轻量级模型来增强隐私同时保持响应效用。

arXiv:2609.10992v1 公告类型:新 摘要:大语言模型集成到日常任务中依赖于丰富的上下文指令,不可避免地暴露敏感用户信息。当前隐私保护方法通常采用与上下文无关的静态规则,导致严重的效用下降。然而,净化如何影响下游性能的具体机制在很大程度上仍未被探索。为此,我们进行系统分析以解构隐私-效用权衡,揭示了三个底层机制:(1) 上下文依赖的效用,它首先根据用户意图揭示数据价值从关键约束转变为可丢弃噪声来确定何时净化;(2) 战略适应,随后根据任务对事实完整性与结构一致性的依赖程度来决定如何净化,即选择移除还是替换;(3) 组合交互,最后通过展示属性形成协同依赖或拮抗冗余的语义网络来扩展保护范围。基于这些见解,我们引入了一个意图驱动的本地保护框架。通过蒸馏一个轻量级模型Veilmind-4B来驱动动态提取-净化-恢复管道,我们的方法达到了低泄漏隐私点,同时保留了比现有面向隐私的基线更高的响应效用,将隐私-效用权衡推向帕累托前沿。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:21

# 揭开大型语言模型交互中隐私与效用权衡的面纱  
来源:https://arxiv.org/html/2609.10992  
Zhanxu Xie、Junjie Yu、Tong Zhu、Lijun Li\\corresponding、Wenliang Chen\\corresponding  
###### 摘要  
大型语言模型在日常任务中的应用依赖于富含上下文的指令,这不可避免地会暴露用户的敏感信息。当前的隐私保护方法通常采用与上下文无关的静态规则,导致效用严重下降。然而,数据清洗如何影响下游性能的具体机制在很大程度上尚未被探索。为此,我们进行了系统性分析以解构隐私-效用权衡,揭示了三种潜在机制:(1)上下文相关的效用,首先通过揭示数据价值如何根据用户意图从关键约束转变为可有可无的噪声来确定何时进行清洗;(2)策略性适应,随后通过说明删除与替换的选择取决于任务对事实完整性还是结构连贯性的依赖程度来决定如何进行清洗;(3)组合交互,最后通过证明属性形成协同依赖或对抗冗余的语义网络来扩展保护范围。基于这些见解,我们提出了一种基于意图的本地保护框架。通过蒸馏一个轻量级模型Veilmind-4B来驱动动态提取-清洗-恢复流程,我们的方法在达到低泄露隐私点的同时,保留了比现有隐私导向基线显著更高的响应效用,推动隐私-效用权衡向帕累托前沿迈进。  
1苏州大学,2北京航空航天大学,3苏州城市学院,4上海智能信息处理重点实验室,5上海人工智能实验室,\{zhliu0106, wlchen\}@stu.suda.edu.cn, [email protected], [email protected], [email protected], [email protected]  

## 1引言  
大型语言模型(LLMs)已发展成为智能代理,能够无缝集成到多样化的工作流程中(Brown等人,2020(https://arxiv.org/html/2609.10992#bib.bib5);Xi等人,2023(https://arxiv.org/html/2609.10992#bib.bib4))。为了引出高质量的响应,用户不可避免地需要提供富含个人上下文和具体约束的详细指令(Salemi等人,2024(https://arxiv.org/html/2609.10992#bib.bib7);Ouyang等人,2022(https://arxiv.org/html/2609.10992#bib.bib8))。这种详细的披露是代理准确理解意图并提供个性化协助的基石(Wei等人,2023(https://arxiv.org/html/2609.10992#bib.bib6))。然而,高性能是有代价的。为了获得精确的帮助,用户必须披露不可避免地暴露敏感个人属性的详细信息。关键的是,数据的敏感性并非静态的。它严格取决于用户的意图和特定任务上下文。这与上下文完整性理论相符(Nissenbaum,2004(https://arxiv.org/html/2609.10992#bib.bib9);Nissenbaum,2009(https://arxiv.org/html/2609.10992#bib.bib10))。在实践中,即使是看似无害的提示也可能被用来重建详细的用户画像(Staab等人,2023(https://arxiv.org/html/2609.10992#bib.bib11))。如图1(https://arxiv.org/html/2609.10992#S1.F1)所示,起草保险申诉这样的常规任务需要披露临床诊断和财务困境。一旦传输到不受信任的服务器,这些数据就有被挖掘用于详细分析,进而被利用进行定向现实世界滥用的风险(Carlini等人,2021(https://arxiv.org/html/2609.10992#bib.bib13);Neel和Chang,2023(https://arxiv.org/html/2609.10992#bib.bib12);Wang等人,2024(https://arxiv.org/html/2609.10992#bib.bib14))。  

参见标题  
图1:一个说明性示例,展示了用户提示如何无意中泄露敏感的个人属性,随后可能被用于定向的现实世界滥用。  

为了减轻这些风险,先前的研究主要依赖于静态的清洗规则或通用启发式方法(Lison等人,2021(https://arxiv.org/html/2609.10992#bib.bib39);Edemacu和Wu,2025(https://arxiv.org/html/2609.10992#bib.bib15))。虽然这些方法在降低隐私风险方面有效,但它们常常损害响应的效用(Feyisetan等人,2020(https://arxiv.org/html/2609.10992#bib.bib16);Chowdhury等人,2025(https://arxiv.org/html/2609.10992#bib.bib3))。其关键限制在于对敏感属性不加区分的处理。这类方法无法评估特定细节相对于用户目标的边际贡献,常常在去除非必要噪声的同时也剥离了必要的上下文(Mireshghallah等人,2024(https://arxiv.org/html/2609.10992#bib.bib17))。因此,该领域缺乏对不同程度的清洗如何影响模型性能的细致理解,导致隐私-效用权衡的底层机制在很大程度上尚未被探索。  

为了解决这一差距,我们进行了系统性的实证分析以解构隐私-效用权衡。与以往的黑箱方法不同,我们超越静态启发式方法,映射底层决策边界,回答三个基本问题:  
- •何时清洗?我们揭示敏感信息的功能价值取决于任务上下文。我们观察到从功能耦合(属性作为关键约束)到信息冗余(属性作为可有可无的噪声)的明显动态变化。因此,关于必要性的决定必须基于这种上下文效用。  
- •如何清洗?我们证明最佳保护取决于优先考虑事实完整性还是结构连贯性。客观任务需要移除以防止错误前提,而交互场景则需要替换以作为对话锚点。因此,策略的选择严格取决于任务对事实有效性还是结构性有效性的依赖程度。  
- •清洗的范围是什么?我们证明敏感属性并非孤立运作,而是形成一个复杂的语义网络。这种结构创造了连贯性所必需的协同组合,或者能够泄露信息的对抗性冗余。因此,保护策略必须超越个体评估,以解决这些组合依赖的范围。  

基于这些见解,我们提出了一种基于意图的本地保护框架。为了赋予轻量级本地模型先进的推理能力,我们采用知识蒸馏对其进行专门化以进行以隐私为中心的任务。该模型驱动一个动态的三阶段流程:提取、策略性清洗和事后上下文恢复。关键是,为了适应不同的用户容忍度,我们的框架通过“效用优先”和“隐私优先”模式提供灵活控制。实验结果表明,我们的框架通过达到一个低泄露的隐私点,同时保留了比现有隐私导向基线显著更强的效用,推动了隐私-效用帕累托前沿的发展。  

## 2相关工作  

##### LLM隐私保护技术。  
大量研究涉及LLM从其训练语料库中记忆敏感信息的风险(Carlini等人,2021(https://arxiv.org/html/2609.10992#bib.bib13);Liu等人,2024b(https://arxiv.org/html/2609.10992#bib.bib19))。最直接的方法是数据清洗,包括检测和编辑数据集中的个人身份信息(PII)(Lison等人,2021(https://arxiv.org/html/2609.10992#bib.bib39);Kandpal等人,2022(https://arxiv.org/html/2609.10992#bib.bib20))。虽然基于启发式过滤和命名实体识别(NER)模型(Chen等人,2023(https://arxiv.org/html/2609.10992#bib.bib21))可以减轻显式泄露,但它们容易出现假阴性(Lukas等人,2023(https://arxiv.org/html/2609.10992#bib.bib22))并可能破坏语言连贯性。为了提供正式的隐私保证,研究人员转而将差分隐私(DP)集成到训练过程中(Abadi等人,2016(https://arxiv.org/html/2609.10992#bib.bib23);Li等人,2021(https://arxiv.org/html/2609.10992#bib.bib24))。最近的工作试图将这些方法扩展到LLMs(Yu等人,2022(https://arxiv.org/html/2609.10992#bib.bib25);Sinha等人,2025(https://arxiv.org/html/2609.10992#bib.bib26))。然而,尽管具有理论上的鲁棒性,DP通常会产生大量的“效用税”,其中噪声注入不可避免地损害模型的能力。  

作为这些预防性策略的补充,机器遗忘已成为一种事后补救技术,特别是为了遵守诸如“被遗忘权”之类的法规(Jang等人,2023(https://arxiv.org/html/2609.10992#bib.bib27);Liu等人,2024a(https://arxiv.org/html/2609.10992#bib.bib28);Liu等人,2025b(https://arxiv.org/html/2609.10992#bib.bib18))。其目标是在不重新训练的情况下,从训练好的模型中擦除特定敏感样本的影响。虽然前景广阔,但它面临着灾难性遗忘的挑战,即移除特定知识会无意中损害模型的通用能力(Yao等人,2024(https://arxiv.org/html/2609.10992#bib.bib29);Xu等人,2025(https://arxiv.org/html/2609.10992#bib.bib30))。  

##### 用户-LLM交互中的隐私保护。  
与训练端防御不同,推理阶段保护侧重于保护用户输入免受第三方提供商的影响。早期尝试通过表示扰动或正式隐私机制来解决此问题。诸如向输入嵌入添加噪声(Feyisetan等人,2020(https://arxiv.org/html/2609.10992#bib.bib16);Plant等人,2021(https://arxiv.org/html/2609.10992#bib.bib31);Meehan等人,2022(https://arxiv.org/html/2609.10992#bib.bib33);Du等人,2023(https://arxiv.org/html/2609.10992#bib.bib32))或采用差分解码(Majmudar等人,2022(https://arxiv.org/html/2609.10992#bib.bib34);Zhang等人,2024(https://arxiv.org/html/2609.10992#bib.bib35);Zeng等人,2025(https://arxiv.org/html/2609.10992#bib.bib36))等技术旨在使输入对人类不可读或具有统计安全性。然而,这些方法面临重大实际障碍。基于嵌入的方法与广泛的纯文本商业API不兼容,并且仍然容易受到逆向攻击(Song和Raghunathan,2020(https://arxiv.org/html/2609.10992#bib.bib37))。同样,将DP噪声直接应用于文本生成通常会破坏语义完整性,导致提示对下游模型无法理解,并严重降低任务性能。因此,研究转向直接的文本级清洗。  

虽然标准的基于规则或NER的方法计算效率高,但它们的上下文无关性常常需要移除任务相关细节,导致效用崩溃(Microsoft,2025(https://arxiv.org/html/2609.10992#bib.bib38);Lison等人,2021(https://arxiv.org/html/2609.10992#bib.bib39))。为了缓解这个问题,最近的工作利用LLM进行更灵活的保护。方法范围从重新表述上下文外信息(Ngong等人,2025(https://arxiv.org/html/2609.10992#bib.bib2))到根据泄露风险动态调整清洗强度(Shen等人,2024(https://arxiv.org/html/2609.10992#bib.bib40))。其他策略探索架构或加密解决方案,例如在本地和远程模型之间委派推理(Li等人,2025(https://arxiv.org/html/2609.10992#bib.bib1))或对敏感令牌采用保留格式的加密(Chowdhury等人,2025(https://arxiv.org/html/2609.10992#bib.bib3))。尽管优于僵硬的规则,但这些方法常常依赖静态启发式方法。关键的是,它们忽略了敏感属性的组合交互,未能根据用户意图策略性地调整清洗操作。因此,这种缺乏细粒度的做法导致了次优的隐私-效用权衡。  

## 3解构隐私-效用权衡  

### 3.1数据收集与标注  
严格的实证分析需要一个由用户提示及其内在敏感语句标注组成的高质量数据集。我们的数据收集流程结合了现实世界分布和检索增强合成,以确保多样性和上下文深度。  

##### 现实世界与合成数据。  
我们采用ShareGPT-X(DeSULT,2025(https://arxiv.org/html/2609.10992#bib.bib41))、LMSYS-Chat-1M(Zheng等人,2024(https://arxiv.org/html/2609.10992#bib.bib42))和WildChat(Zhao等人,2024a(https://arxiv.org/html/2609.10992#bib.bib43))数据集来捕捉多样化的现实世界用户意图。为了确保对敏感属性的充分覆盖,我们用合成数据增强了该语料库。具体而言,我们将Nemotron-Personas数据集(Meyer和Corneil,2025(https://arxiv.org/html/2609.10992#bib.bib44))中的个人资料注入到没有敏感信息的用户查询中,创建了语义连贯且富含敏感细节的样本。  

##### 标注与验证。  
我们将敏感语句定义为一个离散的文本单元(例如,一个从句),它揭示特定的个人属性。我们使用大型推理模型(LRM)实现了一个自动提取流程来识别这些语句。为了保证标注质量,我们实施了严格的验证协议。对随机子集(N=200)的手动检查得出错误率为2.5%,证实了我们自动流程的可靠性。最终数据集包含9,757个样本(5,928个现实世界和3,829个合成)。补充材料提供了额外的实现细节。  

### 3.2实验设置  
为了实证量化清洗的边际效用,我们设计了一个受控实验框架。与以往的黑箱方法不同,我们的分析结构旨在隔离用户意图、清洗策略和属性交互的影响。以下子节详细说明了实现这些维度的数据分类法和评估指标。  

#### 数据选择与分类法  
为了研究组合交互并消除信息量作为一个混淆因素,我们构建了一个受控子集$\mathcal{D}_{\text{multi}}$。我们筛选出包含固定数量敏感语句(具体为N=5)的提示,得到384个高密度样本。这种标准化确保观察到的效用变化是由意图和内容语义驱动,而非披露属性的数量。我们使用gemini-2.5-flash(Gemini Team,2025(https://arxiv.org/html/2609.10992#bib.bib46))在两个正交维度上标注这个子集。如补充材料所述,我们将提示分为六种意图类型,从开放式创造与构思到约束性任务执行。同时,我们将敏感语句分为七种隐私类型,与标准PII定义一致。图2(https://arxiv.org/html/2609.10992#S3.F2)可视化了这些类别的分布。  

参见标题  
(a)意图类型  

参见标题  
(b)隐私类型  

参见标题  
(c)联合分布  

图2:数据集统计图,说明了意图类型和隐私类型的边缘分布和联合分布。  

#### 评估流程  
我们设计了一个流程来量化因隐私清洗而导致的边际效用变化($\Delta U$)。该流程由两个核心组件组成:响应生成器和效用

相似文章

POLAR-Bench:用于LLM智能体中隐私-效用权衡的诊断基准

arXiv cs.AI

POLAR-Bench是一个诊断基准,通过测试LLM智能体在受到第三方模型对抗性探测时遵循隐私策略的能力,来评估隐私-效用的权衡。结果显示,前沿模型保护了超过99%的受保护属性,但较小的开源权重模型泄露了一半以上,突显了意图遵循方面的差距。

当较低权限即足够:探究LLM Agent中的过度权限工具选择

Hugging Face Daily Papers

本文研究了LLM Agent中的过度权限工具选择问题,引入了ToolPrivBench来评估并缓解不必要的高权限工具使用。研究发现,安全对齐并不能确保最小权限选择,并提出了一种训练后防御方法,能够在不牺牲性能的情况下减少过度权限的使用。