PrivacyAlign:面向LLM代理的上下文隐私对齐

Hugging Face Daily Papers 论文

摘要

PrivacyAlign 引入了一个人工标注数据集和训练框架,用于使 LLM 代理尊重上下文隐私规范,结果表明前沿模型仍然会泄露敏感信息,而基于人工的评估能改善对齐效果。

代表用户行动的AI代理不断做出决策,为了让用户信任其代理,这些决策必须与用户的实际意愿一致。隐私对代理而言是一个重要的对齐问题:代理发出的每条消息、每条帖子或每次工具调用,都是关于分享什么、与谁分享以及在何种条件下分享的上下文判断。由于此类判断依赖于社会期望和规范,人类的判断不仅标记隐私侵犯行为,还有助于界定这些行为。虽然现有工作在训练和评估中都依赖于不可靠的代理指标,但我们把人类判断置于代理隐私对齐的核心位置。我们引入了 PrivacyAlign,这是一个包含1,350个样本的数据集,由599位独立标注员在当今LLM实际泄露隐私的多样场景中提供了3,516条详细标注,并利用该数据集将对齐训练和自动评估根植于人类隐私规范中。基于这些标注,我们首先证明,让LLM评判器以同一提示下参考回答的人类标注和解释为条件,可以使它们的判断更加可靠。然后我们引入了基于标注条件的奖励建模,该方法在强化学习过程中使用这些标注对新的回答进行评分,并表明使用这种奖励训练的小型开放权重代理能更好地与人类隐私规范对齐,在PrivacyAlign和现有的代理隐私基准上取得了显著提升。
查看原文
查看缓存全文

缓存时间: 2026/06/25 17:13

论文页面 - PrivacyAlign:面向LLM智能体的情境化隐私对齐

来源:https://huggingface.co/papers/2606.21710

智能体之所以强大,是因为它们能够使用工具收集信息、记住上下文并代表我们采取行动。但正是这些能力带来了新的隐私风险:一个能够访问电子邮件、日历、文件、数据库、工具和记忆的智能体,可能会泄露本不应共享的敏感信息。

我很高兴向大家介绍 PrivacyAlign,这是我们在 LLM 智能体隐私对齐方面的新工作。

隐私并不仅仅是“不披露”那么简单。它取决于情境:哪些信息应该流动、向谁流动、在什么情况下流动、以及以何种详细程度流动。

这使得 LLM 的隐私对齐尤其具有挑战性,因为正确的答案往往取决于特定场景下的社会规范。

在 PrivacyAlign 中,我们引入了一个人工标注的数据集以及训练/评估框架,用于研究智能体场景中的这些风险:
• 1,350 个隐私敏感的智能体响应对
• 3,516 条标注
• 599 名人工标注员

在 PrivacyAlign 测试集上,前沿模型仍然经常泄露敏感信息:
• GPT-5.5:23.3%
• Claude Opus 4.7:34.1%
• Gemini 3.1 Pro:41.4%

我们还表明,仅靠 LLM 裁判自动评估隐私是困难的。当裁判获得同一场景下的人工标注和理由时,其判断变得更可靠,更接近经过审计的黄金标签。

核心贡献之一是标注条件奖励:在对齐训练期间,奖励裁判会看到同一场景下参考回复的人工标注和理由。这使得隐私信号保持情境化、具体化且以人类判断为基础。

结果是:模型泄漏大大减少,同时仍然能共享任务所需的信息。

更广泛的启示是:如果隐私是由人类规范定义的,那么隐私评估和训练也必须以人类判断为基础。

项目页面:https://privacyalign.github.io/
论文:https://arxiv.org/abs/2606.21710
数据集:https://huggingface.co/datasets/ServiceNow/PrivacyAlign

相似文章

在LLM个性化中重新聚焦人类

arXiv cs.CL

本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。

通过溯源分析防范LLM代理失对齐

arXiv cs.CL

本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。