PrivacyAlign:面向LLM代理的上下文隐私对齐
摘要
PrivacyAlign 引入了一个人工标注数据集和训练框架,用于使 LLM 代理尊重上下文隐私规范,结果表明前沿模型仍然会泄露敏感信息,而基于人工的评估能改善对齐效果。
查看缓存全文
缓存时间: 2026/06/25 17:13
论文页面 - PrivacyAlign:面向LLM智能体的情境化隐私对齐
来源:https://huggingface.co/papers/2606.21710
智能体之所以强大,是因为它们能够使用工具收集信息、记住上下文并代表我们采取行动。但正是这些能力带来了新的隐私风险:一个能够访问电子邮件、日历、文件、数据库、工具和记忆的智能体,可能会泄露本不应共享的敏感信息。
我很高兴向大家介绍 PrivacyAlign,这是我们在 LLM 智能体隐私对齐方面的新工作。
隐私并不仅仅是“不披露”那么简单。它取决于情境:哪些信息应该流动、向谁流动、在什么情况下流动、以及以何种详细程度流动。
这使得 LLM 的隐私对齐尤其具有挑战性,因为正确的答案往往取决于特定场景下的社会规范。
在 PrivacyAlign 中,我们引入了一个人工标注的数据集以及训练/评估框架,用于研究智能体场景中的这些风险:
• 1,350 个隐私敏感的智能体响应对
• 3,516 条标注
• 599 名人工标注员
在 PrivacyAlign 测试集上,前沿模型仍然经常泄露敏感信息:
• GPT-5.5:23.3%
• Claude Opus 4.7:34.1%
• Gemini 3.1 Pro:41.4%
我们还表明,仅靠 LLM 裁判自动评估隐私是困难的。当裁判获得同一场景下的人工标注和理由时,其判断变得更可靠,更接近经过审计的黄金标签。
核心贡献之一是标注条件奖励:在对齐训练期间,奖励裁判会看到同一场景下参考回复的人工标注和理由。这使得隐私信号保持情境化、具体化且以人类判断为基础。
结果是:模型泄漏大大减少,同时仍然能共享任务所需的信息。
更广泛的启示是:如果隐私是由人类规范定义的,那么隐私评估和训练也必须以人类判断为基础。
项目页面:https://privacyalign.github.io/
论文:https://arxiv.org/abs/2606.21710
数据集:https://huggingface.co/datasets/ServiceNow/PrivacyAlign
相似文章
@stanfordnlp:众多@stanfordnlp的工作亮相@icmlconf。首尔见!Contextualized Privacy Defense for LLM Agents Yule Wen, @Stev…
该论文提出了上下文防御指令(CDI),一种用于LLM代理隐私防御的新范式,使用强化学习训练的指导模型生成针对具体步骤、具有上下文感知的指导,在隐私保护和有用性之间实现了更好的平衡。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。
面向智能体与多模态大语言模型的上下文感知强化学习
介绍了ContextRL,一种强化学习方法,教会大语言模型识别哪些上下文支持答案,在智能体和多模态基准上取得了性能提升。
通过溯源分析防范LLM代理失对齐
本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。