PrivacyPeek:审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么
摘要
介绍了PrivacyPeek,一个用于审计基于LLM的智能体在获取阶段隐私泄漏的基准,表明智能体经常收集超出必要范围的敏感数据,且现有防御措施不足。
查看缓存全文
缓存时间: 2026/08/10 06:14
论文页面 - PrivacyPeek:审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么
来源:https://huggingface.co/papers/2606.00152
摘要
基于LLM的智能体正在迅速发展,能够自主调用外部工具为用户完成多步骤任务。然而,智能体常常获取超出任务所需范围的敏感信息。现有的隐私基准仅审计智能体的响应或外部行为所披露的内容,却忽视了数据首次进入智能体上下文的获取阶段。这些过度获取的信息距离完全泄露仅一步之遥——可能源于一次不小心操作或一次攻击。为了评估这一现象的普遍性,我们提出了PrivacyPeek,一个用于评估基于LLM的智能体在获取阶段隐私泄露的基准,涵盖7种获取行为和16个应用领域中的1,182个案例。具体来说,AcquisitionInspection检查智能体的工具调用轨迹,包括其调用的工具和接收的数据,以检测其在任务范围之外获取敏感信息的行为。ProbeElicitation随后发出后续探针,衡量攻击者能多容易地引出智能体已获取但未披露的敏感信息。我们在4个模型家族的10个基于LLM的智能体上进行的实验表明,不必要地获取敏感信息的现象十分普遍。此外,我们观察到任务完成能力与获取阶段泄露之间存在相关性。提示词级别的防御只能减少一小部分获取阶段的泄露,大部分仍未得到缓解。这些结果使得对获取阶段隐私的审计既紧迫又必要。我们的数据集和代码可在https://github.com/Xuan269/PrivacyPeek-Resource获取。
查看 arXiv 页面 (https://arxiv.org/abs/2606.00152) 查看 PDF (https://arxiv.org/pdf/2606.00152) GitHub3 (https://github.com/Xuan269/PrivacyPeek-Resource) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.00152)
在您的智能体中获取这篇论文:
hf papers read 2606\.00152
还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.00152 以从此页面链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.00152 以从此页面链接到它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.00152 以从此页面链接到它。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接到它。
相似文章
MosaicLeaks:你的研究助手能保守秘密吗?
MosaicLeaks 提出了一个新的基准,用于衡量深度研究型AI助手的隐私泄露情况,结果表明这些助手经常通过外部查询泄露私人信息,并提出了一种训练方法(PA-DR),在降低泄露的同时提升任务性能。
PrivacyAlign:面向LLM代理的上下文隐私对齐
PrivacyAlign 引入了一个人工标注数据集和训练框架,用于使 LLM 代理尊重上下文隐私规范,结果表明前沿模型仍然会泄露敏感信息,而基于人工的评估能改善对齐效果。
MosaicLeaks:深度研究代理在公开查询中的隐私风险
介绍了MosaicLeaks,一个包含1,001个多跳深度研究任务的基准测试,这些任务将私有企业文档与公共网络查询串联起来,用于评估隐私泄露。研究发现,模型在多个级别上泄露敏感信息,并提出了PA-DR,一种强化学习框架,能够在提高任务准确性的同时减少隐私泄露。
POLAR-Bench:用于LLM智能体中隐私-效用权衡的诊断基准
POLAR-Bench是一个诊断基准,通过测试LLM智能体在受到第三方模型对抗性探测时遵循隐私策略的能力,来评估隐私-效用的权衡。结果显示,前沿模型保护了超过99%的受保护属性,但较小的开源权重模型泄露了一半以上,突显了意图遵循方面的差距。
当智能体学会成为你:人格技能中的隐私泄露、模仿风险与防御基准测试
介绍了AntiSkillBench,一个用于评估AI智能体人格技能管线中隐私泄露、模仿风险及防御措施的基准,发现风险在不同主干模型上持续存在,且现有防御措施效果有限。