PrivacyPeek:审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么

Hugging Face Daily Papers 论文

摘要

介绍了PrivacyPeek,一个用于审计基于LLM的智能体在获取阶段隐私泄漏的基准,表明智能体经常收集超出必要范围的敏感数据,且现有防御措施不足。

基于LLM的智能体正在快速发展,能够自主调用外部工具来为用户完成多步任务。然而,智能体获取的敏感信息往往超出任务所需。现有的隐私基准审计的是智能体的回复或对外动作所披露的内容,却忽视了数据首次进入智能体上下文的获取阶段。过度获取的信息距离真正泄漏仅一步之遥——一次粗心操作或一次攻击即可导致泄漏。为了评估这一现象的普遍性,我们引入了PrivacyPeek,一个用于评估基于LLM的智能体在获取阶段隐私泄漏的基准,包含7种获取行为和16个应用领域的1,182个案例。具体而言,获取检查(Acquisition Inspection)检查智能体的工具调用轨迹,包括其调用的工具和接收的数据,以检测其是否获取了超出任务范围的敏感信息。随后,探针诱导(Probe Elicitation)发出后续探针,衡量攻击者能够多容易地诱导出智能体已获取但未披露的敏感信息。我们在4个模型家族的10个基于LLM的智能体上进行的实验表明,不必要地获取敏感信息的现象非常普遍。此外,我们观察到任务完成能力与获取阶段泄漏之间存在相关性。提示级防御只能减少一小部分获取阶段泄漏,大部分泄漏仍未得到缓解。这些结果使得对获取阶段隐私的审计变得既紧迫又必要。我们的数据集和代码可在 https://github.com/Xuan269/PrivacyPeek-Resource 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/10 06:14

论文页面 - PrivacyPeek:审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么

来源:https://huggingface.co/papers/2606.00152

摘要

基于LLM的智能体正在迅速发展,能够自主调用外部工具为用户完成多步骤任务。然而,智能体常常获取超出任务所需范围的敏感信息。现有的隐私基准仅审计智能体的响应或外部行为所披露的内容,却忽视了数据首次进入智能体上下文的获取阶段。这些过度获取的信息距离完全泄露仅一步之遥——可能源于一次不小心操作或一次攻击。为了评估这一现象的普遍性,我们提出了PrivacyPeek,一个用于评估基于LLM的智能体在获取阶段隐私泄露的基准,涵盖7种获取行为和16个应用领域中的1,182个案例。具体来说,AcquisitionInspection检查智能体的工具调用轨迹,包括其调用的工具和接收的数据,以检测其在任务范围之外获取敏感信息的行为。ProbeElicitation随后发出后续探针,衡量攻击者能多容易地引出智能体已获取但未披露的敏感信息。我们在4个模型家族的10个基于LLM的智能体上进行的实验表明,不必要地获取敏感信息的现象十分普遍。此外,我们观察到任务完成能力与获取阶段泄露之间存在相关性。提示词级别的防御只能减少一小部分获取阶段的泄露,大部分仍未得到缓解。这些结果使得对获取阶段隐私的审计既紧迫又必要。我们的数据集和代码可在https://github.com/Xuan269/PrivacyPeek-Resource获取。

查看 arXiv 页面 (https://arxiv.org/abs/2606.00152) 查看 PDF (https://arxiv.org/pdf/2606.00152) GitHub3 (https://github.com/Xuan269/PrivacyPeek-Resource) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.00152)

在您的智能体中获取这篇论文:

hf papers read 2606\.00152

还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.00152 以从此页面链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.00152 以从此页面链接到它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.00152 以从此页面链接到它。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接到它。

相似文章

MosaicLeaks:你的研究助手能保守秘密吗?

Hugging Face Blog

MosaicLeaks 提出了一个新的基准,用于衡量深度研究型AI助手的隐私泄露情况,结果表明这些助手经常通过外部查询泄露私人信息,并提出了一种训练方法(PA-DR),在降低泄露的同时提升任务性能。

PrivacyAlign:面向LLM代理的上下文隐私对齐

Hugging Face Daily Papers

PrivacyAlign 引入了一个人工标注数据集和训练框架,用于使 LLM 代理尊重上下文隐私规范,结果表明前沿模型仍然会泄露敏感信息,而基于人工的评估能改善对齐效果。

MosaicLeaks:深度研究代理在公开查询中的隐私风险

arXiv cs.CL

介绍了MosaicLeaks,一个包含1,001个多跳深度研究任务的基准测试,这些任务将私有企业文档与公共网络查询串联起来,用于评估隐私泄露。研究发现,模型在多个级别上泄露敏感信息,并提出了PA-DR,一种强化学习框架,能够在提高任务准确性的同时减少隐私泄露。

POLAR-Bench:用于LLM智能体中隐私-效用权衡的诊断基准

arXiv cs.AI

POLAR-Bench是一个诊断基准,通过测试LLM智能体在受到第三方模型对抗性探测时遵循隐私策略的能力,来评估隐私-效用的权衡。结果显示,前沿模型保护了超过99%的受保护属性,但较小的开源权重模型泄露了一半以上,突显了意图遵循方面的差距。