标签
本文介绍了AgentCIBench,一个用于评估计算机使用代理隐私风险的基准测试,发现15个前沿代理中有11个在超过50%的场景中泄露信息。
RedactionBench 是一个手工标注的基准,用于评估大语言模型中的上下文个人身份信息(PII)脱敏,提出了 R-Score 指标,并表明上下文脱敏仍是一个未解决的问题。
本文介绍了 Minim,一个可信的本地代理,它通过上下文完整性来平衡任务必要性和敏感度得分,为基于LLM的代理执行UI观察的隐私感知最小化。在WebArena上的实验表明,它在保留任务关键信息的同时,减少了不相关的敏感信息泄露。
提出互补自蒸馏(SelfCI)方法,通过平衡效用与隐私来提升大语言模型的上下文完整性。在CI-RL和PrivacyLens基准测试上跨多个模型进行了评估。