@rohanpaul_ai: 恶意代理工具无需读取内存或文件即可窃取上下文:它能诱导模型将上下文作为工具参数发送……

X AI KOLs Timeline 论文

摘要

本文介绍了ContextLeak,一种利用恶意工具描述从LLM代理中窃取敏感上下文的攻击方法,在窃取用户提示和对话历史方面实现了高成功率。

恶意代理工具可以在完全不读取内存或文件的情况下窃取上下文:它能说服模型将上下文作为工具参数发送出去。 本文表明,工具描述可以成为数据泄露的渠道。 ContextLeak使用强化学习训练一个攻击LLM,生成使代理选择恶意工具并包含敏感运行时数据(如用户提示、对话历史或已安装工具列表)的工具名称和描述。 在论文的默认评估中,恶意工具在用户提示攻击中被选中92%,在对话历史攻击中被选中89%,一旦被选中,提示重建几乎完美。 该攻击可以跨后端模型迁移,在Claude Sonnet 4.6的Claude Code测试中,仅针对开源代理训练的版本在100个案例中有22个被选中;当被选中时,提取几乎完整。 – arxiv. org/abs/2608.27800 标题:"ContextLeak:通过恶意工具窃取LLM代理上下文"
查看原文
查看缓存全文

缓存时间: 2026/09/01 19:44

恶意代理工具无需读取内存或文件即可窃取上下文:它能够诱使模型将上下文作为工具参数发送。

本文指出,工具描述可能成为数据渗出通道。

ContextLeak通过强化学习训练攻击型大语言模型,生成能诱使代理选择恶意工具的工具名称与描述,并将用户提示词、对话历史记录或已安装工具列表等敏感运行时数据包含在内。

在论文默认评估中,该攻击对92%的用户提示词攻击和89%的对话历史记录攻击成功选定恶意工具,一旦选定,提示词重建准确率接近100%。

该攻击可跨后端模型迁移。在Claude Code测试中,针对Claude Sonnet 4.6的评估显示,仅通过开源代理训练的攻击版本在100次测试中被选中22次;一旦选中,数据提取近乎完全。

– arxiv.org/abs/2608.27800

标题:《ContextLeak:通过恶意工具渗出大语言模型代理上下文》

相似文章

语言模型中的无意上下文泄露

arXiv cs.LG

本研究探讨了语言模型上下文窗口中的敏感信息如何意外泄露至输出,使得通过新攻击方法重建秘密成为可能,实验结果表明在多款专有模型中泄露问题显著。

窃取AI推理痕迹 (2分钟阅读)

TLDR AI

研究揭露了LLM API加密推理痕迹中的漏洞,使攻击者能够提取专有模型推理、个人数据,并实现恶意提示注入。

从专有LLM API窃取推理痕迹

Hugging Face Daily Papers

一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。