@rohanpaul_ai: 恶意代理工具无需读取内存或文件即可窃取上下文:它能诱导模型将上下文作为工具参数发送……
摘要
本文介绍了ContextLeak,一种利用恶意工具描述从LLM代理中窃取敏感上下文的攻击方法,在窃取用户提示和对话历史方面实现了高成功率。
查看缓存全文
缓存时间: 2026/09/01 19:44
恶意代理工具无需读取内存或文件即可窃取上下文:它能够诱使模型将上下文作为工具参数发送。
本文指出,工具描述可能成为数据渗出通道。
ContextLeak通过强化学习训练攻击型大语言模型,生成能诱使代理选择恶意工具的工具名称与描述,并将用户提示词、对话历史记录或已安装工具列表等敏感运行时数据包含在内。
在论文默认评估中,该攻击对92%的用户提示词攻击和89%的对话历史记录攻击成功选定恶意工具,一旦选定,提示词重建准确率接近100%。
该攻击可跨后端模型迁移。在Claude Code测试中,针对Claude Sonnet 4.6的评估显示,仅通过开源代理训练的攻击版本在100次测试中被选中22次;一旦选中,数据提取近乎完全。
– arxiv.org/abs/2608.27800
标题:《ContextLeak:通过恶意工具渗出大语言模型代理上下文》
相似文章
语言模型中的无意上下文泄露
本研究探讨了语言模型上下文窗口中的敏感信息如何意外泄露至输出,使得通过新攻击方法重建秘密成为可能,实验结果表明在多款专有模型中泄露问题显著。
窃取AI推理痕迹 (2分钟阅读)
研究揭露了LLM API加密推理痕迹中的漏洞,使攻击者能够提取专有模型推理、个人数据,并实现恶意提示注入。
当智能体记忆过多:针对大语言模型智能体的记忆投毒攻击
本文介绍了GhostWriter,一种新颖的攻击向量,利用基于大语言模型的个人智能体的记忆子系统来毒化其记忆存储,实现了高注入率和激活率。作者提出了AM-Sentry防御机制,在保持智能体实用性的同时显著降低攻击成功率。
@rohanpaul_ai: 非常重要的工作。模型可能看起来有罪,但实际上,真正的失败往往始于其周围的上下文环境……
这项研究发现,AI代理通常失败是由于糟糕的上下文(指令、工具、证据等)而非模型本身,并提出一个跨七个维度的上下文评分系统,该系统与行为分数无关。从模糊的上下文切换到结构化的上下文,在300次测试中显著提高了代理的性能。
从专有LLM API窃取推理痕迹
一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。