提示注入攻击正在挫败AI黑客代理

Wired 新闻

摘要

来自Tracebit的研究人员开发了“上下文炸弹”技术,该技术通过在敏感数据旁放置提示注入来触发AI黑客代理的拒绝机制,从而显著降低攻击成功率。

“上下文炸弹”诱使恶意AI代理在造成伤害前自行关闭。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:24

# 提示注入攻击正在挫败AI黑客代理 来源:https://www.wired.com/story/prompt-injection-attacks-are-thwarting-ai-hacking-agents/ 提示注入——攻击者嵌入内容中、诱使大语言模型遵循的恶意指令——已成为攻击者将AI平台反噬用户的常用工具。一句巧妙嵌入邮件或日历邀请中的指令,往往足以让LLM泄露敏感数据或执行其他有害行为。 如今,防御者也开始拥抱提示注入。 来自Tracebit(https://tracebit.com/)的研究人员周一表示(https://agentic.tracebit.com/context-bombs/),他们发现将提示注入与存储在亚马逊云服务上的密码、加密密钥及其他密钥放在一起,往往足以阻止来自AI黑客代理的攻击。这些提示指示攻击LLM执行其安全护栏所禁止的操作——安全护栏是AI开发者为防止LLM采取有害行为而设立的屏障。LLM会因此关闭。 例如,一个提示命令LLM提供开发可吸入性炭疽孢子的步骤,或者在来自中国开发者的LLM案例中,提及1989年天安门广场的标志性“坦克人”。一旦LLM遇到这些被禁止的命令,它就不再遵循其现有指令。研究人员将这种技术命名为“上下文炸弹”。 “最终,我们是在上下文中触发了一个拒绝机制,”Tracebit联合创始人兼CEO Andy Smith在解释这一命名选择时说。“我们试图捕捉的事实是,这会产生强烈、尖锐的效果,且对代理来说难以恢复。一旦这些内容进入它们的上下文,它们就会持续拒绝。” Tracebit表示,初步测试表明上下文炸弹潜力巨大。他们测试了Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro和Kimi 2.6,指示它们执行常规开发者任务,导致模型列举资源并偶然发现被植入的字符串。他们在模拟的AWS环境中运行这些模型。 “在五个领先模型和152次攻击运行中,将其中一个字符串植入诱饵密钥,将使代理完全获得账户管理员权限的比例从57%降至5%,完全沦陷(即代理还为自己留下了持久立足点)的比例从36%降至1%,”周一的帖子报告称。“我们测试中最强大的代理Opus 4.8,在面对上下文炸弹时,从93%的运行中获得管理员权限,变成每次都失败。” 五个模型平均,152次运行的结果包括: - 管理员权限提升从57%降至5% - 管理员权限提升附带持久立足点从36%降至1% - 实现任何攻击路径的运行从91%降至15% - 平均每次运行从成功完成1.53条路径降至仅0.16条 - 没有一次运行能在不至少触发一次金丝雀检测的情况下完成攻击路径 这项研究基于5月时的发现,当时Tracebit引入了一种方法(https://agentic.tracebit.com/),让防御者能在其基础设施受到AI代理对手攻击时收到警告。该方法以AWS资源的形式呈现,这些资源看起来像服务于合法目的,但实际上完全未被使用。它们与正在使用的资源相邻。当代理AI探测它们时,防御者会收到警报。就像进入煤矿的“金丝雀”一样,这些资源让防御者能在威胁造成致命后果前发现它。 Tracebit金丝雀平均在攻击开始后8分钟内发出警报。开发上下文炸弹的动机源于需要一种能阻止攻击而非仅仅警告攻击的方法。在实验中,代理模型平均需要14分钟才能升级到管理员控制权。这6分钟的先发制人时间窗口令人不安地紧迫。 攻击者已经在利用提示注入关闭网络内的AI防御。例如,安全公司Socket的研究人员上月挖出(https://socket.dev/blog/mini-shai-hulud-miasma-and-hades-worms-target-bioinformatics-and-mcp-developers-via-malicious)了一个LLM代理,它指示目标LLM提供制造核弹或生物武器的指令。这些注入旨在关闭AI辅助的恶意软件分析。Check Point的研究人员发现了一个类似的(https://research.checkpoint.com/2025/ai-evasion-prompt-injection/)恶意软件原型。 上下文炸弹似乎是已知第一个防御者扭转局面的案例。 “据我所知,我还没见过其他人将这种技术用于防御,”加州大学圣地亚哥分校专攻AI安全的教授Earlence Fernandes在接受采访时说。他说自己也曾尝试类似方法,尽管背景略有不同。“我曾想成为第一个,但看来这些人抢先一步了!” 迄今为止,还没有已知的方法能解决提示注入的根本原因。这使得开发者别无选择,只能构建精心设计的安全护栏,防止注入的提示迫使LLM失控。防御者现在可能找到了利用这个棘手问题为自己谋利的方法。 *本文最初发表于 **Ars Technica(https://arstechnica.com/security/2026/07/now-defenders-are-embracing-the-prompt-injection-too/)*。

相似文章

如今,防御者也开始采用提示注入

Ars Technica

Tracebit 推出了‘context bombing’技术,通过将提示注入作为防御诱饵来阻止AI黑客代理,在领先LLM的测试中,将管理员被入侵率从57%降至5%。

理解提示词注入:AI安全的前沿挑战

OpenAI Blog

OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。

设计能抵抗提示词注入的AI智能体

OpenAI Blog

OpenAI发布了关于设计抗提示词注入攻击的AI智能体的指导意见,指出现代攻击日益采用社会工程学策略而非简单的字符串注入,并倡导采用系统级防御措施来限制影响范围,而不是单纯依赖输入过滤。