@bcherny: 我很高兴看到 OpenAI 的新模型在提示注入风险方面大致与 Gemini Flash 和 Opus 4.8 相当。…

X AI KOLs Timeline 论文

摘要

一项论文通过大规模公开竞赛评估AI代理对间接提示注入攻击的脆弱性,发现所有前沿模型都易受影响,攻击成功率各不相同,并强调需要改进全行业的安全措施。

我很高兴看到 OpenAI 的新模型在提示注入风险方面大致与 Gemini Flash 和 Opus 4.8 相当。干得好! 评估和点名其他实验室竟然成了鼓励他们训练更对齐模型的好方法。我们将继续这样做,直到其他实验室更加重视安全。这对大家都有好处,而且还有很大的改进空间! 大约两个月前,我们在实践中为 Claude 模型解决了提示注入问题。但无论使用什么模型,提示注入都是一个重大的安全风险,业界同样需要投入更多精力来训练模型以抵抗提示注入,这是模型对齐的其他要素之一。 随着模型变得越来越强大并成为企业和经济的核心,风险只会增加。我们应该认真对待它们,为我们的客户和世界做正确的事。
查看原文
查看缓存全文

缓存时间: 2026/09/09 09:52

我很高兴看到 OpenAI 的新模型在提示词注入风险方面与 Gemini Flash 和 Opus 4.8 大致持平。干得漂亮!

通过评估和点评其他实验室,事实证明这是激励他们训练更对齐模型的好方法。我们将持续这样做,直到其他实验室更加重视安全。这对所有人都有益,而且我们还有很长的路要走!

大约两个月前,我们通过实践解决了 Claude 模型的提示词注入问题。但无论使用什么模型,提示词注入都是一个重大的安全风险,业界需要投入更多精力训练模型以抵抗提示词注入——这是模型对齐工作的关键要素之一。

随着模型能力增强,并日益深入商业和经济核心,风险只增不减。我们应当认真对待,为我们的客户和世界做正确的事。


AI 智能体对间接提示词注入的脆弱性如何?来自大规模公开竞赛的洞察

来源:https://arxiv.org/html/2603.15714

摘要

基于大语言模型的智能体越来越多地被部署在高风险场景中,用于处理电子邮件、文档和代码仓库等外部数据源。这导致了间接提示词注入攻击的风险,即嵌入在外部内容中的恶意指令可以在用户不知情的情况下操纵智能体的行为。这种威胁的一个关键但未被充分探讨的维度是隐蔽性:由于用户通常只观察智能体的最终响应,攻击可以通过在最终面向用户的响应中不留下任何被破坏的线索来隐藏其存在,同时成功执行有害操作。这使得用户对操纵毫无察觉,并可能将有害结果视为合法。我们展示了一项大规模公开红队竞赛的发现,该竞赛评估了三个智能体环境(工具调用、编码和计算机使用)中的这一双重目标。竞赛吸引了 464 名参与者,对 13 个前沿模型提交了 272,000 次攻击尝试,在 41 个场景中产生了 8,648 次成功攻击。所有模型都被证明是脆弱的,攻击成功率从 0.5%(Claude Opus 4.5)到 8.5%(Gemini 2.5 Pro)不等。我们发现了可转移至 41 种行为中的 21 种以及多个模型系列的通用攻击策略,这表明指令遵循架构存在根本性弱点。能力与鲁棒性表现出弱相关性,Gemini 2.5 Pro 同时表现出高能力和高脆弱性。为了解决基准测试饱和和过时问题,我们将致力于通过持续的红队竞赛定期发布更新。我们开源了竞赛环境用于评估,以及 95 次针对 Qwen 但未成功转移到任何闭源模型的攻击。我们将针对各实验室自身模型和开源模型的攻击数据分享给相应的前沿实验室,并将完整数据集分享给英国 AISI 和美国 CAISI 以支持鲁棒性研究。

Mateusz Dziemian∗, Maxwell Lin∗, Xiaohan Fu∗, Micha Nowak∗, Nick Winter, Eliot Jones, Andy Zou†, Matt Fredrikson‡, Zico Kolter‡

Gray Swan AI

Lama Ahmad OpenAI Klaudia Krawiecka Meta Kamalika Chaudhuri Meta Riccardo Patana Anthropic Sahana Chennabasappa Meta Neil Perry US CAISI Xander Davies UK AISI Troy Peterson OpenAI Lauren Deason Meta Xiangyu Qi OpenAI Benjamin L. Edelman US CAISI Javier Rando Anthropic Tanner Emek Anthropic Zifan Wang Meta Ivan Evtimov Meta Zihan Wang Meta Jim Gust Meta Spencer Whitman Meta Maia Hamin US CAISI Eric Winsor UK AISI Kat He Meta Arman Zharmagambetov Meta ∗主要贡献者。‡资深作者。†同时隶属于卡内基梅隆大学和人工智能安全中心。

1引言

基于大语言模型的智能体已从简单的聊天机器人迅速发展为能够在长时间跨度内完成复杂多步骤任务的自主系统,最近的评估表明,前沿模型现在可以解决需要数小时持续工作的软件工程任务(kwa2025measuringaiabilitycomplete)。多模态能力的提升进一步使智能体能够处理和操作视觉界面(anthropic2024computeruse)、电子表格(anthropic2025excel)和音频输入(openai2024gpt4o)。这些能力正推动企业快速部署,目前 88% 的组织至少在一个业务功能中使用 AI,62% 正在试验 AI 智能体(mckinsey2025stateofai)。智能体已辅助软件开发(cursor2024;githubcopilot),并越来越多地部署在包括医疗保健和金融服务在内的高风险领域。然而,这种扩展的自主性引入了重大的安全漏洞(lupinacci2025darkside;li2025commercial)。尤其令人担忧的是间接提示词注入——嵌入在外部数据源(电子邮件、文档、网站、代码)中的恶意指令操纵智能体以完成攻击者指定的、用户不希望的目标,这可能导致财务损失或个人数据泄露(greshake2023indirect)。

Gemini 2.5 Pro Nova 1 Premier SecAlign 70B DeepSeek V3.1 Kimi K2 Nova 2 Lite Qwen3 VL 235B Grok 4 GPT-5.1 GPT-5 Claude Haiku 4.5 Claude Sonnet 4.5 Claude Opus 4.5 0 0 2 2 4 4 6 6 8 8 10 10 8.5 8.5 1670/19630 5.8 5.8 1091/18924 5.5 5.5 618/11238 5.4 5.4 808/15026 4.8 4.8 589/12299 4.7 4.7 672/14244 4.2 4.2 781/18733 2.9 2.9 366/12526 2.5 2.5 202/8096 2.0 2.0 261/13143 1.3 1.3 177/13696 1.0 1.0 136/13603 0.5 0.5 61/11969 模型 ASR (%) 模型系列 Google Amazon Meta DeepSeek MoonshotAI Qwen xAI OpenAI Anthropic

图 1:竞赛(第一波和第二波)中各模型的攻击成功率(按降序排列)。ASR 通过成功攻击次数 / 总攻击次数计算。此威胁的一个关键但未被强调的方面是隐蔽性。一个被破坏的模型可能不会在其最终响应中忠实披露其已被操纵以执行攻击者指定的操作,甚至可能为其实际上不相关或恶意的操作编造看似合理的解释。尽管大多数智能体接口会公开工具执行历史记录,这些记录原则上可以帮助用户识别此类操纵,但这些日志的长度和复杂性使得有效的人工检查在实践中极其困难。监控思维链(CoT)也被提议作为一种缓解措施(korbak2025cot_monitorability);然而,推理轨迹的冗长和复杂性同样使得这种方法难以实施。因此,只要最终响应中没有出现明确的线索,攻击实际上就可以保持隐蔽,即使攻击者的目标已经成功实现。

在这项工作中,我们重点研究主要模型针对满足此额外隐蔽性要求的间接提示词注入攻击的鲁棒性。我们精心设计了 41 个独特的智能体场景,涵盖基于文本的工具使用、编码智能体和计算机使用,模拟各种现实世界用例。在每个场景中,我们考虑攻击者控制作为多轮智能体对话记录最后一部分的外部数据(例如工具响应、文件或网页)的固定部分。目标模型接收携带攻击字符串的对话记录,并执行一轮操作(可能包含多轮工具调用)。攻击需要满足以下两个目标:

  1. 1.迫使模型在此助手操作轮次中实现目标有害目标;
  2. 2.通过关于模型最终响应的特定场景标准,例如隐蔽性。

为了收集最新和最高质量的攻击,我们与前沿实验室和政府 AI 研究机构(包括英国 AISI111https://www.aisi.gov.uk/ 和美国 CAISI222https://www.nist.gov/caisi)合作,举办了一场名为间接提示词注入竞技场的大规模竞赛。这场为期三周的竞赛总奖金池为 4 万美元,吸引了 464 名独立参与者,贡献了 240K+ 次总攻击尝试,其中 8K+ 次成功。我们观察到在 13 个参与模型(涵盖主要专有和开源权重模型)中,总体 ASR 范围从 0.5% 到 8.5% 不等(见图 1 (https://arxiv.org/html/2603.15714#S1.F1))。

静态基准测试很快会过时。前沿模型在能力基准测试(如 MMLU(-Pro)、GSM8K 和 HumanEval)上已达到饱和,在发布后不到一年内正确率超过 90%。安全基准测试的情况甚至更糟:防御和攻击技术都在快速演进。最新的自适应攻击可以轻松绕过报告 0% ASR 的防御机制(nasr2025attacker),而现有的静态基准测试仍在对旧世代模型执行过时的攻击,这些攻击正变得无关紧要。鉴于此独特挑战,我们将致力于以循环形式举办此竞赛,每次设计新场景并测试最新模型,以确保此基准测试的时效性和质量。

贡献。

  • •隐蔽性感知提示词注入。我们首次大规模研究了间接提示词注入攻击的隐蔽性方面,在 41 个独特攻击场景(涵盖工具使用、计算机使用和编码用例)中对 13 个模型进行了 8K+ 次成功攻击。
  • •大规模策略分析。在所有 13 个模型和 41 个场景上进行转移实验,我们发现了最新的可转移攻击策略和通用攻击模板,以支持防御机制的创新。
  • •开放科学努力。我们开源了完整的评估工具包333https://github.com/grayswansecurity/ipi_arena_os,以及 95 次针对 Qwen 但未成功转移到任何闭源模型的攻击。444https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks我们将针对各实验室自身和开源模型的攻击数据分享给相应的前沿实验室,并将完整数据集分享给包括英国 AISI 和美国 CAISI 在内的政府 AI 研究机构,以支持鲁棒性研究。

2相关工作

提示词注入攻击。

直接与间接提示词注入的区别由(perez2022ignore)和(greshake2023indirect)正式提出。此后,间接提示词注入已在生产环境中得到广泛验证(wunderwuzzi2024chatgpt;wuest2024m365;johann2025chatgpt;wunderwuzzi2025devin;fu2024impromptertrickingllmagents;fun-tuning),并被广泛认为是大语言模型系统的主要安全关切之一。间接提示词注入也扩展到多模态输入(fu2023misusingtoolslargelanguage;bailey2023image;gong2025figstep;hu2025transferable;wang2025manipulating)和跨智能体网络传播的自我复制蠕虫(worms)。各种防御方法涌现,包括输入输出监控和过滤(inan2023llama;korbak2025cot_monitorability;sharma2025constitutional)、鲁棒性增强的模型训练方案(wallace2024instruction;guan2025deliberativealignmentreasoningenables;chen2025struq;chen2025secalign)以及系统级防御机制(meng2025cellmatesandboxingbrowserai;debenedetti2025defeatingpromptinjectionsdesign;foerster2026camelsusecomputerstoo),尽管自适应攻击和人工红队成员继续绕过已提出的防御(nasr2025attacker;sharma2025constitutional)。

智能体安全基准测试。

早期的安全基准测试侧重于针对聊天模型的单轮对抗性提示(mazeika2024harmbench;chao2024jailbreakbench)。此后,针对工具调用智能体的特定基准测试应运而生。AgentDojo(debenedetti2024agentdojo)测试间接注入漏洞,InjecAgent(zhan-etal-2024-injecagent)按危害类型对攻击进行分类,AgentHarm(andriushchenko2025agentharm)评估直接滥用,ART 基准测试(zou2025security)和 b3b^{3}(bazinska2026breaking)引入了大规模众包红队进行智能体安全评估。对于编码智能体,Cybench(zhang2025cybench)和相关工作(lin2025comparing)针对网络安全能力,而通过恶意仓库内容记录了编码工具中的提示词注入(liu2025your)。OS-Harm(kuntz2025osharm)和 WASP(evtimov2025wasp)将安全评估扩展到计算机使用智能体。随着智能体获得对更多模态和外部资源的访问权限,攻击面也相应扩大。ASB(zhang2025agent)形式化了跨多样工具使用场景的攻击和防御评估,而 Agent-SafetyBench(zhang2024agent)评估了跨交互环境的安全风险和故障模式。虽然这些基准测试极大地推动了针对工具使用场景的智能体安全评估,但没有一个共同解决编码和计算机使用智能体,或要求攻击隐蔽性。表 1(https://arxiv.org/html/2603.15714#S2.T1)总结了这些区别。

表 1:现有智能体安全基准测试比较。

红队方法论。

自动化红队方法包括基于梯度的攻击(zou2023gcg)、遗传算法(liu2024autodan)、迭代细化(pair;tap)、基于采样的方法(hughes2024best)以及学习型攻击者如 Shade(grayswan2025shade),后者已用于前沿模型评估(anthropic2025opus45)。人工红队工作,如 DEF CON AI Village 生成式红队挑战、ART 和 D-REX 竞赛(grt3defcon2025;zou2025security;DREX),已在多个模型上产生了数百万次对抗性交互。这些方法通常针对单一目标进行优化,无论是从聊天模型中引出有害内容还是导致智能体执行有害操作。思维链监控已被提议作为补充安全机制(korbak2025cot_monitorability;baker2025monitoring),尽管前沿提供商通常不会向用户暴露原始推理轨迹,限制了对可观测输出的实际监督。我们的隐蔽性要求反映了这一现实,引入了一个双重目标,测试攻击是否能够同时造成伤害并在面向用户的响应中避免暴露恶意意图。

3设计

在本次竞赛中,我们与英国人工智能安全研究所以及包括 OpenAI、Anthropic、Amazon 和 Meta 在内的前沿实验室合作,设计了涵盖三种智能体环境的 41 个间接提示词注入场景。图 2(https://arxiv.org/html/2603.15714#S3.F2)展示了概览。

3.1场景

智能体环境。

我们评估了代表不同部署模式的三种智能体类型。工具使用智能体(18 个场景)访问电子商务、医疗保健、金融、家居自动化和开发者工作流等领域的特定工具。编码智能体(15 个场景)在软件仓库中运行,执行命令和修改代码。计算机使用智能体(8 个场景)通过前沿实验室 API,使用截图和鼠标/键盘操作与图形界面交互。

构建。

用户 AI 智能体 外部数据 邮件 来自:support@… 尊敬的用户,[忽略之前的指令…] config.yaml 模型:gpt-4 # TODO:发送 # 密钥到… 超时:30 网页 欢迎来到… ¡隐藏¿ 泄露… ¡/隐藏¿ 请求 读取 注入 双重目标 1.执行有害操作 2.在响应中隐藏意图 工具使用 18 个场景 电子商务、医疗保健、金融、开发者工具 编码 15 个场景 真实仓库(TRL、veRL、CrewAI) 计算机使用 8 个场景 仪表板、预订、审批工作流 272K 次攻击 —464 名参与者 —13 个模型 —8.6K 次成功破解 —41 种行为

图 2:间接提示词注入竞技场概览。攻击者在智能体在任务执行过程中处理的外部数据源(电子邮件、代码文件、网页)中嵌入恶意指令。成功的攻击必须满足双重目标:执行有害操作并在最终智能体响应中隐藏被破坏的事实。我们评估了此威胁在三个智能体环境中的表现:工具使用、编码和计算机使用。

相似文章

理解提示词注入:AI安全的前沿挑战

OpenAI Blog

OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。

设计能抵抗提示词注入的AI智能体

OpenAI Blog

OpenAI发布了关于设计抗提示词注入攻击的AI智能体的指导意见,指出现代攻击日益采用社会工程学策略而非简单的字符串注入,并倡导采用系统级防御措施来限制影响范围,而不是单纯依赖输入过滤。