Agent Against Agent: 一种用于自动提示注入红队测试的智能体系统
摘要
本文介绍了 PIMiner,一种用于自动提示注入红队测试的智能体系统,它在训练期间构建策略库,并在测试时迁移到未见过的目标大语言模型上,对 Gemini-2.5-Pro、GPT-5.1 和 Claude-Sonnet-4.5 等模型实现了较高的攻击成功率。
查看缓存全文
缓存时间: 2026/08/06 05:49
论文页面 - 智能体对抗智能体:用于自动提示注入红队测试的智能体系统
来源: https://huggingface.co/papers/2608.05108
摘要
提示注入对LLM智能体构成重大安全风险。因此,高效且有效的红队测试至关重要,既用于评估这些风险,也用于收集训练数据以改进防御。现有最先进的提示注入红队测试方法主要依赖强化学习(RL),所生成的攻击者模型往往难以泛化到新的目标LLM。在本工作中,我们开发了PIMiner,一个用于提示注入红队测试的智能体系统。在训练期间,PIMiner在一系列(数据集,目标模型)对上训练,并从零开始构建策略库。在测试时,学习到的策略库可以直接迁移到之前未见过的目标LLM,而无需额外训练。PIMiner每个测试样本仅需对目标智能体进行少量查询(例如10次)。实验结果表明PIMiner表现出色。在IPIArena上,它对Gemini-2.5-Pro达到76.2%的ASR,对GPT-5.1达到61.9%的ASR,对Claude-Sonnet-4.5达到42.9%的ASR。在AgentDojo上,它对Gemini-2.5-Pro达到86.7%的ASR,对GPT-5.1达到53.3%的ASR,对Claude-Sonnet-4.5达到40.0%的ASR。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05108) 查看 PDF (https://arxiv.org/pdf/2608.05108) GitHub1 (https://github.com/wang-yanting/PIMiner) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05108)
引用该论文的模型 0
没有模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2608.05108,即可从本页面链接到该模型。
引用该论文的数据集 0
没有数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2608.05108,即可从本页面链接到该数据集。
引用该论文的 Space 0
没有 Space 链接该论文
在 Space README.md 中引用 arxiv.org/abs/2608.05108,即可从本页面链接到该 Space。
收录该论文的合集 0
没有合集收录该论文
将这篇论文添加到一个合集中 (https://huggingface.co/new-collection),即可从本页面链接到该合集。
相似文章
GPT-Red:通过规模化自我对弈实现自动化红队测试
本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。
@OpenAI: 推出GPT-Red —— 一个内部自动化红队成员,致力于大规模发现我们模型的提示注入漏洞……
OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。
我对AI代理进行了红队测试,使用隐藏的提示注入。一个前沿模型完美完成了任务,并且将数据泄露给了攻击者,5/5次运行。
一次红队测试发现,一个前沿AI代理模型尽管受到了隐藏的提示注入,但仍成功完成了任务,并在全部五次测试运行中将数据泄露给了攻击者。
@MAXdeg0: 这极度危险 发现了一个无需人类输入的AI红队 PentAGI。扫描器 —> 利用器 —> 报告器 —>…
一个名为PentAGI的自主AI红队系统使用三个代理来扫描、利用和报告漏洞,使严肃的安全测试更加易用,同时强调仅限授权使用。
间接提示注入的见解(12分钟阅读)
Zico Kolter 和 Matt Fredrikson,Gray Swan 的领导者及 AI 安全专家,讨论了 AI 红队测试的现状以及间接提示注入——这是 AI 代理的关键漏洞。他们解释了为何 AI 安全需要不同的思维模式,自动化红队测试如何超越人类,并介绍了用于对抗性测试的工具 Shade。