Agent Against Agent: 一种用于自动提示注入红队测试的智能体系统

Hugging Face Daily Papers 论文

摘要

本文介绍了 PIMiner,一种用于自动提示注入红队测试的智能体系统,它在训练期间构建策略库,并在测试时迁移到未见过的目标大语言模型上,对 Gemini-2.5-Pro、GPT-5.1 和 Claude-Sonnet-4.5 等模型实现了较高的攻击成功率。

提示注入对LLM智能体构成了重大安全风险。因此,高效且有效的红队测试至关重要,既用于评估这些风险,也用于收集训练数据以改进防御。现有最先进的提示注入红队测试方法主要依赖强化学习(RL),由此产生的攻击者模型往往难以泛化到新的目标LLM。在这项工作中,我们开发了PIMiner——一个用于提示注入红队测试的智能体系统。在训练阶段,PIMiner在一系列(数据集,目标模型)对上训练,并从零开始构建策略库。在测试阶段,学习到的策略库可直接迁移到之前未见过的目标LLM,无需额外训练。PIMiner对每个测试样本仅需向目标智能体进行少量查询(例如10次)。实验结果表明,PIMiner取得了强劲性能。在IPIArena上,它对Gemini-2.5-Pro的攻击成功率(ASR)达到76.2%,对GPT-5.1达到61.9%,对Claude-Sonnet-4.5达到42.9%。在AgentDojo上,它对Gemini-2.5-Pro的ASR达到86.7%,对GPT-5.1达到53.3%,对Claude-Sonnet-4.5达到40.0%。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:49

论文页面 - 智能体对抗智能体:用于自动提示注入红队测试的智能体系统

来源: https://huggingface.co/papers/2608.05108

摘要

提示注入对LLM智能体构成重大安全风险。因此,高效且有效的红队测试至关重要,既用于评估这些风险,也用于收集训练数据以改进防御。现有最先进的提示注入红队测试方法主要依赖强化学习(RL),所生成的攻击者模型往往难以泛化到新的目标LLM。在本工作中,我们开发了PIMiner,一个用于提示注入红队测试的智能体系统。在训练期间,PIMiner在一系列(数据集,目标模型)对上训练,并从零开始构建策略库。在测试时,学习到的策略库可以直接迁移到之前未见过的目标LLM,而无需额外训练。PIMiner每个测试样本仅需对目标智能体进行少量查询(例如10次)。实验结果表明PIMiner表现出色。在IPIArena上,它对Gemini-2.5-Pro达到76.2%的ASR,对GPT-5.1达到61.9%的ASR,对Claude-Sonnet-4.5达到42.9%的ASR。在AgentDojo上,它对Gemini-2.5-Pro达到86.7%的ASR,对GPT-5.1达到53.3%的ASR,对Claude-Sonnet-4.5达到40.0%的ASR。

查看 arXiv 页面 (https://arxiv.org/abs/2608.05108) 查看 PDF (https://arxiv.org/pdf/2608.05108) GitHub1 (https://github.com/wang-yanting/PIMiner) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05108)

引用该论文的模型 0

没有模型链接该论文

在模型 README.md 中引用 arxiv.org/abs/2608.05108,即可从本页面链接到该模型。

引用该论文的数据集 0

没有数据集链接该论文

在数据集 README.md 中引用 arxiv.org/abs/2608.05108,即可从本页面链接到该数据集。

引用该论文的 Space 0

没有 Space 链接该论文

在 Space README.md 中引用 arxiv.org/abs/2608.05108,即可从本页面链接到该 Space。

收录该论文的合集 0

没有合集收录该论文

将这篇论文添加到一个合集中 (https://huggingface.co/new-collection),即可从本页面链接到该合集。

相似文章

GPT-Red:通过规模化自我对弈实现自动化红队测试

Hugging Face Daily Papers

本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。

间接提示注入的见解(12分钟阅读)

TLDR AI

Zico Kolter 和 Matt Fredrikson,Gray Swan 的领导者及 AI 安全专家,讨论了 AI 红队测试的现状以及间接提示注入——这是 AI 代理的关键漏洞。他们解释了为何 AI 安全需要不同的思维模式,自动化红队测试如何超越人类,并介绍了用于对抗性测试的工具 Shade。