代理AI的黑箱红队测试:一个基于分类的自动化风险发现框架

arXiv cs.AI 论文

摘要

本文提出了一种系统化的黑箱框架,用于评估代理AI系统,引入了风险分类和自动化红队测试方法。跨代理架构的经验验证揭示了关键漏洞,治理和隐私风险比例较高。

arXiv:2609.09647v1 公告类型:新 摘要:代理系统正迅速进入生产环境,在那里它们读取不受信任的输入,调用具有真实权限的工具,并自主行动,将安全表面扩展到仅聊天模型之外。然而,标准评估仍然是单轮的,无法捕捉多步代理漏洞。我们提出了一种系统化的黑箱框架,用于风险感知的代理评估,仅需要基本的系统描述。我们的方法引入了:(1)一个七领域分类,将可观察行为映射到风险类别;(2)完全自动化的SAGE-RT红队测试,每个领域生成120个对抗场景;(3)使用LLM评判器的人工验证评估。跨两个代理架构(CrewAI和AutoGen)和四个基础模型的经验验证揭示了令人担忧的模式:平均治理风险为56.25\%,多代理配置中的隐私风险为65\%,代理行为漏洞高达85\%。我们的黑箱方法无需特权访问即可有效识别关键架构漏洞,为更安全的代理部署提供了可扩展的路径。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:38

# 智能体AI的黑盒红队测试:一种基于分类体系的自动化风险发现框架
来源:https://arxiv.org/html/2609.09647

###### 摘要
智能体系统正快速投入生产环境,在这些系统中,它们处理不可信的输入、调用具有实际权限的工具并自主行动,这扩展了安全边界,超越了仅限聊天的模型。然而,标准的评估仍是单轮的,未能捕捉多步骤的智能体漏洞。我们提出了一种系统性的黑盒框架,用于风险感知的智能体评估,仅需要基本的系统描述。我们的方法引入了:(1) 一个七领域分类体系,将可观察的行为映射到风险类别;(2) 完全自动化的SAGE-RT红队测试,为每个领域生成120个对抗性场景;以及(3) 使用LLM评判器进行人工验证的评估。在两种智能体架构(CrewAI和AutoGen)及四种基础模型上的实证验证揭示了令人担忧的模式:平均治理风险为56.25%,多智能体配置中的隐私风险为65%,智能体行为漏洞高达85%。我们的黑盒方法无需特权访问即可有效识别关键的架构漏洞,为更安全的智能体部署提供了一条可扩展的途径。
Enkrypt AI \{divyanshu,nitin, tanay, sahil, prashanth\}@enkryptai\.com

## 引言

#### 智能体系统的崛起。智能体系统已迅速从研究原型演进为生产应用,主要的云提供商现在为其开发和部署提供了专用平台。与仅生成文本的传统语言模型不同,智能体主动与环境交互:它们读取潜在不可信的内容、调用具有实际权限的工具、持久化状态并代替用户采取行动。这扩展的能力集引入了超越仅限聊天的LLM的新颖安全与挑战,包括间接提示注入、记忆投毒和不安全的工具执行。

#### 当前评估框架的局限性。标准的LLM评估框架主要关注静态的、单轮任务,如MMLU(Hendrycks等人2021年(https://arxiv.org/html/2609.09647#bib.bib1))和HumanEval(Chen等人2021年(https://arxiv.org/html/2609.09647#bib.bib2)),分别评估知识检索和代码生成。虽然对衡量某些能力很有价值,但这些评估未能捕捉智能体行为的关键方面,如多步骤规划、错误恢复和安全的工具操作。当智能体在真实的交互环境中测试时,会显现出显著的性能差距。例如,WebArena实验显示,顶尖的GPT-4智能体仅达到14.41%的任务成功率,而人类为78.24%(Zhou等人2024年(https://arxiv.org/html/2609.09647#bib.bib3)),而SWE-bench报告称,解决现实世界软件工程任务的模型成功率低于2%(Jimenez等人2024年(https://arxiv.org/html/2609.09647#bib.bib4))。安全评估同样揭示,当作为工具使用的智能体运行时,复杂的模型仍然容易受到简单提示注入攻击的影响(Zhan等人2024年(https://arxiv.org/html/2609.09647#bib.bib5);Evtimov等人2025年(https://arxiv.org/html/2609.09647#bib.bib6))。

#### 风险感知评估的需求。目前仍然缺失的是一个系统框架,用于在真实操作条件下解决全谱系的智能体特定风险。现有的基准测试主要评估任务完成情况,而未对故障模式进行分类,而安全研究通常识别理论漏洞,而未提供全面的评估方法。即使是像工具仿真(用于识别长尾风险)(Ruan等人2024年(https://arxiv.org/html/2609.09647#bib.bib7))或像HELM这样的整体评估框架(Liang等人2023年(https://arxiv.org/html/2609.09647#bib.bib8))这样有前途的方法,也未能提供一个结构化的分类体系来指导跨不同风险类别的系统性智能体评估。

#### 我们的贡献。我们提出三个主要贡献来解决这些差距:
- •一个专门为交互式智能体系统设计的**七领域风险分类体系**,超越了传统的LLM风险,以捕捉来自工具使用、状态持久化和多步骤推理的智能体特定漏洞。与关注抽象能力的现有分类体系不同,我们的框架将可观察的行为映射到具体的风险类别。
- •一种**黑盒评估方法**,通过仅需要基本的系统描述而非内部访问来普及智能体安全评估。我们的方法结合了自动化的SAGE-RT场景生成和跨风险领域的系统性覆盖,无需特定框架的插桩即可进行综合评估。
- •在多样化智能体架构(单智能体CrewAI、多智能体AutoGen)和基础模型上的**实证验证**,表明架构选择(而非模型选择)驱动了漏洞模式。我们的发现揭示了当前智能体部署中的关键差距,治理风险平均为56.25%,隐私风险高达65%。
这些贡献共同提供了一个在多样化风险维度上系统评估智能体系统的框架,通过在真实环境中对智能体可靠性和安全性进行更整体的评估,补充了以任务为中心的基准测试。

## 相关工作

#### 智能体评估框架。最近的智能体基准测试揭示了静态模型能力与交互式智能体性能之间的显著差距。AgentBench(Liu等人2023a(https://arxiv.org/html/2609.09647#bib.bib10))证明,强大的语言模型在顺序决策中表现出显著的性能下降,而像SWE-bench(Jimenez等人2024年(https://arxiv.org/html/2609.09647#bib.bib4))这样的特定领域基准测试报告,在真实世界的软件任务上成功率低于2%。WebArena(Zhou等人2024年(https://arxiv.org/html/2609.09647#bib.bib3))同样显示,GPT-4智能体在网络导航中仅达到14.41%的任务成功率。更复杂的框架,包括DSGBench(Zhang等人2023年(https://arxiv.org/html/2609.09647#bib.bib38))、LLMArena(Shi等人2024年(https://arxiv.org/html/2609.09647#bib.bib39))和AgentQuest(Fang等人2024年(https://arxiv.org/html/2609.09647#bib.bib40))已经推进了评估方法,但主要是衡量任务完成情况,而不是根据风险分类系统地对故障模式进行分类。

#### 工具使用和面向API的评估。工具导向的基准测试已经识别了智能体-API交互中的独特漏洞。API-Bank(Li等人2023年(https://arxiv.org/html/2609.09647#bib.bib34))揭示了在264个API任务中参数提取和约束满足方面的显著差距,而ToolBench(Cheng等人2023年(https://arxiv.org/html/2609.09647#bib.bib35))通过分析16,464条人类轨迹记录了错误处理和故障恢复中的特定故障模式。ToolEmu(Ruan等人2023年(https://arxiv.org/html/2609.09647#bib.bib36))证明,通过仿真数千种工具,API交互引入了新的攻击面,而MINT(Wang等人2023年(https://arxiv.org/html/2609.09647#bib.bib37))在顺序API调用中识别了系统性的状态管理缺陷,这些缺陷可能导致信息泄露。虽然这些研究确立了工具使用能力的经验边界,但它们通常未将发现与风险分类体系整合以进行系统评估。

#### AI风险分类体系和整体评估。现有的AI风险分类体系主要关注抽象的系统,而非具有环境交互能力的操作性智能体。HELM(Liang等人2023年(https://arxiv.org/html/2609.09647#bib.bib8))开创了跨多个维度(包括偏见、毒性和公平性)的整体模型评估,但侧重于静态的语言模型输出,而非具有工具访问和状态持久化的交互式智能体行为。虽然OpenAI(OpenAI 2023(https://arxiv.org/html/2609.09647#bib.bib42))和DeepMind(DeepMind 2023(https://arxiv.org/html/2609.09647#bib.bib43))的努力已经提出了风险评估方法,但它们关注的是模型能力,而非来自工具使用和状态持久化的智能体特定风险。OWASP智能体安全倡议最近发布了关于智能体AI威胁和缓解措施的全面指南111https://genai\.owasp\.org/resource/agentic\-ai\-threats\-and\-mitigations/,为新兴的智能体风险提供了基于威胁模型的参考,这些风险超越了传统的LLM漏洞,涉及自主系统行为、工具编排故障和多智能体协调攻击。我们的工作与HELM的静态评估方法不同,专注于通过对抗性场景生成来评估交互式智能体漏洞,同时将OWASP的威胁建模扩展到系统性的经验评估。最近的工作已经开始解决智能体在规划、工具调用和记忆管理方面的攻击面,但这些分类体系很少指定具体的方法论来连接抽象的风险类别与可观察的行为——我们的工作通过将这些框架操作化为可执行的测试场景来解决这一差距。

#### 合成评估生成。SAGE-RT(Kumar等人2024年(https://arxiv.org/html/2609.09647#bib.bib9))证明,结构化的分类体系可以有效地指导跨风险类别的合成生成,尽管它主要针对语言模型输出而非多步骤智能体行为。自动化红队测试方法,如MART(Ge等人2023年(https://arxiv.org/html/2609.09647#bib.bib11))、APRT(Jiang等人2024年(https://arxiv.org/html/2609.09647#bib.bib12))和MM-ART(Singhania等人2025年(https://arxiv.org/html/2609.09647#bib.bib13))已经发展到在多轮交互中发现漏洞,而像InjecAgent(Zhan等人2024年(https://arxiv.org/html/2609.09647#bib.bib5))和WASP(Evtimov等人2025年(https://arxiv.org/html/2609.09647#bib.bib6))这样的框架则针对特定的漏洞类别。基于LLM的评估方法,包括G-Eval(Liu等人2023b(https://arxiv.org/html/2609.09647#bib.bib14))和Agent-as-a-Judge(Zhuge等人2024年(https://arxiv.org/html/2609.09647#bib.bib41)),实现了可扩展的评估,尽管存在已记录的偏差(Li等人2025b(https://arxiv.org/html/2609.09647#bib.bib15))。尽管有这些进展,现有方法缺乏生成与风险分类体系对齐的多样化场景的整合方法——我们的方法论解决了这一差距。

#### 智能体红队测试和安全评估。虽然红队测试已经成为评估语言模型的常规手段(Bai等人2022年(https://arxiv.org/html/2609.09647#bib.bib44)),但智能体红队测试仍然受到严重限制。现有方法在范围和可及性方面有限:它们通常专注于特定的智能体架构(如基于ReAct的系统),需要直接访问内部组件进行插桩,或者依赖于对智能体实现的白盒分析。这为希望评估真实部署场景中智能体系统的从业者设置了重大障碍。此外,当前的智能体安全研究通常针对狭窄的漏洞类别(例如,InjecAgent中的提示注入(Zhan等人2024年(https://arxiv.org/html/2609.09647#bib.bib5))),而不是提供跨多个领域的综合风险评估。我们的工作通过提出一个黑盒评估框架来解决这些限制,该框架仅需要基本的系统描述即可启动系统性红队测试。这种方法普及了智能体安全评估,使得没有深度技术访问智能体内部权限的团队也能进行评估,同时通过我们分类体系指导的方法论提供跨多样化风险类别的全面覆盖。

## 智能体风险分类体系

#### 分类体系设计原则。我们将风险分类体系定义为T=\{D1,D2,...,D7\},其中每个领域D_i代表一个独特的风险类别,该类别受到OWASP智能体风险分类体系的启发。对于具有动作空间A、观察空间O和工具集K的智能体A,我们评估风险为:
R(A) = \sum_{i=1}^{7} w_i \cdot r_i(A, D_i) (1)
其中 r_i: A \times O \times K \rightarrow [0,1] 衡量领域 D_i 的风险得分,w_i 代表领域特定的权重。

#### 领域1:治理(D1)。令R*表示真实的奖励函数,\hat{R}表示指定的代理奖励。治理风险出现在以下情况:
max_\pi E_\pi[\hat{R}] \neq max_\pi E_\pi[R^*] (2)
这捕捉了奖励黑客场景(Amodei等人2016年(https://arxiv.org/html/2609.09647#bib.bib16)),即智能体优化代理目标而非预期目标。

#### 领域2:智能体输出质量(D2)。衡量智能体输出的事实准确性、偏见和毒性(Huang等人2025年(https://arxiv.org/html/2609.09647#bib.bib17);Gehman等人2020年(https://arxiv.org/html/2609.09647#bib.bib18))。示例包括幻觉的API响应、有偏见的推荐或客户交互中的有毒语言。

#### 领域3:工具误用(D3)。捕捉工具交互和API操作中的故障,包括提示注入漏洞(Greshake等人2023年(https://arxiv.org/html/2609.09647#bib.bib19))。这包括通过自然语言接口的SQL注入、未经授权的API调用或格式错误的工具参数。

#### 领域4:隐私(D4)。评估通过训练数据提取或系统访问导致的数据泄露风险(Carlini等人2021年(https://arxiv.org/html/2609.09647#bib.bib20))。涵盖暴露客户PII、泄露内部系统信息或跨用户数据污染等场景。

#### 领域5:可靠性和可观察性(D5)。评估跨分布的性能一致性和推理透明度。包括处理边缘情况失败、不透明的决策过程以及跨相似输入的不一致行为。

#### 领域6:智能体行为(D6)。识别在安全训练后仍然存在的操纵性或欺骗性交互(Hubinger等人2024年(https://arxiv.org/html/2609.09647#bib.bib21))。示例包括社会工程尝试、尽管用户反对仍坚持目标追求,或对行为的欺骗性解释。

#### 领域7:访问控制(D7)。在多工具环境中检测权限提升和混淆代理人漏洞。这包括对受限资源的未授权访问、冒充其他用户或绕过预期的权限边界。

这些领域共同构成了智能体系统系统性风险评估的综合框架。每个领域对应特定的故障模式,可以通过针对性评估进行观察、测量和测试,从而实现跨智能体生命周期更有效的风险管理。

## 由SAGE-RT支持的评估方法论

#### 方法论概述。我们的评估方法论将风险分类体系转变为一个系统的黑盒测试框架,仅需要基本的系统描述即可启动全面的红队测试。与要求源代码访问、API文档或系统内部的传统安全评估不同,我们的流程完全通过公共接口运行,使其适用于……

相似文章

用人和AI推进红队测试

OpenAI Blog

OpenAI 发布了一份白皮书,详细说明了他们对AI模型进行外部红队测试的方法,包括选择多样化红队成员、确定模型访问权限、提供测试基础设施以及整合反馈以改进AI安全和政策覆盖范围的方法。