智能体安全:LLM驱动渗透测试工具、失败模式与设计规律的系统化研究
摘要
本文通过评估LLM驱动的渗透测试工具、识别重复出现的失败模式,并推导自主安全系统的量化设计规律,对智能体安全进行了系统化研究。
arXiv:2608.21423v1 公告类型:新研究
摘要:智能体安全利用大语言模型代理来规划、调度和解释安全工具。随着这些系统从演示阶段迈向部署产品,从业者反复遭遇相同的操作故障。我们通过对十种广泛使用的静态、动态、云端、编排及AI红队测试工具进行实地评估,系统化了这些失败模式。我们引入了四维“集成摩擦指数”,将一次性工程成本与重复性的组织、法律及维护成本区分开来。进而推导出解释重复失败模式的量化规律。通过将智能体安全系统建模为由确定性中介封装的随机LLM策略,我们发现长期会话的存留证据会随阶段数量增加而丢失,而短期子智能体会根据原始证据与其摘要的压缩比来延长可用时间窗口。研究表明,两阶段判定级联会放大评分器的似然比,但当评分器错误相关时,其收益甚微。我们将不可评估的结果视为攻击失败,会导致下游测量偏向规避性与高危响应。我们把规划者与执行者的模型路由形式化为背包问题,并推导出重尾工具的闭式执行上限:η* = α v/c。最后,我们解释了为何作用域与预算约束不能委派给系统提示:提示无法限制实际执行的内容。我们实现的Inspectra平台作为工作实例,其机制被标注为已交付、部分完成或计划中,包括那些未能奏效的部分。
查看缓存全文
缓存时间: 2026/08/25 04:11
# LLM驱动渗透测试的工具系统化、失败模式与设计法则
来源:https://arxiv.org/html/2608.21423
## 智能体安全:LLM驱动渗透测试的工具系统化、失败模式与设计法则
致谢:I. M. Noumi 任职于孟加拉国达卡 Ahsanullah 理工大学计算机科学与工程系。
致谢:T. A. Nowshin 任职于孟加拉国达卡 BRAC 大学计算机科学与工程系。
致谢:M. M. H. B. Nipu 任职于孟加拉国达卡 北方大学电气与计算机工程系。
致谢:M. S. Mahmood 任职于美国密苏里州斯普林菲尔德 密苏里州立大学计算机科学系(邮编 65897)。
致谢:M. Jakir Hossain 任职于马来西亚马六甲(邮编 75450) 多媒体大学工程技术学院人工智能卓越中心高级分析中心(IEEE 高级会员)。
致谢:M. F. Mridha 任职于孟加拉国达卡 美国国际大学孟加拉分校计算机科学系(IEEE 高级会员)。
Tarannum Ahmed Nowshin、Md. Mehedi Hasan Bhuiyan Nipu、Mohammad Sakib Mahmood、Md. Jakir Hossain 与 M. F. Mridha。
###### 摘要
智能体安全——使用大型语言模型代理来规划、调度和解释安全工具——在两年内已从演示发展为已部署的产品,而现在进入该领域的从业者正在按相同的顺序重新发现相同的失败。本文基于实践评估对该领域进行了系统化:我们评估了十种广泛使用的静态、动态、云、编排和AI红队工具在无人值守管道中的使用情况,从一次性工程成本与周期性组织、法律和维护成本分离的四个维度——集成摩擦指数——对每个工具进行评分,并编目了反复出现的失败模式。随后我们表明,这些失败源于少数几个量化规律性,这些规律以封闭形式推导和表述。
将智能体安全系统建模为由确定性中介封装的随机LLM策略,我们表明长时间运行的会话丢失常驻证据的速率与阶段数成反比,因此将管道分割成短期子代理可将可用范围恰好延长原始证据与其摘要之间的压缩比;两级判决级联将其两个评分器的似然比相乘,是解决红队评分器噪声的唯一经济方法,但一旦评分器的错误相关,该方法就会退化为单级;将评分器无法评估的结果记录为“攻击失败”会偏置所有下游数据,且恰恰在最具规避性、最严重的响应上发生这种偏置;在昂贵的规划层模型与廉价的工作层模型之间路由是一个背包问题,其教科书式解决方案恢复了大多数团队通过试错已达到的规划者/工作者划分;对于运行时呈重尾分布的工具,最大化期望值的执行上限具有封闭形式 β⋆=αv/c。最后,我们认为范围和预算执行不能委托给系统提示,因为没有这种执行能过滤实际执行的内容,这使得LLM在构建时就位于系统可信计算基之外。
我们自行设计和构建的平台*Inspectra*贯穿全文作为实例化,每个机制都标注为已发布、部分完成或计划中——包括那些未起作用的部分。
###### 索引术语:
智能体安全、知识系统化、安全工具化、综述、自主渗透测试、AI红队测试、提示注入、护栏漂移、可信计算基。
## I 引言
第一个出现问题的迹象是一份自相矛盾的报告。扫描起初很干净:代理枚举了仓库,调度其分析,运行应用程序,然后开始撰写报告。当它到达最后一部分时,它正在总结与三阶段前记录的证据不匹配的发现,并自信地描述它从未打开过的文件。没有崩溃。没有引发异常。系统只是用完了没人想到要度量的资源:它自己的上下文窗口。
这种失败,以及大约十几次类似的失败,是本文的主题。它们都不奇特。它们是构建一个自主系统的常见后果,而该系统的每个组件最初都是为与现在驱动它们的操作员不同的操作员设计的——为图形控制台前的人类构建的安全扫描器、为确定性业务流程构建的工作流引擎,以及为进行对话而构建的语言模型。*智能体安全*是将这三者组合成一个系统(该系统在无人参与的情况下规划、攻击、验证和解释)的新兴学科,其难点几乎全部存在于它们之间的缝隙中。
该学科尚年轻,但已不再是推测性的:自主代理已仅从公告文本中就利用了一日漏洞[17 (https://arxiv.org/html/2608.21423#bib.bib4)],在无人指导的情况下攻陷网站[18 (https://arxiv.org/html/2608.21423#bib.bib3)],并端到端驱动结构化的渗透测试工作流程[15 (https://arxiv.org/html/2608.21423#bib.bib1), 21 (https://arxiv.org/html/2608.21423#bib.bib2), 43 (https://arxiv.org/html/2608.21423#bib.bib5)]。基准测试现在衡量攻击能力[45 (https://arxiv.org/html/2608.21423#bib.bib6), 8 (https://arxiv.org/html/2608.21423#bib.bib7)],而通过代理仅阅读的内容进行的间接提示注入是一个拥有自身评估工具的活跃领域[20 (https://arxiv.org/html/2608.21423#bib.bib8), 14 (https://arxiv.org/html/2608.21423#bib.bib9)]。
缺失的不是能力证据,而是工程说明:这样的系统必须具备哪些属性,为什么,以及当它不具备时定量会发生什么。本文通过两个部分弥合这一差距:系统性地考察新手首先会实际使用的工具——我们集成了、评了分并在若干情况下替换了的十种静态分析、动态分析、云审计、编排和AI红队工具;并论证这些工具产生的失败并非一次性错误,而是少数几种普遍现象的实例,每种现象一旦正确命名,都有封闭形式的答案:上下文窗口填满、检测器在低流行率下运行、路由决策实际上是背包问题、运行时分布呈重尾。我们将每个教训与这些规律性之一相关联,使其在激发它的工具版本之后仍然存在;一份写于2026年的工具发布调查将在2027年出错,但关于固定大小上下文窗口饱和速度的陈述不会出错。
每个此类教训都追溯到我们自身集成工作中一个特定的、有记录的失败,因此以下每个形式化主张都带有具体的经验锚点,而非仅依赖规律性。全文,我们使用*Inspectra*——我们设计、构建并运营的智能体渗透测试平台,而非我们仅评估的第三方系统——作为贯穿示例,而非作为本文的贡献。其在第IX节 (https://arxiv.org/html/2608.21423#S9) 中的数字是来自运行系统的真实配置值,我们提到的每个机制都明确标注为已发布、部分完成或计划中。该领域的架构图通常描述已设计但从未构建的组件;明确指出我们的哪些组件属于此类别,我们认为这本身就是一项有用的贡献。
本文其余部分提出了四种主张,在此汇总,以便读者在深入研究之前看到整个论证的脉络。
- • 使管道具有智能体属性的词汇表(第III节 (https://arxiv.org/html/2608.21423#S3)):将智能体安全系统定义为由确定性中介封装的LLM策略族,并给出自治性的可衡量定义,以在经验上区分真正的智能体管道与脚本管道,而非仅凭营销话术。
- • 逐个工具的集成摩擦说明(第V节 (https://arxiv.org/html/2608.21423#S5)):十种工具在四个成本维度上的评分,这些成本由不同的人在不同时间尺度上支付,这解释了为什么最容易从命令行运行的工具往往最难整合到无人值守管道中。
- • 四个量化规律性(第IV至VII节 (https://arxiv.org/html/2608.21423#S4)–(https://arxiv.org/html/2608.21423#S7)):长期会话丢失常驻证据的速率;级联验证是解决红队评分器噪声的唯一廉价方法的原因(以似然比解释),以及当两个评分器相关时该方法为何失效;一个最终是教科书背包问题的路由规则;以及任何运行时呈重尾分布的工具的封闭形式执行上限。
- • LLM不能成为最后一道防线的论证(第VIII节 (https://arxiv.org/html/2608.21423#S8)):范围和预算执行是系统执行内容的属性,而非提示要求模型执行内容的属性,仅提示实现两者在代理阅读的内容试图说服其违反规则时恰好失效。
此处的所有技术都预设了书面、范围受限的授权,指明被测试的目标;我们不发布攻击载荷、越狱字符串或漏洞利用代码。云态势审计和网络侦察是相邻学科,我们仅在工具边界重要时涉及(第V节 (https://arxiv.org/html/2608.21423#S5)),否则将其排除在默认管道之外,原因在第VIII节 (https://arxiv.org/html/2608.21423#S8) 中给出。
## II 四个关注点,一份报告
任何智能体安全系统最终都是对小型渗透测试团队现有工作的自动化尝试,而该团队的工作自然分为四个关注点:静态分析(SAST),即在不运行的情况下读取源代码;动态分析(DAST),即运行应用程序;手动式渗透测试(PT),即将低严重性发现链接并升级为附带业务故事的已验证漏洞利用;以及AI红队测试(AIRT),即攻击产品本身内嵌的模型。
跳过任何一个都会留下特定的、可预测的盲点——表I (https://arxiv.org/html/2608.21423#S2.T1) 列出了每个关注点的功能以及管道缺少它时会遗漏什么。
表I:智能体安全系统必须涵盖的四个关注点。
智能体安全之所以作为一个独立学科存在,而不是作为四个独立的扫描器背靠背运行,是因为一个单一的规划循环原则上可以在一次运行中覆盖所有四个关注点,并在同一报告中将静态接收点与动态确认和AI层弱点关联起来。本文的大部分内容是说明这一承诺为何在实践中难以实现,第III节 (https://arxiv.org/html/2608.21423#S3) 开篇即明确区分了此类循环与固定脚本的区别。
三类先前工作构成了本文的其余部分。在攻击方面,PentestGPT 将渗透测试分解为推理、生成和解析模块,专门应对上下文丢失[15 (https://arxiv.org/html/2608.21423#bib.bib1)];Happe 和 Cito 报告了LLM能够驱动权限提升工作流程的早期证据[21 (https://arxiv.org/html/2608.21423#bib.bib2)];Fang 等人展示了仅从公告文本自主利用网站和一日漏洞[18 (https://arxiv.org/html/2608.21423#bib.bib3), 17 (https://arxiv.org/html/2608.21423#bib.bib4)]。我们的贡献是互补的:不是证明代理可以攻击某物,而是研究使生成的系统可靠、可预算和可重现的学科。
在架构方面,推理-行动循环[44 (https://arxiv.org/html/2608.21423#bib.bib15)]、学习的工具调用[38 (https://arxiv.org/html/2608.21423#bib.bib16)]和多代理框架[42 (https://arxiv.org/html/2608.21423#bib.bib17)]提供了构建此类管道的原语,而持久执行语义[9 (https://arxiv.org/html/2608.21423#bib.bib18)]提供了代理SDK所不具备的可靠性层;长上下文退化被记录为依赖位置的召回损失[24 (https://arxiv.org/html/2608.21423#bib.bib19), 22 (https://arxiv.org/html/2608.21423#bib.bib20)],第IV节 (https://arxiv.org/html/2608.21423#S4) 给出了其速率。
在攻击方面,间接提示注入[20 (https://arxiv.org/html/2608.21423#bib.bib8)]、直接提示覆盖[33 (https://arxiv.org/html/2608.21423#bib.bib10)]以及多轮策略(如PAIR[10 (https://arxiv.org/html/2608.21423#bib.bib11)]和Crescendo[36 (https://arxiv.org/html/2608.21423#bib.bib12)])构成了红队测试工具自动化的目录,而防御实践正在向权限分离而非更好的提示工程收敛[13 (https://arxiv.org/html/2608.21423#bib.bib13), 7 (https://arxiv.org/html/2608.21423#bib.bib14)]——第VIII节 (https://arxiv.org/html/2608.21423#S8) 从第一性原理出发倡导的立场。
AI层关注点的治理词汇来自OWASP LLM Top 10[30 (https://arxiv.org/html/2608.21423#bib.bib27)]。
## III 什么使管道具有智能体属性
我们现在将脚本管道与智能体管道之间的区分精确到足以建立基础。
一个*目标* $\mathcal{T}$ 是所有被测试的内容:其源代码库、其可达的网络端点、其暴露的任何基于模型的表面及其基础设施配置。目标具有真实状态 $V^{\star}(\mathcal{T})$ ——其实际包含的真正可被利用的漏洞的有限集合,任何测试系统(无论是智能体式还是脚本式)的一次运行都会产生一组发现 $\hat{V}$,给出通常的召回率 $|\hat{V} \cap V^{\star}| / |V^{\star}|$ 和精确率 $|\hat{V} \cap V^{\star}| / |\hat{V}|$。
系统通过*工具代数*与其目标交互:一组调用 $a = (\tau, \theta, u)$,指定了一个工具 $\tau$、其参数 $\theta$ 及其预期目标 $u$。
将智能体系统与脚本系统区分开来的不是LLM的存在,而是控制权所在之处。我们将该系统视为一族随机LLM策略 $\Pi = \{\pi_0, \dots, \pi_k\}$ ——一个编排器及其子代理——每个策略将观察历史映射到一个新的调用或终端产物,它们位于三个非装饰性的确定性部分之上:一个决定每个提议的调用是否实际执行的*中介*谓词 $g$、一个将原始跟踪转换为稳定报告的规范化步骤 $\Psi$,以及一个为每个工具提供每次调用和每次会话上限的预算分配。第VII节 (https://arxiv.org/html/2608.21423#S7) 展示了预算购买了什么,第VIII节 (https://arxiv.org/html/2608.21423#S8) 展示了为什么必须是中介(而非 $\Pi$ 中的任何策略)来执行范围。
以这种方式构建的系统表现得像脚本还是像代理,是一个经验性问题,我们可以为其赋予一个数值。
令 $O$ 为一次运行实际产生的观察序列,$P$ 为实现的调用序列——系统实际执行的计划。定义
$$\alpha = \frac{I(P; O)}{H(P)} \in [0, 1], \tag{1}$$
即计划自身的不确定性中由系统观察解释的部分,当计划没有不确定性需要解释时,$\alpha := 0$。始终运行相同的静态分析器、然后相同的爬虫、然后相同的扫描器的管道具有恒定的计划,因此 $H(P) = 0$。相似文章
迈向可安全审计的大模型智能体:一种统一的图表示方法
本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。
学习构建实用的智能体系统
本文提出了设计和优化实用智能体LLM系统的原则性方法,引入了一个包含伪工具和固定工作流的框架,以提高模块化、成本效益和跨多种任务的准确性。
超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击
本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。
哪个大语言模型在渗透测试中表现最佳?基准测试来揭晓
HunterBench 引入了一个基准测试,用于评估大语言模型在自主渗透测试任务上的表现,根据在两个模拟实验室中的覆盖范围和利用能力进行评分。
从受控到真实世界:面向实际环境的渗透测试智能体评估
本文提出了一种实用的评估协议,用于在现实复杂目标(而非简化基准)中评估AI渗透测试智能体。它采用基于LLM的语义匹配、二分图解析和持续真值来对发现的漏洞进行评分,并发布了专家标注的真值数据和代码。