可信代理AI:威胁环境、防御架构与开放挑战的全面网络安全与系统调查

arXiv cs.AI 论文

摘要

本文全面调查了可信代理AI系统的网络安全挑战和防御机制,涵盖威胁环境、架构和开放研究问题。

arXiv:2609.13731v1 Announce Type: new 摘要:从被动基础模型到自主的、目标导向的代理AI系统的转变,通过耦合递归认知推理循环、持久内存架构、实时工具执行平面和多代理协作拓扑,引入了前所未有的能力。然而,授予概率神经核心跨文件系统、网络和云基础设施的执行权限,消解了经典安全边界:自然语言同时作为输入数据、内部控制代码和通信协议,暴露了图灵完备的爆炸半径,其中不受信任的数据代表可执行指令。本调查提供了可信代理AI的全面系统安全参考框架,综合了206项基础研究和监管标准。我们将通用代理架构形式化为一个有状态的5元组,并建立了涵盖安全性、安全性、隐私、可解释性、公平性和问责制的6维可信度分类。我们系统分析了跨执行循环和交互平面的威胁面,制定了一种多层零信任纵深防御架构,集成双LLM隔离、基于能力的访问控制、内核eBPF探针和沙箱运行时,回顾了标准化评估基准,并将技术控制映射到国际AI治理框架。
查看原文
查看缓存全文

缓存时间: 2026/09/15 09:00

# 可信代理型AI:关于威胁态势、防御架构与开放挑战的全面网络安全与系统综述  
来源:https://arxiv.org/html/2609.13731  
Seyedakbar Mostafavi††thanks:Seyedakbar Mostafavi 任职于伊朗亚兹德大学计算机工程系,邮编 89195-741,亚兹德(邮箱:[email protected])。††thanks:稿件接收日期:2026年8月31日。通讯作者:Seyedakbar Mostafavi。  
###### 摘要  
从被动基础模型向自主、目标导向的代理型AI系统的转变,通过耦合递归认知推理循环(如 ReAct、思维树、反思)、分层记忆架构、实时工具执行平面(模型上下文协议、API、Shell解释器)以及分布式多智能体协作拓扑结构,带来了前所未有的能力。然而,赋予概率神经推理核心在文件系统、网络和云基础设施上的执行权限,也溶解了传统的安全边界。在代理型系统中,自然语言同时充当输入数据、内部控制代码和通信协议,暴露了图灵完备的影响范围,其中不可信数据代表可执行指令。本综述首次为**可信代理型AI**提供了全面的系统安全参考框架,综合了206项基础研究和监管标准。我们将通用智能体架构形式化为一个有状态的五元组,并建立了**六维可信度分类体系**,涵盖**安全性、安全与运行稳健性、隐私性、可解释性与可验证性、公平性和问责性**。我们系统性地分析了跨执行循环(提示注入、推理后门、幻觉级联、工具参数远程代码执行、SSRF)和交互平面(间接提示注入、向量数据库投毒、嵌入反转、级联群体故障、拜占庭共识破坏)的全频谱威胁面。为缓解这些威胁,我们设计了一个**多层零信任纵深防御架构**,整合了双LLM检查器-执行器隔离、基于能力的访问控制(CapBAC)、内核级 eBPF 系统调用探针、微虚拟机沙盒、签名向量嵌入和拜占庭容错。最后,我们回顾了标准化评估基准(InjecAgent、AgentBench、CyberSecEval),将技术控制映射到国际AI法规(NIST AI RMF、欧盟AI法案、ISO/IEC 42001),并指明了高优先级的开放研究前沿。  
###### 索引关键词:代理型AI,可信AI,网络安全,威胁建模,间接提示注入,记忆投毒,工具使用安全,零信任架构,多智能体系统,AI治理,形式化验证。  
## I 引言  
人工智能领域正在经历一场宏大的范式转变,从在孤立对话框中生成令牌的静态基础模型,转向**自主、目标导向的代理型AI系统**[1 (https://arxiv.org/html/2609.13731#bib.bib1), 2 (https://arxiv.org/html/2609.13731#bib.bib2), 3 (https://arxiv.org/html/2609.13731#bib.bib3)]。与作为被动文本处理器运行的对话式大语言模型(LLM)不同,代理型AI系统综合了递归认知推理循环(如 ReAct [4 (https://arxiv.org/html/2609.13731#bib.bib4)]、思维树 [5 (https://arxiv.org/html/2609.13731#bib.bib5)]、思维图 [6 (https://arxiv.org/html/2609.13731#bib.bib6)] 和反思 [7 (https://arxiv.org/html/2609.13731#bib.bib7)])、持久化多层存储器 [8 (https://arxiv.org/html/2609.13731#bib.bib8)] 和实时工具激活平面 [9 (https://arxiv.org/html/2609.13731#bib.bib9), 10 (https://arxiv.org/html/2609.13731#bib.bib10), 11 (https://arxiv.org/html/2609.13731#bib.bib11)]。通过自主分解抽象目标、查询外部数据库、选择 API、执行 Shell 命令以及在多智能体网络内协作 [12 (https://arxiv.org/html/2609.13731#bib.bib12), 13 (https://arxiv.org/html/2609.13731#bib.bib13)],代理型系统正在彻底改变软件工程、自动化网络防御、科学发现和企业自动化 [14 (https://arxiv.org/html/2609.13731#bib.bib14), 15 (https://arxiv.org/html/2609.13731#bib.bib15)]。  
1\. 统计机器学习时代(2018年之前)静态决策边界,监督分类器  
2\. 基础模型时代(2018–2023)被动语言合成,无状态聊天对话  
3\. 代理型AI时代(2023至今)自主代理,持久记忆,实时工具激活  
图 1:人工智能范式的历史演进。  
然而,赋予概率神经引擎跨越物理和数字环境的自主执行权限,粉碎了传统的安全边界 [16 (https://arxiv.org/html/2609.13731#bib.bib16), 17 (https://arxiv.org/html/2609.13731#bib.bib17)]。在传统软件架构中,不可信输入数据和可执行控制逻辑之间通过硬件强制的数据执行保护、W⊕X内存管理策略以及严格参数化的数据库接口来强制实施严格分离 [18 (https://arxiv.org/html/2609.13731#bib.bib18), 19 (https://arxiv.org/html/2609.13731#bib.bib19)]。在代理型AI中,这种基本边界完全崩溃:自然语言同时作为用户输入、内部程序逻辑和组件间通信协议:  
输入数据 ≡ 控制逻辑 ≡ 通信协议 = 自然语言  
\(\begin{split}\text{Input Data} &\equiv \text{Control Logic} \\ &\equiv \text{Communication Protocol} = \text{Natural Language}\end{split}\) (1)  
因此,智能体从网页、电子邮件、外部数据库记录或对等智能体检索的任何不可信数据,都代表任意的、未编译的可执行代码 [20 (https://arxiv.org/html/2609.13731#bib.bib20), 21 (https://arxiv.org/html/2609.13731#bib.bib21)]。当智能体被赋予工具执行能力时,恶意输入可能在机器速度下触发未经授权的远程代码执行、敏感数据泄露或云基础设施被破坏 [22 (https://arxiv.org/html/2609.13731#bib.bib22), 23 (https://arxiv.org/html/2609.13731#bib.bib23), 24 (https://arxiv.org/html/2609.13731#bib.bib24), 25 (https://arxiv.org/html/2609.13731#bib.bib25)]。  
### I-A 智能体执行原型分类  
现代代理型AI体现在几种不同的运行原型中,每种原型都以专门的执行环境、工具集成模式和运行故障面为特征。在软件工程中,自主智能体如 SWE-agent [14 (https://arxiv.org/html/2609.13731#bib.bib14)]、ChatDev [26 (https://arxiv.org/html/2609.13731#bib.bib26)] 和 MetaGPT [13 (https://arxiv.org/html/2609.13731#bib.bib13)] 吞吐复杂的代码库问题描述、导航多文件代码库、制定复现脚本、编辑源文件,并通过交互式 bash Shell 执行编译和测试套件。这些智能体拥有广泛的文件系统读写权限运行,使得规划中的任何偏差都直接危及代码库完整性。在交互式网络环境中,如 WebGPT [27 (https://arxiv.org/html/2609.13731#bib.bib27)] 和 Mind2Web [15 (https://arxiv.org/html/2609.13731#bib.bib15)] 等智能体解析文档对象模型(DOM)树,制定多步浏览器操作(包括表单提交、认证握手和页面导航),并与商业和企业网络门户交互。这些系统在固有的不可信执行上下文中运行,恶意第三方网络内容很容易污染智能体的感知流。  
在网络安全运营中,自主智能体越来越多地用于双用途任务,从自动漏洞发现、渗透测试和漏洞利用链合成,到实时安全运营中心(SOC)事件分类和自动补丁验证 [28 (https://arxiv.org/html/2609.13731#bib.bib28), 29 (https://arxiv.org/html/2609.13731#bib.bib29), 17 (https://arxiv.org/html/2609.13731#bib.bib17)]。同时,网络物理和具身机器人智能体将高级自然语言意图转化为机器人手臂、自动驾驶车辆和空中无人机的低级运动原语(例如,SayCan [30 (https://arxiv.org/html/2609.13731#bib.bib30)]、SurrealDriver [31 (https://arxiv.org/html/2609.13731#bib.bib31)]、VOYAGER [32 (https://arxiv.org/html/2609.13731#bib.bib32)])。最后,企业工作流编排群体(如 AutoGen [12 (https://arxiv.org/html/2609.13731#bib.bib12)]、CAMEL [33 (https://arxiv.org/html/2609.13731#bib.bib33)] 和 AgentVerse [34 (https://arxiv.org/html/2609.13731#bib.bib34)])将复杂的组织任务分配给专门的智能体,协调供应链优化、合同审计和跨部门商业智能。  
### I-B 代理型自主中的网络安全困境  
我们将这一根本性的安全危机形式化为**代理型网络安全困境**,它源于智能体能力与系统可控制性之间的三种复合结构紧张关系。**图灵完备的影响范围**。通过为交互式 Shell 解释器、持久文件系统访问、云 API 和标准化模型上下文协议(MCP)服务器配备基础模型 [11 (https://arxiv.org/html/2609.13731#bib.bib11), 14 (https://arxiv.org/html/2609.13731#bib.bib14)],成功的提示注入的影响范围呈指数级扩大。攻击对话模型仅导致有毒文本生成,而危害自主智能体则直接导致任意主机接管、远程代码执行以及跨越企业边界的云权限提升 [21 (https://arxiv.org/html/2609.13731#bib.bib21), 35 (https://arxiv.org/html/2609.13731#bib.bib35)]。**概率性和非确定性控制流**。经典网络安全防御依赖于确定性状态机、静态代码分析和数学上可验证的授权不变式 [36 (https://arxiv.org/html/2609.13731#bib.bib36), 37 (https://arxiv.org/html/2609.13731#bib.bib37)]。与此形成鲜明对比的是,智能体的认知核心本质上是随机的:  
\(a_t \sim P(a_t \mid H_{t-1}, o_{t-1}; \theta)\) (2)  
细微的语义变化、采样温度波动或难以察觉的提示扰动会导致相同的系统状态产生截然不同的工具调度序列,使得恶意负载以高概率绕过静态基于签名的过滤器和运行时启发式防火墙 [38 (https://arxiv.org/html/2609.13731#bib.bib38), 39 (https://arxiv.org/html/2609.13731#bib.bib39)]。**双用途机器速度网络战**。自主智能体极大地压缩了网络对抗的时间线 [17 (https://arxiv.org/html/2609.13731#bib.bib17)]。虽然防御性智能体可以自动化安全运营中心分类、关联分布式遥测数据并实时合成软件补丁,但对手可以利用相同的架构来发现零日漏洞、合成多态漏洞利用程序并以机器速度执行自适应横向移动,形成不对称的进攻优势 [28 (https://arxiv.org/html/2609.13731#bib.bib28), 29 (https://arxiv.org/html/2609.13731#bib.bib29), 16 (https://arxiv.org/html/2609.13731#bib.bib16)]。  
自主智能体 \(\mathcal{A} = \langle \mathcal{C}, \mathcal{M}, \mathcal{T}, \mathcal{E}, \Pi \rangle\)  
差距1:输入不可预测性 多步提示注入、对抗性后缀、越狱攻击  
差距2:内部复杂性 推理漂移、幻觉级联、休眠后门  
差距3:环境可变性 SSRF、沙盒逃逸、资源耗尽 DoS  
差距4:不可信实体 RAG 向量投毒、拜占庭对等共识破坏  
图 2:可信代理型AI安全中的四个关键知识差距。  
### I-C 代理型AI安全中的四个关键知识差距  
如图 2 (https://arxiv.org/html/2609.13731#S1.F2) 所示,现代代理型AI的漏洞源于跨越感知、推理、执行和通信平面的四个基础性知识差距。第一个差距涉及**多步用户输入的不可预测性**,其中多轮对话交互引入了微妙的提示漂移、自动越狱攻击和目标劫持攻击,这些攻击在扩展轨迹上操纵智能体违反开发者安全策略 [40 (https://arxiv.org/html/2609.13731#bib.bib40), 41 (https://arxiv.org/html/2609.13731#bib.bib41), 42 (https://arxiv.org/html/2609.13731#bib.bib42), 43 (https://arxiv.org/html/2609.13731#bib.bib43), 44 (https://arxiv.org/html/2609.13731#bib.bib44), 45 (https://arxiv.org/html/2609.13731#bib.bib45), 46 (https://arxiv.org/html/2609.13731#bib.bib46), 47 (https://arxiv.org/html/2609.13731#bib.bib47)]。第二个差距源于**内部认知推理的复杂性**,智能体的内部思维过程构成一个多分支图结构,而非简单的前馈管道。中间思想的轻微幻觉、语义漂移或潜在的休眠后门会乘法式地累积,导致灾难性的工具执行失败 [6 (https://arxiv.org/html/2609.13731#bib.bib6), 48 (https://arxiv.org/html/2609.13731#bib.bib48), 49 (https://arxiv.org/html/2609.13731#bib.bib49), 50 (https://arxiv.org/html/2609.13731#bib.bib50), 51 (https://arxiv.org/html/2609.13731#bib.bib51), 52 (https://arxiv.org/html/2609.13731#bib.bib52), 53 (https://arxiv.org/html/2609.13731#bib.bib53)]。第三个差距涉及**运行环境的可变性**,在不同的虚拟文件系统、容器化网络和云基础设施上部署智能体引入了严重的系统级漏洞,包括服务器端请求伪造(SSRF)、沙盒逃逸和算法资源耗尽拒绝服务 [54 (https://arxiv.org/html/2609.13731#bib.bib54), 55 (https://arxiv.org/html/2609.13731#bib.bib55), 56 (https://arxiv.org/html/2609.13731#bib.bib56), 57 (https://arxiv.org/html/2609.13731#bib.bib57), 58 (https://arxiv.org/html/2609.13731#bib.bib58)]。最后,第四个差距出现在**与不可信外部实体的交互中**,与第三方网页、外部 API 提供商、模型上下文协议服务器、持久化向量数据库和对等智能体的接口使系统暴露于间接提示注入(IPI)、密集向量数据库投毒和拜占庭共识破坏 [20 (https://arxiv.org/html/2609.13731#bib.bib20), 21 (https://arxiv.org/html/2609.13731#bib.bib21), 59 (https://arxiv.org/html/2609.13731#bib.bib59), 60 (https://arxiv.org/html/2609.13731#bib.bib60), 61 (https://arxiv.org/html/2609.13731#bib.bib61), 62 (https://arxiv.org/html/2609.13731#bib.bib62), 63 (https://arxiv.org/html/2609.13731#bib.bib63), 64 (https://arxiv.org/html/2609.13731#bib.bib64)]。  
### I-D 系统性综述方法与语料库识别  
为建立一个全面、证据支持的综述基础,我们实施了严格的文献综述协议,该协议遵循 PRISMA-S 系统性文献综合标准 [65 (https://arxiv.org/html/2609.13731#bib.bib65)]。我们的书目获取过程跨越了主要计算机科学、网络安全和人工智能数据库,包括 IEEE Xplore、ACM 数字图书馆、USENIX Security、NDSS、IEEE S&P、EuroS&P、NeurIPS、ICML、ICLR、ACL 和 arXiv。搜索查询综合了跨越智能体架构、可信度维度和威胁载体的全面布尔组合:Q=(代理型AI ∨ LLM智能体 ∨ 自

相似文章

Agentic AI 的安全与隐私:重大挑战与未来方向

arXiv cs.AI

本文基于一项包含三十位国际专家的前瞻性扫描活动,提出了 Agentic AI 安全与隐私方面的关键挑战和未来研究方向。该活动识别出由于 AI 自主性和权限增加而带来的新兴风险,包括提示注入攻击和恶意应用。