从智能体失效路径到量化残余风险:面向弹性智能体AI的组合框架
摘要
本文提出CPSAINT,一种面向智能体AI系统的七层完整性分解,以及基于吸收马尔可夫模型的残余风险函数FRIESA-K。它将结构性失效路径分析与量化风险评估联系起来,并在仓库机器人和金融服务智能体场景中展示了该框架。
arXiv:2607.18243v1 Announce Type: new
摘要:智能体AI正在以当前风险模型无法表示的速度跨越信任边界。现有方法仅提供两种局部视角。它们要么描述失效机制而不产生可转移的残余风险估计,要么产生风险估计但将内部失效路径视为黑箱。我们通过提出CPSAINT(一种涵盖Physical state、Sensors、Data、Compute、Actuators、Environment和Time的七层完整性分解)以及FRIESA-K(一种将每条失效路径映射到量化风险实例的残余风险函数)来耦合这两种视角。FRIESA-K将阻力项K建立在受控吸收马尔可夫模型中,使得控制有效性源自状态动态而非分配非正式分数。结果形成一种从机制到量级的简洁管道,用于弹性智能体和具身AI。我们通过单独的附加惩罚项报告治理可观测性,而不是将治理作为新变量插入阻力函数中。我们形式化了将有效失效路径与明确定义的风险实例关联起来的结构组合性,并在两个对比场景中展示了该框架:一个硬实时仓库机器人和一个治理型金融服务智能体。在这两种情况下,相同的层语法、变量语义和动态阻力结构保持不变。因此,我们获得了一个支持跨领域推理、显式假设以及可组合信任的定量形式化的紧凑核心。
查看缓存全文
缓存时间: 2026/07/22 08:19
# 从智能体失效路径到量化剩余风险:面向韧性智能体AI的组合框架
来源:https://arxiv.org/html/2607.18243
###### 摘要
智能体AI正在以超越当前风险模型表征能力的速度跨越信任边界。现有方法只提供了两种片面视角。它们要么描述失效机制但无法产生可迁移的剩余风险估计,要么生成风险估计但将内部失效路径视为黑盒。我们通过提出CPSAINT(一种基于物理状态、传感器、数据、计算、执行器、环境与时间的七层完整性分解)以及FRIESA-K(一种将每条失效路径映射到量化风险实例的剩余风险函数)将这两种视角耦合起来。FRIESA-K将抵抗项K基于受控吸收马尔可夫模型,从而控制有效性源自状态动态而非任意指定的分数。最终形成一个从机制到量级的紧凑管线,适用于韧性智能体AI与具身AI。我们通过一个独立的附加惩罚项报告治理可观测性,而非将治理作为新变量插入抵抗函数。我们形式化了结构组合性,将有效失效路径与定义良好的风险实例关联起来,并在两个对比场景(一个硬实时仓库机器人和一个治理装备化的金融服务智能体)上展示了该框架。在这两个案例中,相同的层次语法、变量语义和动态抵抗构造保持不变。因此,我们获得了一个支持跨领域推理、明确假设以及可组合信任的量化形式化内核。
## I. 引言
智能体AI——通过规划、工具使用和环境交互自主追求多步目标的软件——正从原型快速走向生产。Gartner预测,到2028年,至少15%的日常工作决策将由这类系统自主做出(而2024年基本为零),同期33%的企业应用将嵌入智能体能力[9]。
与仅响应单次提示的聊天机器人不同,智能体系统分解目标、跨多个决策周期排序行动,并在每个步骤很少或无人批准的情况下修改外部状态(记录、工作流、物理执行器)。
智能体AI已经在静态风险评分无法捕捉的信任边界上运行[7]。例如,规划智能体可能调用工具、更新记录、触发工作流或影响执行。机器人控制器可能融合传感器数据、调用学习模型并发布时间关键指令。在这两种情境中,失效是路径依赖的。完整性并非一次失效,而是跨层次、跨接口、跨截止时间失效。
参见图注
图1:CPSAINT七层语法在仓库机器人与银行智能体工作流之间的结构分解对比。初始妥协始于编排、数据或工具逻辑附近,穿过明确的故障边界,向物理执行或治理敏感的工作流退化传播。层编号对应第IV节给出的形式符号集。
当前方法将问题分割开。结构方法如STAMP[16]和STPA[8]及相关安全-安全分析提供了因果路径、非安全控制情景和约束违反,但在可迁移的剩余风险估计前止步。量化方法如对抗风险分析、条件风险价值(CVaR)报告[18]和罕见事件模拟提供了估计量和尾部摘要,但它们通常将威胁到损失之间的系统视为黑盒[17]。近期的智能体安全与运行时保证方法强化了权限边界、约束了工具使用或验证了局部行为,但并未提供从失效路径到剩余风险的紧凑、跨领域映射。
现有框架无法同时回答两个问题:完整性通过何种机制失效?以及剩余风险有多大?最接近的工作要么提供结构因果性但无迁移性风险估计,要么提供风险估计但无结构基础。这使得两者均不适用于智能体与信息物理系统所表现出的跨领域、路径依赖的失效模式。
在本文中,我们通过耦合机制与量级来应对这一缺口。我们使用CPSAINT(图1)回答结构性问题:完整性通过何种机制失效?我们使用FRIESA-K回答剩余风险有多大(量化地)?然后,我们从受控吸收动力学推导抵抗项 K(π,τ,u),使得控制有效性反映可测量的截止时间前灾难概率变化,而非任意的专家评分。我们在此使用FRIESA-K语义,并通过一个独立的加性项报告治理可观测性退化,而不是重新定义基础方程。
本文的主要贡献如下:
- 首先,我们定义CPSAINT为带有显式路径语义的七层结构分解。
- 其次,我们定义FRIESA-K,具有锁定的变量边界和K(π,τ,u)的动态构造。
- 第三,我们陈述一个组合定理,表明有效CPSAINT路径会诱导出定义良好的FRIESA-K风险实例,而无需改变函数形式。
- 第四,我们在两个实质不同的用例(实时仓库机器人与银行/金融服务智能体)上演示该框架。
本文其余部分组织如下。第II节压缩相关文献。第III节定义系统模型、符号和威胁边界。第IV节提出方法:CPSAINT、FRIESA-K、动态抵抗构造和组合定理。第V节在两个场景上分析地评估框架并报告灵敏度行为。第VI节和第VII节提供局限性和结论。
## II. 相关工作
本工作建立在三个工作分支上:失效原因的结构分解、量化对抗风险估计、以及AI与具身AI智能体的运行时保证、安全与治理。
最接近的先前工作分为三类。结构安全-安全方法如STAMP/STPA[16]、STPA-SafeSec[8]和攻防树[15]提供了因果路径、攻防逻辑和非安全控制推理,但它们不将分解后的失效路径映射到稳定的剩余风险模型。
模块化智能体框架如DSPy[14]、AutoGen[22]和MetaGPT[10]表明组合操作上重要,但它们未明确处理故障边界、传播语义和剩余风险核算。经验分类如MAST目录化了多智能体轨迹中的失效模式,但它们未提供机制到量级的演算[5]。
量化风险与尾部估计方法提供了拼图的另一半。对抗风险分析[17]贡献了意图性威胁的严格决策理论处理。一致风险理论、CVaR[1,18]、子集模拟[2]及相关罕见事件方法提供了保守尾部报告和小概率估计的数学基础。级联失效模型显示了小扰动如何传播为系统性损失[4]。然而,这些工作大多在内部结构路径已被抽象化之后才开始,使得难以利用这些模型进行实时智能体系统所需的粒度风险建模。
运行时保证与安全隔离工作限制了行为,但通常停留在单个智能体或单个工具边界层面。AgentSpec[21]、Pro2Guard[20]、CaMeL[6]、IsolateGPT[23]和Progent[19]都展示了某种约束执行、概率模型检查、能力隔离或权限控制。然而,它们不传播剩余风险,从而在具有固定语义的组合智能体路径上失去风险保真度。可信赖AI工作指出了最后一点。Assurance 2.0[3]、保证安全AI以及最近的拓扑韧性研究认为架构和明确假设决定韧性[11],但它们并未给出基于结构失效路径的跨领域剩余风险函数。先前工作[13]在LLM集成机器人系统的工作负载层面操作化了NIST AI RMF治理功能,由此为FRIESA-K将治理可观测性处理为建模状态维度而非外部策略叠加提供了经验基础。我们瞄准这一交集。据我们所知,目前尚无现有方法在单个框架中联合固定失效语法、风险语义和动态控制解释。
## III. 系统与威胁模型
表I:核心符号
我们将智能体或信息物理系统建模为一个带标签的有向图
GCPS = (L, Φ, M, Π), (1)
其中 L = {P, S, D, C, A, E, T} 是固定的CPSAINT层集合,Φ ⊆ L × L 是有效传播关系,M = {corruption, delay, omission, replay, coupling_abuse} 是失效模式字母表,Π 是实例化架构所允许的有效失效路径集合。该图是领域无关的。领域迁移通过节点、边和路径内容的实例化发生,而非通过改变层语法本身。
我们假设一个对手试图沿一条或多条有效路径诱导完整性损失。入侵可能通过传感、数据摄入、计算逻辑、工具执行、时间操纵或环境耦合发生。防御者行动由控制策略 u ∈ C 编码。评估时间范围 τ 是有限的且依赖于领域。对于硬实时系统,它可能是毫秒或秒级;对于企业智能体,可能是分钟或更长时间。单个 τ 也可能表示领域内一个狭窄的操作分析窗口,而该领域的完整治理或审计生命周期跨越更长时间间隔;第V-B节中银行智能体的实例化使用了 τ=0.75秒作为短窗操作切片,而非全保障时间范围的模型。
表I总结了全文使用的核心符号。
## IV. 建议方法
### IV-A CPSAINT:结构失效分解
我们在有序层元组上定义CPSAINT(式(2)):
Σ = ⟨P, S, D, C, A, E, T⟩, (2)
其中 P 表示物理设备或任务关键硬件状态,S 表示感知与信号采集,D 表示数据/信息表示与模型输入,C 表示计算与决策逻辑,A 表示执行或带副作用的操作,E 表示外部环境或对手方上下文,T 表示时序与同步。每个层可能表现出五种完整性失效模式之一:Corruption(篡改)、Delay(延迟)、Omission(遗漏)、Replay(重放)、Coupling Abuse(耦合滥用)。
**定义1(智能体失效路径)。** 一条有效的智能体失效路径是一个有序序列(式(3))
π = [(ℓ1, m1), (ℓ2, m2), ..., (ℓn, mn)] (3)
使得每个 ℓi ∈ L,每个 mi ∈ M,且每个连续对尊重实例化系统的传播关系 Φ。
如图1所示,此构造的目的是建立一个稳定的完整性传播语法。这样,仓库机器人、医疗工作流智能体和银行助手都可以用相同的层集合表达,同时保留领域特定的路径内容。
图1将层集合呈现为一个操作栈,以显示失效如何跨各领域实例化中的架构边界传播。形式层符号映射如下:层1-2(任务与意图;人类与治理监督)实例化E(外部环境与对手方上下文),包括操作员意图、治理主体和监管约束。层3(智能体编排与规划)和层4(应用与工具逻辑)均在领域内不同抽象级别实例化C(计算与决策逻辑)。层5(数据与状态管理)实例化D。层6(通信与平台服务)实例化S(感知与信号采集),在软件密集型智能体中包括API端点、消息总线和数据摄入接口。层7(物理过程与执行)联合实例化P(物理设备)和A(执行或带副作用的操作)。T(时序与同步)是一个横切属性:它管理每个层的时间约束,而非占据专用的架构槽位,这符合网络延迟映射到T、数据路由完整性映射到D的设计原则。
### IV-B FRIESA-K:剩余风险
FRIESA-K定义于式(4):
R(π, τ, u) = F(π) Ri(π) E(π) S(π) A(π) / K(π, τ, u), (4)
其中 F 表示威胁的频率。可达性由 Ri 给出,可利用性由 E 表达。威胁的严重程度由 S 捕获。我们捕捉了威胁可能被放大的潜力,用 A 表示。许多模型未能捕捉控制有效性。我们使用控制K来捕捉控制的抵抗有效性。如果一个因素使攻击更可能发生或后果更严重,它属于分子;如果一个因素使攻击更困难或恢复更快,它属于分母。这种分离防止了语义漂移和双重计数。
我们使用一个终相似文章
理解代理AI系统中认知引发的风险
本文系统分析了代理AI系统中由扩展认知能力在物理、社会和自反性层面引发的风险,并提出了缓解策略以确保其安全发展。
TrustX Agent Risk Classification Framework (ARC): 对内创建的自主体AI系统的风险分层
本文介绍了TrustX Agent Risk Classification Framework (ARC),这是一个结构化的工具,用于对内创建的自主体AI系统进行风险分层,基于现有的治理框架,并包含一个十二维度评分标准、自主性级别和三层级治理输出。
面向可信Agentic AI:安全性、鲁棒性、隐私与系统安全综合综述
本调查全面审视了可信的Agentic AI,重点关注安全性、鲁棒性、隐私和系统安全。它澄清了关键概念,沿着Agent工作流程识别风险,总结缓解策略,并整合评估指标和基准,旨在作为在高风险环境中部署Agentic AI的实用参考。
使用多种编码模型开发开源静态AI代理能力与风险分析器
描述了开发一个开源静态分析器的过程,该分析器利用多种编码模型来评估AI代理的能力和风险。
可证明安全的智能体护栏
本文提出了一种新的AI智能体安全范式,采用带有神经符号隔离的可执行证明约束动作(ePCA)框架,实证评估中实现了零攻击成功率。