CAVA:面向智能体AI系统运行时治理的规范动作验证与证明
摘要
本文提出了规范动作验证与证明(CAVA),这是一种运行时语义层,将异构智能体活动转换为用于治理的规范运行时动作对象,从而在多样化的AI执行环境中实现一致的审批绑定、凭证可再现性和策略执行。
arXiv:2607.13716v1 公告类型:新
摘要:智能体AI系统越来越多地通过异构运行时运行:本地编码钩子、SDK工具、浏览器自动化、托管智能体轨迹、API网关和工作流引擎。因此,一个单一的操作行为,如发布代码、更改身份状态、转移资金或导出数据,可能由多个不兼容的运行时记录表示。这使得一个基本的治理问题难以回答:实际批准了什么动作?什么证据将批准与执行绑定?独立验证者能否在以后再现相同的动作身份?
本文提出了规范动作验证与证明(CAVA),这是一种运行时语义层,用于将异构智能体活动转换为规范运行时动作对象。CAVA位于携带证明的智能体动作(PCAA)之下:PCAA定义了部署者拥有的路由-审查-证明治理过程,而CAVA定义了该过程治理的稳定动作对象。本文正式定义了规范动作身份、语义模式检测、审批绑定、凭证完整性、运行时可移植投影以及可选的证明基底。我们通过一个包含96个种子、384个变体的基准测试研究了参考实现,涵盖了语义等价、语义分离、包装器绕过、假阳性控制、审批绑定、凭证可再现性、证据篡改检测、运行时可移植性、语义模式检测、策略降级以及Azure部署测试。本文的贡献是提出了动作级规范化和策略可寻址语义模式的系统化表述,作为部署者侧AI治理的必要基础。
查看缓存全文
缓存时间: 2026/07/16 04:24
# 规范动作验证与证明:面向智能体AI系统运行时治理
来源:https://arxiv.org/html/2607.13716(2026年6月)
###### 摘要
智能体AI系统日益通过异构运行时进行运作:本地编码钩子、SDK工具、浏览器自动化、托管智能体追踪、API网关和工作流引擎。因此,单个操作行为(如发布代码、变更身份状态、转移资金或导出数据)可能由多种不兼容的运行时记录所表示。这使得一个基本的治理问题难以回答:实际批准了什么动作?什么证据将批准与执行绑定?独立验证者能否在之后重现相同的动作身份?本文提出了**规范动作验证与证明**(CAVA),这是一个运行时语义层,用于将异构智能体活动转换为规范的运行时动作对象。CAVA位于动作可证明代理动作(PCAA)之下:PCAA定义了部署者拥有的“路由-审查-证明”治理流程,而CAVA定义了该流程所治理的稳定动作对象。本文形式化了规范动作身份、语义模式检测、批准绑定、收据完整性、运行时可移植证明以及可选证明基底。我们通过一个包含96个种子、384个变体的基准测试来研究参考实现,涵盖语义等价、语义分离、包装器绕过、假阳性控制、批准绑定、收据可重现性、证明篡改检测、运行时可移植性、语义模式检测、策略退化以及Azure部署演练。我们还提供了一个系统卡片附录,包括消融实验、红队案例、比较边界、部署证据和剩余风险披露。在该代表性语料库中,CAVA在重写的运行时形式之间保留了规范动作身份,而原始文本和首个标记基线在包装器、策略可寻址模式检测和批准漂移下均会失败。本文的贡献在于,将动作级别的规范化和策略可寻址语义模式形式化为部署者侧AI治理的必要基础。
## 第一部分:主要研究手稿
### 1 引言
智能体AI系统的操作风险很少在模型输出文本的时刻真正显现。风险在运行时采取行动时变为现实:执行命令、调用工具、浏览器提交表单、工作流改变状态、身份边界变更、触发支付、部署离开工作空间,或数据跨越组织边界。因此,企业治理需要的不仅仅是模型侧策略、聊天日志或事后追踪。它需要一个稳定的对象来标识正在被决策的动作。如今,这个对象并不稳定。同一个高影响动作可能表现为本地编码智能体中的shell命令、智能体框架内的SDK方法、MCP工具调用、浏览器自动化事件、CI/CD API请求,或托管智能体会话转换。每种表示可能对调试有用,但都不能保证是治理对象。如果批准绑定到原始文本,等价的改写可能绕过批准。如果审计绑定到运行时原生追踪,不同的运行时可能使同一动作无法比较。如果策略绑定到首个标记,那么诸如`env`、`sudo`、`bash -c`、别名、SDK辅助函数或工具间接引用之类的包装器,可以在不改变后果的情况下改变表面形式。
本文研究CAVA作为该问题的运行时语义基础。CAVA将原始运行时事件转换为**规范运行时动作**:一个带版本、可哈希且携带收据的动作对象。它不是模型对齐方法、通用可观测性产品,或企业策略的替代品。相反,它解决一个更狭窄的前提条件:
> 在部署者能够决定智能体动作是否应该进行之前,部署者需要一个可重现的表示,以明确正在被决策的动作究竟是什么。
CAVA旨在与PCAA[16 (https://arxiv.org/html/2607.13716#bib.bib16)]组合使用。PCAA定义了治理循环:路由动作、必要时审查、证明闭环。CAVA则提供能够在该循环中传递的规范动作对象。简而言之,PCAA回答谁有权以及什么证明必须关闭动作;CAVA回答权力决策所指的具体内容是什么。
本文做出五项贡献:
1. 1. 针对异构智能体系统的规范运行时动作身份的形式化;
2. 2. 一个CAVA协议,将策略结果、批准、收据和证明绑定到规范动作指纹上,而非原始文本;
3. 3. CAVA内部的语义模式层,将规范动作和外部性上下文映射为策略可寻址的模式,而非客户特定的规则;
4. 4. 一个威胁模型,涵盖语义绕过、包装器绕过、批准漂移、证据清洗和解析器捕获;
5. 5. 一个参考的开源核心实现边界,将可移植模式与收据验证同托管解析器包和企业证据操作分离开;
6. 6. 一个可重现的基准测试工作台,包含96个代表性种子和384个运行时变体,将CAVA与原始文本和首个标记基线在动作语义、语义模式检测、策略退化、云动作演练、消融实验和红队案例方面进行比较。
### 2 相关工作
#### 2.1 智能体评估与工具使用风险
AgentBench将智能体评估定位为交互环境问题,而不仅仅是静态响应问题[6 (https://arxiv.org/html/2607.13716#bib.bib6)]。SWE-bench同样将真实软件仓库作为评估自主编码行为的实用测试平台[3 (https://arxiv.org/html/2607.13716#bib.bib3)]。ToolEmu专注于通过模拟工具执行来发现工具增强型语言模型智能体的风险[13 (https://arxiv.org/html/2607.13716#bib.bib13)]。CAVA与相同的假设一致,即智能体行为必须在动作层进行评估。然而,它的目标并非任务成功或场景发现,而是治理级别的动作身份:运行时事件能否在异构执行表面下被规范化、批准、重放和证明。
#### 2.2 运行时治理、遥测与可观测性
运行时控制规范和托管智能体系统日益暴露会话、工具调用、执行状态和企业控制功能。微软智能体控制规范强调智能体的可移植运行时治理合约[7 (https://arxiv.org/html/2607.13716#bib.bib7)]。OpenTelemetry GenAI语义约定标准化了LLM和智能体系统的遥测字段[11 (https://arxiv.org/html/2607.13716#bib.bib11)]。Langfuse等平台暴露了追踪、提示管理、评估和可观测性工作流[5 (https://arxiv.org/html/2607.13716#bib.bib5)]。这些系统使得相邻记录可读。CAVA的不同之处在于它视为首要对象的实体:不是跨度、会话、提示或追踪,而是适合批准绑定和收据验证的规范动作对象。
#### 2.3 证明、收据与认证
证明携带代码确立了可执行工件可以伴随机器可检查的证明对象的概念[9 (https://arxiv.org/html/2607.13716#bib.bib9)]。现代软件供应链系统(如in-toto和Sigstore)为构建和发布工作流提供了签名的来源和认证模式[2 (https://arxiv.org/html/2607.13716#bib.bib2),14 (https://arxiv.org/html/2607.13716#bib.bib14)]。可验证凭证为跨方验证提供了可移植声明结构[15 (https://arxiv.org/html/2607.13716#bib.bib15)]。Dapr可验证执行贡献了签名的工作流历史和执行认证[1 (https://arxiv.org/html/2607.13716#bib.bib1)]。CAVA是互补的:它定义了这些收据或认证应绑定到哪个运行时动作。
#### 2.4 治理框架
前沿治理框架日益记录风险识别、风险分析、缓解措施、事件响应、模型报告、专家输入、责任分配和变更管理[10 (https://arxiv.org/html/2607.13716#bib.bib10)]。CAVA采用相同的操作严肃性,但将其应用于部署者侧的运行时动作语义,而非前沿模型发布。这种区别很重要,因为模型提供商可以报告能力和缓解态势,但部署者仍然拥有生产系统、客户数据、企业身份边界和业务权限。
### 3 问题形式化
#### 3.1 运行时异构性
令\(\mathcal{R}\)表示智能体可能通过其行动的运行时家族集合。示例包括shell钩子、SDK工具、API网关、MCP服务器、浏览器自动化、托管智能体平台、工作流引擎和Web3签名通道。原始运行时事件记作\(a \in \mathcal{A}_r\),其中运行时\(r \in \mathcal{R}\)。
部署者面临的问题不仅仅是\(a\)是否包含可疑字符串,而是\(a\)是否代表一个应被允许、警告、审批控制、阻止或事后审计的业务动作。
###### 定义1(规范运行时动作)。对于原始运行时事件\(a\),CAVA规范化器将\(a\)映射为规范运行时动作\(C(a) = (v, r, e, o, k, S, \tau, u, m)\),其中\(v\)是模式版本,\(r\)是运行时家族,\(e\)是可执行文件或工具标识,\(o\)是规范化操作,\(k\)是风险类别,\(S\)是触及的系统集合,\(\tau\)是可逆性,\(u\)是目标或主体上下文,\(m\)是有界的适配器元数据。
###### 定义2(规范指纹)。令\(\mathrm{canon}(\cdot)\)表示对选定规范字段的确定性序列化。CAVA指纹为\(F(a) = H(\mathrm{canon}(C(a)))\),其中\(H\)是一个抗冲突哈希函数。策略决策、批准收据和审计证据均绑定到\(F(a)\),而非原始运行时文本。
#### 3.2 期望性质
CAVA围绕六个性质设计:
1. 1. 语义等价:同一动作的不同等价表达应收敛到相同的规范身份。
2. 2. 语义分离:实质性不同的动作不应合并到同一个治理对象中。
3. 3. 包装器鲁棒性:Shell包装器、SDK辅助函数、工具别名和运行时间接引用不应隐藏高影响动作。
4. 4. 批准绑定:批准必须绑定到规范动作含义,而非显示字符串。
5. 5. 收据可重现性:独立验证者应能根据已发布对象重新计算收据哈希。
6. 6. 运行时可移植性:不同的运行时家族应能投射可比较的动作语义,而不假装所有运行时暴露相同的执行深度。
#### 3.3 威胁模型
威胁模型同时包括恶意和偶然失败:
- • 等价语法绕过:同一动作被改写,使得基于原始字符串的策略不再匹配。
- • 包装器绕过:动作被置于`env`、`sudo`、`bash -c`、别名、辅助脚本、SDK调用或工具间接引用之后。
- • 批准漂移:操作员批准了一个表面描述,而实际执行了不同的语义动作。
- • 追踪模糊性:可观测性记录存在,但无法证明授权了什么。
- • 证据清洗:下游系统提供了经过清理的事后记录。
- • 解析器捕获:特定供应商的解析器成为唯一的治理权威。
CAVA不假设每个运行时都能提供内联拦截。它仅假设运行时事件可以被捕获、规范化、针对覆盖深度进行评分,并附加到明确的收据上。当运行时仅为观察时,CAVA应公开该限制,而非夸大执行能力。
### 4 规范动作验证与证明
#### 4.1 协议
CAVA可表示为六阶段协议:
1. 1. 捕获:收集原始运行时事件和执行上下文。
2. 2. 规范化:将原始事件映射为规范运行时动作。
3. 3. 解释:根据规范动作、边界、来源和数据信号检测策略可寻址的语义模式。
4. 4. 指纹计算:在规范动作语义上计算确定性哈希。
5. 5. 绑定:将策略结果、批准、拒绝或升级附加到指纹上。这是在动作含义层的批准绑定。
6. 6. 关闭:附加结果、证据、异常和副作用摘要。
7. 7. 证明:可选地签名、添加凭证、锚定到账本或外部验证收据材料。
捕获原始事件 → 规范化动作 → 解释模式 → 指纹语义 → 绑定批准 → 关闭证据 → 收据哈希和验证器 → 可选签名器、VC或账本锚点
图1:CAVA协议:原始运行时事件被转换为规范动作对象,解释为策略可寻址的语义模式,并在批准、关闭和可选证明之前绑定到指纹。
#### 4.2 规范动作对象
表1 (https://arxiv.org/html/2607.13716#S4.T1)给出了参考规范对象。该模式故意设计得较小,并非为了编码每个私有的工作流细节,而是为了保留治理级动作身份所需的关键字段。
表1:参考CAVA规范动作字段。
###### 命题1(原始文本不足以用于批准绑定)。如果治理决策只绑定到原始字符串表示\(s(a)\),那么任何具有相同操作效果但不同文本的替代表示\(s'(a)\)可能绕过基于\(s(a)\)的策略,除非该策略独立地重建动作语义。该命题并非密码学定理,而是系统观察。原始文本是一种显示形式。CAVA使得重建的动作语义成为治理对象。
#### 4.3 与PCAA的关系
PCAA将受治理的动作视为一个携带证书的对象,具有用于可接受性、动作开启、假设捕获、批准和结果关闭的检查点[16 (https://arxiv.org/html/2607.13716#bib.bib16)]。CAVA是较低层,使该对象足够稳定以进行治理。一个PCAA证书可以包含路由决策和证明包,但那些决策需要一个规范的动作身份以避免歧义。相反,CAVA指纹本身并不决定权限。当PCAA或等效的部署者所有治理循环对其进行路由、审查和关闭时,它才变得具有操作意义。
#### 4.4 语义模式层
规范动作身份是必要的,但不够充分。企业策略很少只说“阻止此可执行文件”。它通常会说:不要为敏感材料创建公开链接,不要削弱端点控制,不要让智能体在用户授权范围之外行使权限,不要让工作流接收器将数据移入公共通道。这些不是特定供应商的命令,而是可重用的智能体风险模式。
因此,CAVA包含一个**语义模式层**,它位于规范化之后、策略路由之前。模式层不是新产品,也不是第二个治理权威。它是CAVA内部的一个解释过程。CAVA拥有结构;语义模式拥有风险含义;策略配置文件拥有企业态势;PCAA拥有最终权威和证明。
形式上,模式检测器映射\(P(C(a), B(a), D(a)) \rightarrow \{p_1, \ldots, p_n\}\),其中\(C(a)\)是规范动作,\(B(a)\)是边界上下文(如目标可见性和账户来源),\(D(a)\)是数据上下文(如敏感性和最小化态势)。每个模式都是一个带版本的证据对象,具有标识符、标签、严重性相似文章
治理行动,而非智能体:将机构认证作为自主AI系统的治理模型
本文提出了一种基于机构认证的自主AI智能体治理模型,其中行动通过独立认证的证据进行治理,而非监控智能体推理。该模型通过概念验证实现进行了形式化,适用于临床处方和软件部署等高风险行动。
代理AI的运行时治理:基于可信来源和失败关闭执行的动作边界控制
本文介绍了Aegis,一个代理AI的运行时治理系统,通过可信授权调解工具操作,防止在评估的沙箱场景中出现高风险副作用。
AgentBound: 自主AI智能体的可验证行为治理
AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。
可验证的智能体基础设施:面向主权AI系统的基于证明的授权机制
本文提出了一种分布式信任框架(DTF),用于自主AI代理系统中的可验证、基于证明的授权,通过要求提供理由证明和共识执行来应对以身份为中心的权限所带来的风险。
面向企业AI智能体的部署前保障:基于本体论的仿真与信任认证
研究人员提出了一种基于本体论的企业AI智能体部署前验证框架,结合了智能体操作包络、自动化场景生成以及可机器验证的信任证书与分级部署判定。在四个受监管行业开展的试点研究共生成1,800个测试场景,结果显示基于本体论的生成方法在监管覆盖率上显著优于基于角色的基线方法。