面向生产环境 AI 代理运行时治理的五平面参考架构

arXiv cs.AI 论文

摘要

本文提出了一种面向生产环境 AI 代理运行时治理的五平面参考架构,应对委托操作带来的安全风险。它定义了原语、不变性和评估框架,以确保安全性和实用性。

arXiv:2606.12320v1 公告类型:新 摘要:企业安全长期以来致力于管理数据边界:受保护的范围包括静态数据和传输中的数据,而控制手段——访问控制、数据丢失防护、边界检查——则管理着这些边界的跨越。生产环境 AI 代理打破了这一假设。代理代表企业读取上下文、调用工具、调用连接器并修改记录系统,因此风险转移到了工作流内部,进入一系列单独允许的操作序列,这些操作可能会改变一个未经授权的业务流程。现有的策略引擎无法扩展至这一领域:它们针对原子主体评估请求时的决策,而代理系统需要对复合主体进行有状态评估,这些主体的权限通过委托链而衰减。 我们提出了一种用于生产代理运行时治理的参考架构,它由四个可组合的原语构建而成:一个五平面分解(一个裁决意图的推理平面,以及四个执行平面——网络、身份、端点、数据——它们实现决策)、任意点停止中介、具有能力衰减的复合主体,以及作为结构化证据基础的审计。我们定义了六种中断原语的分类,这些原语对允许和拒绝进行了泛化,阐述并论证了四个正确性不变性,并展示了在五个具体工作流中对七个生产代理威胁的规避。策略引擎核心的参考实现提供了可测量的证据:每次试验都保持了衰减正确性和证据可重构性,裁决在个位数微秒内完成,并且审计基础的防篡改行为完全符合设计。我们明确了范围:该架构治理的是委托操作,而非模型行为,下一步计划是针对实时代理基准进行全系统评估。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:51

# 生产级AI智能体运行时治理的五层参考架构 来源: https://arxiv.org/html/2606.12320 ###### 摘要 企业安全体系原本是为治理数据边界而构建的:受保护面是静态数据和传输中的数据,控制手段(访问控制、数据防泄漏、边界检查)管辖的是该边界的穿越。生产级AI智能体打破了这一假设。智能体代表企业读取上下文、调用工具、触发连接器、修改记录系统,因此风险转移到了工作流内部,转化为一系列单独许可的动作,这些动作的组合可能改变未经授权的业务流程。现有策略引擎无法扩展至这一领域:它们基于原子主体评估请求时刻的决策,而智能体系统需要基于组合主体进行状态化评估,且组合主体的权限通过委托链衰减。我们提出一个生产级智能体运行时治理的参考架构,由四个可组合原语构成:五层分解(一个裁决意图的推理层,加上四个实现决策的强制执行层:网络层、身份层、端点层和数据层);任意点中介;带能力衰减的组合主体;以及作为结构化证据基底的审计。我们定义了一个包含六种中断原语的分类法,推广了允许和拒绝;提出并论证了四个正确性不变量;在五个具体工作流中展示了七种生产级智能体威胁的封闭;提出一个将安全性和实用性作为联合目标的评估框架。策略引擎核心的参考实现提供了实测证据:衰减正确性和证据可重构性在每次试验中均成立;裁决时间在个位数微秒内;审计基底的防篡改行为完全符合设计。我们明确界定范围:该架构治理的是委托行为,而非模型行为;其不变量的论证基于结构逻辑,而非形式化证明;参考实现验证了架构的内部主张,而基于实时智能体基准进行全系统评估则是下一步待探索的工作。

## 1 引言

### 1.1 安全定义正在变化

二十年来,企业安全体系始终围绕边界来组织。网络边界定义了可信网络与不可信网络之间的边界。应用边界定义了请求进入系统并被授权的点。数据防泄漏定义了敏感数据不得越过的边界。执行这些边界的控制手段——防火墙、访问控制、内容检查——已成熟、被充分理解,并且对于它们所针对的威胁(数据或请求未经授权越过边界)是有效的。

生产级AI智能体改变了需要保护的对象。一个部署在企业记录系统上的智能体不仅仅越过边界;它还会行动。它通过连接器读取上下文,形成计划,选择并调用工具,修改记录。它引入的风险主要不是数据越过边界——尽管该风险仍然存在——而是智能体的决策和动作序列以企业未授权的方式改变了企业的流程。受保护面不再是孤立的基础设施、数据或用户,而是人类意图、智能体生成的决策、企业上下文以及智能体对记录系统的动作之间的交互。

这种变化直接影响到安全栈。为边界穿越构建的控制手段无法管理动作序列。数据防泄漏检查传输中的内容;它无法评估产生该内容的计划是否被授权。访问控制根据主体授权请求;它无法评估一个委托链(智能体通过该链获得权限),也无法评估一个由单独许可动作组成的序列,其组合构成数据外泄。安全定义正在变化,因为需要治理的对象已经改变:从数据越过边界,转变为在委托权限下采取的行动。

### 1.2 为何现有策略引擎无法扩展

面对新的治理需求,自然的反应是扩展现有的授权栈。我们认为现有栈无法扩展,原因有五个结构性方面。

第一,现有引擎是请求门控的,而非计划感知的。授权系统——基于角色、基于属性或策略即代码的评估器[7](https://arxiv.org/html/2606.12320#bib.bib7)、[1](https://arxiv.org/html/2606.12320#bib.bib1)——每次评估一个请求:主体p是否可以对资源r执行动作a?智能体系统会生成计划,与策略相关的问题不是单个动作是否被允许,而是一系列预期动作在任何一个发生之前是否被允许。现有引擎没有意图的抽象。

第二,现有引擎假设原子主体。它们针对单个主体进行授权。智能体系统具有复合主体:人类委托给规划器智能体,规划器委托给执行器智能体,执行器调用一个工具,该工具再调用下游智能体。现有引擎将这个链扁平化为其中一个成员——通常是最新调用者——丢弃了正是用于推理该链是否具有所行使权限所需的信息。

第三,现有引擎表达的是绝对权限,而非衰减权限。它们以绝对术语陈述规则;委托权限应严格是委托者权限的子集——在对象-能力理论的意义上[30](https://arxiv.org/html/2606.12320#bib.bib30)、[3](https://arxiv.org/html/2606.12320#bib.bib3)——这一基本原则并非其原生特性。它们可以拒绝,但无法原生表达“执行器智能体持有规划器的能力,减去这些”。

第四,现有引擎是无状态的。按设计[37](https://arxiv.org/html/2606.12320#bib.bib37),策略即代码评估器每次独立决策。智能体治理需要依赖会话状态的决策:一个在会话早期读取了机密内容的智能体,可能在同一会话后期被禁止进行外部传输,即使该传输单独看来是允许的。将会话状态编码到无状态评估器的输入中是一种正确性和性能上的病态做法,而非解决方案。

第五,现有引擎输出布尔值。允许或拒绝是其输出类型。生产级智能体治理需要更丰富的输出——修改参数、缩小能力集、升级给人类、在条件满足前推迟、回滚已提交的效果——布尔评估器无法表达这些。

这五个差距并非偶然;它们是专为不同问题设计的引擎的结构性属性。结论并非现有栈是错的,而是它不够用:它针对原子主体治理请求时刻的访问,而生产级智能体治理需要对复合主体进行计划感知、有状态、衰减的、丰富输出的裁决。

### 1.3 参考架构

我们提出一个生产级智能体运行时治理的参考架构。该架构由四个原语组成。

第一个是**五层结构分解**。生产级智能体的动作涉及五层:一个推理层,在其中针对复合主体和会话状态裁决意图;以及四个基础设施层——网络层、身份层、端点层和数据层——在其中使用企业现有的执行原语来实现决策。推理层决策一次;四个层协调地实现该决策;一个组合的证据记录将决策与其实现绑定。这种分解替代了当前流行的联邦模型,在该模型中每一层基于部分上下文独立授权,而新模型则基于完整上下文进行一次裁决。

第二个是**任意点中介**。推理层存在于智能体执行管道的每一个有意义的点上——共七个点,从计划形成到审计输出——其输出词汇是一个包含六种中断原语(暂停、升级、缩小、修改、推迟、回滚)的分类法,推广了允许和拒绝。系统可以在智能体循环中的任何位置进行干预,且其干预不限于阻止。

第三个是**带能力衰减的组合主体**。推理层裁决所针对的主体不是原子身份,而是一个明确的委托链,该链的每一步都严格衰减前一步的权限。任何智能体的有效权限是其链中能力集的交集,仅限于未过期能力,并且通过密码学绑定到链本身。这使得任何智能体——包括受损的智能体——的权限在结构上是有界的。

第四个是**作为结构化证据基底的审计**。每个决策产生一个结构化、完整、防篡改的证据记录,即使在部分信息下也可重构。审计不是被标记用于合规的日志;它是为审计员、监管者和事件响应者设计的证据生成。

### 1.4 贡献

本文做出以下贡献。

1. 面向生产级AI智能体运行时治理的**五层参考架构**,将单一推理层裁决与四个基础设施层的协调执行分离(第4节)。
2. **任意点中介**作为设计属性,形式化为七个中介点,并附带一个包含六种中断原语的分类法,推广了允许和拒绝(第5节)。
3. **带能力衰减的组合主体模型**作为结构原语,附带线性时间裁决算法和允许静态分析的能力集格(第6节)。
4. **生成可重构证据的审计基底**,其属性是部分证据能对系统行为进行有界推断(第7节)。
5. **四个正确性不变量**——组合权限、中介覆盖、有界组合权限、证据充分性——通过结构论证,并精确表述以便后续形式化验证(第4–7节)。
6. **七种生产级智能体威胁的封闭演示**,涵盖一个规范工作流和另外四个生产用例(金融服务、医疗、软件工程、客户运营)(第3、9节),以及一个将安全性和实用性作为联合目标的**评估框架**(第10节)。

### 1.5 范围与路线图

该架构治理的是**行动**,而非**模型行为**。它位于模型对齐的下游——它约束智能体被允许做什么,而非模型被诱导说什么——并且位于基础设施执行的上游,它指导但不替代基础设施执行。此范围界定是刻意的,并在威胁模型中展开(第3节)。

本文其余部分安排如下。第2节将该架构置于安全原则、能力理论和现代授权系统(它是其扩展)的谱系中。第3节详细说明威胁模型。第4至第7节阐述四个原语,并提出和论证四个正确性不变量。第8节将这些原语组合成一个统一的参考架构,并追踪一个完整的智能体动作。第9节通过一个规范工作流和另外四个生产用例展示该架构对七种威胁的封闭。第10节提出评估框架。第11节讨论局限性、开放问题、对抗性考量以及采纳路径。第12节总结。

## 2 背景与相关工作

本文提出的架构扩展了三个已建立的研究传统,并回应了一个新兴传统。我们相应地对相关工作进行了组织:该架构应用于新系统类别的经典安全原则(第2.1节);组合主体模型源自的对象-能力理论(第2.2节);推理层扩展的现代授权系统(第2.3节);五层分解延续其发展轨迹的零信任架构(第2.4节);以及该架构定位其中的智能体AI安全文献(第2.5节)。最后,我们将其定位相对于我们自己先前关于多智能体系统授权的工作(第2.6节)。

### 2.1 经典安全原则

支配该架构的原则并非新的;它们对智能体系统的应用才是。Saltzer和Schroeder对安全系统设计原则的基础性列举[36](https://arxiv.org/html/2606.12320#bib.bib36)——最小权限、完全中介、特权分离、故障安全默认、机制经济性、最小公共机制、心理可接受性以及工作因子和妥协记录原则——至今仍是安全系统应如何做的经典参考。在精确意义上,该架构是将这些原则应用于Saltzer和Schroeder无法预见的系统类别。

对应关系是直接的。**最小权限**通过组合主体的能力衰减实现(第6节):智能体持有其委托链赋予的最小权限,绝不会更多。**完全中介**通过任意点中介实现(第5节),从经典范围(每次对每个对象的访问都被检查)扩展到智能体范围,其中智能体推理循环的每一步都被中介。**故障安全默认**通过架构的故障关闭失败语义实现(第4.4节):除非每个适用层肯定地实现其指令,否则动作不会执行。**特权分离**通过会话状态谓词实现,这些谓词禁止智能体组合具有危险组合的能力(第6.4节)。而**妥协记录**原则——Saltzer和Schroeder认识到无法防止妥协的系统至少应可靠地记录它——由审计基底实现(第7节),我们将其视为一等原语而非后备措施。

该架构在经典原则之外贡献的并非新原则,而是新的实现。Saltzer和Schroeder为这样的系统撰写:主体是进程和用户,对象是内存和文件。智能体领域引入了复合和委托的主体,对象是通过连接器访问的记录系统,以及组合——而非单个发生——构成威胁的动作。该架构是将不变的原则应用于这一变化的环境。

### 2.2 对象-能力理论

组合主体模型(第6节)源自对象-能力理论。访问控制的能力模型——其中权限由不可伪造、可传输的令牌表示,该令牌既指定资源又授予对其的访问权——起源于操作系统文献[13](https://arxiv.org/html/2606.12320#bib.bib13),并由Miller[30](https://arxiv.org/html/2606.12320#bib.bib30)发展为安全组合的统一理论。该架构继承的核心洞见是**权限应可衰减**:持有能力者应能够派生出一个更弱的能力进行委托,但绝不能派生出一个更强的。这就是属性

相似文章

运行时治理自主AI代理的五个基本原语

arXiv cs.AI

本文识别了治理自主AI代理的三个挑战——短暂性、模型选择的行动和发现的群体——并提出了五个运行时控制原语,附有私人试点的实施报告。