AgentBound: 自主AI智能体的可验证行为治理
摘要
AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。
arXiv:2606.30970v1 公告类型:新
摘要:自主AI智能体越来越多地代表人类主体执行重要行动,包括金融交易、外部通信和企业工作流。现有的智能体基础设施依赖身份联合和委托授权来验证工作负载并控制资源访问,但无法确定在当前行为和操作上下文中是否应执行授权操作。
我们提出AgentBound,一个提供可验证行为监督的运行时治理框架,用于自主AI智能体。AgentBound通过三个独立权威机构评估每个提议的操作:委托授权、所有者签名的行为章程和站点行动合约。它们的判断通过一个形式化决策模型进行保守组合,以确定操作在执行前应被允许、审查还是拒绝。
为了提供问责性,AgentBound生成密码学可验证的治理收据,将每个操作绑定到管辖决策的具体委托、策略和语义工件的精确组合,从而实现独立的回放验证和策略溯源。该框架还引入了针对长期运行的智能体的常设委托,允许周期性工作负载在持续刷新的治理策略下运行,同时保留可撤销性和有限权限。
我们介绍了形式化基础、系统架构、治理收据协议以及AgentBound-Bench——一个用于评估治理正确性、权威组合和问责性的基准框架。AgentBound并非取代模型对齐,而是通过提供授权与执行之间的确定性治理层来补充模型对齐,将治理从必须信任的过程转变为可以独立验证的过程。
查看缓存全文
缓存时间: 2026/07/01 05:36
# AgentBound:自主AI智能体的可验证行为治理框架
###### 摘要
自主AI智能体正被日益信任地委以代表人类主体执行关键行动的重任,例如管理金融交易、对外沟通以及执行无需持续人类监督的多步骤企业工作流。当前的智能体基础设施主要依赖身份联合和委托授权,确保工作负载认证和资源级访问控制。然而,这些机制在行为上下文方面基本是盲目的,无法保证一个已授权的行动是否应在特定、动态变化的行为约束下执行。
为弥合这一治理鸿沟,我们提出了AgentBound,一个运行时治理框架,为自主智能体强制执行可验证的行为监督。AgentBound通过三个独立权威的并行组合来形式化行为治理:委托授权、所有者签署的行为章程和站点行动合约。每个权威产生类型化判断,通过一个形式化决策代数系统地组合。为确保严格问责,该框架引入了密码学可验证的治理收据,将每个已执行的行动与其确切的管理策略工件绑定,实现不可否认的、可独立重放的验证。
AgentBound通过引入新颖的常设委托模型、每次执行策略刷新和确定性义务执行,同时支持交互式和长期运行的周期性智能体。我们介绍了该框架的形式化基础、系统架构、密码学收据验证流水线和全面的实现设计。我们还引入了AgentBound-Bench,一个标准化的评估框架,旨在量化跨多种智能体工作流的治理执行准确性、权威组合行为和政策溯源。
AgentBound作为一个确定性的问责和执行层运行,补充而非替代模型对齐机制。其基本不变量是清晰的:范围允许它,章程阻止它,收据证明它。AgentBound将治理从一个必须被信任的过程转变为一个可以独立验证的过程。
*关键词* 自主AI智能体·智能体治理·行为策略·策略执行·授权·可审计性·问责·密码学溯源
## 1. 引言
自主AI智能体正迅速从对话助手演变为能够代表人类主体执行关键行动的委托执行者。现代智能体工作负载通常在没有持续人类监督的情况下,浏览网站、访问企业基础设施、管理通信、安排事件、调用外部API以及协调复杂的多步骤工作流[11,7]。随着智能体自主性的增强以及执行与实时人类干预的日益脱节,建立全面的行为监督成为首要的系统级挑战,而不仅仅是应用层的关注点。
现有的安全和治理基础设施主要解决两个基本问题:身份系统确定*谁*是智能体,而委托授权框架确定智能体被授权访问*什么*资源或端点[10,6]。然而,这些传统的访问控制机制在操作安全的第三个关键维度上基本是盲目的:*在当前动态运行时环境下,某个特定行动是否应该发生?*
一个智能体可能完美通过身份验证,在其有效的OAuth或IAM范围内操作,并完全符合静态访问策略,但仍可能执行直接违反其主体意图的决策。这些行为偏差包括执行过早的金融交易、发布未经审查的公开内容、在对抗性上下文操纵下泄露敏感信息,或在存在安全替代方案时选择不可逆的行动。这些系统性故障既非源于身份缺陷,也非源于授权不足;它们代表了行为治理的根本性失败。
参见图例 图1:从访问授权到可验证行为治理的范式转变。现有系统解析智能体身份和资源权限,但在上下文适宜性方面留下了关键的执行盲点。AgentBound在授权和执行之间引入了一个不可绕过的行为治理层,将多权威策略综合为一个确定性裁决,并附带一个密码学签名的治理收据。
这种治理差距在智能体转变为持久、长期运行的系统时变得尤为尖锐。当前的架构缺乏形式化机制来表达细微的所有者意图、在运行时强制执行行为边界,或产生不可否认的策略合规证据[14,3,16,8]。至关重要的是,这种行为治理缺陷无法仅通过训练时的模型对齐来解决。虽然对齐技术试图影响模型内部的概率推理,但运行时治理针对提议的行动,根据不断变化的操作、组织和环境现实,强制执行确定性、上下文感知的约束[1]。
为弥合这一差距,我们提出了AgentBound,一个运行时治理框架,为自主AI智能体提供可验证的行为监督。如图1所示,AgentBound通过在授权之后立即引入一个显式的治理层来拦截智能体的执行轨迹。AgentBound可以概括为三个问题:
- • 智能体是谁?
- • 智能体可以访问什么?
- • 这个行动应该发生吗?
该框架通过三个独立的权威支柱来评估提议的行动:委托授权、所有者签署的行为章程和特定站点的行动合约。这些不同权威发出的判断通过一个保守的决策代数进行形式化组合,在任何行动触及底层系统之前,产生一个确定的、不可绕过的执行裁决。
除了严格的运行时执行,AgentBound还引入了*治理收据*的架构。这些收据是密码学可验证的工件,将每个已执行的行动紧密绑定到负责该决策的确切行为策略快照、结构委托和语义站点合约上[2]。与传统的被动审计日志不同,治理收据具有可重放验证的溯源能力。这使得独立的第三方审计员能够事后确定性地重建和验证策略合规性,而无需依赖智能体的内部状态或运行时环境。因此,AgentBound将智能体问责从不可验证的隐式信任模型转变为透明、独立验证的框架。
总之,本文做出了以下四个主要贡献:
- • **三权威治理模型**:我们形式化了一个综合模型,统一了委托授权、所有者行为章程和站点行动合约,以评估提议的智能体行动的上下文有效性。
- • **常设委托架构**:我们设计了一个安全的、长期运行的委托机制,专为周期性自主智能体定制,以保持策略新鲜度和细粒度的可撤销性。
- • **形式化运行时执行**:我们引入了一个确定性执行流水线,其中来自独立权威的互补判断在执行前通过一个保守的决策代数进行综合。
- • **密码学治理收据**:我们开发了一个可验证的问责机制,产生可重放验证的溯源,实现自主智能体操作的独立事后审计能力。
## 2. 动机与治理鸿沟
### 2.1 身份与授权不等于治理
自主AI智能体的出现加速了身份框架(如SPIFFE/SPIRE)[10]的发展,这些框架旨在认证代表人类用户运行的软件实体。虽然这些系统有效地解决了工作负载身份以建立下游问责,但身份本身与智能体所执行行动的行为正确性根本上是脱钩的。同样,基于OAuth范围、JWT声明、能力令牌和结构化策略引擎的现代授权架构,旨在限制智能体可以访问的资源的边界。虽然授权有效地约束了工作负载的操作范围,但它对于某个特定行动是否应在给定的一组运行时环境下执行仍然是盲目的。例如,一个智能体可能拥有有效的委托OAuth范围,可以发放最高特定金额的财务退款。在该授权限制内执行退款的请求完全在访问控制基线之内;然而,标准授权引擎无法确定该特定决策是否需要经理干预、是否需要客户明确同意、是否满足内部置信度阈值,或是否违反了季节性操作禁运期。授权无法解决这些关键边界条件,因为它们涉及行为意图和上下文合规性,而非资源可访问性。
### 2.2 行为治理失败与结构性鸿沟
我们将行为治理失败形式化为一种场景,即自主智能体完全在其允许的授权边界内操作,却违反了其人类主体施加的战略或行为期望。这些系统性故障通过多种模式体现,例如:发布外部可见的企业内容而未进行强制性编辑审查、在低于可接受模型置信度阈值时执行高风险金融交易,或当存在等效可逆替代方案时选择不可逆的系统突变。
自主智能体行动的执行生命周期传统上经历三个不同的操作阶段:认证、授权和执行。在授权和执行阶段之间存在一个关键的架构鸿沟。当前系统评估智能体是否具有执行某项行动的技术能力,但很少评估该行动在当前环境条件下是否符合所有者定义的行为期望。人类主体将交易权委托给自主实体以提高运营效率,但他们保留了隐式的行为和风险缓解期望,这些期望无法通过僵化的访问控制列表或基于角色的原语来表达。我们将这个缺失的结构层定义为行为治理。AgentBound的设计正是为了弥合这一架构鸿沟,通过在智能体执行流水线中引入确定性的运行时行为监督和密码学可验证的问责机制。
## 3. 威胁模型
### 3.1 主体与对抗目标
我们将AgentBound生态系统围绕四个核心架构主体进行形式化,表示为元组 P = (O, A, AB, S):
- • **所有者 (O)**:部署智能体、授权结构委托并通过基本事实意图配置文件 I_O 定义底层行为治理要求的人类主体。
- • **智能体 (A)**:被委托代表所有者行动的自主软件系统。A 基于其内部执行状态生成一系列提议的行动 α ∈ A。虽然信任其在技术边界内执行分配的任务,但A不被信任能正确管理自身行为或评估策略合规性。
- • **AgentBound服务 (AB)**:作为可信计算基运行的集中式运行时治理执行引擎。AB拦截每个提议的行动α,根据联合多权威策略 M 进行评估,并输出确定的执行裁决 v ∈ {允许, 拒绝}。
- • **站点资源提供者 (S)**:承载目标资源并执行已验证行动的外部应用程序、网络平台或远程企业服务。
令 R_S(α) ∈ {有效, 无效} 代表站点 S 在委托授权范围 G_auth 下的标准访问控制和委托验证函数。我们通过考虑一个行为对抗者 A_beh 来形式化对抗环境,该对抗者能够与智能体的运行时环境、输入流或提示空间交互。
与旨在绕过 R_S 以执行未经授权行动的传统权限提升对抗者不同,行为对抗者 A_beh 的目标是操纵或诱导一个已授权的智能体 A 执行直接违反所有者意图的行动,同时严格保持在智能体的委托权限范围内。形式上,给定在 A_beh 影响下生成的提议行动 α,攻击成功当且仅当以下联合条件成立:
R_S(α) = 有效 ∧ α ∉ I_O。 (1)
对抗者利用认知模糊性、语义不确定性或不完整的治理规则规范来达成此状态,诱导智能体未经所需行政批准就错误分配资金、诱使其操纵内部模型置信度指标,或强制未经授权的外部发布敏感数据,同时保持有效的OAuth令牌或密码学会话凭证。
### 3.2 系统边界与信任假设
AgentBound 专注于缓解在传统授权成功完成后出现的语义和行为威胁。该框架旨在系统地检测和拦截运行时行为策略违规、绕过强制性审批工作流的未授权执行、由异常环境诱导的不安全置信度依赖决策,以及直接违反站点行动语义或可逆性约束的行为。
AgentBound 的安全保证基于一组明确的基础信任假设。我们假设所有者和 AgentBound 执行服务所属的密码学签名密钥在整个执行生命周期内保持未被攻破。我们进一步假设运行时环境成功保证所有治理评估严格在任何关键行动被发送到外部系统之前发生。最后,我们假设所有生成的治理收据被安全地传输并存储在一个仅追加、防篡改的审计账本中。相似文章
治理行动,而非智能体:将机构认证作为自主AI系统的治理模型
本文提出了一种基于机构认证的自主AI智能体治理模型,其中行动通过独立认证的证据进行治理,而非监控智能体推理。该模型通过概念验证实现进行了形式化,适用于临床处方和软件部署等高风险行动。
叠加治理:面向代理型AI的委托与范围组合式授权框架
本文提出一种面向代理型AI系统的组合式授权框架,引入了委托、范围衰减及递归权限链等原语,以治理自主AI代理。
@bibryam: AI Agent Governance Toolkit - 由微软提供,通过确定性策略执行、...
微软发布了 Agent Governance Toolkit,这是一个面向AI智能体的开源运行时执行工具,提供确定性策略执行、零信任身份验证和沙箱隔离,覆盖全部10项OWASP Agentic风险,并拥有超过13,000个测试。
运行时治理:2026年AI代理缺失的一环
文章讨论了AI代理运行时治理的必要性,以平衡自主性与合规性,并介绍了SAFi——一个开源框架,可实时执行策略并审计操作。
可验证的智能体基础设施:面向主权AI系统的基于证明的授权机制
本文提出了一种分布式信任框架(DTF),用于自主AI代理系统中的可验证、基于证明的授权,通过要求提供理由证明和共识执行来应对以身份为中心的权限所带来的风险。