治理行动,而非智能体:将机构认证作为自主AI系统的治理模型
摘要
本文提出了一种基于机构认证的自主AI智能体治理模型,其中行动通过独立认证的证据进行治理,而非监控智能体推理。该模型通过概念验证实现进行了形式化,适用于临床处方和软件部署等高风险行动。
arXiv:2606.26298v1 Announce Type: new
摘要:自主AI智能体可能开始执行具有重大影响且不可逆转的行动,例如临床处方和生产软件部署。本文观察到,人类机构治理强大的自主行动者时,并非监控其推理过程,而是要求在关键行动点提供独立认证的证据。我们将这种机构模式形式化为AI智能体系统的计算治理模型。在该模型下,智能体保留规划和推理的完全自主权,但对指定的高风险行动没有执行权限。执行取决于前提条件,每个前提条件由独立的权威来源单独认证,并以密码学方式绑定到声明的意图,然后由确定性策略进行评估。决策记录在防篡改的日志中,可供独立重新验证。我们提供了一个概念验证实现,并通过软件部署和临床处方的示例说明了该模型。
查看缓存全文
缓存时间: 2026/06/26 05:11
# 机构认证作为自主AI系统的治理模型 来源:https://arxiv.org/html/2606.26298
## 治理行为而非智能体:机构认证作为自主AI系统的治理模型
###### 摘要
自主AI智能体可能开始执行具有重大影响且不可逆的行动,例如临床处方和生成软件部署。本文观察到,人类机构在治理强大自主行为者时,并非通过监控其推理过程,而是要求在产生重大影响的行动时提供独立验证的证据。我们将这一机构模式形式化为AI智能体系统的计算治理模型。在该模型下,智能体保留规划和推理的完全自主权,但对指定的高风险行动不持有执行权限。执行的前提条件是:每个前提条件均由独立的权威来源分别认证,以加密方式绑定到声明的意图,并由确定性策略评估。决策记录在可防篡改的日志中,可供独立的重新验证。我们提供了一个概念验证实现,并通过软件部署和临床处方的示例说明该模型。
关键词:AI智能体治理;机构认证;零信任架构;策略决策点;加密认证;可验证计算;防篡改审计
## 1. 引言
大型语言模型智能体现如今能够规划多步骤任务、调用外部工具,并在记录系统中产生副作用,而无需每一步都获得人类批准。这引发了一个治理问题:在什么条件下应允许这样的系统采取行动?现有方法通常对智能体运行时进行检测,拦截工具调用、分类行为,并根据观察到的执行上下文执行策略。这些机制对于操作约束是有效的——限制哪些工具可以被调用、执行速率限制、阻止已知的危险参数模式。然而,它们作用于工具调用的机制:工具名称、参数及其响应的形式。对于那些正确性依赖于世界状态事实的行为——例如是否检查过药物相互作用、构建是否通过、许可证是否有效——相关信息驻留在外部权威系统中,智能体的运行时并不会咨询这些系统。
本文提出了一种源自更古老且经过充分测试的治理模型:对重大行为进行机构治理。人类机构在治理强大的自主行为者(如医生、法官、财务官员)时,并非通过监控其审议过程,而是在采取行动时施加要求。例如,开具受控物质处方需要经过验证的患者记录、药物相互作用清除以及有效的DEA注册,每个都由独立的权威来源认证。行为者的推理不受治理;受到治理的是行为本身,通过独立认证的证据来实现。
我们将这一模式形式化为AI智能体系统的计算治理模型。该模型基于三个承诺:
- **治理的是行为,而非智能体。** 治理应用于智能体产生不可逆副作用的边界,而非其推理或规划的边界。
- **智能体保留自主权。** 智能体在运行时发现治理要求,并组装必要证据,而无需修改其内部控制流。
- **证据可独立验证。** 仅当每个前提条件都由一个独立、明确的外部权威认证,绑定到具体意图,并由确定性策略评估时,才允许采取行动。没有任何一方——无论是智能体还是任何单个守门人——提供决策的全部基础;证据由不同的认证者组装,最终决策可由任何第三方重新验证。
支撑该模型的基本要素各自已成熟,且2026年几篇同时期的预印本发展了密切相关的思路:将执行权限从智能体移除,并将行动绑定到经过验证的意图,置于代理准入边界之后[20, 23];确定性行动前授权并带有防篡改审计记录[19];以及智能体治理的机构化、权力分立框架[21]。相关研究还涉及意图到执行的完整性[22]。我们的目的是将这些思路组合成一个针对智能体-行动边界的统一机构治理模型,该模型基于长期存在的机构先例,并通过自2026年5月起公开可用、且独立于这些同期工作的概念验证实现加以说明。
该机构模式展现出几个特性,它们成为计算模型的设计要求:
- **独立认证。** 任何单一方的认证都不足够。每个前提条件由独立的权威机构验证——如许可机构、记录系统、测试服务——每个都有其自身的判断依据和凭证。决策者评估收集到的认证,但并不产生这些认证。信任分布于独立的认证者之间,而非集中于行为者或单一的守门人。这实现了Clark和Wilson[1]形式化的职责分离原则。
- **交易绑定。** 认证绑定到特定行为。经过公证的文件标识日期、当事人和交易。先前的认证不能替代当前的认证。这防止了重放攻击以及证据与其上下文分离。
- **依据明确规则的确定性评估。** 决策来自将已声明的规则应用于已认证的事实。规则事先声明,统一应用,且其应用是可重现的。给定相同的已认证事实,相同规则产生相同决策。这对应于XACML[2]中描述的策略决策点架构,并可通过如Cedar[3]或Rego[4]等确定性策略语言实现。
- **永久、可独立审计的记录。** 决策、底层证据以及应用的规则被记录下来,使得任何授权第三方随后可以检查并重新验证该决策。这借鉴了防篡改日志结构[5]和透明日志架构,如证书透明性[6]。现有的供应链认证框架,如in-toto[7]和SCITT[8],处理了软件溯源方面密切相关的问题,并为本文描述的认证和透明机制提供了相关先例。
- **行为者的自主性。** 行为者的审议过程不受治理。治理仅在行动发生时介入,并且仅通过要求证据来实现。该模式与自由裁量权和能力兼容,因为它约束的是后果而非推理。
这些特性在安全文献中各自已被充分确立:零信任验证[9]、能力安全[10, 11]、拜占庭容错[12]以及引用监控概念[13]。我们的目标是将它们组合成一个统一的治理模型,该模型以机构先例为动机,并应用于智能体-行动边界。
## 3. 计算模型
我们将机构模式形式化为AI智能体系统的治理架构。一个概念验证实现——零信任行动中心(github.com/jsalfeld/zta-hub)——说明了该模型;我们描述抽象机制,并参考实现以获得工程细节。
### 3.1 信使模式
在传统的工具调用架构中,智能体持有凭据并直接执行行动。在本文提出的模型下,智能体对受治理行动不持有执行权限。相反,它通过以下步骤作为信使运作:
1. **意图声明。** 智能体请求对一个特定的受治理行动进行授权。治理中心发出一个唯一的、密码学随机的意图标识符——一个绑定令牌,所有后续认证都必须引用它——并返回所需认证的列表。
2. **证据收集。** 智能体联系所需的权威来源——被称为预言机的独立服务——并收集每个前提条件成立的签名认证。每个预言机验证一个条件,并使用其自身私钥对结果签名,绑定到意图标识符。
3. **提交与评估。** 智能体将收集到的认证提交给治理中心。中心针对预注册的公钥验证每个签名,确认意图绑定,并在已认证的事实上评估确定性策略。默认姿态是拒绝。
4. **条件授权。** 如果策略允许,中心要么代表智能体执行行动,要么发出一个签名的、范围狭窄的能力令牌。决策被附加到防篡改审计日志中。
智能体组装证据但无法伪造,因为它不持有预言机的签名密钥。授权来自经过验证的证据并依据策略评估,而非来自智能体的已有权限。
### 3.2 多方认证与意图绑定
每个前提条件由独立的预言机检查,预言机拥有自己的非对称密钥对(例如Ed25519[14])。没有任何一方(包括治理中心)能够产生另一方的认证。认证信封可以采用如DSSE[15]等既定格式以促进互操作性。每个认证包括在声明阶段发出的意图标识符,预言机将意图标识符与其源标识符、过期时间和有效负载作为单个规范信封一起签名。该标识符作为特定行动请求与其收集的证据之间的密码学绑定;由于它在签名信封内,无论是绑定还是被认证的事实都无法在不使签名无效的情况下被更改,为一个意图产生的认证如果在另一个意图中提交则被拒绝。这防止了证据跨行动重用以及认证在无关请求间替换。此外,每个认证还携带一个过期时间,也在签名信封内;中心拒绝在过期后提交的任何认证。这限制了检查前提条件与执行行动之间的时间间隔,确保每个行动的证据是新鲜收集的,而非从较早上下文继承而来。
### 3.3 确定性策略与可验证计算
已认证的事实被组装成策略上下文,并针对声明性策略进行评估。由于评估是确定性的,决策可以从记录的输入重现。当一个前提条件涉及计算而非外部查找(例如剂量计算或对持有数据的推理)时,智能体可以执行已批准的代码,并提交一个针对已注册、经过审计的代码哈希的正确执行证明(通过可信执行环境认证或零知识论证[16])。中心验证该证明,并仅允许经过验证的输出进入策略上下文。
### 3.4 防篡改审计与行动组合
每个决策被附加到使用哈希链或默克尔树技术[5]构建的防篡改审计日志中。每个条目包括意图标识符、行动类型、签名收据以及先前条目的密码学承诺。篡改过去记录会使后续条目无效。透明日志服务(如证书透明性[6]或供应链完整性框架[7, 8]中使用的)为此提供了成熟的基础设施。第三方可以通过检查预言机签名、确认意图绑定、重新评估策略并遍历日志来重新验证任何决策。
一次成功的行动产生一个签名的执行收据,该收据可以作为后续行动的前提条件。这允许治理进行组合:后续行动的策略可以要求可验证的证据,证明先前的行动本身是经过治理并执行的。
### 3.5 治理发现
每个受治理行动的要求以机器可读的技能契约形式发布,指定风险分类、所需认证、预言机端点以及输入/输出模式。智能体在运行时读取这些契约并相应地组装证据。添加或修改受治理行动不需要改动智能体。这使得治理面在组织上重要的维度上可扩展:可以引入新的受治理行动、新的认证者和额外的预言机,而无需修改智能体或中心的评估逻辑;治理通过执行收据跨行动组合(§3.4)。由于认证者是独立的,信任在组织和管辖边界间分布,而非集中于单一权威。这里的可扩展性在于治理覆盖范围,而非每个行动的通量;每个行动收集多个认证的成本将适用范围限定于高容量常规操作。
## 4. 示例
### 4.1 软件部署
考虑一个AI智能体已完成一项功能并试图将其部署到生产环境。在该模型下,`deploy_to_production`是一个受治理行动,需要三个独立认证的前提条件。
*图1说明:受治理的`deploy_to_production`:智能体从CI、代码审查和安全扫描预言机收集独立签名的认证,每个认证都绑定到发出的意图标识符,然后中心进行验证和授权。*
每个预言机返回一个签名的认证信封,包含其验证过的事实和意图标识符。例如,CI预言机返回:
```
{
"source_id":"ci_pipeline",
"intent_id":"int-7f3a",
"expires_at":"2026-06-23T12:05:00Z",
"payload":{"tests_passed":true,"coverage":94.2},
"signature":""
}
```
收到认证后,中心在执行策略评估前运行以下验证流程:
1. **签名验证。** 对于每个认证,中心通过`source_id`检索预言机预注册的公钥,并验证规范信封(源标识符、意图标识符、过期时间、有效负载)上的Ed25519签名。无效或未识别的签名拒绝该请求。
2. **意图绑定。** 中心确认每个认证中的`intent_id`与步骤1中声明的意图匹配。如果不匹配相似文章
AgentBound: 自主AI智能体的可验证行为治理
AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。
CAVA:面向智能体AI系统运行时治理的规范动作验证与证明
本文提出了规范动作验证与证明(CAVA),这是一种运行时语义层,将异构智能体活动转换为用于治理的规范运行时动作对象,从而在多样化的AI执行环境中实现一致的审批绑定、凭证可再现性和策略执行。
代理AI的运行时治理:基于可信来源和失败关闭执行的动作边界控制
本文介绍了Aegis,一个代理AI的运行时治理系统,通过可信授权调解工具操作,防止在评估的沙箱场景中出现高风险副作用。
如何在“治理”尚不明确的情况下管理自主AI代理?
本文讨论了为自主AI代理定义和实施治理的挑战,作者寻求建议,如何向董事会或审计委员会展示控制措施。
以机器速度治理:实时AI策略执行的自适应智能架构
本文指出AI治理中的认证缺陷,并提出了AGIL,一个使用机器学习进行实时策略执行的五层自适应架构。