谁审计谁,在什么基座上,用什么证据?一个面向代理式AI的独立性分级审计协议
摘要
本文提出了一种针对代理式AI系统的独立性分级审计协议,从主体、基座和证据三个轴向对独立性进行分级,并提供了形式化基础及分析。
arXiv:2609.18272v1 Announce Type: new
摘要: 代理式AI系统在有限监督下进行规划、调用工具并行动;它们现在既是审计的对象,也越来越多地成为审计者。独立性作为保证的基础,目前仍以二元方式应用于它们。我们认为必须沿着三个正交轴进行分级:主体独立性(谁控制审计者)、基座独立性(审计者与被审计者共享基础模型家族、工具链或防护栏时会随之失效)和证据独立性(证据是可验证的而非自我报告的)。每个轴都有先例;贡献在于在单次审计中对所有三个轴进行分级,通过最薄弱环节进行聚合,并在审计者本身是代理时应用相同的标准。我们通过引入可靠性工程中共同原因故障的β因子模型为该模型提供了形式化基础,提出了一个七步协议,其输出可由第三方验证,对三个等级审计的采购控制代理进行了结构可检测性分析,并对该模型进行了蒙特卡洛研究。研究中,对代理的传统内部审计——一个真实审计团队、第二个代理、提供商日志——仅发现了原则上可检测故障的5.9%,并且在一半故障类别中完全未发现。我们将这三元组映射到修订后的欧盟AI法案、ISO/IEC 42006、英国公共部门风险管理指南以及审计监管实践。
查看缓存全文
缓存时间: 2026/09/17 09:36
# 谁审计谁,在什么基质上,以什么证据?智能体AI的独立性分级审计协议 来源:https://arxiv.org/html/2609.18272 CCS分类:安全与隐私 系统安全;CCS分类:计算方法 智能体;CCS分类:社会与专业主题 计算/技术政策 Mohamed Chahine Ghanem https://orcid.org/0000-0002-7067-7848 邮箱:[[email protected]](mailto:[email protected]) 所属机构:基尔大学计算机科学与数学学院,基尔,英国 所属机构:利物浦大学网络安全研究所,利物浦,英国 **摘要** 智能体AI系统规划、调用工具并在有限监督下行动;它们现在既是审计对象,也日益成为审计者。独立性——保障的基石——目前仍被视为二元属性应用于它们。本文主张,独立性必须沿三个正交轴进行分级:*委托人*独立性(谁控制审计者)、*基质*独立性(审计者与被审计者共享基础模型家族、工具链或防护栏时会共同失效)以及*证据*独立性(证据是否可验证而非自我报告)。每个轴都有先例;我们的贡献在于将三者置于同一审计中按最弱链规则综合评定,并在审计者本身是智能体时应用相同分级标准。我们通过移植可靠性工程中共因故障的贝塔因子模型为该模型提供形式化基础,设计了一个输出可被第三方验证的七步协议,对一个采购控制智能体在三个等级下进行了结构性可检测性分析,并通过蒙特卡洛研究模拟了该模型——研究发现,对智能体的常规内部审计(由真实审计团队、第二个智能体、供应商日志执行)仅能发现原则上可见故障的5.9%,且在半数故障类别中完全无法检测。我们将该三元组与修订后的欧盟《人工智能法案》、ISO/IEC 42006标准、英国公共部门风险管理指南及审计监管实践进行了映射。 **关键词**:智能体AI、AI审计、审计者独立性、算法单一文化、远程证明、欧盟《人工智能法案》、ISO/IEC 42006 ## 1. 引言 两种实践正汇聚于“审计智能体AI”这一表述下。第一种是独立评审员评估组织的自主智能体在可观测性、可控性和问责方面的表现;第二种是保障职能部署自身的智能体,对全体而非样本进行持续测试——监管机构现已开始监控这一转变。两者都借用了一个支撑保障体系长达一个世纪的核心概念:独立性。在职业规范中,独立性是针对人和资金的属性:审计者必须不受妥协性利益和关系影响,且判断是二元的。这对智能体系统而言已不足够,原因有三: 1. **委托人独立性**:控制审计智能体的*委托人*可能独立,但智能体本身可能不独立——它可能运行在被审计者的基础设施上、持有其凭证,或可通过其工具输出进行操纵。 2. **基质独立性**:审计者与被审计者日益共享*基质*——模型家族、工具链、防护栏——而共享基质会共同失效:模型倾向选择自身输出;相关性评判面板实际独立投票数远少于其席位数;智能体能暗中协调。 3. **证据独立性**:意见背后的*证据*通常由被审计系统生成——日志、跟踪和自我报告——可能被智能体、其提供商或托管方篡改,因此即使有特权访问也无法确定实际发生情况。 现行指南继承了这三项缺陷:英国2026年公共部门AI风险管理工具包要求团队采用“独立于AI项目团队”人员的测试和使系统可审计的日志记录,却未明确“独立”的程度,也未说明日志的证明力。我们主张独立性应*分级*而非简单宣告,并提出五项贡献: - **C1** 三轴模型:每轴按明确依据(委托人激励、共享组件、证据能抵御的最强对手)进行0–3级评定,并按最弱链规则综合。 - **C2** 为基质轴提供量化基础:将算法单一文化、评判相关性和AI控制结果引入保障框架。 - **C3** 设计可被第三方验证的七步协议,对智能体审计与智能体作为审计者的情形对称应用。 - **C4** 进行结构性分析确定各轴可关闭的故障类别,并通过蒙特卡洛研究量化配置差异、检验综合规则。 - **C5** 将三元组与现行法规工具进行映射。 ## 2. 定义与范围 三个轴中的两个依赖尚未统一的术语,故先作界定。 - **定义2.1(智能体AI系统)**:*AI智能体*是能感知环境、响应并采取行动以实现目标的自动化实体。系统的*智能体性*程度体现在其以有限直接监督追求复杂目标的能力。因此,智能体性是连续谱,以下协议适用于任何持有凭证、调用工具并在人工审查间行动的系统。 - **定义2.2(基质)**:AI系统的*基质*是其行为依赖且继承其故障的技术组件集合:基础模型(家族与版本)、微调与对齐数据、工具与连接器层、防护栏与分类器栈、托管环境。两个系统在这些组件重合的范围内*共享*基质。 - **定义2.3(独立性三元组与等级)**:智能体系统的审计报告三元组 \(I=(P,S,E) \in \{0,1,2,3\}^3\),其中 \(P\) 评定审计者的委托人,\(S\) 评定两个基质的分离度,\(E\) 评定证据能抵御的最强对手。其*等级*为 \(g=\min(P,S,E)\)。 ### 范围与假设 本协议评定审计的独立性,而非系统安全性、正确性或合规性。三个关键假设将在第9节复审:硬件信任根与外部见证者未被破坏;委托人未在评级模型通道外串通;基质谱系若公开则属实。 ## 3. 相关工作与定位 - **委托人独立性**:由职业规范和ISO/IEC 42006的认证机构公正性要求约束。算法审计框架定义其为合同或财务冲突的缺失,前沿AI研究探讨应由哪些机构审计并提出防止审计俘获的保障措施。 - **基质相关性**:已在部署模型、LLM评判者(发现9个模型家族的评审实际仅约2个独立投票)、AI控制监控(同模型“不可信”监控在串谋下退化,可通过释义、重采样或可信弱模型修复)中被记录。 - **可验证证据**:是可信执行环境基准审计、智能体转录见证、工具使用密码学绑定、可验证推理的研究对象;可见性与身份基础设施提供这些机制所证明的记录;分层与分级审计对检查内容和可见度进行分层。 ### 冗余系统中的共因故障 基质轴沿用了非AI领域的谱系:软件可靠性工程发现独立开发的程序版本因输入空间难度函数而在相同困难输入上共同失效,导致N版本编程的独立性假设不成立。可靠性实践将此残余编码为*贝塔因子*:组件故障中共因故障的比例。共享基础模型使AI情况更严峻,因为组件因设计而非偶然趋同而被共享。第4节移植了贝塔因子模型,贡献在于移植及其分级应用。 ### 分析对应性 LLM评审团的设计效应算术、AI控制的可信/不可信监控区分(不可信监控即 \(S=0\),可信弱模型即 \(S \geq 2\))均可视为本模型的特例或正交补。基准审计的 \(E=3\) 可扩展至部署智能体的运行时工具调用。 ### 正交性 访问层级与分层审计与本文正交且可组合:访问层级评定审计者可见度;\(E\) 评定所见是否可能被伪造,因此对未验证工件的白盒访问属于高访问但 \(E=1\)。
相似文章
AgentAudit:一个用于 AI 代理全生命周期信任评估的开放、可扩展框架
AgentAudit 是一个开放且可扩展的框架,用于评估 AI 代理在能力、基础、安全和行为维度的全生命周期,实现精确的故障归因并突出不同语言模型之间的可信度差异。
其他人在AI可审计性方面也遇到困难了吗?
作者描述了一个AI可审计性的挑战,其中代理的决策缺乏与活跃策略版本的可追溯性,并就为AI代理决策构建有效决策路径寻求建议。
超越组件测试:验证智能体AI系统
本综述综合了257篇关于智能体AI系统验证的论文,提出了一个涵盖行为、安全、时间、监管和多智能体问题的五维分类法。它指出了时间有效性、运行时证据维护、监管可读性和开放式多智能体保障方面的空白,认为可信赖的部署需要在上下文中验证轨迹。
治理行动,而非智能体:将机构认证作为自主AI系统的治理模型
本文提出了一种基于机构认证的自主AI智能体治理模型,其中行动通过独立认证的证据进行治理,而非监控智能体推理。该模型通过概念验证实现进行了形式化,适用于临床处方和软件部署等高风险行动。
贵组织如何处理自主系统的审计与合规问题?
一位实践者详细阐述了自主AI代理在审计、合规和治理方面面临的实际挑战,包括身份识别、审批、日志记录和问责机制,并向社区寻求解决方案。