TrustX Agent Risk Classification Framework (ARC): 对内创建的自主体AI系统的风险分层

arXiv cs.AI 论文

摘要

本文介绍了TrustX Agent Risk Classification Framework (ARC),这是一个结构化的工具,用于对内创建的自主体AI系统进行风险分层,基于现有的治理框架,并包含一个十二维度评分标准、自主性级别和三层级治理输出。

arXiv:2607.09586v1 Announce Type: new 摘要:自主体AI系统在企业及公共部门环境中的激增,已超出通用AI风险框架对其分类和治理的能力。本文介绍了TrustX Agent Risk Classification Framework (ARC),这是一个结构化、可重复使用的工具,可应用于七种类型的自主体AI系统,并基于现有的基础AI治理框架。该框架的核心是一个十二维度评分标准,能够稳健地量化风险。该评分标准与其他组件(如GPA + IAT分类模型和基于现有文献的五级自主性框架)相结合。这些输入产生一个三层治理输出,并附带相应的控制建议。还包含一个专门的编码助手扩展,以考虑此类自主体AI系统的特定细微差别。然后我们通过一个示例说明该框架的实际应用。ARC旨在服务AI治理从业者、风险官员、开发者和监管者,并将随着我们不断扩展和增强其稳健性而定期迭代。社区可在此处访问交互式框架:https://arc.responsible.ai/
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:54

# TrustX 智能体风险分类框架 (ARC):内部创建的自主型 AI 系统的风险分级

来源:https://arxiv.org/html/2607.09586
Rhea Saxena 负责任人工智能研究所 rhea@responsible\.ai Shiv Asthana 负责任人工智能研究所 shiv@responsible\.ai

###### 摘要

自主型 AI 系统在企业及公共部门领域的广泛部署,已超出通用 AI 风险框架对其进行分类和治理的能力范围。在本文中,我们介绍了 TrustX 智能体风险分类框架(ARC),这是一套结构化、可重复的评估工具,可应用于七类自主型 AI 系统,并基于现有 AI 治理框架构建。该框架的核心是一个十二维评分标准,能够稳健地量化风险。该评分标准与其他组成部分相结合,例如源于现有文献的 GPA + IAT 分类模型以及五级自主性框架。这些输入产生一个三级治理输出,并附有对应的控制建议。此外,我们还提供了一个专门的编码助手扩展,以考虑此类自主型 AI 系统的特定细微差别。然后,我们通过一个示例来说明该框架的实际应用。ARC 面向 AI 治理从业者、风险官、开发者和监管机构,并将在我们持续扩展和增强其稳健性的过程中定期进行迭代。社区可通过交互式框架(https://arc.responsible.ai/)进行访问。

*关*键词:AI 治理·风险评估·自主型 AI·企业 AI 风险·治理框架

## 1 引言

自主型 AI 系统(即具备较高程度自主性和编排能力的先进感知、规划与行动能力的应用[42 (https://arxiv.org/html/2607.09586#bib.bib14),51 (https://arxiv.org/html/2607.09586#bib.bib23),48 (https://arxiv.org/html/2607.09586#bib.bib24)])在企业管理、金融服务、医疗保健、软件开发及公共部门管理中的部署已加速进行。近期调查记录了基于 LLM 的智能体在研究和工业领域的快速扩张[51 (https://arxiv.org/html/2607.09586#bib.bib23),48 (https://arxiv.org/html/2607.09586#bib.bib24)],而实证分析则警告称,智能体能力的增长速度超过了可靠评估其所需治理实践的演进速度[23 (https://arxiv.org/html/2607.09586#bib.bib25)]。

自主型 AI 的快速普及带来了现有通用 AI 风险框架无法解决的治理挑战,这一缺口在早期关于自主型 AI 系统治理实践的研究中已有所体现[44 (https://arxiv.org/html/2607.09586#bib.bib22)]。例如,NIST AI 风险管理框架[32 (https://arxiv.org/html/2607.09586#bib.bib3)]、ISO/IEC 42001[21 (https://arxiv.org/html/2607.09586#bib.bib5)]、OWASP 指南[33 (https://arxiv.org/html/2607.09586#bib.bib6),34 (https://arxiv.org/html/2607.09586#bib.bib7)]以及 MITRE ATLAS 技术[30 (https://arxiv.org/html/2607.09586#bib.bib8)]均具有影响力,但其指南在很大程度上是自愿性的。SR 11-7 和 SR 26-2 等行业特定工具有助于强制银行实施模型风险管理,但已明确指出其指南不涵盖生成式 AI 和自主型 AI[6 (https://arxiv.org/html/2607.09586#bib.bib9),5 (https://arxiv.org/html/2607.09586#bib.bib10)]。最接近具有约束力的监管文件是 EU AI Act[15 (https://arxiv.org/html/2607.09586#bib.bib4)],但其范围也未能考虑自主型 AI,原因在于该法案在自主型 AI 系统广泛普及之前便已发布。

与此同时,一系列现实世界事件已证明了不受约束的自主型系统的具体风险。2025 年 11 月,Anthropic 披露一个名为 GTG-1002 的中国国有背景组织操纵 Claude Code 对大约 30 个全球目标进行间谍活动,该编码助手智能体自主执行了约 80-90% 的攻击[3 (https://arxiv.org/html/2607.09586#bib.bib15)]。2025 年 12 月,安全研究员 Ari Marzouk 将其发现称为“IDEsaster”,原因是他在超过十种 AI 编码工具中发现了 30 多个漏洞,包括通过 JSON Schema 攻击和 IDE 设置操纵实现远程代码执行[28 (https://arxiv.org/html/2607.09586#bib.bib16),25 (https://arxiv.org/html/2607.09586#bib.bib17)]。2025 年 3 月,Pillar Security 披露了“规则文件后门”攻击,其中隐藏的 Unicode 字符被用于配置文件以操纵 Copilot 和 Cursor 的输出[24 (https://arxiv.org/html/2607.09586#bib.bib18)]。许多此类事件体现了一类更广泛的间接提示注入攻击,这在 Greshake 等人[18 (https://arxiv.org/html/2607.09586#bib.bib26)]的先前工作中已有描述,即嵌入在第三方内容中的对抗性指令被集成 LLM 的应用程序所执行。2026 年,我们看到这类自主型 AI 事件持续发生,从持久性提示注入[27 (https://arxiv.org/html/2607.09586#bib.bib19)]到无需大量人为参与即可执行多阶段攻击[26 (https://arxiv.org/html/2607.09586#bib.bib20)]。

在本文中,我们旨在为评估自主型 AI 系统的风险提供实用建议。我们提供了一套完整的接收与风险评估方法论,同时采用了 Bommarito[7 (https://arxiv.org/html/2607.09586#bib.bib1)] 和 Feng[16 (https://arxiv.org/html/2607.09586#bib.bib2)] 关于自主型 AI 和智能体自主性的操作性定义。该框架的核心是一个十二维风险评分标准,其基础基于当前的治理框架[15 (https://arxiv.org/html/2607.09586#bib.bib4),32 (https://arxiv.org/html/2607.09586#bib.bib3),21 (https://arxiv.org/html/2607.09586#bib.bib5),30 (https://arxiv.org/html/2607.09586#bib.bib8),33 (https://arxiv.org/html/2607.09586#bib.bib6),34 (https://arxiv.org/html/2607.09586#bib.bib7),6 (https://arxiv.org/html/2607.09586#bib.bib9),5 (https://arxiv.org/html/2607.09586#bib.bib10)]。最终通过框架所有组成部分的加权计算得出三级风险评估输出,该输出采用“关键维度”方法,防止高风险在算法中被平均化。该框架包含一个专门的编码助手扩展,以考虑此类自主型 AI 系统的进一步细微差别。

我们的主要贡献如下:

1.  1. **十二维风险评分标准**,基于既有框架构建,采用“关键维度”方法防止高风险被平均化。
2.  2. 专门的编码助手扩展,包括评估编码助手特定属性的能力评估、伴随核心自主性级别分类的部署模型分类,以及编码助手特定的额外风险因素。
3.  3. **全面的框架权重公式**,有效考虑所有评估组件,产生风险分级输出。

## 2 背景与相关工作

### 2.1 现有的 AI 风险评估与治理框架

ARC 工具建立在多个基础且成熟的框架之上。NIST AI RMF[32 (https://arxiv.org/html/2607.09586#bib.bib3)] 为社区提供了一个以四项功能为核心的结构:映射、测量、管理和治理。前三个是本地化组件,而治理则是一个影响并贯穿其他三个组件的功能。生成式 AI 配置文件(NIST AI 600-1)列举了生成式模型新引入或加剧的风险[4 (https://arxiv.org/html/2607.09586#bib.bib27)]。EU AI Act[15 (https://arxiv.org/html/2607.09586#bib.bib4)] 是 AI 治理领域最具影响力的立法之一,建立了四级风险分类,并对高风险系统施加了具有约束力的义务。ISO/IEC 42001[21 (https://arxiv.org/html/2607.09586#bib.bib5)] 是首个 AI 管理体系的国际标准,提供了个人可用于解决 AI 系统部署中各种问题的适用控制措施。OWASP 发布了针对自主型 AI 架构的威胁模式框架,例如关于自主型 AI 威胁与缓解的白皮书[33 (https://arxiv.org/html/2607.09586#bib.bib6)] 以及 2026 年自主型应用前十名[34 (https://arxiv.org/html/2607.09586#bib.bib7)]。MITRE ATLAS[30 (https://arxiv.org/html/2607.09586#bib.bib8)] 是一个知识库,记录了针对 AI 系统的对抗性风险和技术。最后,美联储通过 SR 11-7 和 SR 26-2[6 (https://arxiv.org/html/2607.09586#bib.bib9),5 (https://arxiv.org/html/2607.09586#bib.bib10)] 提供的模型风险管理指南,为 AI 驱动的金融模型提供了具体指导。

除了这些既定框架,AI 治理和风险评估领域还有其他一些发展。例如,AURA 框架[12 (https://arxiv.org/html/2607.09586#bib.bib11)] 通过采用模块化方法和基于 Gamma 的风险评分方法论来解决智能体自主性风险评估问题。另一个例子是云安全联盟基于能力的风险评估(CBRA),它通过包含四个核心风险维度为企业提供了一种可扩展的治理方法[1 (https://arxiv.org/html/2607.09586#bib.bib21)]。在近两年,针对智能体治理的具体工作开始出现。Chan 等人[8 (https://arxiv.org/html/2607.09586#bib.bib28)] 提出了智能体可见性措施,如标识符、实时监控、活动日志记录,并随后概述了调解和归因智能体交互所需的基础设施[10 (https://arxiv.org/html/2607.09586#bib.bib29)]。South 等人开发了身份验证委托协议,让人类负责人指导智能体的权限[47 (https://arxiv.org/html/2607.09586#bib.bib30)],而 Hammond 等人[19 (https://arxiv.org/html/2607.09586#bib.bib31)] 则调查了多智能体设置中特有的故障模式。分类学方面的相关工作包括 MIT AI 风险库[46 (https://arxiv.org/html/2607.09586#bib.bib32)]、Weidinger 等人[49 (https://arxiv.org/html/2607.09586#bib.bib33)] 的语言模型风险分类法以及 Raji 等人[38 (https://arxiv.org/html/2607.09586#bib.bib34)] 的内部算法审计框架。沙盒化和对抗性基准测试,如 ToolEmu[39 (https://arxiv.org/html/2607.09586#bib.bib36)]、AgentDojo[13 (https://arxiv.org/html/2607.09586#bib.bib37)] 和 AgentHarm[2 (https://arxiv.org/html/2607.09586#bib.bib38)],将智能体风险测量操作化用于评估。

然而,现有的这些框架在自主型 AI 风险评估方面缺少几个关键组成部分。既定的通用 AI 治理框架不一定具备涵盖自主型 AI 的能力,这要么是由于其自愿性质,要么是因为其最后发布的时间。较新的工作直接涉及自主型 AI,但往往要么是狭隘的评估性(如上述基准测试),要么是立场导向的,支持或反对某种行动方案,而不是提供可重复的分类工具。例如,Mitchell 等人[29 (https://arxiv.org/html/2607.09586#bib.bib35)] 认为完全自主的智能体根本不应该被开发。

### 2.2 AI 编码助手的具体细微差别

AI 编码助手在任何自主型风险框架中都值得单独处理。这些工具源于在代码上训练的大语言模型,从 Codex[11 (https://arxiv.org/html/2607.09586#bib.bib39)] 开始,已从自动补全式的建议引擎发展为自主型系统,如 SWE-agent[52 (https://arxiv.org/html/2607.09586#bib.bib44)],该系统可自主导航代码库、编辑文件和执行测试。像 SWE-bench 这样的基准测试显示,在真实世界的软件工程任务上取得了快速进展[22 (https://arxiv.org/html/2607.09586#bib.bib43)]。这种演进伴随着安全代价。Pearce 等人[36 (https://arxiv.org/html/2607.09586#bib.bib40)] 发现,Copilot 生成的安全相关场景程序中约 40% 包含漏洞。Perry 等人[37 (https://arxiv.org/html/2607.09586#bib.bib41)] 在一项受控用户研究中表明,获得 AI 辅助的开发人员编写的代码显著更不安全,同时却认为更安全。Sandoval 等人[41 (https://arxiv.org/html/2607.09586#bib.bib42)] 在系统编程用户研究中发现了类似结果。Hou 等人[20 (https://arxiv.org/html/2607.09586#bib.bib45)] 补充说,模型上下文协议(现在作为编码助手访问外部工具的标准协议)引入了自身的安全威胁。结合第 1 节描述的事件[3 (https://arxiv.org/html/2607.09586#bib.bib15),28 (https://arxiv.org/html/2607.09586#bib.bib16),25 (https://arxiv.org/html/2607.09586#bib.bib17),24 (https://arxiv.org/html/2607.09586#bib.bib18),27 (https://arxiv.org/html/2607.09586#bib.bib19)],这就是第 4 节引入专用编码助手扩展的原因。

### 2.3 自主型 AI 的概念基础

AI 中的智能体概念已从早期的符号 AI 规划器演变为今天基于基础模型的智能体,能够进行多步推理、使用工具和自主执行。关键的技术里程碑包括 ReAct[53 (https://arxiv.org/html/2607.09586#bib.bib46)],它将推理轨迹与环境改变动作交织在一起;Toolformer[43 (https://arxiv.org/html/2607.09586#bib.bib47)],它展示了语言模型可以自学调用外部工具;以及多智能体编排框架,如 AutoGen[50 (https://arxiv.org/html/2607.09586#bib.bib48)],它将多个对话智能体组合成更大的工作流。Bommarito 等人[7 (https://arxiv.org/html/2607.09586#bib.bib1)] 通过 GPA + IAT 属性模型捕捉了这一进展,该模型通过六个操作属性定义智能体能力。

属性的前半部分(GPA)是“最低智能体”的基础要求。缺乏这些核心属性的系统在 Bommarito 等人的模型中被归类为“非智能体”。G 代表目标(Goal),即智能体追求客观目标。P 代表感知(Perception),即智能体接收环境信息。A 代表行动(Action),即智能体有能力影响环境。

属性的后半部分(IAT)使系统成为“自主型系统”。I 代表迭代(Iteration),即智能体在重复的感知-行动循环中运行。A 代表适应(Adaptation),即智能体能够根据用户反馈修改其行为。最后,T 代表终止(Termination),即智能体有定义的停止条件。

### 2.4 自主型系统中的自主性级别

自动化的分级水平在人因工程研究中有着悠久的历史,源于 Sheridan 和 Verplank 针对水下遥操作提出的十级自动化量表[45 (https://arxiv.org/html/2607.09586#bib.bib49)],后来由 Parasuraman 等人[35 (https://arxiv.org/html/2607.09586#bib.bib50)] 细化为一个关于人与自动化交互类型和级别的模型。SAE J3016[40 (https://arxiv.org/html/2607.09586#bib.bib51)] 驾驶自动化级别展示了此类量表如何在安全关键领域中锚定监管和行业实践,而 Morris 等人[31 (https://arxiv.org/html/2607.09586#bib.bib52)] 近期已

相似文章

为代理经济降低风险

Reddit r/AI_Agents

x402 Trust 持续监控超过 85,000 个端点并提供风险评分,防止AI代理在支付中受骗,同时通过语义搜索识别可信服务。