面向关键系统的可信代理型人工智能工程
摘要
本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。
arXiv:2607.18548v1 Announce Type: new
摘要:能够自主感知、规划、使用工具并执行多步骤行动的代理型人工智能系统,正越来越多地被应用于关键工程领域,在这些领域中,决策会带来物理、运营或经济上的后果。本综述通过将可信性——即代理行为在工程实践实际要求的约束下是否可验证、可审计和可信任——视为一个一流的工程属性,而不是仅根据任务能力评估代理型AI,从而填补了当前文献中的空白。该研究采用了一个围绕五个交叉维度组织的可信模型:安全与约束满足;鲁棒性与可靠性;透明性与可解释性;可问责性与可审计性;以及隐私与安全。这被映射到一个从感知到审计的代理保证工作流中。在此基础上,综述了代理系统架构、威胁、具体信任机制和量化指标,以便直接应用于代理系统的开发和评估。随后,在四个受约束的工程领域中检验了这些原则:电力系统、自动驾驶车辆/机器人/无人机、高性能计算和通信网络,识别了重复出现的设计模式、共有的故障模式以及特定领域的差距。综合这些领域,代理型AI的可信性被证明是一个单一的问题,并勾勒出一条通向可复用的跨领域保证框架的路径,类似于成熟的安全关键工程领域所使用的分级认证制度。
查看缓存全文
缓存时间: 2026/07/22 08:22
# 为关键系统构建可信的自主AI代理 来源:https://arxiv.org/html/2607.18548 Omar Al‑Refai (https://orcid.org/0009-0002-8357-0668),Ibrahim Shahbaz (https://orcid.org/0009-0007-2520-3970),Adam Ali Husseinat (https://orcid.org/0009-0002-0426-0486),Michael Mandulak (https://orcid.org/0009-0002-6656-6237),Jaewon Kim (https://orcid.org/0000-0002-3021-729X),Eman Hammad (https://orcid.org/0000-0001-6069-1550) 通讯作者:Omar Al‑Refai(电子邮箱:[email protected])和 Eman Hammad(电子邮箱:[email protected])。 O. Al‑Refai、I. Shahbaz、A. Ali Husseinat 和 E. Hammad 就职于德克萨斯农工大学系统信任与韧性创新(iSTAR)实验室,美国德克萨斯州。E. Hammad 和 M. Mandulak 就职于德克萨斯农工大学数据科学研究所——安全、隐私与韧性助力可信AI(SPARTA)专题实验室,美国德克萨斯州。J. Kim 就职于德克萨斯农工大学全球网络安全研究所(GCRI),美国德克萨斯州。 ###### 摘要 自主人工智能系统(自主AI代理)能够自主感知环境、制定计划、使用工具并执行多步骤行动,正越来越多地被应用于关键工程领域——在这些领域中,决策会带来物理、运营或经济后果。本综述填补了当前文献中的一项空白:它不将自主AI的行为能力作为唯一评判标准,而是将可信性(即自主行为能否在工程实践实际要求的约束下得到验证、审计和信任)作为一项首要的工程属性加以对待。本研究采用了一种围绕五个横切维度组织的可信性模型:安全性与约束满足;鲁棒性与可靠性;透明度与可解释性;问责性与可审计性;以及隐私与安全。该模型映射到一个从感知到审计的自主保障工作流程。在此基础之上,我们调研了自主系统架构、威胁、具体信任机制以及定量指标,以便直接应用于自主系统的开发与评估。随后,我们在四个受约束的工程领域中检验了这些原则:电力系统、自动驾驶车辆/机器人/无人机、高性能计算以及通信网络。我们的分析识别了重复出现的设计模式、共有的失效模式以及各个领域的特定空白。通过对这些领域的综合比较,我们证明自主AI的可信性实际上是一个单一问题,并进而描绘出一条通往可复用的跨领域保障框架的路径——类似于成熟的安全关键工程领域所使用的分级认证体系。 ## I. 引言 自主人工智能(Agentic AI)指的是能够自主感知环境、就目标与中间状态进行推理,并执行一系列行动(通常是迭代式、在较长时间范围内)以在动态环境中实现目标的人工智能系统\[14 (https://arxiv.org/html/2607.18548#bib.bib4)\]。自主AI系统与静态预测式单轮大型语言模型(LLM)之间的关键区别在于,前者纳入了显式的决策循环、记忆、工具使用,有时还包括异构智能体(包括人类)之间的协调。近期的进展通过以下架构将上述理念变为现实:推理与行动交织(例如 ReAct)\[130 (https://arxiv.org/html/2607.18548#bib.bib5)\]、自我反思型智能体(例如 Reflexion)\[107 (https://arxiv.org/html/2607.18548#bib.bib6)\]、在中间推理步骤上进行深思熟虑的搜索(例如思维树)\[129 (https://arxiv.org/html/2607.18548#bib.bib7)\],以及能够进行通信和任务分解的基于LLM的多智能体系统。总的来说,这些方法标志着从被动的AI组件向能够适应、规划和在复杂环境中行动的自主、目标导向系统的转变。 尽管这些能力已在多个领域展现出潜力,但它们在关键基础设施系统(如电力网络、自动驾驶车辆与机器人平台、高性能计算设施以及通信网络)中的实施带来了根本性的可信度挑战\[89 (https://arxiv.org/html/2607.18548#bib.bib8)\]。在这些环境中发生故障可能导致级联中断、人身伤害、经济损失,或者对公众和人类操作员造成安全危害——此外还会导致性能下降\[80 (https://arxiv.org/html/2607.18548#bib.bib9),24 (https://arxiv.org/html/2607.18548#bib.bib10)\]。在自主AI中,可信性是一个关乎存亡的要求,而非辅助性关切。它要求自主智能体持续遵守操作约束,保持对逆境和不确定性的韧性,提供决策过程的透明度,促进问责性和可审计性,并防止滥用或意外升级。与传统的自动化不同,自主AI系统能够创建并执行新的行动序列、与外部工具或模拟器通信,并能在线调整其策略——这既增强了它们的潜在影响,也增加了它们的失效模式。 本综述旨在应对自主AI架构的快速发展与其在关键基础设施中应用时的可靠性认知有限之间的日益扩大的差距。本文提供了一种结构化的、以信任为中心的分析,专门针对那些自主决策会带来重大社会、经济和后果的领域,而不是提供宽泛的或由能力驱动的自主AI概述。除了整理自主可信性技术之外,我们还综合了现有知识,探讨这些系统是否以及能够在何种条件下,在要求严格、容错率低的操作环境中得到负责任的依赖。我们通过以下四种方式对此做出贡献。 首先,我们创建了一个统一的自主AI架构分类体系,涵盖了文献中常见的几种设计模式:推理-行动交织型智能体、自我反思与记忆增强型智能体、基于外部环境的工具增强型智能体、基于结构化搜索的深思规划型智能体,以及具备协调和角色专业化能力的多智能体系统。本综述的概念基础建立在这一分类体系之上,从而能够在原本不同的方法之间进行系统比较。 其次,我们将这些架构类别围绕五个横切的可信性维度进行组织:安全性与约束满足、鲁棒性与可靠性、透明度与可解释性、问责性与可审计性、以及隐私与安全。这些维度映射到一个涵盖从感知到审计的十个要点的自主工作流程\[3 (https://arxiv.org/html/2607.18548#bib.bib26)\]。我们不是将信任视为事后或抽象问题,而是考察信任机制在工作流程中的哪些环节存在、哪些环节缺失——从而揭示出重复出现的不完整覆盖模式、隐含假设以及未解决的风险——这些在关注能力的自主AI讨论中常常被忽视。 第三,我们将这种工作流程层面的视角转化为开发者可以直接行动的内容:对已嵌入自主循环中的信任机制进行综述,包括防护栏、安全强化学习公式,以及针对分布偏移和对抗操控的鲁棒性措施;对AI安全评估如何从表征和推理层面的探测演变为对自主工作流程的行为、风险和轨迹层面的评估进行回顾;以及整合一套定量指标(涵盖工具使用、记忆连贯性、规划质量、策略遵守和目标漂移),这些指标可以直接报告,而不仅仅通过任务成功来推断。 第四,我们将这种架构和信任分析落实到四个受约束的工程领域:电力系统、自动驾驶车辆/机器人/无人机、高性能计算以及通信网络。我们考察了在这些领域中自主AI已被提出或实施的方式,包括用于评估的模拟器、基准和试验台的类型,以及可信性通过可量化约束、失效分析或部署相关指标在多大程度上得到了可操作化落实。通过比较和对比这些领域中自主AI的应用,我们识别并分析了真实世界的操作要求与基准驱动验证之间的差异,以及通用智能体评估无法捕捉的领域特定失效模式。 这引出了一个重要洞见:自主AI的可信性并非四个独立的工程问题,而是从四个观察点看到的同一个问题,由于领域特定的术语和不连贯的评估实践而被掩盖。在每个领域中,都以不同的术语出现了相同的重复性空白:1)在分布偏移和对抗条件下缺乏具有领域意识的安全保障;2)缺乏标准化的以信任为导向的评估;3)形式化验证与运行时监控的整合有限;4)人类-智能体监督不足。基于这一洞见,本综述描绘了一条通往可复用的跨领域可信性框架的路径,类似于航空和汽车安全工程已使用的分级认证制度——从而将该领域下一阶段的进展从架构创新转向保障基础设施。 与目前主要关注推理能力、协调方法和性能指标的自主AI综述不同,本文强调可信性以及关键基础设施带来的挑战。与主要讨论静态模型或单决策场景的可信AI综述不同,我们特别针对自主、顺序性和工具集成的自主系统所带来的独特风险。本综述填补了自主AI、可信性与高风险真实世界应用交叉领域的一个重要空白。它为那些希望将自主AI从实验环境过渡到实际应用的研究人员和实践者提供了坚实的基础。 本文的其余部分安排如下。第II节 (https://arxiv.org/html/2607.18548#S2) 介绍自主AI架构和四个目标领域。第III节 (https://arxiv.org/html/2607.18548#S3) 介绍我们的五个可信性维度和十个要点的保障工作流程。第IV节 (https://arxiv.org/html/2607.18548#S4) 通过这一信任视角分析具有代表性的自主架构。第V节 (https://arxiv.org/html/2607.18548#S5) 调研具体的信任机制,第VI节 (https://arxiv.org/html/2607.18548#S6) 追溯AI安全评估从表征层面探测到自主、轨迹层面评估的演变过程,第VII节 (https://arxiv.org/html/2607.18548#S7) 综合整理自主工作流程的定量指标。第VIII节 (https://arxiv.org/html/2607.18548#S8)、第IX节 (https://arxiv.org/html/2607.18548#S9)、第X节 (https://arxiv.org/html/2607.18548#S10) 和第XI节 (https://arxiv.org/html/2607.18548#S11) 考察具体领域应用,第XII节 (https://arxiv.org/html/2607.18548#S12) 综合跨领域的洞见和空白,第XIII节 (https://arxiv.org/html/2607.18548#S13) 以开放挑战和未来方向作为结论。 ## II. 背景:自主架构与可信AI ### II-A 基于LLM的自主架构 大型语言模型(LLM)的最新进展引发了从静态、单轮推理向自主AI结构的转变。在这些系统中,模型成为闭环设置的一部分,能够随时间推移做出决策、与环境交互并调整自身行为。与传统的LLM使用方式(模型根据固定提示生成响应)不同,自主结构将LLM视为决策核心。这些模型持续观察状态信息、考虑目标和结果、采取行动,并根据接收到的反馈更新其内部信息。这一变化导致了基于LLM的智能体数量不断增长。 从高层次来看,自主架构可以根据所涉及的决策实体数量及其交互模式进行分类。单智能体架构由一个LLM驱动的智能体在环境中运行,通常配备记忆和工具访问权限。这类智能体通常独立处理规划、推理和行动,以实现特定目标。相比之下,多智能体架构涉及多个智能体(每个智能体可能由LLM驱动),它们通过协调、通信或竞争来共同完成任务。多智能体系统通过通信协议、角色专业化、协商和冲突解决增加了复杂性,同时也放大了因协调失败和意外行为带来的挑战。 现代自主AI系统的一个关键特征是它们使用工具并与环境交互。智能体不再仅仅在文本空间中工作,而是越来越多地连接外部API、模拟器、数据库、代码解释器、网络靶场或物理系统模型\[9 (https://arxiv.org/html/2607.18548#bib.bib45)\]。使用这些工具使智能体能够超越语言生成:它们可以查询实时信息、执行控制动作,或操控模拟或真实世界环境。在关键基础设施的背景下,这些环境可能包括电力系统模拟器、强化学习设置、网络模拟器或操作仪表板。这加强了智能体决策与系统级后果之间的关联。 大多数自主架构都可以用一个通用的智能体循环来描述,如图1 (https://arxiv.org/html/2607.18548#S2.F1) 所示,它捕捉了不同实现背后的重复结构。在这个循环中,智能体首先观察环境的当前状态,包括系统输出、传感器数据或先前行动的反馈。然后它对此信息进行推理,以确定最佳行动方案,通常使用链式思考推理、计划或候选行动评估等中间表示。接着,智能体通过发出命令、使用工具或与其他智能体或环境交互来行动。最后,智能体更新其记忆,添加新的观察结果、行动结果或自我反思反馈,以指导未来的决策。这个观察、推理、行动和更新的循环一直持续到满足终止条件。 参见说明 图1:通用自主AI观察-推理-行动循环。 尽管这个智能体循环提供了灵活性,但它也引发了新的信任问题——这些问题在静态模型推理中并不存在。错误可能在迭代中累积,行动可能产生不可逆的影响,并且在与复杂环境或其他智能体的长期交互中可能出现意外行为。因此,理解不同的自主架构如何实现这个循环,以及在哪些环节包含了保障措施、约束或监督机制,至关重要。这种理解对于评估它们在高风险、安全关键场景中的适用性至关重要。这一基础性洞见推动了本综述其余部分中分类体系和以信任为中心的分析。 在单智能体循环的基础上,多智能体系统(MAS)将这些过程分布到一个专业化实体的网络中。在多智能体设置中,“环境”通常成为一个共享空间。在这里,一个智能体的行动成为另一个智能体的观察结果。这就创建了一个控制个体智能体如何交互的协调循环。这些系统通常依赖于一个通信层,通常被称为“黑板”或
相似文章
面向可信Agentic AI:安全性、鲁棒性、隐私与系统安全综合综述
本调查全面审视了可信的Agentic AI,重点关注安全性、鲁棒性、隐私和系统安全。它澄清了关键概念,沿着Agent工作流程识别风险,总结缓解策略,并整合评估指标和基准,旨在作为在高风险环境中部署Agentic AI的实用参考。
真正让你信任AI的是什么?不是“听起来正确”,而是像信任一个人或一个机构那样信任它?
一场讨论,探讨哪些具体条件(透明度、可验证的记录、持久的身份、可问责性)能让人们像信任人类或机构一样信任AI系统,而不仅仅是将其视为工具。
Agentic AI 的安全与隐私:重大挑战与未来方向
本文基于一项包含三十位国际专家的前瞻性扫描活动,提出了 Agentic AI 安全与隐私方面的关键挑战和未来研究方向。该活动识别出由于 AI 自主性和权限增加而带来的新兴风险,包括提示注入攻击和恶意应用。
面向企业AI智能体的部署前保障:基于本体论的仿真与信任认证
研究人员提出了一种基于本体论的企业AI智能体部署前验证框架,结合了智能体操作包络、自动化场景生成以及可机器验证的信任证书与分级部署判定。在四个受监管行业开展的试点研究共生成1,800个测试场景,结果显示基于本体论的生成方法在监管覆盖率上显著优于基于角色的基线方法。
团队在信任AI代理用于实际工作流程之前应问什么问题?
本文提出了团队在信任AI代理用于实际工作流程之前应考虑的关键问题,重点关注可靠性、责任感和正确性。