面向可信Agentic AI:安全性、鲁棒性、隐私与系统安全综合综述

arXiv cs.AI 论文

摘要

本调查全面审视了可信的Agentic AI,重点关注安全性、鲁棒性、隐私和系统安全。它澄清了关键概念,沿着Agent工作流程识别风险,总结缓解策略,并整合评估指标和基准,旨在作为在高风险环境中部署Agentic AI的实用参考。

arXiv:2605.23989v1 Announce Type: new 摘要: Agentic AI系统——通过规划、工具使用、记忆和长期交互增强的大型语言模型(LLMs)——能够自主执行复杂任务,但其多步轨迹引入了新的故障模式,挑战了可信性。本调查通过两个对高风险部署至关重要的核心维度——安全性与鲁棒性,以及隐私与系统安全——重点审视了可信Agentic AI。针对每个维度,我们澄清关键概念,识别沿Agent工作流程出现的风险,并总结针对阶段的缓解策略。其他可信性方面(价值对齐、透明度、公平性和问责制)作为相关背景讨论,而非独立章节。为支持一致比较和部署决策,我们将评估整合为一个统一的指标与基准中心,强调结果和过程信号(例如,约束违反、轨迹完整性和对抗成功率),并提供场景到指标的发布门控指南。最后,我们概述了开放挑战,如自我进化的Agent、运行时监控与验证、隐私保护个性化以及信任-效用权衡,并呈现了一个开源Agentic系统中真实世界安全失败的案例研究。我们的目标是作为研究人员和从业者在高风险环境中构建可信Agentic系统的实用参考。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:04

# 1 引言 来源:https://arxiv.org/html/2605.23989 ###### 摘要 智能体AI系统——具备规划、工具使用、记忆和长程交互能力的大型语言模型(LLM)——可以自主执行复杂任务,但其多步轨迹引入了新的故障模式,挑战了可信赖性。本综述聚焦于可信赖智能体AI的两个核心维度,这对于高风险部署至关重要:安全性与鲁棒性,以及隐私与系统安全。针对每个维度,我们澄清关键概念,指出风险在智能体工作流中出现的环节,并总结针对各阶段的缓解策略。其他可信赖性方面(价值对齐、透明度、公平性和问责制)则作为相关背景讨论,而非独立章节。为支持一致的比较和部署决策,我们将评估整合为一个统一的指标与基准中心,强调结果信号和过程信号(例如,约束违反、轨迹完整性、对抗攻击成功率),并提供针对发布门控的场景到指标指导。最后,我们总结了开放挑战,如自我进化智能体、运行时监控与验证、隐私保护个性化以及信任-效用权衡,并呈现了一个真实世界中开源智能体系统(OpenClaw/Moltbook)安全故障的案例研究。我们的目标是成为研究人员和实践者在高风险环境中构建可信赖智能体系统的实用参考。 **关键词:** 智能体AI;可信赖性;安全性;鲁棒性;隐私;系统安全;大型语言模型;评估;基准;多智能体系统

\\pubvolume 2\\issuenum1\\externaleditor Academic Editors: Vincent Hilaire, Soo Ling Lim\\datereceived 1 February 2026\\dateaccepted 9 April 2026\\datepublished Day Month 2026\\doinum 10.20935/xxx

**标题:** 迈向可信赖智能体AI:关于安全性、鲁棒性、隐私和系统安全的全面综述

**标题引用:** 迈向可信赖智能体AI:关于安全性、鲁棒性、隐私和系统安全的全面综述

**作者:** Jinhu Qi1, Muzhi Li1, Jiahong Liu1, Yuqin Shu1, Dianzhi Yu1, Shicheng Ma1, Wenqian Cui1, Yiyang Zhao2,3, Yiyi Chen2, Ruoxi Jiang2,3, Irwin King1,\*, Zenglin Xu2,3,\*

**作者名称:** Qi J, Li M, Liu J, Shu Y, Yu D, Ma S, et al

**作者引用:** Qi J, Li M, Liu J, Shu Y, Yu D, Ma S, et al

**通讯作者:** [email protected] (I.K.); [email protected] (Z.X.)

### 1.1 动机

从静态的大型语言模型(LLM)到具备自主规划、工具调用和多步推理能力的智能体系统的范式转变,使得它们能够被部署在关键的现实世界应用中。从自动化复杂的软件开发周期,到作为医疗和金融服务中的智能中介,这些智能体利用其与外部环境交互的能力来实现高级目标[3 (https://arxiv.org/html/2605.23989#bib.bib3),4 (https://arxiv.org/html/2605.23989#bib.bib4),5 (https://arxiv.org/html/2605.23989#bib.bib5)]。这种日益增强的自主性将它们从单纯的效率工具转变为现代数字基础设施的核心节点。然而,随着基于LLM的助手越来越多地连接到企业数据和工具,故障可能会直接转化为现实世界的影响。例如,Microsoft 365 Copilot 中一个“零点击”提示注入漏洞(CVE-2025-32711,“EchoLeak”)被公开报告并修补,凸显了特制的不可信输入(如电子邮件)可能触发意外行为并在无需用户明确交互的情况下导致敏感数据泄露[6 (https://arxiv.org/html/2605.23989#bib.bib6),7 (https://arxiv.org/html/2605.23989#bib.bib7)]。更广泛地说,先前的工作表明,间接提示注入模糊了LLM集成应用中数据与指令的边界,使得从网络或文档中检索的由攻击者控制的内容能够劫持使用工具的智能体,导致数据外泄或意外操作[8 (https://arxiv.org/html/2605.23989#bib.bib8),9 (https://arxiv.org/html/2605.23989#bib.bib9),10 (https://arxiv.org/html/2605.23989#bib.bib10)]。这些事件强调了智能体AI的“可信赖性”必须在系统层面进行评估,而不仅仅是单轮输出。

在此背景下,大型语言模型(LLM)已从纯粹的文本生成器迅速演变为能够在世界中“行动”的系统。现代的“智能体AI”通过规划、工具使用(例如,网页浏览、API和代码执行)、记忆以及长程交互来增强LLM,使它们能够将复杂目标分解为可执行的步骤,并根据反馈迭代地优化行为[11 (https://arxiv.org/html/2605.23989#bib.bib11)]。代表性系统证明,这类智能体可以自主探索环境并持续获取技能(例如,通过终身交互和自我改进循环)[12 (https://arxiv.org/html/2605.23989#bib.bib12),13 (https://arxiv.org/html/2605.23989#bib.bib13),14 (https://arxiv.org/html/2605.23989#bib.bib14)]。这种从静态单轮模型到自主或半自主智能体的转变是一项能力的飞跃——但也引入了质的新风险。与传统的预测模型或基于聊天的LLM不同,智能体系统产生多步轨迹,其中间状态(计划、工具调用、检索到的证据和记忆更新)可以直接影响现实世界的结果。轨迹早期的一个小错误可能会级联成高影响的操作,并且智能体与工具的交互扩大了攻击面(提示注入、工具滥用和数据外泄),超出了传统LLM安全评估所涵盖的范围。此外,智能体越来越多地在人类监督是间歇性而非连续性的环境中运行;这引发了关于智能体行为问责性、可审计性和可中断性的根本性问题[15 (https://arxiv.org/html/2605.23989#bib.bib15),16 (https://arxiv.org/html/2605.23989#bib.bib16)]。随着智能体自主性的增长,“可信赖性”不仅必须通过最终输出来评估,还必须通过过程信号,如约束合规性、轨迹证据以及对对抗性和长程压力的鲁棒性来评估。

同时,可信赖性本身并非单一属性。它涵盖多个相互作用的维度:增强记忆可以提高有效性,但也可能增加隐私风险;增加安全防护可以减少灾难性故障,但可能降低效用或增加成本;解释接口可以提高可审计性,但如果解释不忠实,也可能导致过度信任。这些张力促使我们进行一项综述,将可信赖智能体AI视为一个系统级问题而非仅模型问题,并使得评估在不同维度和部署场景间具有可比性。

### 1.2 范围与视角

我们关注基于LLM的智能体系统,这些系统 (i) 在扩展的时间跨度上进行规划,(ii) 使用外部工具和环境,(iii) 可能包含记忆、自我反思或多智能体交互。为了结构化讨论,我们采用智能体工作流视角——**感知→规划→行动→反思→学习**——来精确定位风险产生的位置以及缓解措施的介入点。此工作流并非严格的架构要求;相反,它为跨不同智能体设计映射威胁、防御和评估信号提供了一致的接口。

### 1.3 与基于聊天的系统风险的关系

本综述中讨论的许多信任与安全问题——如有害内容生成、欺骗性输出或不适当建议——也出现在非智能体的、基于聊天的LLM系统中。我们不排除这些基础风险;相反,我们强调智能体的自主性以质的新方式放大并扩展了它们。例如,针对基于聊天的系统的提示注入攻击可能会产生误导性文本,但针对使用工具的智能体的相同攻击可能触发未经授权的代码执行、数据外泄或不可逆的现实世界操作。类似地,在聊天环境中,有害说服受限于对话,而拥有工具访问权限的智能体可以在多步轨迹中自主地基于这种说服采取行动。因此,我们调查的风险和缓解措施并非智能体系统独有,但当智能体具备现实世界能力时,它们的严重性、攻击面和级联潜力要大得多[17 (https://arxiv.org/html/2605.23989#bib.bib17)]。在适用情况下,我们会注明某一风险或方法也适用于非智能体的LLM部署。

### 1.4 说明性而非穷举性范围

鉴于智能体AI快速演变的特性,本综述讨论的风险和缓解方法应被理解为反映当前知识状态的说明性示例,而非可证明的穷举列举。随着智能体架构、工具生态系统和部署环境的持续演进,新的风险和解决方案方法很可能会出现。在可能的情况下,我们会指出当前理解的边界,并强调覆盖仍不完整的领域。

### 1.5 与现有综述的比较

先前的综述已经研究了通用AI系统的可信赖AI原则和要求(例如,[18 (https://arxiv.org/html/2605.23989#bib.bib18)])以及大型语言模型的可信评估(例如,[19 (https://arxiv.org/html/2605.23989#bib.bib19),20 (https://arxiv.org/html/2605.23989#bib.bib20)])。最近的工作开始涉及基于LLM的智能体和多智能体系统的信任/安全问题(例如,[21 (https://arxiv.org/html/2605.23989#bib.bib21),22 (https://arxiv.org/html/2605.23989#bib.bib22)]),或提供了智能体AI的架构/应用中心概述(例如,[23 (https://arxiv.org/html/2605.23989#bib.bib23),24 (https://arxiv.org/html/2605.23989#bib.bib24)])。相比之下,本综述将多维信任分类与工作流视角相结合,并进一步整合了过程感知评估和基于场景的发布门控(表1 (https://arxiv.org/html/2605.23989#S1.T1))。

**表1:与可信赖AI/大型语言模型/智能体相关的代表性综述的比较。**

| 综述 | 范围 | MDT | WL | EH | RG |
|------|------|-----|-----|-----|-----|
| [18] | 通用TAI | ✓ | - | ∼ | - |
| [19] | 可信LLM | ✓ | - | ∼ | - |
| [20] | LLM基准 | ✓ | - | ✓ | - |
| [21] | LLM智能体/MAS | ∼ | ∼ | ∼ | - |
| [22] | LM及智能体(安全) | ∼ | - | ✓ | - |
| [23] | 智能体AI(架构) | ∼ | ∼ | - | - |
| [24] | 工具学习智能体 | ∼ | ∼ | ∼ | - |
| 本综述(我们的) | 可信智能体AI | ✓ | ✓ | ✓ | ✓ |

**列缩写:** MDT:多维信任分类;WL:工作流视角(感知–规划–行动–反思–学习);EH:评估中心(整合指标和基准);RG:发布门控(场景到指标指导)。
**符号:** ✓:明确主要焦点;∼:部分覆盖;-:非主要焦点。

### 1.6 贡献

我们的主要贡献如下:

*   **对两个核心可信赖维度的聚焦审查。** 我们专注于安全性与鲁棒性以及隐私与系统安全——这两个维度对于高风险智能体AI部署尤其关键。其他可信赖性方面(价值对齐、透明度、公平性和问责制)作为相关背景讨论,而非独立章节。
*   **沿智能体工作流的风险到方法映射。** 对于每个核心维度,我们提供一致的**定义→风险→方法**结构,说明故障可能发生在智能体生命周期的哪个环节,并总结代表性的阶段针对性缓解措施(例如,约束优化、红队测试、运行时防护和沙箱)。这些映射旨在说明当前格局,而非穷举。
*   **整合的指标与基准评估中心。** 由于评估内容常常分散在子领域中,我们将跨维度的指标和代表性的基准系列整合到第4节 (https://arxiv.org/html/2605.23989#S4)。我们强调结果指标(例如,成功率和灾难性风险)和过程指标(例如,约束违反率和轨迹覆盖率),并为高风险场景中的实际发布门控提供场景到指标的指导。
*   **开放挑战与解决方案。** 我们识别了研究前沿,例如概念漂移下的自我进化智能体、罕见事件和交互设置的验证与运行时监控、隐私保护个性化以及信任-效用权衡。

**图1:论文结构与阅读指南。** 本综述从动机和智能体AI预备知识(第1节和第2节)开始,然后介绍两个核心可信赖维度——安全性与鲁棒性以及隐私与系统安全——采用一致的**定义→风险→方法**结构(第3节)。评估指标整合了过程级和结果级评估(第4节)。挑战与解决方案作为综述的总结(第6节)。灰色框代表引言和结论部分;紫色框代表预备知识;绿色框代表核心维度;黄色框代表评估中心。实线箭头表示主要阅读流程;虚线箭头表示维度与评估之间的依赖关系。

### 1.7 论文组织

图1 (https://arxiv.org/html/2605.23989#S1.F1) 展示了整体结构并提供了阅读指南。本综述分为四个主要部分:

1.  1. **预备知识(第2节)**:定义智能体AI及其组件,沿五阶段工作流(感知–规划–行动–反思–学习;参见图2 (https://arxiv.org/html/2605.23989#S2.F2) 了解系统架构),并回顾与可信训练相关的强化学习和偏好优化基础,并概述

相似文章

Agentic AI 的安全与隐私:重大挑战与未来方向

arXiv cs.AI

本文基于一项包含三十位国际专家的前瞻性扫描活动,提出了 Agentic AI 安全与隐私方面的关键挑战和未来研究方向。该活动识别出由于 AI 自主性和权限增加而带来的新兴风险,包括提示注入攻击和恶意应用。

2026年4月9日政策:实践中的可信智能体

Anthropic Research

Anthropic 发布了一篇研究文章,详细阐述如何在实践中构建可信的 AI 智能体,概述了核心安全原则以及 Claude Code 和 Claude Cowork 等产品实现。