隔离作为LLM-Agent系统安全的首要原则:概念、分类、挑战与未来方向
摘要
本文提出将隔离作为LLM-Agent系统安全的首要原则,并给出一种以边界为中心的故障与防御分析分类法。该分类法系统性地对五大边界上的安全问题进行了划分,并概述了未来研究方向。
arXiv:2607.12406v1 Announce Type: new
摘要:LLM Agent作为系统“大脑”的能力从根本上扩展了分析范围,不再局限于独立模型。因此,安全性不再仅仅涉及输入输出内容对齐,还涉及系统行为和实际执行结果。然而,当前文献在攻击类型、应用场景和基准测试方面较为分散,导致难以解释为何提示注入、工具误用和记忆中毒等故障常常具有相同的结构原因,以及它们如何在Agent工作流中传播。在本综述中,我们将隔离视为LLM-Agent系统安全的首要原则。所谓隔离,是指对用户输入、工具访问、执行通道、Agent间通信以及环境来源上下文的分离。我们通过一种以边界为中心的分类法组织文献,该分类法包含五个边界:用户-Agent、Agent-工具、Agent-执行、Agent-Agent和系统-环境。这种视角有助于识别隔离失效的首要发生位置、损害如何在边界间传播,以及每个接口上最相关的防御措施。我们还总结了跨边界故障路径,讨论了开放挑战,并概述了未来Agent系统中“构建即隔离”的研究议程。
查看缓存全文
缓存时间: 2026/07/15 04:20
# 隔离作为大语言模型智能体系统安全的第一原则:概念、分类、挑战与未来方向 来源:https://arxiv.org/html/2607.12406 Huihao Jing![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x1.png), Wenbin Hu![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x2.png), Shaojin Chen![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x3.png), Haochen Shi![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x4.png), Sirui Zhang![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/assets/nyu.png)![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x5.png), Hanyu Yang![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/assets/swupl.png)![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x6.png), Changxuan Fan![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x7.png), Zhongwei Xie![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x8.png), Hongyu Luo![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x9.png), Wun Yu Chan![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x10.png), Wei Fan![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x11.png), Haoran Li![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x12.png), Yangqiu Song![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x13.png) ![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x14.png)HKUST, ![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/assets/nyu.png)NYU, ![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/assets/swupl.png)SWUPL, ![[Uncaptioned image]](https://arxiv.org/html/2607.12406v1/x15.png)MODEIO.AI, [email protected] ###### 摘要 LLM智能体作为系统“大脑”的能力,从根本上拓展了分析范围,使其不再局限于单模型。因此,安全问题不再仅是输入-输出内容对齐,还涉及系统行为和真实世界的执行结果。然而,现有文献在攻击类型、应用领域和基准测试方面仍然零散。这导致很难解释为什么提示注入、工具误用和记忆投毒等失效往往共享相同的结构性原因,以及它们如何在智能体工作流中传播。在本综述中,我们将隔离视为LLM智能体系统安全的第一原则。所谓隔离,指的是用户输入、工具访问、执行通道、智能体间通信以及环境来源上下文的分离。我们通过一个以边界为中心的分类法来组织文献,包含五个边界:用户-智能体、智能体-工具、智能体-执行、智能体-智能体、系统-环境。这种视角有助于识别隔离最初在何处丧失、损害如何跨边界传播,以及每个接口上哪些防御最为相关。我们还总结了跨边界失效路径,讨论了开放挑战,并概述了一个面向未来智能体系统中“构建即隔离”的研究议程。 ## 1 引言 参照图注 图1:以边界为中心的LLM智能体系统安全分类法,围绕五个隔离边界组织:用户-智能体、智能体-工具、智能体-执行、智能体-智能体、系统-环境。 LLM智能体正快速从研究原型转向实际系统。最近的例子包括CodexOpenAI (2025 (https://arxiv.org/html/2607.12406#bib.bib87))、Claude CodeAnthropic (2025 (https://arxiv.org/html/2607.12406#bib.bib6))和OpenClawOpenClaw (2026 (https://arxiv.org/html/2607.12406#bib.bib88))。关于托管智能体Anthropic (2026 (https://arxiv.org/html/2607.12406#bib.bib7))和智能体约束装置Meng等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib84))的相关工作也显示了同样的转变。这些系统不仅仅生成文本,它们还读取文件、调用工具、浏览网页、编辑状态、与其他智能体协调,并在长时间跨度内采取行动。因此,安全问题不再仅仅是关于不安全的输出,还涉及控制、能力、记忆和上下文如何在系统中流动。 这一变化已经塑造了工业实践和近期研究。一个共同方向是将大脑与手解耦。托管智能体Anthropic (2026 (https://arxiv.org/html/2607.12406#bib.bib7))、AgentVisorYing等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib142))、权限分离提案Jacob等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib52))、CaMeL风格设计防御Debenedetti等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib30))和ParallaxFokou (2026 (https://arxiv.org/html/2607.12406#bib.bib36))都朝这个方向推动。不同的论文使用不同的术语,如虚拟化、权限分离、类型接口和设计级防御。但核心思想很简单:当系统边界明确并通过结构强制实施,而不是仅靠提示指令来维护时,智能体安全性就能得到改善。 尽管取得了进展,文献仍然是零散的。现有的综述常常按攻击类型、应用领域或智能体能力来组织空间Meng等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib84));Li等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib68));Kim等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib63))。这种视角虽然有帮助,但留下了一个空白。它没有清楚解释为什么表面上看起来不同的失效往往共享相同的原因:在某个边界上丧失了隔离。这也使得跨边界传播更难被看到。 本综述旨在填补这一空白。我们将隔离视为LLM智能体安全的第一原则,并围绕五个边界组织文献:用户-智能体、智能体-工具、智能体-执行、智能体-智能体、系统-环境。图1 (https://arxiv.org/html/2607.12406#S1.F1) 给出了这一分类法的紧凑视图。中心是智能体核心。周围是五个接口,用户输入、工具访问、执行通道、智能体间通信和环境来源上下文可能在这些接口上改变状态。**用户-智能体边界**关注用户内容是作为数据还是变为控制。**智能体-工具边界**关注外部能力如何被访问。**智能体-执行边界**关注从推理到行动的转变。**智能体-智能体边界**关注跨多智能体的通信与协调。**系统-环境边界**关注智能体系统作为一个整体如何与外部内容和状态交互。这些边界是不同的,但又紧密相关。它们共同提供了一种更清晰的方式来解释失陷从何处开始以及后来如何传播。 这一分类法是以边界为中心的,但并非边界排他性的。许多论文自然会涉及多个边界。因此,我们根据论文的**主要安全边界**进行分类,即隔离首次丧失的点。这一规则保持了分类的简洁性,并使跨边界分析更容易。 我们的贡献总结如下: - • 我们提出了一个基于五个隔离边界的LLM智能体安全边界中心分类法,并将攻击/防御映射到隔离首次破裂的位置,展示了失效如何在智能体工作流中传播。 - • 我们通过一种以隔离为中心的失效传播视角统一了先前的工作,并概述了一个强调信任分离、范围限定能力、可追溯性和恢复的“构建即隔离”议程。 ## 以边界为中心的LLM智能体安全分类法 ### 用户-智能体边界 §2 (https://arxiv.org/html/2607.12406#S2) - **直接的提示注入/越狱** 直接的提示注入仍然是典型的失效模式,包括指令覆盖Perez和Ribeiro (2022 (https://arxiv.org/html/2607.12406#bib.bib93));Liu等人 (2023b (https://arxiv.org/html/2607.12406#bib.bib77))、越狱后缀Zhu等人 (2023 (https://arxiv.org/html/2607.12406#bib.bib164))和自适应攻击Mazeika等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib83))。 用户内容跨越权限边界,表现为策略或开发者指令而非数据。 - **权限分离失效** 失陷可以逐步通过对话涌现Russinovich等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib102))、上下文偏离Ren等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib98))和隐性引导Zhou等人 (2024b (https://arxiv.org/html/2607.12406#bib.bib163))。 - **多轮攻击** 图像Gong等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib38));Wu等人 (2023 (https://arxiv.org/html/2607.12406#bib.bib132))和长上下文Cheng等人 (2024b (https://arxiv.org/html/2607.12406#bib.bib26))将攻击面扩展到纯文本之外。 - **多模态/长上下文攻击** 攻击可以通过记忆注入He等人 (2025b (https://arxiv.org/html/2607.12406#bib.bib44))、上下文内污染Wang等人 (2024e (https://arxiv.org/html/2607.12406#bib.bib126))和残留影响Xu等人 (2025b (https://arxiv.org/html/2607.12406#bib.bib137))持久存在。 - **持久化失陷** ### 智能体-工具边界 §3 (https://arxiv.org/html/2607.12406#S3) - **工具输出作为控制** 工具返回的观察结果可能被视为可信控制而非有界证据。这种观察-控制模糊是间接工具注入Yi等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib141))和工具反馈误用Fu等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib37))的核心。 - **工具误用/选择失败** 系统可能选择了错误的能力Ye等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib140))、路由到错误的外部服务Zhao等人 (2024b (https://arxiv.org/html/2607.12406#bib.bib157)),或者信任了恶意的工具广告Zhang等人 (2025c (https://arxiv.org/html/2607.12406#bib.bib151))。 - **参数构造** 即使选择了正确的工具,不安全的参数构造也可能将局部推理错误转化为外部副作用。 - **协议/元数据风险** MCP风格的生态系统表明,元数据Jing等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib59))、能力描述和协议操纵Wang等人 (2026b (https://arxiv.org/html/2607.12406#bib.bib127)),以及经过基准测试的MCP攻击Zhang等人 (2025b (https://arxiv.org/html/2607.12406#bib.bib148))都是接口攻击面的一部分。 - **轨迹级编排** 许多失败仅在轨迹级别才变得可见。不安全工作流出现在自适应工具跟踪Wang等人 (2026a (https://arxiv.org/html/2607.12406#bib.bib117))、轨迹级分析Chen等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib21))、安全调用研究Mou等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib85))和编程智能体基准测试Steinberg和Gal (2026 (https://arxiv.org/html/2607.12406#bib.bib108))中。 ### 智能体-执行边界 §4 (https://arxiv.org/html/2607.12406#S4) - **代码/浏览器/GUI动作风险** 该边界涵盖计划变为真实动作的点。例如代码执行攻击Zhang等人 (2025a (https://arxiv.org/html/2607.12406#bib.bib147))、自主网站黑客攻击Fang等人 (2024b (https://arxiv.org/html/2607.12406#bib.bib35))、有风险的代码生成Guo等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib41))和不安全的网页交互Tur等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib115))。 - **不安全的动作实现** 关键的转变是从不安全的文本到不安全的副作用:系统可能点击、运行、提交或操纵错误的东西,即使语言输出看起来合理。 - **具身智能体/VLA系统** 在具身和VLA系统中,感知错误、后门和对抗性输入可能转化为不安全的运动或操作Zhang等人 (2024a (https://arxiv.org/html/2607.12406#bib.bib149));Robey等人 (2025a (https://arxiv.org/html/2607.12406#bib.bib100)),包括对抗性VLA漏洞Wang等人 (2024b (https://arxiv.org/html/2607.12406#bib.bib121))。 - **包含/运行时中介** 防御趋势因此强调通过沙箱生态系统Zhou等人 (2024a (https://arxiv.org/html/2607.12406#bib.bib161))、策略-可执行检查Lu等人 (2024b (https://arxiv.org/html/2607.12406#bib.bib80))和更真实的执行基准测试Cui等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib28))来限制动作。 ### 智能体-智能体边界 §5 (https://arxiv.org/html/2607.12406#S5) - **提示感染/通信攻击** 一个被攻陷的消息可以成为控制的载体,并从一个人工智能体传播到另一个。这在提示感染Lee和Tiwari (2024 (https://arxiv.org/html/2607.12406#bib.bib65))和通信攻击He等人 (2025a (https://arxiv.org/html/2607.12406#bib.bib43))中是明显的。 - **讨论/消息传播** 讨论、批评、辩论Amayuelas等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib4))、知识泛滥Ju等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib60))和通信重用He等人 (2025a (https://arxiv.org/html/2607.12406#bib.bib43))可能放大而非减少恶意影响。 - **拓扑/级联/记忆** 拓扑、路由和共享记忆决定了故障是局限于局部还是变为系统性。这在后门插入Wang等人 (2024c (https://arxiv.org/html/2607.12406#bib.bib124))、递归阻塞Zhou等人 (2025c (https://arxiv.org/html/2607.12406#bib.bib162))、拓扑感知分析Wang等人 (2025b (https://arxiv.org/html/2607.12406#bib.bib120))和记忆武器化Das等人 (2026 (https://arxiv.org/html/2607.12406#bib.bib29))中可见。 - **防御智能体/归因** 代表性防御依赖于守卫智能体Xiang等人 (2024 (https://arxiv.org/html/2607.12406#bib.bib133))、可验证的安全角色Chen等人 (2025d (https://arxiv.org/html/2607.12406#bib.bib23))、故障归因Zhang等人 (2025d (https://arxiv.org/html/2607.12406#bib.bib152))和分层数据管理Mao等人 (2025 (https://arxiv.org/html/2607.12406#bib.bib82))。 ### 系统-环境边界 §6 (https://arxiv.org/html/2607.12406#S6) - **间接提示** - **环境注入** - **敌对网页/接口** - **RAG投毒/检索污染** - **环境中介泄露** - **认证/来源/警告**
相似文章
如何防止LLM代理相互干扰及干扰您的系统?
探讨防止LLM代理相互干扰及干扰系统操作的技巧,重点关注多代理部署中的协调和安全措施。
隐形编排者抑制保护行为并使权力持有者解离:多智能体LLM系统中的安全风险
本文对多智能体LLM系统中隐形编排的安全风险进行了实证研究,发现隐形编排者增加了解离并抑制了保护行为,且基于行为的评估不足以检测内部状态风险。
超越个体智能:基于LLM的多智能体系统中的协作、故障归因与自我进化综述
本综述论文对基于LLM的多智能体系统进行了统一回顾,聚焦于协作、故障归因和自我进化,通过LIFE框架识别开放挑战,并提出跨阶段的研究议程。
多智能体LLM安全中的操作重构与批准框架委托
本文引入了一种五条件控制对比设计,以区分多智能体LLM安全评估中操作重构、规划器行为和批准框架委托的影响,表明整体流水线安全度量不能解释为稳定的架构属性。
层隔离评估:基于无LLM、回归锁定的测试框架对生产级LLM代理的确定性骨架进行门控
本文介绍了针对LLM代理的层隔离评估方法,将生产级代理分解为架构层,每层使用确定性无LLM测试框架进行测试。它展示了逐切片基线测试能够定位聚合指标所掩盖的性能回归,并通过跨多个租户的受控回归注入进行了验证。