迈向可安全审计的大模型智能体:一种统一的图表示方法

arXiv cs.AI 论文

摘要

本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。

arXiv:2605.06812v1 宣布类型:新论文 摘要:基于大语言模型(LLM)的智能体系统正迅速演进,通过动态工具调用、有状态的记忆管理以及多智能体协作来执行复杂的自主任务。然而,这种语义驱动的执行范式在底层物理事件与高层执行意图之间造成了严重的语义鸿沟,使得事后安全审计变得极为困难。现有的表示机制(包括静态软件物料清单 SBOM 和运行时日志)仅提供碎片化的证据,无法捕捉认知状态的演变、能力绑定、持久化记忆污染以及在交互智能体间传播的级联风险。为了弥合这一鸿沟,我们提出了 Agent-BOM,一种用于智能体安全审计的统一结构表示方法。Agent-BOM 将智能体系统建模为一个分层属性有向图,将静态能力基(如模型、工具和长期记忆)与动态运行时语义状态(如目标、推理轨迹和动作)区分开来。这些层通过语义边和安全属性连接,将碎片化的执行痕迹转化为可查询的审计路径。基于 Agent-BOM,我们开发了一种基于图查询的路径级风险评估范式,并将其实例化应用于 OWASP Agentic Top 10。此外,我们在 OpenClaw 环境中实现了一个审计插件,用于从实时执行中构建 Agent-BOM。在具有代表性的真实世界智能体攻击场景中的评估表明,Agent-BOM 能够重构隐蔽的攻击链,包括跨会话记忆投毒和工具误用、能力供应链劫持及意外代码执行、多智能体生态系统劫持,以及特权和信任滥用。这些结果证明,Agent-BOM 为复杂智能体生态系统中的根本原因分析和安全裁决提供了统一且可审计的基础。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:07

# 迈向可安全审计的大语言模型智能体:一种统一的图表示方法
来源:https://arxiv.org/abs/2605.06812
作者:Chaofan Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+C),Lyuye Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+L),Jintao Zhai (https://arxiv.org/search/cs?searchtype=author&query=Zhai,+J),Siyue Feng (https://arxiv.org/search/cs?searchtype=author&query=Feng,+S),Xichun Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+X),Huahao Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+H),Shihan Dou (https://arxiv.org/search/cs?searchtype=author&query=Dou,+S),Yu Ji (https://arxiv.org/search/cs?searchtype=author&query=Ji,+Y),Yutao Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+Y),Yueming Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+Y),Yang Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+Y),Deqing Zou (https://arxiv.org/search/cs?searchtype=author&query=Zou,+D)

查看 PDF (https://arxiv.org/pdf/2605.06812)

> 摘要:基于大语言模型(LLM)的智能体系统正迅速演进,通过动态工具调用、有状态记忆管理和多智能体协作来执行复杂的自主任务。然而,这种语义驱动的执行范式在底层物理事件与高层执行意图之间造成了严重的语义鸿沟,使得事后安全审计变得极其困难。现有的表示机制,包括静态软件物料清单(SBOM)和运行时日志,仅提供碎片化的证据,且无法捕捉认知状态的演变、能力绑定、持久性记忆污染以及在交互智能体之间的级联风险传播。为了弥合这一差距,我们提出了 Agent-BOM,一种用于智能体安全审计的统一结构表示方法。Agent-BOM 将智能体系统建模为分层属性有向图,将静态能力基座(如模型、工具和长期记忆)与动态运行时语义状态(如目标、推理轨迹和操作)分离开来。这些层级通过语义边和安全属性相连,将碎片化的执行轨迹转化为可查询的审计路径。基于 Agent-BOM,我们开发了一种基于图查询的路径级风险评估范式,并结合 OWASP 智能体十大风险进行了实例化。此外,我们在 OpenClaw 环境中实现了一个审计插件,能够从实时执行中构建 Agent-BOM。在代表性真实世界智能体攻击场景下的评估表明,Agent-BOM 能够重构隐蔽的攻击链,包括跨会话记忆投毒和工具滥用、能力供应链劫持和意外代码执行、多智能体生态系统劫持以及权限和信任滥用。这些结果表明,Agent-BOM 为复杂智能体生态系统中的根本原因分析和安全裁决提供了统一且可审计的基础。

## 提交历史

作者:Chaofan Li [查看邮件 (https://arxiv.org/show-email/9345ad8b/2605.06812)] **[v1]** 2026年5月7日 周四 18:14:29 UTC (5,277 KB)

相似文章

审计智能体执行框架安全性

arXiv cs.CL

本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。

通过溯源分析防范LLM代理失对齐

arXiv cs.CL

本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。

内存增强型LLM智能体中的状态污染

arXiv cs.AI

本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。