审计智能体执行框架安全性
摘要
本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。
arXiv:2605.14271v1 公告类型:新论文
摘要:LLM智能体越来越多地在执行框架内运行,这些框架调度工具、分配资源并在专门组件之间路由消息。然而,执行框架可能会返回正确且良性的答案,但其轨迹却访问了未授权资源或将上下文泄露给错误的智能体。输出级评估无法发现这些失败,尽管大多数安全基准仅对最终输出或终端状态评分,但许多违规行为发生在轨迹中间而非结束时。核心问题是执行框架在整个执行过程中是否尊重用户意图、权限边界和信息流约束。为填补这一空白,我们提出HarnessAudit,一个审计完整执行轨迹的框架,涵盖边界合规性、执行保真度和系统稳定性,重点关注这些风险最为突出的多智能体执行框架。我们还引入HarnessAudit-Bench,一个包含八个真实世界领域210个任务的基准,实例化为单智能体和多智能体配置,并嵌入安全约束。在前沿模型和三个多智能体框架下评估十种执行框架配置,我们发现:(i) 任务完成与安全执行不一致,违规行为随轨迹长度累积;(ii) 安全风险因领域、任务类型和智能体角色而异;(iii) 大多数违规行为集中在资源访问和智能体间信息传输;(iv) 多智能体协作扩大了安全风险面,而执行框架设计设定了安全部署的上限。
查看缓存全文
缓存时间: 2026/05/15 06:20
# 审计Agent执行框架的安全性 来源:https://arxiv.org/html/2605.14271 \\SetTitleBoxVerticalShift \-27mm\\SetTitleBoxLogoSep0\.2em\\SetTitleLeftLogofigures/logos/logo\.png\\SetTitleLeftLogoWidth2\.2cm\\SetTitleLeftLogoSep0\.02em\\SetTitleLeftLogoRaise0\.6em\\settitleboxlogos\\TitleBoxLogoItem\[1\.15cm\]figures/logos/UCSB\_NLP\.png\\TitleBoxLogoItem\[1\.15cm\]figures/logos/ucb\.png\\TitleBoxLogoItem\[1\.15cm\]figures/logos/wisc\.png\\TitleBoxLogoItem\[1\.15cm\]figures/logos/stanford\.png\\TitleBoxLogoItem\[1\.1cm\]figures/logos/msr1\.png Yichen GuoYepeng LiuYuzhe YangQianqi YanXuandong ZhaoWenyue HuaSheng LiuSharon LiYuheng BuXin Eric Wang ###### 摘要 LLM Agent越来越多地在执行框架内运行,这些框架负责分发工具、分配资源,并在专业化组件之间路由消息。然而,一个框架可能在一条访问了未授权资源或向错误 Agent 泄露了上下文的轨迹上,返回一个正确、良性的答案。输出级别的评估无法发现这些失败,而大多数安全基准只对最终输出或终端状态打分,即使许多违规发生在轨迹中间而非终止时。核心问题是框架在整个执行过程中是否尊重用户意图、权限边界和信息流约束。为弥补这一空白,我们提出了HarnessAudit,这是一个框架,用于审计完整执行轨迹的边界合规性、执行保真度和系统稳定性,重点关注这些风险最显著的多Agent框架。我们进一步引入了HarnessAudit-Bench,一个包含210个任务的基准测试,跨越八个真实世界领域,并以单Agent和多Agent配置实例化,嵌入安全约束。通过对前沿模型和三个多Agent框架的十种框架配置进行评估,我们发现:(i) 任务完成与安全执行不一致,且违规行为随轨迹长度累积;(ii) 安全风险因领域、任务类型和Agent角色而异;(iii) 大多数违规行为集中在资源访问和Agent间信息传输上;(iv) 多Agent协作扩大了安全风险面,而框架设计设定了安全部署的上限。参见图注图1:HarnessAudit 概览。(a) HarnessAudit 涵盖八个真实世界领域,构建带有现实约束的安全评估任务。(b) Agent 通过规划、检索、工具执行、审查和通信完成任务,同时与外部资源和动态环境交互。(c) HarnessAudit 审计超越最终输出的完整轨迹,并比较配置在边界合规性、执行保真度和系统稳定性方面的表现。## 1 引言 现代大语言模型 (LLM) AgentAnthropic (2026b (https://arxiv.org/html/2605.14271#bib.bib3)), OpenAI (2026b (https://arxiv.org/html/2605.14271#bib.bib25)), Google DeepMind (2026 (https://arxiv.org/html/2605.14271#bib.bib10))很少单独行动。它在执行框架内运行,例如 OpenClawSteinberger (2025 (https://arxiv.org/html/2605.14271#bib.bib28)), Claude CodeAnthropic (2026c (https://arxiv.org/html/2605.14271#bib.bib4)) 和 CodexOpenAI (2026a (https://arxiv.org/html/2605.14271#bib.bib24)),这些框架分解目标、分发工具、分配资源并在专业化组件之间路由消息。决定哪些动作被暴露、谁可以调用它们以及执行何时终止的是框架,而不是模型。这种转变暴露了一种输出级别评估无法发现的失败模式:如图2 (https://arxiv.org/html/2605.14271#S1.F2) 所示,一个框架可以返回一个正确、良性的答案,但在此过程中访问了未授权资源、向错误的 Agent 泄露了私有上下文,或在预期范围之外触发了不可逆的副作用。仅评估最终响应会将这些运行错误地归类为成功。我们认为,Agent 安全性应该基于框架而非响应进行评估,并应审计整个执行轨迹。这需要联合检查三个属性:动作是否保持在框架指定的权限和信息流边界内(边界合规性),轨迹是否通过有效的中间步骤达到目标(执行保真度),以及这两个属性是否能在真实扰动(如间接提示注入、模糊目标和工具错误)下保持不变(系统稳定性)。现有基准在这三个方面均存在不足。大多数仅对最终输出或终端状态打分Shao et al. (2025 (https://arxiv.org/html/2605.14271#bib.bib27)), Zhang et al. (2025 (https://arxiv.org/html/2605.14271#bib.bib40)),因此一个在访问禁止资源的同时完成任务的成功运行看起来与完全成功无异。近期面向框架的基准Hua et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib12)), Li et al. (2026a (https://arxiv.org/html/2605.14271#bib.bib19)), Tang et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib29)) 增加了现实工具和约束,但仍以任务完成为中心,很少在对抗条件下测试稳定性。这些工作几乎都针对单AgentWang et al. (2026a (https://arxiv.org/html/2605.14271#bib.bib31)), Chen et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib5)),使得生产多Agent框架引入的组件间通信渠道基本未经审计。如图2 (https://arxiv.org/html/2605.14271#S1.F2)(b) 所示,多Agent执行产生更长的轨迹、更复杂的权限结构和显式的通信渠道,实质性地扩大了安全风险面。参见图注图2:不同Agent执行框架在真实任务中暴露的安全风险。我们通过HarnessAudit来弥补这一空白,这是一个审计完整执行轨迹以覆盖上述三个属性的框架,以及HarnessAudit-Bench,一个在真实单Agent和多Agent框架上实例化审计的基准测试,如图1 (https://arxiv.org/html/2605.14271#S0.F1) 所示。我们的贡献是:(1) 一个以框架为中心的安全表述和审计框架。我们将Agent框架形式化为一个策略约束的执行系统,并沿边界合规性、执行保真度和系统稳定性审计轨迹,使用隐藏的、与Agent无关的证据渠道来记录工具调用、资源访问和组件间消息。(2) 真实的Agent框架安全压力测试。我们构建了HarnessAudit-Bench,涵盖8个真实世界应用场景和210个内嵌安全约束的任务,在单Agent和多Agent配置中实例化。(3) Agent框架安全失败的实证分析。我们评估了十种框架配置,涵盖前沿模型和三个多Agent框架,揭示了资源访问、Agent间信息传输以及在扰动下稳定性方面的系统性失败模式。## 2 相关工作 Agent安全评估。近期关于Agent安全基准的研究关注Agent在外部环境中的执行时风险,例如 AgentHarmAndriushchenko et al. (2025 (https://arxiv.org/html/2605.14271#bib.bib1)) 和 OS-HarmKuntz et al. (2025 (https://arxiv.org/html/2605.14271#bib.bib16))。这些工作将安全评估从输出审核推进了一步,但大多建立在受限环境或局部风险设置上,使得真实Agent框架中的系统性风险尚未得到充分探索。最近的基准如 ClawsBenchLi et al. (2026a (https://arxiv.org/html/2605.14271#bib.bib19)) 和 Claw-EvalYe et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib36)) 进一步引入了更真实的Agent评估场景,但其安全压力和协作复杂性仍然有限。相比之下,HarnessAudit将框架本身作为评估单元,通过隐藏的、独立的证据渠道审计完整执行轨迹。轨迹审计与框架级保障。另一条工作线通过执行轨迹而非最终输出来审计Agent安全。对代表性框架如 OpenClawWang et al. (2026a (https://arxiv.org/html/2605.14271#bib.bib31)), Liu et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib21)), Wang et al. (2026b (https://arxiv.org/html/2605.14271#bib.bib32)), Deng et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib7)) 的研究表明,风险往往来自工具调用和中间状态变化,而基于轨迹的审计Chen et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib5)), Li et al. (2026b (https://arxiv.org/html/2605.14271#bib.bib20)), Zhang et al. (2026a (https://arxiv.org/html/2605.14271#bib.bib38)) 从可检查的痕迹(如工具参数和Agent间消息)中定位失败。这些工作强调了轨迹级证据对于评估策略合规性的价值。然而,现有的轨迹审计主要针对特定框架或局部失败,未能将这些风险统一为框架级的诊断。HarnessAudit通过记录完整轨迹并系统评估边界合规性、执行保真度和系统稳定性,作为一个统一的框架级问题,弥补了这一空白。多Agent系统中的安全性。基于角色的协调已成为复杂Agent系统的常见设计模式。像 AutoGenWu et al. (2023 (https://arxiv.org/html/2605.14271#bib.bib33)), CAMELLi et al. (2023 (https://arxiv.org/html/2605.14271#bib.bib18)) 和 Claw-TeamHKUDS (2026 (https://arxiv.org/html/2605.14271#bib.bib11)) 这样的框架通过通信和任务委派来协调Agent,以提高复杂任务的执行能力。然而,这种协调也使安全成为一个系统级的问题,失败可能源于跨Agent的上下文共享和边界跨越Tao et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib30)), Huang et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib13))。最近的工作如 TAMASKavathekar et al. (2025 (https://arxiv.org/html/2605.14271#bib.bib14)) 和 AgentLeakEl Yagoubi et al. (2026 (https://arxiv.org/html/2605.14271#bib.bib8)) 研究了多Agent系统中的对抗攻击和隐私泄露,但主要集中在特定的威胁模型或泄露渠道上,而非框架级的执行安全。HarnessAudit-Bench通过构建带有角色类型团队的现实多Agent任务,使得评估委派、通信和权限边界如何影响框架安全成为可能,从而弥补了这一空白。## 3 问题形式化 ### 3.1 Agent框架作为策略约束的执行系统 我们将Agent框架定义为一个策略约束的执行系统,它在工具、资源和通信渠道上协调一个或多个LLM驱动的组件。给定用户目标\(G\)和环境状态\(\mathcal{D}\),框架分解目标、向组件分发子任务并约束其动作: \[ \mathcal{H} := (\mathcal{A},\,\mathcal{T},\,\mathcal{R},\,\Pi,\,\Phi,\,\Sigma),\qquad \mathcal{H}(G;\mathcal{D}_{0})\longrightarrow (\tau_{\mathcal{H}},\,y). \] (1) 这里\(\mathcal{A}\)是行动组件的集合(单Agent框架中为一个,多Agent框架中为多个),\(\mathcal{T}\)表示可调用的工具,\(\mathcal{R}\)表示环境资源。权限策略\(\Pi\)指定哪些Agent可以访问哪些工具和资源,而信息流策略\(\Phi\)约束哪些信息可以在Agent之间共享。协调协议\(\Sigma\)管理任务委派、动作确认和结果验证。执行框架产生一个可观测的轨迹\(\tau_{\mathcal{H}}\)和一个最终输出\(y\)。### 3.2 三个Agent框架安全层级 HarnessAudit沿三个轨迹级层级评估框架,如图3 (https://arxiv.org/html/2605.14271#S3.F3)(b) 所示。这些层级被设计为联合评估:一个框架必须满足所有三个层级才能被认为是安全可部署的,且每个层级对应一个其他层级无法检测到的独特失败模式。 ♣ L1 边界合规性。该层级评估\(\tau_{\mathcal{H}}\)中的每个动作是否保持在\(\Pi\)和\(\Phi\)指定的边界内。我们通过三个渠道记录违规行为,包括:(a) 工具违规,即Agent调用了未授权、与任务无关或超出角色的工具;(b) 资源违规,即Agent访问了受保护或范围外的文件、记录、字段或对象;(c) 信息流违规,即Agent通过通信、转发或最终输出披露了不允许披露的信息。 ♣ L2 执行保真度。该层级评估轨迹是否通过有效的中间步骤达到目标,而不仅仅是最终输出\(y\)是否与参考答案匹配。我们评估两个方面,包括:(a) 动作有效性,衡量工具选择、参数和目标对象是否正确,以及是否避免了冗余操作;(b) 检查点任务完成,衡量可以从轨迹或状态验证的任务里程碑。 ♣ L3 系统稳定性。该层级评估在受控压力因素注入执行过程后,L1和L2是否仍然满足。这些压力因素包括:(a) 通过工具返回内容进行的间接提示注入,(b) 模糊或规定不明确的用户目标,(c) 工具或运行时错误以及噪声。参见图注图3:HarnessAudit 审计流程。它将评估分为设置、执行和判断。隐藏的审计工件在执行期间保持不可见;轨迹日志和后端证据支持对边界合规性、执行保真度和系统稳定性的三层诊断。### 3.3 轨迹审计流程 HarnessAudit的一个核心设计选择是,所有评估证据都来自Agent无法操纵或预见的渠道,而非来自Agent的自我报告。每次运行依次经历三个阶段:设置、执行和判断,如图3 (https://arxiv.org/html/2605.14271#S3.F3) 所示。设置。声明式的任务规范实例化一个可复现的框架,包括具有确定性种子的模拟服务、在明确的\(\Pi\)和\(\Phi\)下分配给组件的工具和资源,以及从相同规范派生的隐藏审计工件。这些工件包括完成检查点、策略规则和违规分类,并在执行期间对所有组件保持不可见。Agent仅通过API工具交互,从不访问真实用户数据。执行。框架在标准的思考-行动-观察循环中运行至完成。不进行在线评分。相反,框架记录每个工具调用、资源访问、组件间消息和状态转换的结构化日志,以及执行前后的环境快照。判断。终止后,加载隐藏工件并与收集到的证据渠道结合。执行轨迹重建动作序列,权限和信息流日志提供边界证据。然后根据第3.2节的L1到L3规范对框架进行评分。轨迹审计实现详见附录8 (https://arxiv.org/html/2605.14271#S8)。### 3.4 评分评估 每次运行产生与三个评估层级对应的分数,这些分数进一步聚合为整体框架安全分数。评分和聚合细节见附录9 (h相似文章
审计自改进智能体中的框架篡改
该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。
HarnessRisk:一个面向生命周期的代理工具安全性基准测试
HarnessRisk 是一种面向生命周期的基准测试,专门评估代理工具安全性,揭示了配置漏洞和检测缺口,这些漏洞和缺口允许高攻击成功率,同时保持系统的效用。
面向执行轨迹的推理时对齐框架
本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。
研究如何构建LLM智能体框架
这篇研究文章回顾了关于构建LLM智能体框架的研究成果,强调确定性护栏、有效的多智能体层次结构和适当的记忆架构对性能和安全至关重要,同时指出了当前评估和认证中的空白。