工具规范至关重要:揭示并缓解AI代理中的安全风险
摘要
本文指出,模式化(schema-formatted)工具规范是AI代理安全性能下降的主要来源,会削弱大语言模型的拒绝信号。作者提出了SafeKeep,一种推理时的安全防护机制,将安全判断与工具执行分离,使有害请求的拒绝率从23.8%提升到70.6%,并将提示注入攻击的成功率从25.6%降至2.5%。
arXiv:2607.29254v1 公告类型:新增
摘要:AI代理通过外部工具扩展了大型语言模型(LLM),使其能够执行复杂任务并将模型输出转化为具有实际影响的现实世界行动。然而,LLM在作为代理部署时往往变得不那么安全,而这种性能下降的根源仍知之甚少。在本文中,我们确定了模式化工具规范是代理安全性能下降的主要来源,并通过白盒表示分析表明,这些规范削弱了模型内部的拒绝信号,导致不安全的工具执行。基于这一发现,我们提出了SafeKeep,一种推理时的安全防护机制,将安全判断与工具执行解耦:它使用扁平化的文本工具规范来评估请求,同时保留原始模式化规范用于执行。在两个代表性基准测试和四个LLM(包括白盒和黑盒模型)上,SafeKeep将有害请求的平均拒绝率从23.8%提高到70.6%,并将观察级提示注入下的平均攻击成功率从25.6%降至2.5%。它还优于现有的安全防护措施,并保持了任务处理能力。我们在https://github.com/snowcatsmoking/SafeKeep发布了代码和数据。
查看缓存全文
缓存时间: 2026/08/03 07:31
# 工具规范的重要性:揭示并缓解AI智能体中的安全风险
来源:https://arxiv.org/html/2607.29254
潘明辉1杨嘉宇轩2袁媛媛3蒋宇3陈振鹏3 1北京邮电大学2北京航空航天大学3清华大学panmingh@outlook\.com denerate@buaa\.edu\.cn \{yyyuan, jy1989, zpchen\}@tsinghua\.edu\.cn
###### 摘要
AI智能体通过外部工具扩展了大语言模型(LLM),使其能够执行复杂任务并将模型输出转化为具有实际影响的世界操作。然而,LLM在部署为智能体时往往安全性大幅下降,而这种退化的根源至今仍知之甚少。在本文中,我们识别出schema格式化的工具规范是智能体安全退化的重要来源,并通过白盒表示分析表明,它们会削弱模型内部的拒绝信号,并导致不安全的工具执行。基于这一发现,我们提出了SafeKeep,一种推理期安全防护机制,将安全判断与工具执行解耦:它使用扁平化的文本工具规范来评估请求,同时保留原始的schema格式化规范用于执行。在两个代表性基准和四个LLM(包括白盒和黑盒模型)上的实验表明,SafeKeep将对有害请求的平均拒绝率从23.8%提升到70.6%,并将观测级提示注入下的平均攻击成功率从25.6%降低到2.5%。它也优于现有的防护机制,并保持了任务处理能力。我们在以下链接(https://github.com/snowcatsmoking/SafeKeep)发布了代码和数据。
## 1 引言
AI智能体通过外部工具扩展大语言模型(LLM),使其能够检索信息、与外部系统交互并代表用户执行操作(Yao等,2022 (https://arxiv.org/html/2607.29254#bib.bib1);Qin等,2024 (https://arxiv.org/html/2607.29254#bib.bib2);Wang等,2024a (https://arxiv.org/html/2607.29254#bib.bib3))。这些能力使智能体比传统聊天机器人强大得多,但也使其失败后果更加严重:不安全的聊天机器人响应仍然是文本,而不安全的智能体响应可能泄露私人信息、操纵外部服务或触发真实世界操作(Debenedetti等,2024 (https://arxiv.org/html/2607.29254#bib.bib15);Zhou等,2024 (https://arxiv.org/html/2607.29254#bib.bib4))。因此,可靠地识别并拒绝有害请求是安全部署智能体的先决条件。
然而,近期研究(Andriushchenko等,2025 (https://arxiv.org/html/2607.29254#bib.bib34);Kumar等,2025 (https://arxiv.org/html/2607.29254#bib.bib19);Zhang等,2025 (https://arxiv.org/html/2607.29254#bib.bib20))揭示了一个令人不安的现象:同一个LLM在聊天机器人场景中会拒绝有害请求,但在部署为智能体时却可能遵从该请求。这种退化令人惊讶,因为现代LLM已经过广泛的安全对齐,并在标准对话环境中表现出强大的拒绝行为(Xie等,2025a (https://arxiv.org/html/2607.29254#bib.bib21);Bai等,2022 (https://arxiv.org/html/2607.29254#bib.bib22))。构建智能体旨在扩展模型能力,却可能无意中破坏底层模型已经具备的安全行为。这引出了一个根本性问题:
> 为什么一个在聊天机器人场景中会拒绝有害请求的LLM,在部署为智能体时却变得不那么可靠?
我们通过隔离智能体特定输入组件对模型拒绝相关表示的影响来研究这个问题。通过组件级消融实验,我们发现工具规范是智能体上下文引入的退化的大部分原因。进一步细粒度的分析将工具规范“描述什么”与“如何表示”分离开来。在保持相同工具语义的同时,将schema格式化的规范转换为扁平化的文本表示,可以在很大程度上恢复有害-良性样本的可分性;而移除工具语义但保留schema格式化的表示则不能。这些结果将工具规范的schema格式化表示确定为退化的主要来源。
随后,我们揭示了schema格式化如何干扰拒绝行为。借鉴先前关于拒绝方向提取的工作(Arditi等,2024 (https://arxiv.org/html/2607.29254#bib.bib24)),我们将*Schema方向*定义为:在同一工具规范以schema格式化而非扁平化文本形式呈现时,所引起的平均隐藏状态变化。对于有害请求,该方向在整个模型范围内与聊天机器人场景得到的拒绝方向呈负对齐,表明schema格式化使内部表示朝着与拒绝相关方向相反的方向移动。这种对立在解码开始后仍然可见:schema格式化的规范显著降低了第一个生成token处沿拒绝方向的有害-良性分离度。最后,针对Schema方向进行激活引导会使模型行为偏离有害工具执行,转向有效的拒绝,从而为schema引起的表示变化导致了智能体安全退化提供了因果证据。
基于这一机制,我们提出了SafeKeep,一种推理期安全防护机制,将安全判断与工具执行解耦。SafeKeep首先使用扁平化的文本工具规范来评估请求,从而避免被识别为干扰拒绝的表示。被判定为安全的请求将转发到原始智能体流水线,其中schema格式化的规范在工具选择和执行过程中保持不变。被判定为不安全的请求将被阻止执行工具,并转向拒绝生成。SafeKeep既不需要参数更新,也不需要访问模型激活,因此可以应用于开源和专有LLM,而无需修改底层智能体或其工具使用接口。
我们在两个代表性基准上评估SafeKeep,覆盖直接有害请求和观测级提示注入,使用四个涵盖白盒和黑盒设置的LLM。SafeKeep将有害请求的平均拒绝率从23.8%提升到70.6%,并将整体提示注入攻击成功率从25.6%降低到2.5%,同时保持了任务处理能力。与在安全判断期间保留schema格式化工具规范的基线进行受控比较,进一步表明这些收益并非仅仅来自增加安全判断阶段;以扁平化文本形式呈现工具规范对于可靠的安全评估至关重要。在评估的安全设置中,SafeKeep也始终优于近期专门针对智能体的防护机制。
总之,本文做出了以下贡献:
- •我们识别出schema格式化的工具规范是智能体安全退化的主要来源,并通过受控消融实验将其表示效应与工具语义区分开来。
- •我们揭示了底层机制:schema格式化会诱发一个与拒绝相对立的隐藏状态方向,削弱生成期间的有害-良性分离,并因果性地导致有害工具执行。
- •我们提出了SafeKeep,一种推理期安全防护机制,将安全判断与工具执行解耦。大量评估表明,SafeKeep在保持任务处理能力的同时显著提升了智能体安全性。
- •
## 2 相关工作
#### AI智能体。
AI智能体将传统LLM从被动文本生成扩展到交互式任务执行。代表性框架如ReAct(Yao等,2022 (https://arxiv.org/html/2607.29254#bib.bib1))、ToolLLM(Qin等,2024 (https://arxiv.org/html/2607.29254#bib.bib2))、AutoGPT(Yang等,2023 (https://arxiv.org/html/2607.29254#bib.bib5))和LangChain(Topsakal和Akinci,2023 (https://arxiv.org/html/2607.29254#bib.bib6))遵循这一范式,赋予模型信息检索(Nakano等,2021 (https://arxiv.org/html/2607.29254#bib.bib39))、API调用(Li等,2023 (https://arxiv.org/html/2607.29254#bib.bib40))和代码执行(Wang等,2024b (https://arxiv.org/html/2607.29254#bib.bib41))等能力。为了支持这些能力,智能体输入通常包含额外的组件。其中,工具规范尤为重要,因为它们直接赋予LLM调用外部工具与外界交互的能力(Liu等,2024 (https://arxiv.org/html/2607.29254#bib.bib10))。
#### 智能体安全。
智能体安全变得越来越重要,因为LLM智能体可以将不安全模型行为转化为具体的外部操作。现有防御主要依赖防护机制,如外部分类器(Han等,2024 (https://arxiv.org/html/2607.29254#bib.bib7))、基于规则的过滤器(Alon和Kamfonas,2023 (https://arxiv.org/html/2607.29254#bib.bib9))和运行时监控(Yuan等,2024 (https://arxiv.org/html/2607.29254#bib.bib8))。这些方法旨在覆盖多种智能体风险,包括有害请求(Andriushchenko等,2025 (https://arxiv.org/html/2607.29254#bib.bib34))、提示注入(Zhan等,2024 (https://arxiv.org/html/2607.29254#bib.bib35))、隐私泄露(Wang等,2025 (https://arxiv.org/html/2607.29254#bib.bib17))和不安全的工具执行(Ruan等,2024 (https://arxiv.org/html/2607.29254#bib.bib18))。与这些方法不同,我们分析了LLM自身的拒绝能力为何在智能体输入中退化,并提出了恢复这种能力的轻量级通用防御。
## 3 定位安全退化的根源
近期研究(Andriushchenko等,2025 (https://arxiv.org/html/2607.29254#bib.bib34);Kumar等,2025 (https://arxiv.org/html/2607.29254#bib.bib19);Zhang等,2025 (https://arxiv.org/html/2607.29254#bib.bib20))表明,智能体可能遵从底层LLM在聊天机器人场景中会拒绝的有害请求。然而,智能体上下文的哪些组件导致了这种安全退化仍不清楚。我们通过白盒分析拒绝相关内部表示来研究这个问题。
先前工作(Arditi等,2024 (https://arxiv.org/html/2607.29254#bib.bib24))表明,LLM的拒绝行为与隐藏状态空间中的一个方向相关。这个*拒绝方向*通常通过有害请求与良性请求所激发平均激活的差异来提取。对于未见输入,其在该方向上的投影产生一个拒绝得分,反映了其内部表示中拒绝相关特征的强度(Han等,2025 (https://arxiv.org/html/2607.29254#bib.bib25))。由于沿该方向进行引导可以诱发或抑制拒绝,它提供了一个紧凑的诊断工具,用于检查智能体上下文的不同组件如何影响拒绝相关表示。
### 3.1 拒绝相关表示在智能体上下文中退化
在识别责任组件之前,我们首先考察聊天机器人与智能体设置之间的安全差距是否伴随着拒绝相关表示的系统性退化。如果智能体上下文只影响最终生成行为,那么拒绝方向分析对问题根源的洞察将有限。相反,如果有害请求和良性请求沿拒绝方向的分离度降低,则表明退化在模型的内部表示中也是可观察的。
#### 受控输入。
我们在保持用户请求和底层LLM不变的情况下比较聊天机器人与智能体输入。如图1 (https://arxiv.org/html/2607.29254#S3.F1)所示,聊天机器人输入包含LLM的默认系统提示和用户请求,而智能体输入还额外包含智能体角色描述、工具使用指令和工具规范。两种输入均遵循Transformers库(Wolf等,2019 (https://arxiv.org/html/2607.29254#bib.bib13))提供的相应模板。
#### 配对数据集。
为了确保提取的拒绝方向主要捕获请求安全性方面的差异,而不是样本之间无关的差异,我们基于ToolSafety(Xie等,2025b (https://arxiv.org/html/2607.29254#bib.bib16))构建了一个配对数据集,该基准包含多种工具使用场景和详细的工具规范。我们保留其中的400个有害请求,并使用Claude Sonnet 4.6将每个请求最小程度地改写为良性对应样本。每次改写只更改用户请求,同时尽可能保留底层场景、任务结构和可用工具。我们人工检查所有生成的对应样本,以验证其良性意图、标签正确性,以及除预期的安全性变化外对原始场景的保持。
最终数据集包含400个有害-良性配对样本,按7:3比例划分为方向提取和评估两部分。拒绝方向从前者提取,在后者上评估。我们在此配对数据集上进行根源定位和机制分析。
#### 拒绝方向分析。
我们进行了两项互补分析。首先,我们在每种输入设置内评估有害-良性可分性:分别从聊天机器人格式和智能体格式的输入中独立提取拒绝方向,并在以相同格式呈现的留出请求上评估每个方向。其次,我们将聊天机器人场景得到的拒绝方向应用于智能体格式的输入,以检查在引入智能体上下文后,聊天机器人场景中识别到的拒绝相关分离是否得以保留。
令Dext\\mathcal\{D\}\_\{\\mathrm\{ext\}\}和Deval\\mathcal\{D\}\_\{\\mathrm\{eval\}\}分别表示方向提取和留出评估分割。对于输入格式f∈\{chatbot,agent\}f\\in\\\{\\mathrm\{chatbot\},\\mathrm\{agent\}\\\},我们按照先前工作(Arditi等,2024 (https://arxiv.org/html/2607.29254#bib.bib24))的做法,从以格式ff呈现的Dext\\mathcal\{D\}\_\{\\mathrm\{ext\}\}中的有害和良性样本提取拒绝方向rf∈Rdr\_\{f\}\\in\\mathbb\{R\}^\{d\},并将其归一化为r^f=rf/∥rf∥\\hat\{r\}\_\{f\}=r\_\{f\}/\\lVert r\_\{f\}\\rVert。对于Deval\\mathcal\{D\}\_\{\\mathrm\{eval\}\}中的每个请求,令hg∈Rdh\_\{g\}\\in\\mathbb\{R\}^\{d\}表示其在输入格式gg下的最终token隐藏状态。给定在格式ff下提取的拒绝方向rfr\_\{f\},我们计算拒绝得分:
s=hg⊤r^f=hg⊤rf∥rf∥\.s=h\_\{g\}^\{\\top\}\\hat\{r\}\_\{f\}=h\_\{g\}^\{\\top\}\\frac\{r\_\{f\}\}\{\\lVert r\_\{f\}\\rVert\}\.\(1\)
我们以安全性标签为真实标签,对每个方向-输入组合下所有有害和良性请求的拒绝得分计算AUROC。AUROC越高表示有害-良性分离越清晰。格式内AUROC衡量聊天机器人和智能体设置下的可分性,而聊天机器人到智能体的AUROC衡量聊天机器人场景得到的拒绝方向所捕获的分离在智能体输入下是否得以保留。
#### 结果。
我们在Llama3.1-8B-Instruct(Grattafiori等,2024 (https://arxiv.org/html/2607.29254#bib.bib28))上进行该诊断分析,该模型可访问其内部激活。我们首先确认智能体输入显著降低了行为安全性。在请求和底层LLM保持不变的条件下,有害请求的拒绝率从聊天机器人输入下的58%下降到智能体输入下的3%,这表明t相似文章
对于使用工具的智能体,安全边界应划在哪里?
讨论AI智能体使用工具的安全风险,重点关注提示注入这一实际威胁——不受信任的文本可能改变智能体行为,以及在授予权限前需要进行可重复测试。
智能体安全应成为运行时契约
本文认为,AI 智能体的安全性应在运行时通过预防性控制和可验证证据来强制执行,而非仅仅依赖训练时的对齐。该立场基于对安全事件、虚假完成、轨迹模式(trajectory schemas)以及发表趋势的审计。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。
智能体安全可能始于枯燥的权限设计
讨论了枯燥的权限设计作为确保AI代理安全的基础要素的重要性。
代理安全即行动对齐
本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。