智能体安全触发机制并非文本安全触发机制——超越SOTA防护栏过半时间成功的MCP攻击(代码+数据集)[研究报告]
摘要
本研究显示,基于文本的安全防护栏无法检测针对具备工具访问能力的LLM智能体的攻击,因为攻击嵌入在工具调用序列中而非文本中,对最先进的防御措施实现了高规避率。
大多数安全对齐工作将“检测攻击”视为文本分类问题——即提示词是否包含模型安全防护栏应拦截的语言。这一假设对于拥有真实工具访问权限的LLM智能体不再成立。这里有一个具体案例:选取一个已知的公开安全漏洞(CVE),设计能够利用该漏洞的工具调用序列,然后让LLM将其重写为听起来普通的请求。结果生成的文本中毫无攻击痕迹——因为“攻击”不在文本中,而在文本所引发的工具调用序列中。一个仅依赖文本线索触发的防护栏模型对此无能为力。我们针对使用模型上下文协议(MCP)工具访问(文件系统IO)的LLM智能体进行了测试。在基础模型(1B–14B参数)中,拒绝率均未超过35%,而最先进的安全微调(DPO、SafeDPO)也仅将这一比例提升至48%。无需训练的方法表现更佳——其中一种方法在不进行任何微调的情况下,将基准拒绝率提升了约3倍。完整的方法论、训练/评估代码(四种方法)、数据集及论文见首条评论。
相似文章
工具规范至关重要:揭示并缓解AI代理中的安全风险
本文指出,模式化(schema-formatted)工具规范是AI代理安全性能下降的主要来源,会削弱大语言模型的拒绝信号。作者提出了SafeKeep,一种推理时的安全防护机制,将安全判断与工具执行分离,使有害请求的拒绝率从23.8%提升到70.6%,并将提示注入攻击的成功率从25.6%降至2.5%。
智能体AI控制评估中的攻击选择显著降低安全性
本文表明,在智能体AI控制评估中,允许攻击者策略性地选择攻击时机(攻击选择)会显著降低测量到的安全性,这意味着当前评估可能高估了对选择性攻击者的安全性。
遏制缺口:已部署的自主AI框架如何未能满足面向公众的安全要求
本文审计了LangChain、AutoGPT和OpenAI Agents SDK在架构安全保证方面的表现,发现它们均未原生符合遏制原则,并展示了内存投毒如何导致持续性失败;文中还引入了轻量级机制以消除此类攻击。
超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击
本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。
AI安全争论聚焦于错误的边界
本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。