智能体安全触发机制并非文本安全触发机制——超越SOTA防护栏过半时间成功的MCP攻击(代码+数据集)[研究报告]

Reddit r/MachineLearning 论文

摘要

本研究显示,基于文本的安全防护栏无法检测针对具备工具访问能力的LLM智能体的攻击,因为攻击嵌入在工具调用序列中而非文本中,对最先进的防御措施实现了高规避率。

大多数安全对齐工作将“检测攻击”视为文本分类问题——即提示词是否包含模型安全防护栏应拦截的语言。这一假设对于拥有真实工具访问权限的LLM智能体不再成立。这里有一个具体案例:选取一个已知的公开安全漏洞(CVE),设计能够利用该漏洞的工具调用序列,然后让LLM将其重写为听起来普通的请求。结果生成的文本中毫无攻击痕迹——因为“攻击”不在文本中,而在文本所引发的工具调用序列中。一个仅依赖文本线索触发的防护栏模型对此无能为力。我们针对使用模型上下文协议(MCP)工具访问(文件系统IO)的LLM智能体进行了测试。在基础模型(1B–14B参数)中,拒绝率均未超过35%,而最先进的安全微调(DPO、SafeDPO)也仅将这一比例提升至48%。无需训练的方法表现更佳——其中一种方法在不进行任何微调的情况下,将基准拒绝率提升了约3倍。完整的方法论、训练/评估代码(四种方法)、数据集及论文见首条评论。
查看原文

相似文章

工具规范至关重要:揭示并缓解AI代理中的安全风险

arXiv cs.AI

本文指出,模式化(schema-formatted)工具规范是AI代理安全性能下降的主要来源,会削弱大语言模型的拒绝信号。作者提出了SafeKeep,一种推理时的安全防护机制,将安全判断与工具执行分离,使有害请求的拒绝率从23.8%提升到70.6%,并将提示注入攻击的成功率从25.6%降至2.5%。

AI安全争论聚焦于错误的边界

Reddit r/AI_Agents

本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。