tool-specifications

标签

Cards List
#tool-specifications

工具规范至关重要:揭示并缓解AI代理中的安全风险

arXiv cs.AI · 2026-08-03 缓存

本文指出,模式化(schema-formatted)工具规范是AI代理安全性能下降的主要来源,会削弱大语言模型的拒绝信号。作者提出了SafeKeep,一种推理时的安全防护机制,将安全判断与工具执行分离,使有害请求的拒绝率从23.8%提升到70.6%,并将提示注入攻击的成功率从25.6%降至2.5%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈