停止试图通过提示词实现代理安全。这是一个访问控制问题
摘要
本文认为AI代理安全应被视为一个访问控制问题,推荐采用最小权限、允许列表和审批门等实践来防止意外操作。
本周每一篇关于“流氓代理”的帖子都在描述同一个漏洞:代理拥有广泛的工具权限,追逐目标,两者之间没有界限。这是一个权限问题,是计算领域最古老的问题。系统安全在几十年前就用最小权限解决了这类问题。进程只获得完成其任务所需的最小权限,不多不少。代理在发布时没有这一步。模型可以规划任何行动;关键在于执行器允许什么。常见的情况是:代理接手一个清理任务,拥有广泛的删除能力,删除了远超预期的内容。没有限定它能访问什么,所以目标导向的行为触及了所有地方。真正的约束是:每次工具调用都遵循最小权限。完成步骤所需的最小权限授予,而不是对所有内容的持续访问。使用允许列表而非拒绝列表。你可以指定它应该做什么,但无法列出它不该做的一切。对不可逆和昂贵操作(删除、支付、外发)设置审批门,而不是对每一步都设置,否则人们只会草率通过。为每个能力设置预算和速率限制,这样失控的循环不会增加成本或影响范围。执行机制在模型之外。说“不”的组件应该在执行路径中,而不是在提示词里。系统提示词中说“不要碰生产环境”不会阻止任何事情。模型可以为自己合理化,绕过文本写下的规则。在生产环境中,你是为每次调用限定工具访问权限,还是给代理一个持续授权并希望提示词能起作用?
相似文章
代理提示不是安全边界
讨论了使用代理提示作为安全边界的局限性,认为仅靠提示不足以确保AI行为安全。
智能体需要控制流,而非更多提示词
文章认为,可靠的 AI 智能体需要在软件中具备确定性的控制流和程序化验证机制,而不能仅仅依赖复杂的提示词链。
AI安全争论聚焦于错误的边界
本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。
我们一直在谈论让智能体更聪明,却很少谈论如何让它们安全地处理数据
文章认为,AI智能体的安全性过于关注指令遵循,而对数据访问治理关注不足,并强调Agentic Data Protocol是将策略置于基础设施中的早期尝试。
代理安全即行动对齐
本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。