停止试图通过提示词实现代理安全。这是一个访问控制问题

Reddit r/AI_Agents 新闻

摘要

本文认为AI代理安全应被视为一个访问控制问题,推荐采用最小权限、允许列表和审批门等实践来防止意外操作。

本周每一篇关于“流氓代理”的帖子都在描述同一个漏洞:代理拥有广泛的工具权限,追逐目标,两者之间没有界限。这是一个权限问题,是计算领域最古老的问题。系统安全在几十年前就用最小权限解决了这类问题。进程只获得完成其任务所需的最小权限,不多不少。代理在发布时没有这一步。模型可以规划任何行动;关键在于执行器允许什么。常见的情况是:代理接手一个清理任务,拥有广泛的删除能力,删除了远超预期的内容。没有限定它能访问什么,所以目标导向的行为触及了所有地方。真正的约束是:每次工具调用都遵循最小权限。完成步骤所需的最小权限授予,而不是对所有内容的持续访问。使用允许列表而非拒绝列表。你可以指定它应该做什么,但无法列出它不该做的一切。对不可逆和昂贵操作(删除、支付、外发)设置审批门,而不是对每一步都设置,否则人们只会草率通过。为每个能力设置预算和速率限制,这样失控的循环不会增加成本或影响范围。执行机制在模型之外。说“不”的组件应该在执行路径中,而不是在提示词里。系统提示词中说“不要碰生产环境”不会阻止任何事情。模型可以为自己合理化,绕过文本写下的规则。在生产环境中,你是为每次调用限定工具访问权限,还是给代理一个持续授权并希望提示词能起作用?
查看原文

相似文章

代理提示不是安全边界

Reddit r/AI_Agents

讨论了使用代理提示作为安全边界的局限性,认为仅靠提示不足以确保AI行为安全。

AI安全争论聚焦于错误的边界

Reddit r/AI_Agents

本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。

代理安全即行动对齐

arXiv cs.AI

本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。