标签
Cloudflare 提出了一种代理访问模型(AAM),用于调整针对 AI 代理的零信任安全控制,强调任务范围的临时访问和最小权限。
随着AI代理获得更多能力,运营控制——而非模型能力——成为主要挑战,引发了关于安全、权限、可观测性和恢复的关键问题。
本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。
本文研究了LLM Agent中的过度权限工具选择问题,引入了ToolPrivBench来评估并缓解不必要的高权限工具使用。研究发现,安全对齐并不能确保最小权限选择,并提出了一种训练后防御方法,能够在不牺牲性能的情况下减少过度权限的使用。
本文提出风险感知因果门控(RACG),这是一种无需训练的机制,将最小权限原则应用于LLM代理的工具暴露,仅在授权和因果必要时暴露高风险工具,从而减少提示注入的攻击面。