对于使用工具的智能体,安全边界应划在哪里?
摘要
讨论AI智能体使用工具的安全风险,重点关注提示注入这一实际威胁——不受信任的文本可能改变智能体行为,以及在授予权限前需要进行可重复测试。
我不断看到一些演示,智能体可以读取文档、调用API、写入文件或触发某些业务操作。这正是让我觉得提示注入不那么理论化的部分。风险不在于模型说出奇怪的话,而在于不受信任的文本会改变智能体使用工具时的行为。我现在正围绕这一边界进行测试。没有神奇的修复方法,只是试图让失败足够可重复,以便他人之后能够检查。很好奇这里的人们在给智能体实际权限之前是如何测试它们的。
相似文章
如何定义和测试使用工具的AI代理的边界?
关于定义和测试使用工具的AI代理边界的讨论,以防止它们即使在没有明显越狱的情况下跨越安全或伦理界限。
如果一个AI代理可以调用20个工具,那么授权应该实际放在哪里?
探讨了当一个AI代理可以调用多个工具时,应该在何处实施授权的问题,讨论了安全访问控制的架构考虑。
AI代理是否正在创造一个新的运行时供应链攻击面?
讨论AI代理安全作为一个超越提示注入的运行时供应链问题,强调来自不可信数据、工具和反馈循环的风险,并质疑开发者如何执行边界。
谁授予了你的AI代理权限?
讨论AI代理工作流中的安全漏洞,即代理在关键步骤中假设存在人类监督,并提出了一个运行时控制平面,用于强制执行权限,并在破坏性操作前要求人工批准,通过Tandem演示进行了说明。
你们如何处理读取外部内容的代理中的提示注入问题?
关于在读取外部内容(如电子邮件和网页)的AI代理中处理提示注入攻击的讨论,探讨了生产级别的防御措施以及超越明显模式的微妙威胁。