如何在AI代理执行破坏性操作前有效阻止?

Reddit r/AI_Agents 新闻

摘要

这篇文章讨论了防止AI代理执行破坏性操作的挑战,并寻求主动控制的方法,例如在提示之外强制执行安全措施和实施有效的支出上限。

我看到很多关于AI代理在事后出错的帖子。比如操作了错误的账户、执行了不该运行的删除操作,或者工具调用消耗了远超预期的预算。但我发现很少有讨论在问题发生前如何阻止它。目前,我主要依靠提示指令告诉AI代理什么不该做,加上对涉及生产环境的操作进行手动审查。这种方法有效,但有点累人。系统提示非常基础,不是真正的强制执行。你们开发者如何确保AI代理(主要运行我的SaaS)的安全?不仅仅是告诉它什么不该做。是否有任何仓库或软件可以在提示注入到达工具调用之前捕获它?你们是否有支出上限能真正停止执行,而不仅仅是事后警报?如果有人经历过类似情况,你们是如何解决的或是否找到了方法?
查看原文

相似文章