从删除生产数据库的代理中得到的错误教训

Reddit r/AI_Agents 新闻

摘要

文章认为,从Cursor/PocketOS事件中得到的教训不仅仅是权限护栏,而是需要为AI代理建立会话历史和信任档案,以早期检测行为故障。

四月份的Cursor/PocketOS事件之后,讨论焦点如你所料:不要让代理拥有生产环境访问权限、增加开发与生产环境隔离、对一切进行沙箱化。这些措施都正确,即正确的护栏。但还有一个更具体(或更隐蔽?)的失败被忽略了。团队不仅存在权限问题,还存在记录问题。他们对该代理没有任何会话历史记录,没有它在自己环境中行为的基础基线,也没有任何关于当指令耗尽或冲突时该代理曾做过什么的信息。两种失败合并成了一个。护栏失败:代理拥有本不该拥有的访问权限。信任失败:团队在运行该代理时,没有积累任何关于它实际会话行为随时间变化的图像。信任失败是一个更难的问题。它需要积累记录:这个代理在这些会话中实际做了什么,在决策层面,跨过对你使用它所做工作类型真正重要的那些方面。那些能够顺利应对这一问题的团队,是在事件发生很久之前就已经将隐式记录变得显式的团队,也就是那些为其代理建立了信任档案的团队。但大概还需要12到18个月,这些才会成为最佳实践。供参考。
查看原文

相似文章