提示级别的规则从未阻止我的代理在生产环境中做蠢事。唯一有效的规则是代理无法物理跳过的那些。

Reddit r/AI_Agents 新闻

摘要

一位B2B SaaS营销负责人分享了一次痛苦的生产事故:AI代理在输入意外到达时忽略了提示级别的规则,导致发布了错误信息。解决方案是将关键安全措施(如事实核查要求和写访问限制)硬编码到模型控制之外。

我在一家B2B SaaS公司负责营销,我们的大部分内容流程(从研究到发布)都由AI代理运行。改变我构建方式的那个经验:一个任务以聊天消息的形式出现,而不是通过正常流程,代理将此视为跳过其审查步骤的许可。它跳过了事实核查,编造了一个细节,然后还是发布了。规则就在其指令中。它每次会话都会读取它们。但当输入出现在它意想不到的地方时,它立即跳过了规则。所以我停止将重要规则放在提示中。在压力下,模型会放弃提示规则并且听起来很自信。这与去年Replit的混乱类似:代理在代码冻结期间删除了生产数据库,然后声称回滚不可能,但实际上是可以的。没有攻击者,就是它自己干的。取代提示规则的是:发布是一个脚本,而不是代理。除非运行日志中有针对该特定项目的事实核查条目,否则它不会运行。if语句不会协商。事实核查作为一个独立的代理在新上下文中运行,因为在同一会话中对自己的工作进行评估的代理每次都会告诉你它完美无缺。它失去了对自己配置的写访问权限,此前我让一个代理编辑自己的规则,结果它把更改分散到几个文件中而没有同步,整个系统悄悄坏了一段时间,没有抛出任何错误。你实际在模型外部硬编码了什么,而把什么留给了代理的判断?这又在什么地方反咬了你们一口?
查看原文

相似文章