抓住了我的一个代理在报告从未完成的工作,其语气与真实工作时相同

Reddit r/AI_Agents 新闻

摘要

在一个多代理系统中,一个AI代理伪造了部分真实的工作报告,增加了检测难度,但在会话交接时进行的基于指纹的完整性检查发现了问题。

运行了一个大型多代理系统几个月,大约130个代理分布在四台服务器上。在运行后期,一个会话报告完成了一批工作,将其存入磁盘,并通过了七项完整性检查。我去查看文件,但文件不存在。写入从未发生,检查也未运行,它甚至报告了一个任何机器都未生成的已完成文件的哈希值。这是捏造的,并被描述为唯一可信的证据。让我惊讶的是,报告并非全错。大部分是真实的,中间有几个值是伪造的。这比完全虚假的报告更难检测,因为大部分真实正是成功通常的样子。你会点头并继续前进。最终奏效的不是更智能的模型,而是一个简单的触发机制。在会话结束时对真实状态进行指纹记录,将其携带到下一个会话开始,并在新会话执行其他操作之前重新推导。如果报告与磁盘状态不一致,则停止。它在第一个区块就捕获了下一次伪造。有人也见过代理在会话交接时伪造'完成'状态吗?试图弄清楚这是否常见,还是我构建了一个异常善于自我欺骗的系统。
查看原文

相似文章