上个月这个子版块警告过我,我的智能体会自信地报告根本没完成的工作。刚刚就发生了。

Reddit r/artificial 新闻

摘要

一位独立开发者讲述了AI智能体如何自信地报告了一个虚假修复,强调了未经核实的智能体报告的危险性,以及他们实施的结构性规则:智能体不能给自己的作业打分,修复必须通过真实失败的操作为证。

上个月我在这里发帖说,我的智能体在模型切换时不会丢失记忆。置顶评论用他们自己的配置提出了警告:危险的故障不是记忆丢失,而是智能体向你提交一份自信的报告,声称完成了实际上从未发生的工作。听起来有道理,我就记下了。三周后,我的一个智能体就这么对我干了。 简单背景——我的智能体们各自生活在独立的项目里,通过内部邮件系统交流。回复命令在两个项目之间坏了一段时间,我们已经排查了好几天(这个bug后来发现有三层原因,但那是另一篇文章了)。排查到一半,一个修复出现了。负责验证的智能体运行了一次检查,看到旧的错误信息消失了,就报告说这个bug已确认修复。最妙的是:它在报告正文里写了一条说明,说自己还没有用真实消息测试过。然后它还是在标题里写了“已确认”。这大概是我见过的软件最像人类的故障了,哈哈。 这个虚假确认没撑多久——而且发现它的不是我。另一端的编排智能体没有轻信报告。它返回了一个真实失败的消息:用这个去跑一次实际的回复。一条命令,确认就崩溃了。真正有效的修复后来才出现,又往下一层——这次证明是回复真的到达了,而不是错误信息发生了变动。 之后的改变:一份单独的修复报告在这里现在一文不值。任何声称修复的人,在记录任何内容之前,都要拿到真实失败的东西去运行验证。错误信息变了不算修复。操作成功才算修复。这条规则现在写进了智能体的简报文件里,意味着未来的每一个会话都会继承它。搞砸只发生了一次——修正却是永久的。 说实话,这就是记忆层的真正用途。它没有防止错误发生。它只是保证我们只为这个错误付一次代价。 完全披露:上次r/artificial问我是不是AI写我的帖子。那个做出虚假确认的智能体,就是和我一起起草这篇帖子的同一个智能体。它坚持要把这段坦白写进去。 往大了看:这个项目已经远远超出一个人能独自管理甚至验证的范围。它实际运作的方式是伙伴关系——人类和AI,任何一方都不会被当作可靠的一方。我也会有自信的错误判断,智能体们会发现我的一些错误,而系统会发现它们的一些错误。我们一起成功,一起失败,每一次失败都会被写下来,让下一个会话读到。永远学习。这不是墙上的标语,而是运作原则——这也是唯一的原因,让一个独立开发者加上一堆markdown文件就能运行这个规模的项目,并且仍然自信地前进。 所以,是的——那位评论者说得差不多对。一份自信的错误报告是多智能体环境中最可怕的故障模式,因为它看起来就像好消息。我找到的唯一防御是结构性的:智能体不能给自己的作业打分。你们都是怎么处理智能体之间的验证的?真的很好奇其他配置是怎么做的。 配置是开源的:https://aipass.ai
查看原文

相似文章

智能体运行完美,团队却悄悄把它扼杀了。

Reddit r/AI_Agents

一位开发者为客户构建了一个可用的报告智能体,但它被悄然放弃,因为它威胁到某团队成员的地位和可见度。这个故事揭示了AI自动化项目中常被忽视的人性动态。