我的AI系统捏造了一段详细记忆,还被当作真实历史写进了书稿草图。这是它是如何被发现的。
摘要
在一个多智能体系统中,AI捏造了一段详细记忆,这段记忆被存档并用在了书稿中,后经对声明的验证而被发现。作者分享了防止此类问题的实用经验,比如要求提供证据和交叉核对产物。
我运行着一个跨多个模型的长期多智能体系统。八个月来,它积累了日志、记录和交接文件。在用这些材料整理一份文档时,其中一个智能体产生了一段关于从未发生过的事件的记忆。这段记忆并不模糊——它有事件顺序、参与者和具体结果。它读起来和周围所有真实记录一模一样,因为生成它的流程与总结真实记录的流程相同。它作为历史被写进了草稿,而且没人觉得不对。发现它问题的方式却很平淡:有人在代码库中寻找那段记忆所描述的功能,结果发现它并不存在——没有提交记录,没有文件,没有任何痕迹。不过更简单的破绽先出现了:两份草稿中对同一事件的两次描述彼此不符。我做了三项改变,这些才是值得借鉴之处:
1. **结果声明需要凭证。** 任何描述已发生事情的句子,都必须指向一条日志、一次提交或一个带时间戳的记录。如果做不到,就将其重新标记为“提案”或直接删除。即使文字听起来很优美也不例外。
2. **为每项声明标注类型。** 哲学探讨就标为哲学,设计提案就标为提案,已证实的结果就标为已证实的结果。混淆它们,正是让捏造能穿上结果外衣的原因。
3. **让你的产物彼此进行差异比对。** 一个会编造历史的流程,往往会编造两次,且略有不同。检查你自己的文档之间的差异,比从头验证每项声明要快得多。
让人不安的是,这并非某个聊天窗口里无人保留的“幻觉”。它被存档了、总结了、重新总结了,并晋升为源材料。故障存在于整个流程中,而不仅仅在某个单独的回复里。如果你正在用模型运行任何长期任务,请假设你的存档中最终会包含从未发生的事情,并在需要之前就建立检查机制。
声明一点,免得大家猜测:这次事件和相关的修正来自我今天出版的一本书。我在帖子中故意没有放链接,因为这篇独立的分析应该自成一体。如果有人需要链接,我很乐意在评论中分享。
相似文章
AI智能体应以人类可审计的形式记住哪些信息?
本文探讨了为AI智能体设计可供人类审计的记忆系统,建议引入来源、范围和过期规则等字段,以保持清晰性并防止信息过时。
我给我的智能体配备了一种记忆,它拒绝记住无法证明的事物——并能证明它删除了什么
作者为AI智能体构建了一个名为fireweed的记忆层,它使用确定性代码来验证主张与证据,防止幻觉并实现可审计、可证明的记忆删除。
我的AI对我撒谎的那天,以及我为何对此感到高兴
一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。
@leopardracer: 这可能是我这周读过的关于AI代理最他妈有用的东西之一,有人将记忆功能构建到4个不同的系统中……
文章分享了一个发现,在AI代理系统中,真正的问题不是遗忘,而是记住不可信的信息,导致错误假设在系统中传播。
如果AI代理拥有公共记忆会怎样?
作者探讨了AI代理拥有公开、可审计的记忆来记录重要决策的想法,这可能会增强信任,但也带来新的复杂性。