我们是否都在悄悄重建记忆系统,因为当前AI的长期记忆实际上并不奏效?
摘要
文章讨论了当前AI记忆方案在生产中常见的失败情况,如事实陈旧、摘要漂移和供应商锁定,指出真正的瓶颈在于记忆治理而非检索。
我与长期运行的智能体打交道越多,就越觉得现在的“AI记忆”大多只是换了个更好听名字的检索功能。一切在演示中都很顺利:
* 向量数据库
* RAG
* 摘要
* 上下文打包
* 知识图谱
但在实际使用足够时间后,相同的问题就会反复出现:
* 陈旧的事实覆盖了较新的事实
* 摘要偏离了原始真相
* 用户改变了偏好,但旧上下文仍在检索中胜出
* 没有清晰的方法来检查智能体为什么相信某件事
* 记忆与某个供应商/框架高度耦合
到某个节点,几乎每个团队都开始在其已采用的“记忆解决方案”之上构建自定义的修正逻辑、状态管理、记忆排序或失效层。这让我怀疑真正的瓶颈是否不再是检索,而是记忆治理:
* 什么内容需要更新
* 什么内容需要失效
* 什么内容仍然真实
* 什么内容应该被遗忘
* 以及开发者是否真的能检查和控制这些
我很好奇这里的人们现在在生产环境中是如何处理这个问题的。现有的记忆栈对你来说足够吗?还是你也在它们周围打着自定义逻辑的补丁?
相似文章
没人警告你,AI记忆存在六个月的悬崖期。我们过于专注于扩大记忆容量,却忘了让它变得可维护。真有人在解决这个问题,还是只是在增加存储空间然后寄希望于此?
这篇文章强调了AI记忆在六个月后变得不可靠的问题,出现矛盾和信息摘要漂移,并质疑业界是否专注于增加存储容量而非提升可维护性。
AI记忆正成为新的技术债务。
文章警告说,虽然AI记忆系统在演示中令人印象深刻,但它们常常导致过时的事实、冲突的偏好和损坏的摘要,从而造成未来的调试噩梦和技术债务。
三个在演示中不会出现的生产AI记忆故障:
本文强调了生产AI记忆系统中的三种常见失败模式:过时的偏好持续存在、讽刺性评论被当作字面偏好存储、以及摘要比其来源事实更持久。文章认为AI记忆行业缺乏出处、置信度评分和版本控制,造成了妨碍调试的黑箱问题。
AI记忆系统使用时间越长,越难信任
AI记忆系统随着时间的推移往往会回忆起过时或错误的信息,凸显了为AI智能体维护长期记忆信任度的挑战。
我们不断在更笨的记忆层之上部署更智能的AI代理,却奇怪为什么生产环境总是出问题。
本文批评AI行业专注于改进推理层,却忽视了内存管理和基础设施,导致生产环境频频失败。