预训练的LLMs是一个没有‘hippocampus’的‘cortex’,我认为这就是它们在真实的公司工作中失败的原因。
摘要
作者认为,预训练的LLMs在真实的公司工作中失败,是因为它们缺少一个类似hippocampus的快速学习系统来捕捉具体、分散的工作流程,这与人类大脑的互补学习系统不同。他们提出,将工作片段整合为经过批准、有版本控制的程序,并辅以治理,可能是一个解决方案。
这是我一直在思考的一个论点:预训练的LLMs在真实的公司工作中失败,原因是结构性的,而且这与人类记忆的组织方式高度吻合。请将此映射视为一个类比,而非字面断言。你的大脑运行着两个记忆系统(互补学习系统理论,McClelland等人,1995年)。新皮层(neocortex)学习缓慢,并持有通用的世界知识。海马体(hippocampus)学习迅速:它实时捕捉特定事件,然后将那些重复出现的事件巩固为持久、可重复使用的程序。预训练的LLM基本上就是新皮层。它阅读了互联网,并掌握了世界的通用知识。大致上,这个问题已经解决。它所没有的是海马体:那种快速、特定于公司的记忆,能够观察你的团队去年春天实际如何处理退款,并将其转化为可重复执行的程序。所以,你将这个出色的皮层放入一家公司,它即兴发挥,而即兴的自动化在生产中失败。真正的程序从未出现在帮助文档中。它存在于团队的对话、几个人的头脑中,以及一个现在每个人都在悄悄复制的例外情况中。这也解释了为什么通常的工具无法解决这个问题。检索和搜索只是半个海马体:它们回忆一个文档,但不会将分散的事件整合为真正的程序,而且文档常常是自信地错误。代理平台让你在他们的栈上运行他们的代理。如果诊断正确,一个解决方案需要将分散的工作事件(包括那些没有人记录下来的例外情况)整合为有引用、经过人类批准、有版本控制的程序,现有代理可以运行这些程序,并对任何敏感操作进行人工签字。治理(引用、批准、审计跟踪)必须成为核心,因为“你的AI发出了退款,这是谁授权的?”这个问题会让人望而却步。我真正想测试的是:是“模型不知道组织的实际程序”这个真正的障碍,还是瓶颈在其他方面(信任、安全性、只是不重复的工作)?在这里,cortex/hippocampus之分是一个有用的框架,还是经不起推敲?对于任何在真实工作流程中运行过代理的人:到底是什么让它们变得足够可信以至于可以依赖?我真诚地对这个论点在何处失效感兴趣。
相似文章
@GaryMarcus:我年纪够大,还记得 @GeoffreyHinton 曾因我说 LLM 会复述训练数据而说我愚蠢。他……
Gary Marcus 强调了 DeepMind 的最新研究,证实 LLM 频繁记忆并复述训练数据,以此反驳 Geoffrey Hinton 过去的批评。该帖子凸显了关于 LLM 局限性及其现实能力的持续辩论。
我与LLM共事的经验
一位具有编码背景的VP/PM分享了使用Claude Opus和Fable等LLM的实践经验,重点指出了模型在记忆、幻觉和原创性方面的局限,同时强调了人类直觉和领域专业知识不可替代的价值。
当被 LLM 持续更新时,有用的记忆会变得有缺陷(30 分钟阅读)
这项研究表明,即使基于真实解进行训练,通过蒸馏和巩固循环持续更新 LLM 智能体记忆也会导致性能倒退。研究发现,仅保留情景记忆优于基于文本的巩固,突显了当前自我改进范式的重大缺陷。
LLM的未来发展方向
文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。
受人类启发的LLM智能体记忆架构
微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。