2026年年中的持续学习:各方攻克路线图——记忆层、“梦境”智能体和在网络内部学习的后Transformer模型
摘要
2026年年中持续学习现状与未来展望的概述,涵盖记忆方法(包括外部记忆、状态内记忆和权重更新),并分析了TTT、Titans和Dragon Hatchling等各类模型。
Llion Jones在近期的后Transformer辩论中表示“2026年是持续学习之年”。Sutton/Silver将下一阶段称为“经验时代”。什么是持续学习?简单来说,就是模型在积累经验的同时持续改进的能力——且不会出现灾难性遗忘。本质上,这是一个推理模型的稳定性-可塑性权衡问题。关键归结为:记忆存储在哪里?
* **模型外部**:记忆文件、向量数据库、图结构。文本被检索并粘贴回上下文。模型保持冻结。
* **模型运行状态中**:隐藏状态或快速权重,随模型处理输入而变化。
* **模型权重中**:模型实际掌握的知识。编码在模型权重内,以改进决策模式且不遗忘。
今天的开发文档暗示了#1——模型外部的记忆。但“2026年是持续学习之年”这一观点并非源于此。为什么?
# 第一部分:Memento技术栈(当前技术栈)
针对LLM记忆问题存在工程性修复。Julian Togelius与a16z将其比作《Memento》。影片中Leonard依靠宝丽来照片和笔记运作,但每天他都是与第0天相同的个体。相关的进展包括:
* **Anthropic的Dreaming**:一种异步任务,用于管理“记忆”,明确模仿睡眠巩固机制。
* **长上下文作为记忆**:效果显著,但存在三个问题:a) 位置偏差和“中间迷失”挑战;b) 更长的LLM窗口带来更高成本,而我们已经开始讨论“token经济学”;c) KV缓存瓶颈,以及请求结束后一切消失。
* **Mem0、Letta、Zep**:初创公司推出的热门记忆层产品。
* [**AGENTS.md**](http://AGENTS.md) **与类git记忆文件**:然而,ETH Zurich的论文(arXiv 2602.11988)表明,LLM生成的上下文文件实际上使任务成功率下降约3%,同时成本增加超过20%。人工编写的文件也收效甚微。
# 第二部分:持续学习——模型内部的记忆(重大赌注)
大规模网络中的权重更新会引发灾难性遗忘。2026年1月一篇论文尝试对LRM进行持续微调(arXiv 2601.18699),但灾难性遗忘并未减少,反而加剧。有前景的解决方向包括:
* **TTT层(arXiv 2407.04620, ICML 2025)**:序列层的隐藏状态是一个小模型,通过梯度下降根据输入token流更新。在1.3B参数范围内匹配或超越Transformer/Mamba基线。
* **Titans与Atlas**:Titans添加了神经长期记忆,利用惊喜信号决定存储内容;Atlas改进了记忆的学习规则。
* **嵌套学习 + HOPE**:架构以不同频率更新不同模块。RNN通过病毒式传播的Memory Caching论文正逐步接近Transformer。
* **Dragon Hatchling (BDH)**:来自AI实验室Pathway(arXiv 2509.26507)。工作记忆驻留在赫布型突触中,而非KV缓存,从而实现无二次代价的“无限上下文窗口”。AMI Labs、LFMs等也提及持续学习,但我未在此方面找到具体信息。
# 当前状态与未来展望
**2026年年中,持续学习处于何种阶段?**
* 公开可用解决方案:无。
* 投入生产环境:仅限档案栈,所有模型皆冻结。
* 研究规模展示(< 2B参数):TTT、Titans、Memory Caching、HOPE和BDH。
**我认为推动进展的关键在于**:将模型内部记忆推向量产,并有效控制遗忘。
**但有两个问题:**
* OpenAI在此领域有何布局?
* 持续学习模型广泛应用的障碍是什么:是缺乏关键突破,还是评估标准、服务成本等问题?
相似文章
不忘记的艺术:一种用于持续学习的局部学习架构
本文介绍了CMP(认知记忆原语),一种持续学习架构,它使用稀疏关系编码和局部学习来减少灾难性遗忘,在字节级语言建模协议上展示了比使用EWC的Transformer更好的反向迁移。
转型中的持续学习
本文综述了持续学习从参数中心方法向系统级适应的演变,提出了一个三轴框架(何时、如何、何地)来刻画预训练、后训练和推理阶段的学习。
Sleep 用于持续学习(24分钟阅读)
Google 研究人员提出了一种名为 'Sleep' 的持续学习范式,通过蒸馏和回放将短期上下文知识整合到长期模型参数中。'Dreaming' 阶段则利用强化学习生成用于自我改进的合成课程。
@TheTuringPost:本周必读研究 Harness-1:基于状态外化束带的搜索智能体的强化学习 R…
本文探讨了大型语言模型中持续学习的复兴,强调了离线整合(即“睡眠”)的必要性,以防止灾难性遗忘,并使模型在部署后能够保持更新和专业化。
Dendritron Transformer:工作内部记忆与持续学习
介绍了Dendritron,一种替代Perceptron的模型,可以为冻结权重的Transformer模型添加内部记忆和持续学习能力,并提供了开源代码。