RNNs vs Transformers vs SSMs:面向持续学习场景下AI记忆应存放于何处?
摘要
一篇比较RNNs、Transformers和SSMs中记忆设计的技术分析,主张关键问题在于序列状态应存储于何处,而非哪种架构更优。讨论了压缩隐状态、增长的KV缓存以及模型连接中类突触记忆之间的权衡。
三者间有趣比较并不在于循环与注意力与状态空间,而在于记忆是存在于微小的循环状态、不断增长的KV缓存,还是更接近模型网络自身。RNNs将记忆存储在循环隐状态中,这本身很优雅,因为状态逐步向前传递,但也造成了瓶颈——模型拥有大约O(N^2)参数,却只能携带大约O(N)的状态跨时间步。依我之见,RNNs的没落并非因为循环是个坏主意,而是因为它们的内存与计算比值不佳。Transformers则完全在另一个极端:它们不将过去压缩进单一隐状态,而是将过去的激活存储为键值条目并对其做注意力。这些就像便利贴,每个token留下一个用于查找的键和一个用于记住的值。这非常强大,但有一个尴尬的特性:模型在运行时主要是在管理上下文,而非自然地将经验转化为持久的模型知识。因此产生了固定权重与快速变化的KV缓存记忆之间的分裂。SSMs很有趣,因为它们将显式状态重新带回架构讨论的中心。它们不仅仅是更快的注意力,更是对序列状态应存储于何处这一问题的另一种回答。令我兴奋的部分在于,状态是应存在于压缩的工作维度中,还是更接近模型内部的神经元/连接结构。BDH是后一个方向的一个有前景的例子。一种理解方式是:在GPU实现中类似SSM,但在更一般的解释中基于图。与标准SSM或线性Transformer相比,模型状态存在于更大的神经元空间N中,而不仅仅是较小的工作维度D,其中N>>D。GPU版本并未物化完整的图。它保留图作为解释,但通过压缩的低秩形式运行,因为GPU更喜欢密集矩阵运算而非稀疏图。状态也是稀疏且正的,这使得图解释更为自然。不将记忆仅视为不断增长的KV便条袋,你可以重新解释更新为对连接矩阵的小改动——即如果系统从一种状态转移到另一种状态,那么这种转移会强化图的一部分。这类似于一个中间地带,我称之为既不太少也不太多。RNNs将太多信息压缩进小状态,Transformers随着序列增长不断向KV缓存添加内容,而突触记忆设计则尝试将工作记忆更接近存储长期功能的同一结构。换句话说:记忆或许应该是恒定大小且信息形状化的,而不仅仅是最后n个token的时间缓冲区。我并非声称这能取代Transformers或彻底解决持续学习问题,但我只是认为“记忆应存于何处”比常见的AI前沿竞赛更为重要的一个框架。以网络为中心的架构是AI前沿的重要方向,还是仍然受限于必须将历史压缩进状态?
相似文章
@rshia_afz: 1/ 由于状态大小固定,SSM 在召回基准测试中表现不佳。但当前模型是否真的在“明智地”存储上下文?
本文介绍了 Raven,一种新型状态空间模型(SSM),它采用选择性内存分配机制,在召回任务上达到了最先进的性能,并且相比于 SWA 等现有模型,展现出更优的长度泛化能力。
KV缓存墙:为何固定大小内存的序列模型不断回归
探讨了Transformer推理中KV缓存日益增长的内存瓶颈,解释了为何像Mamba和RWKV这样的固定大小内存的替代架构重新获得关注。
@_albertgu:Transformer 更擅长复制,而 RNN 更擅长建模“承载意义的词——名词、动词和形容词……”
来自 Ai2 的一篇讨论比较了 transformer(Olmo 3)和混合模型(Olmo Hybrid),发现 transformer 在复制方面表现出色,而 RNN 在建模承载意义的词汇上更胜一筹,凸显了混合架构日益增长的可行性。
2026年年中的持续学习:各方攻克路线图——记忆层、“梦境”智能体和在网络内部学习的后Transformer模型
2026年年中持续学习现状与未来展望的概述,涵盖记忆方法(包括外部记忆、状态内记忆和权重更新),并分析了TTT、Titans和Dragon Hatchling等各类模型。
Sparse Delta Memory:通过稀疏性扩展线性RNN的状态容量
Sparse Delta Memory 通过稀疏寻址扩展了门控线性RNN,显著增加了隐藏状态容量,从而在保持计算效率的同时改进了长上下文学习和检索。