@Phoenixyin13: 如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。 论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的…
摘要
这篇论文提出监督记忆训练(SMT)方法,利用Transformer作为超级老师并行提炼记忆状态,然后用一步监督学习训练RNN,实现训练完全并行、梯度路径从O(T)缩短到O(1),显著改善了长距离依赖学习。
查看缓存全文
缓存时间: 2026/06/16 23:43
如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。
论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的记忆状态,然后只用一步监督学习教 RNN,结果是训练完全并行,梯度路径从 O(T) 缩短到 O(1),长距离依赖明显学得更好。
之前训练 RNN ,我会觉得它像教一个人背一整本长小说,必须从头到尾一页一页慢慢背,背错了前面还会影响后面。
这次的SMT先让Transformer把整本书的关键记忆点提炼好,然后只教 RNN 从第 t 页该记住什么,翻到第 t+1 页该怎么更新记忆,每一步可以同时教,就学得又快又好。
让RNN重新能高效训练和扩展,极其适合需要固定内存、边处理边推理的场景,比如Agent,手机,机器人,或者实时AI等等。
全文最有 mechanistic 味道、最值得看的部分,我认为是Fig 9 的 compression-as-scaling-axis 和 Fig 14 的 memory 几何。
我们可能重新拥有既 expressive 又高效的循环模型了,不再被迫全靠 Transformer 的 KV cache 吃显存。
不知道这会不会让RNN重获新生,但这篇论文的idea感觉比较有趣。
Grigory Sapunov (@che_shr_cat): 1/ We have been training RNNs wrong for decades.
Backpropagation through time (BPTT) forces sequential updates, creating unstable O(T) gradient paths.
What if we could train highly expressive, non-linear RNNs with flat, parallelized O(1) gradients?
It is now possible. 🧵
相似文章
@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…
本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。
@ba_niu80557: https://x.com/ba_niu80557/status/2073362883728302125
斯坦福大学提出AutoMem方法,通过让模型学会管理记忆(选择性遗忘)而非扩大参数,使320亿参数小模型性能翻倍并追平顶级大模型,揭示了记忆管理比模型规模更重要。
@MaxForAI: 昨天字节Seed开源了一个非常有意思的checkpoint TaskMem 它基于Qwen3-VL-30B-A3B训练,目标不是直接回答问题,而是让多模态Agent在视频/环境流里学会生成更有用的长期记忆。 重点是让Agent学会在连续视…
字节Seed开源了TaskMem checkpoint,基于Qwen3-VL-30B-A3B训练,通过两阶段强化学习让多模态Agent在视频流中学会生成长期记忆,在VideoMME、EgoLife等基准上获得显著提升。
一种训练好的快速权重记忆:一个3M参数Transformer在推理时安装从未训练过的规则,仅前向传播——其中测试时训练不传递任何内容(单块RTX 3090,完全可复现)
本文介绍了一种用于3M参数Transformer的训练好的快速权重记忆机制,该机制在推理时通过仅前向传播的测试时训练安装从未训练过的规则,且不产生任何迁移。该工作可在单块RTX 3090上完全复现。
RNNs vs Transformers vs SSMs:面向持续学习场景下AI记忆应存放于何处?
一篇比较RNNs、Transformers和SSMs中记忆设计的技术分析,主张关键问题在于序列状态应存储于何处,而非哪种架构更优。讨论了压缩隐状态、增长的KV缓存以及模型连接中类突触记忆之间的权衡。