@Phoenixyin13: 如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。 论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的…

X AI KOLs Timeline 论文

摘要

这篇论文提出监督记忆训练(SMT)方法,利用Transformer作为超级老师并行提炼记忆状态,然后用一步监督学习训练RNN,实现训练完全并行、梯度路径从O(T)缩短到O(1),显著改善了长距离依赖学习。

如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。 论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的记忆状态,然后只用一步监督学习教 RNN,结果是训练完全并行,梯度路径从 O(T) 缩短到 O(1),长距离依赖明显学得更好。 之前训练 RNN ,我会觉得它像教一个人背一整本长小说,必须从头到尾一页一页慢慢背,背错了前面还会影响后面。 这次的SMT先让Transformer把整本书的关键记忆点提炼好,然后只教 RNN 从第 t 页该记住什么,翻到第 t+1 页该怎么更新记忆,每一步可以同时教,就学得又快又好。 让RNN重新能高效训练和扩展,极其适合需要固定内存、边处理边推理的场景,比如Agent,手机,机器人,或者实时AI等等。 全文最有 mechanistic 味道、最值得看的部分,我认为是Fig 9 的 compression-as-scaling-axis 和 Fig 14 的 memory 几何。 我们可能重新拥有既 expressive 又高效的循环模型了,不再被迫全靠 Transformer 的 KV cache 吃显存。 不知道这会不会让RNN重获新生,但这篇论文的idea感觉比较有趣。
查看原文
查看缓存全文

缓存时间: 2026/06/16 23:43

如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。

论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的记忆状态,然后只用一步监督学习教 RNN,结果是训练完全并行,梯度路径从 O(T) 缩短到 O(1),长距离依赖明显学得更好。

之前训练 RNN ,我会觉得它像教一个人背一整本长小说,必须从头到尾一页一页慢慢背,背错了前面还会影响后面。

这次的SMT先让Transformer把整本书的关键记忆点提炼好,然后只教 RNN 从第 t 页该记住什么,翻到第 t+1 页该怎么更新记忆,每一步可以同时教,就学得又快又好。

让RNN重新能高效训练和扩展,极其适合需要固定内存、边处理边推理的场景,比如Agent,手机,机器人,或者实时AI等等。

全文最有 mechanistic 味道、最值得看的部分,我认为是Fig 9 的 compression-as-scaling-axis 和 Fig 14 的 memory 几何。

我们可能重新拥有既 expressive 又高效的循环模型了,不再被迫全靠 Transformer 的 KV cache 吃显存。

不知道这会不会让RNN重获新生,但这篇论文的idea感觉比较有趣。

Grigory Sapunov (@che_shr_cat): 1/ We have been training RNNs wrong for decades.

Backpropagation through time (BPTT) forces sequential updates, creating unstable O(T) gradient paths.

What if we could train highly expressive, non-linear RNNs with flat, parallelized O(1) gradients?

It is now possible. 🧵

相似文章

@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…

X AI KOLs Timeline

本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。

@MaxForAI: 昨天字节Seed开源了一个非常有意思的checkpoint TaskMem 它基于Qwen3-VL-30B-A3B训练,目标不是直接回答问题,而是让多模态Agent在视频/环境流里学会生成更有用的长期记忆。 重点是让Agent学会在连续视…

X AI KOLs Timeline

字节Seed开源了TaskMem checkpoint,基于Qwen3-VL-30B-A3B训练,通过两阶段强化学习让多模态Agent在视频流中学会生成长期记忆,在VideoMME、EgoLife等基准上获得显著提升。