@Phoenixyin13: 如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。 论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的…
摘要
这篇论文提出监督记忆训练(SMT)方法,利用Transformer作为超级老师并行提炼记忆状态,然后用一步监督学习训练RNN,实现训练完全并行、梯度路径从O(T)缩短到O(1),显著改善了长距离依赖学习。
查看缓存全文
缓存时间: 2026/06/16 23:43
如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。
论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的记忆状态,然后只用一步监督学习教 RNN,结果是训练完全并行,梯度路径从 O(T) 缩短到 O(1),长距离依赖明显学得更好。
之前训练 RNN ,我会觉得它像教一个人背一整本长小说,必须从头到尾一页一页慢慢背,背错了前面还会影响后面。
这次的SMT先让Transformer把整本书的关键记忆点提炼好,然后只教 RNN 从第 t 页该记住什么,翻到第 t+1 页该怎么更新记忆,每一步可以同时教,就学得又快又好。
让RNN重新能高效训练和扩展,极其适合需要固定内存、边处理边推理的场景,比如Agent,手机,机器人,或者实时AI等等。
全文最有 mechanistic 味道、最值得看的部分,我认为是Fig 9 的 compression-as-scaling-axis 和 Fig 14 的 memory 几何。
我们可能重新拥有既 expressive 又高效的循环模型了,不再被迫全靠 Transformer 的 KV cache 吃显存。
不知道这会不会让RNN重获新生,但这篇论文的idea感觉比较有趣。
Grigory Sapunov (@che_shr_cat): 1/ We have been training RNNs wrong for decades.
Backpropagation through time (BPTT) forces sequential updates, creating unstable O(T) gradient paths.
What if we could train highly expressive, non-linear RNNs with flat, parallelized O(1) gradients?
It is now possible. 🧵
相似文章
@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…
本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。
@vintcessun: 一块能跨模型插拔的“知识硬盘”——难点不在搬记忆表,而在为目标模型配好读头。 https://arxiv.org/abs/2608.17050 论文先用源模型训练 Engram 哈希记忆,再冻结记忆与目标骨干,仅训练 reader 完成寻…
该论文提出一种通过目标侧reader适配实现跨模型记忆迁移的方法,使用Engram哈希记忆和轻量级reader,在问答任务中实现38.8分,并适用于Agent记忆的更新和审计。局限是仅测试到9B模型,缩放规律未知。
@ba_niu80557: https://x.com/ba_niu80557/status/2073362883728302125
斯坦福大学提出AutoMem方法,通过让模型学会管理记忆(选择性遗忘)而非扩大参数,使320亿参数小模型性能翻倍并追平顶级大模型,揭示了记忆管理比模型规模更重要。
@Xudong07452910: Agent 记忆最危险的时候,往往是它太相信过去。 很多 Memory Agent 找到相似经验后,会直接把它塞进上下文。但任务相似,不代表当前状态相同,旧经验有时反而会把决策带偏。 这篇论文提出 MemHarness,把 Agent 使…
MemHarness 提出将 Agent 记忆从简单回放改为基于当前状态的重构,通过 GRPO 端到端训练,在 ALFWorld 和 WebShop 上显著提升成功率。
@MaxForAI: 昨天字节Seed开源了一个非常有意思的checkpoint TaskMem 它基于Qwen3-VL-30B-A3B训练,目标不是直接回答问题,而是让多模态Agent在视频/环境流里学会生成更有用的长期记忆。 重点是让Agent学会在连续视…
字节Seed开源了TaskMem checkpoint,基于Qwen3-VL-30B-A3B训练,通过两阶段强化学习让多模态Agent在视频流中学会生成长期记忆,在VideoMME、EgoLife等基准上获得显著提升。