@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…

X AI KOLs Timeline 论文

摘要

本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。

现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻头彻尾的马大哈,多读两句就会把前面的内容忘得一干二净。 Google Research 联合康奈尔和南加大带来的这篇论文,核心思路极其简单粗暴却又充满智慧。既然 RNN 的脑容量固定,那我们每读完一段话,就给它当时的记忆拍个快照,存进缓存里。 当模型后面需要处理新内容时,它不仅能用当下的脑子去想,还能随时去翻看之前存下来的这些历史快照。 这样一来,RNN 的记忆容量就不再是死板固定的了,而是随着文本越长,存的快照越多,记忆力跟着一起动态生长。 它完美融合了两个流派的优势,在高效和博闻强识之间找到了黄金平衡点。 如果把所有快照都无脑翻一遍,那和昂贵的 Transformer 就没区别了。为了解决这个问题,论文设计了几种极其高效的翻账本技巧。 我们可以看到,实验结果非常震撼。 在语言模型以及各类长文本测试中,加了记忆缓存的 RNN 战斗力飙升。 特别是在大海捞针这种极其考验精准回忆的任务里,虽然 Transformer 依然是天花板,但这个新版 RNN 已经逼近了天花板的边缘,把以前的循环模型远远甩在身后。 它证明了我们不需要在昂贵的全量记忆和廉价的严重健忘之间二选一。 同时,提供了一条计算复杂度可以根据缓存多少来灵活调节的第三条道路。 我想,这项技术如果落地,意味着未来我们在手机、电脑等本地边缘设备上部署超长上下文的 AI 将变得便宜得多。 当然,这还是研究阶段的成果。Transformer 在并行训练速度和最终精度上依然有明显优势,实际落地还需要更多工程验证。 但这篇工作很扎实,它告诉了我们不需要永远在要么全记住、要么容易忘之间二选一,聪明地缓存关键记忆快照,就能把差距大幅缩小。 AI Agent时代,学界联合工业界为更高效、更 scalable 的长上下文 AI 指了一条值得大力投入的路。
查看原文
查看缓存全文

缓存时间: 2026/06/08 07:21

现在的人工智能领域陷入了一个非此即彼的怪圈。

一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻头彻尾的马大哈,多读两句就会把前面的内容忘得一干二净。

Google Research 联合康奈尔和南加大带来的这篇论文,核心思路极其简单粗暴却又充满智慧。既然 RNN 的脑容量固定,那我们每读完一段话,就给它当时的记忆拍个快照,存进缓存里。

当模型后面需要处理新内容时,它不仅能用当下的脑子去想,还能随时去翻看之前存下来的这些历史快照。 这样一来,RNN 的记忆容量就不再是死板固定的了,而是随着文本越长,存的快照越多,记忆力跟着一起动态生长。 它完美融合了两个流派的优势,在高效和博闻强识之间找到了黄金平衡点。

如果把所有快照都无脑翻一遍,那和昂贵的 Transformer 就没区别了。为了解决这个问题,论文设计了几种极其高效的翻账本技巧。

我们可以看到,实验结果非常震撼。 在语言模型以及各类长文本测试中,加了记忆缓存的 RNN 战斗力飙升。 特别是在大海捞针这种极其考验精准回忆的任务里,虽然 Transformer 依然是天花板,但这个新版 RNN 已经逼近了天花板的边缘,把以前的循环模型远远甩在身后。

它证明了我们不需要在昂贵的全量记忆和廉价的严重健忘之间二选一。 同时,提供了一条计算复杂度可以根据缓存多少来灵活调节的第三条道路。 我想,这项技术如果落地,意味着未来我们在手机、电脑等本地边缘设备上部署超长上下文的 AI 将变得便宜得多。

当然,这还是研究阶段的成果。Transformer 在并行训练速度和最终精度上依然有明显优势,实际落地还需要更多工程验证。 但这篇工作很扎实,它告诉了我们不需要永远在要么全记住、要么容易忘之间二选一,聪明地缓存关键记忆快照,就能把差距大幅缩小。

AI Agent时代,学界联合工业界为更高效、更 scalable 的长上下文 AI 指了一条值得大力投入的路。

相似文章

@XAMTO_AI: AI 开发中最消磨精力的,莫过于这种被迫的“上下文重置”——只要切换环境,之前做过什么、卡在哪个环节、当时的思考逻辑是什么,全得重新交代清楚。 针对这个痛点,有人推出了 Memanto,一个专为 AI 打造的工作记忆库,目前已支持 Cla…

X AI KOLs Timeline

Memanto是一个专为AI开发环境打造的主动式工作记忆库,能在无API密钥和向量数据库的情况下,实现零延迟索引和高性能检索,支持Claude Code、Cursor等16+开发环境,在LongMemEval基准测试中达到89.8%的分数。

@Phoenixyin13: 如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。 论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的…

X AI KOLs Timeline

这篇论文提出监督记忆训练(SMT)方法,利用Transformer作为超级老师并行提炼记忆状态,然后用一步监督学习训练RNN,实现训练完全并行、梯度路径从O(T)缩短到O(1),显著改善了长距离依赖学习。