@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…
摘要
本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。
查看缓存全文
缓存时间: 2026/06/08 07:21
现在的人工智能领域陷入了一个非此即彼的怪圈。
一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻头彻尾的马大哈,多读两句就会把前面的内容忘得一干二净。
Google Research 联合康奈尔和南加大带来的这篇论文,核心思路极其简单粗暴却又充满智慧。既然 RNN 的脑容量固定,那我们每读完一段话,就给它当时的记忆拍个快照,存进缓存里。
当模型后面需要处理新内容时,它不仅能用当下的脑子去想,还能随时去翻看之前存下来的这些历史快照。 这样一来,RNN 的记忆容量就不再是死板固定的了,而是随着文本越长,存的快照越多,记忆力跟着一起动态生长。 它完美融合了两个流派的优势,在高效和博闻强识之间找到了黄金平衡点。
如果把所有快照都无脑翻一遍,那和昂贵的 Transformer 就没区别了。为了解决这个问题,论文设计了几种极其高效的翻账本技巧。
我们可以看到,实验结果非常震撼。 在语言模型以及各类长文本测试中,加了记忆缓存的 RNN 战斗力飙升。 特别是在大海捞针这种极其考验精准回忆的任务里,虽然 Transformer 依然是天花板,但这个新版 RNN 已经逼近了天花板的边缘,把以前的循环模型远远甩在身后。
它证明了我们不需要在昂贵的全量记忆和廉价的严重健忘之间二选一。 同时,提供了一条计算复杂度可以根据缓存多少来灵活调节的第三条道路。 我想,这项技术如果落地,意味着未来我们在手机、电脑等本地边缘设备上部署超长上下文的 AI 将变得便宜得多。
当然,这还是研究阶段的成果。Transformer 在并行训练速度和最终精度上依然有明显优势,实际落地还需要更多工程验证。 但这篇工作很扎实,它告诉了我们不需要永远在要么全记住、要么容易忘之间二选一,聪明地缓存关键记忆快照,就能把差距大幅缩小。
AI Agent时代,学界联合工业界为更高效、更 scalable 的长上下文 AI 指了一条值得大力投入的路。
相似文章
@XAMTO_AI: AI 开发中最消磨精力的,莫过于这种被迫的“上下文重置”——只要切换环境,之前做过什么、卡在哪个环节、当时的思考逻辑是什么,全得重新交代清楚。 针对这个痛点,有人推出了 Memanto,一个专为 AI 打造的工作记忆库,目前已支持 Cla…
Memanto是一个专为AI开发环境打造的主动式工作记忆库,能在无API密钥和向量数据库的情况下,实现零延迟索引和高性能检索,支持Claude Code、Cursor等16+开发环境,在LongMemEval基准测试中达到89.8%的分数。
@snowboat84: 你有没有发现,AI里模型的诞生其实相当随意?拿语言模型举例子:先是RNN,再到LSTM,某天突然说Transformer效果好就全换上,后来又拆成Encoder和Decoder,一会儿说BERT一桶浆糊,一会儿又说GPT可以有涌现能力,S…
文章讨论了AI模型诞生的随意性,提出从物理学模型中获得灵感并建立备选模型资料库,将选模型过程工程化的想法。
@HowToAI_: Google 悄悄发布了研究人员所称的“Attention Is All You Need V2”。这标志着 Transformer… 的终结。
Google 研究人员引入了 Nested Learning,这是一种新的架构,通过将模型视为嵌套优化问题来取代 Transformer,解决了灾难性遗忘问题,并实现了 100% 的长上下文记忆稳定性。
@jiqizhixin: 如果AI的记忆不必随着每多一句话而膨胀呢?牛津大学、Technion、AITHYRA 等…
介绍了KV-Compression Aware Training (KV-CAT) 方法,该方法鼓励Transformer在训练过程中学习可压缩的键值缓存,在不牺牲性能的情况下提高长上下文任务的记忆效率。
@Phoenixyin13: 如果满分10分,这篇来自麻省理工学院的论文的SMT的idea与writing我真的会给到8分。 论文提出 Supervised Memory Training 的想法是用 Transformer 当超级老师,先并行提炼出每一时刻最该记住的…
这篇论文提出监督记忆训练(SMT)方法,利用Transformer作为超级老师并行提炼记忆状态,然后用一步监督学习训练RNN,实现训练完全并行、梯度路径从O(T)缩短到O(1),显著改善了长距离依赖学习。