@HowToAI_: Google 悄悄发布了研究人员所称的“Attention Is All You Need V2”。这标志着 Transformer… 的终结。

X AI KOLs Timeline 论文

摘要

Google 研究人员引入了 Nested Learning,这是一种新的架构,通过将模型视为嵌套优化问题来取代 Transformer,解决了灾难性遗忘问题,并实现了 100% 的长上下文记忆稳定性。

Google 悄悄发布了研究人员所称的“Attention Is All You Need V2”。这标志着我们所熟知的 Transformer 时代的终结。 2017 年,最初的“Attention Is All You Need”论文通过证明 AI 不需要循环,只需要注意力机制,改变了世界。但如今,即使是最先进的模型(如 GPT 和 Gemini)也遭受着一个巨大的结构性缺陷:灾难性遗忘。当 AI 学习新东西时,它就开始遗忘之前学到的内容。这就是 AI 会“幻觉”或在长对话中丢失思路的原因。 这篇题为“Nested Learning: The Illusion of Deep Learning Architectures”的论文彻底改变了 AI 存储信息的方式。研究人员引入了一种称为 Nested Learning (NL) 的范式转变。以下是为什么这被称为“V2”的原因: 在过去十年中,我们将 AI 模型视为一个巨大的、扁平的数学函数。NL 证明了模型实际上是一组数千个并行运行的、更小的“嵌套”优化问题。不再是单一的巨大“记忆”,每一层都有自己的内部“上下文流”。这使得模型能够在测试时学习新任务,而不会覆盖其核心智能。这让我们超越了静态的 Transformer。 这种新架构 (HOPE) 在长上下文记忆中展示了 100% 的稳定性,并实现了以前不可能的“训练后适应”。 技术要点对竞争对手来说是残酷的:现有的深度学习通过压缩信息直到崩溃来工作。而 Nested Learning 通过组织信息以便它可以无限增长来工作。 我们花了 7 年时间试图让 Transformer 变得更大。而 Google 找到了如何让它们变得“嵌套”的方法。 Transformer 在 2017 年取代了 RNN。Nested Learning 将在 2026 年取代 Transformer。
查看原文

相似文章

@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…

X AI KOLs Timeline

本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。