@HowToAI_: Google 悄悄发布了研究人员所称的“Attention Is All You Need V2”。这标志着 Transformer… 的终结。
摘要
Google 研究人员引入了 Nested Learning,这是一种新的架构,通过将模型视为嵌套优化问题来取代 Transformer,解决了灾难性遗忘问题,并实现了 100% 的长上下文记忆稳定性。
Google 悄悄发布了研究人员所称的“Attention Is All You Need V2”。这标志着我们所熟知的 Transformer 时代的终结。
2017 年,最初的“Attention Is All You Need”论文通过证明 AI 不需要循环,只需要注意力机制,改变了世界。但如今,即使是最先进的模型(如 GPT 和 Gemini)也遭受着一个巨大的结构性缺陷:灾难性遗忘。当 AI 学习新东西时,它就开始遗忘之前学到的内容。这就是 AI 会“幻觉”或在长对话中丢失思路的原因。
这篇题为“Nested Learning: The Illusion of Deep Learning Architectures”的论文彻底改变了 AI 存储信息的方式。研究人员引入了一种称为 Nested Learning (NL) 的范式转变。以下是为什么这被称为“V2”的原因:
在过去十年中,我们将 AI 模型视为一个巨大的、扁平的数学函数。NL 证明了模型实际上是一组数千个并行运行的、更小的“嵌套”优化问题。不再是单一的巨大“记忆”,每一层都有自己的内部“上下文流”。这使得模型能够在测试时学习新任务,而不会覆盖其核心智能。这让我们超越了静态的 Transformer。
这种新架构 (HOPE) 在长上下文记忆中展示了 100% 的稳定性,并实现了以前不可能的“训练后适应”。
技术要点对竞争对手来说是残酷的:现有的深度学习通过压缩信息直到崩溃来工作。而 Nested Learning 通过组织信息以便它可以无限增长来工作。
我们花了 7 年时间试图让 Transformer 变得更大。而 Google 找到了如何让它们变得“嵌套”的方法。
Transformer 在 2017 年取代了 RNN。Nested Learning 将在 2026 年取代 Transformer。
相似文章
@RoundtableSpace: 谷歌刚刚找到一种方法,将AI内存从31GB压缩到4GB
谷歌开发了一种方法,将AI内存使用量从31GB压缩到4GB,代表了AI模型效率的重大突破。
@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…
本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。
@Oliviacoder1: MIT刚刚让每家AI公司的数十亿美元赌注看起来尴尬不已。他们解决了AI记忆问题。不是通过构建更大的……
MIT CSAIL研究人员提出了一种新颖的AI记忆方法,通过将文档存储在外部,并让AI自行导航和查询,从而避免了上下文腐烂,以更低成本实现了1000万令牌的有效上下文。
@jiqizhixin: 如果AI的记忆不必随着每多一句话而膨胀呢?牛津大学、Technion、AITHYRA 等…
介绍了KV-Compression Aware Training (KV-CAT) 方法,该方法鼓励Transformer在训练过程中学习可压缩的键值缓存,在不牺牲性能的情况下提高长上下文任务的记忆效率。
2026年年中的持续学习:各方攻克路线图——记忆层、“梦境”智能体和在网络内部学习的后Transformer模型
2026年年中持续学习现状与未来展望的概述,涵盖记忆方法(包括外部记忆、状态内记忆和权重更新),并分析了TTT、Titans和Dragon Hatchling等各类模型。