@mubeitech: Transformer根本不是AI的终局。 这是英伟达AI研究副总裁Sanja Fidler给出的断言。 这位掌管英伟达空间智能实验室的负责人,看到的是当前架构的死穴。 现在的模型训练成本太昂贵。 对海量数据的依赖深不见底。 必须在架构底…

X AI KOLs Timeline 新闻

摘要

英伟达AI研究副总裁Sanja Fidler断言Transformer并非AI的终局架构,指出当前模型训练成本过高、对海量数据依赖严重,需要在架构底层寻求新突破,新一代架构变种已开始涌现。

Transformer根本不是AI的终局。 这是英伟达AI研究副总裁Sanja Fidler给出的断言。 这位掌管英伟达空间智能实验室的负责人,看到的是当前架构的死穴。 现在的模型训练成本太昂贵。 对海量数据的依赖深不见底。 必须在架构底层撕开新的突破口。 新一代变种已经开始冒头。
查看原文

相似文章

@snowboat84: 继续讨论物理模型在AI中的运用。今天的Transformer靠attention让序列里不同位置的信息相互作用,但这种混合极有可能是有损、不可逆的。独立的各份信息混着混着就糊了、丢了,也无法从结果精确倒推回输入。我们想要的是另一种相互作用…

X AI KOLs Timeline

作者讨论Transformer注意力机制导致信息有损和不可逆的问题,提出借鉴孤立子传播的物理模型,设计一种可逆、零损耗的相互作用层,作为对现有AI模型结构的改进方向。

@NFTCPS: 天天喊着搞AI,结果你连Transformer是个啥都说不清? 有个仓库够狠,从零手搓一个GPT,不调任何高级库。Attention、多头、前馈、Embedding、残差、Layer Norm,怎么拼起来的全摊给你看。而且不止模型,整条链…

X AI KOLs Timeline

一个GitHub开源项目,从零实现完整的GPT训练流程,包含数据预处理、预训练、SFT和RLHF后训练,全部基于原生PyTorch,适合想深入理解Transformer原理的开发者。

@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…

X AI KOLs Timeline

本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。

@AYi_AInotes: 说个反常识的判断, 80% 的 Agent 生产崩溃,跟模型智商没半毛钱关系, 基本都死在上下文溢出、工具调错、子代理失控上, 2026 年真正的分水岭在 Harness 和 Loop,不是模型啊, 兄弟@wizardly_ai 这篇工程…

X AI KOLs Timeline

这篇文章指出80%的AI Agent生产崩溃并非模型智商问题,而是由上下文溢出、工具调错、子代理失控引起。作者强调2026年的分水岭在于Harness(办公室制度、安保系统)和Loop(自动循环机制),而非模型本身。