Transformer联合作者验证后Transformer时代成本效率突破

Reddit r/artificial 模型

摘要

一个1.5亿参数的非Transformer架构在ARC-AGI-1上实现了最先进的成本效率,并获得了Transformer论文联合作者Łukasz Kaiser的验证,表明循环潜在推理可以取代暴力扩展。

https://preview.redd.it/frhws9cu1cjh1.png?width=1222&format=png&auto=webp&s=f3aa2f0bde64333c3fd4786a9b4c4e05a0c4e8f6 一个1.5亿参数的模型刚刚重新绘制了ARC-AGI-1的成本效率前沿。顺便提一下,他们展示了600B规模仍能保持循环潜在推理能力。该结果由Łukasz Kaiser(原Transformer论文联合作者)、Remek Kinas(AI研究员、Bielik LLM联合创造者)和Richard Zhong(NYU研究员)评估,重点关注模型评估和基准鲁棒性。ARC-AGI-1是一个公开的推理基准,测试系统是否能从少量示例中推断出底层规则并将其应用于新输入,这种能力通常与类人智能相关。标准LLM尽管参数规模巨大,但历史上在ARC-AGI上表现不佳,因为它需要对不熟悉的问题进行新颖推理。Transformer通常通过暴力扩展来改进,这需要越来越多的计算量。这些研究人员所展示的是,一种非Transformer架构可以以传统模型一小部分的计算成本攀升ARC-AGI基准。它不是依赖标准的基于注意力的Transformer堆栈和可见的CoT,而是使用循环记忆和潜在推理,以大幅减少的计算量实现这些强劲结果。以低计算成本提供强推理能力的新架构可能会改变AI本身的经济学。
查看原文

相似文章