Transformer联合作者验证后Transformer时代成本效率突破
摘要
一个1.5亿参数的非Transformer架构在ARC-AGI-1上实现了最先进的成本效率,并获得了Transformer论文联合作者Łukasz Kaiser的验证,表明循环潜在推理可以取代暴力扩展。
https://preview.redd.it/frhws9cu1cjh1.png?width=1222&format=png&auto=webp&s=f3aa2f0bde64333c3fd4786a9b4c4e05a0c4e8f6 一个1.5亿参数的模型刚刚重新绘制了ARC-AGI-1的成本效率前沿。顺便提一下,他们展示了600B规模仍能保持循环潜在推理能力。该结果由Łukasz Kaiser(原Transformer论文联合作者)、Remek Kinas(AI研究员、Bielik LLM联合创造者)和Richard Zhong(NYU研究员)评估,重点关注模型评估和基准鲁棒性。ARC-AGI-1是一个公开的推理基准,测试系统是否能从少量示例中推断出底层规则并将其应用于新输入,这种能力通常与类人智能相关。标准LLM尽管参数规模巨大,但历史上在ARC-AGI上表现不佳,因为它需要对不熟悉的问题进行新颖推理。Transformer通常通过暴力扩展来改进,这需要越来越多的计算量。这些研究人员所展示的是,一种非Transformer架构可以以传统模型一小部分的计算成本攀升ARC-AGI基准。它不是依赖标准的基于注意力的Transformer堆栈和可见的CoT,而是使用循环记忆和潜在推理,以大幅减少的计算量实现这些强劲结果。以低计算成本提供强推理能力的新架构可能会改变AI本身的经济学。
相似文章
在ARC-AGI-1基准测试中以67美分达到44%准确率
从头训练了一个小型Transformer模型,仅花费0.67美元就在ARC-AGI-1基准测试上实现了44%的准确率,在速度、准确性和成本效益方面均优于先前方法。
Pathway是否刚刚揭示了Andrew Curran预测的架构突破?其150M模型树立了ARC-AGI-1成本效率新前沿
Pathway的150M参数BDH-CQ模型在ARC-AGI-1上达到29.5%的准确率,每个任务成本仅为0.0007美元,创下新低,采用循环记忆和潜在推理,而非长token链。该架构或许正是Andrew Curran预告的突破,OpenAI研究员Lukasz Kaiser担任投资者和顾问。
@yingfan_bot: 关于Looped Transformers的新论文!隐式推理速度快,但在大规模下难以达到CoT级别的准确性。能否lo…
一篇关于Looped Transformers的新论文发现,循环填充骨干网络为隐式推理提供了并行工作空间,使其能够像显式思维链(CoT)一样进行监督,并同时实现了速度和准确性。
每美元智能是新的扩展定律:一个小型推理模型在Arc-AGI 1上突破现有成本-精度帕累托前沿
Chart Pathway的BDH-CQ,一个150M参数的推理模型,在ARC-AGI-1上达到了29.5%的准确率,每任务成本远低于像GPT-5.6 Luna这样的大型模型,展示了成本-精度权衡的改进。
超越 FP16 + ONNX 的 Transformer 体积与推理优化(剪枝/图优化收效甚微)[P]
作者分享在 162 MB Transformer 上把 FP16 + ONNX + 剪枝用到极致却收益递减的经历,求教下一步该选量化、蒸馏、低秩分解还是硬件级技巧。