在ARC-AGI-1基准测试中以67美分达到44%准确率

Hacker News Top 论文

摘要

从头训练了一个小型Transformer模型,仅花费0.67美元就在ARC-AGI-1基准测试上实现了44%的准确率,在速度、准确性和成本效益方面均优于先前方法。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:23

# 在ARC-AGI-1上以67美分成本实现44%准确率 来源:https://mvakde.github.io/blog/44-on-arc-1/ 我在5090显卡上用1.5小时从头训练了一个小型Transformer模型,其性能超越了许多大型语言模型,并达到了与TRM/HRM相同的分数 这是我之前模型(https://x.com/evilmathkid/status/2001689479476879448)的升级版本,具备更快的速度、更优的性能、更低的成本,并且仍然保持开源 在ARC-2上也获得了7%的准确率 相关讨论(https://x.com/evilmathkid/status/2029519274835148829),代码托管于GitHub(https://github.com/mvakde/mdlARC/) ARC-1公开评估表现 在ARC-1公开评估集上的表现。我仅与采用类似测试时训练方法的模型进行对比。这是ARC-AGI系列研究的第三篇博文。前文:第二篇(https://mvakde.github.io/blog/new-pareto-frontier-arc-agi/#implementation-details),第一篇(https://mvakde.github.io/blog/why-all-ARC-solvers-fail-today/) 许多人曾认为先前的结果不可能实现。该研究引起了顶尖研究者的关注并在X平台爆火。例如:Lucas Beyer(https://x.com/giffmana/status/2002111246225621296)、Jeremy Howard(https://x.com/jeremyphoward/status/2002136723573387537)、Rohan Anil(https://x.com/_arohan_/status/2001939028606947505)等人的讨论,以及众多其他评论 ## 为何研究此方向? 我认为样本效率是当前人工智能领域最重要的问题,我希望能解决它 本研究的目标在于:(1)探索在限制于Transformer/当前深度学习方法下的样本效率极限;(2)降低成本以实现更快速、更廉价的迭代 ARC是测试这一问题的绝佳基准: - 高维空间中极少的样本量(仅1000个谜题) - 作为元学习基准,每个谜题使用不同规则,但包含一些共同概念 - 所需先验知识极少:评估集所需的所有概念都存在于训练集中 - 对人类而言极其容易解决,即使资源有限的AI研究者也能参与 - 基准仍未饱和(在数据效率方面,需忽略大型语言模型及使用大量合成数据/人类归纳偏置的方法) 接下来我将探索新的研究思路以突破这些限制。我会努力保持低成本,使全球任何研究者都能参与这项研究 ## 技术细节 ## 工作原理 整体方法与上次类似(完整技术细节见此处:https://mvakde.github.io/blog/new-pareto-frontier-arc-agi/#implementation-details),但我进行了多项升级。以下是方法概要: - 每个输入-输出对被转换为token序列。这些序列由小型Transformer通过自回归方式进行训练。在测试时,该过程会在训练集和评估集谜题上重新执行(测试标签保持隐藏) - 为实现跨任务学习,每个谜题被赋予独立的可加性嵌入向量(可学习)。由于每个序列包含两个二维网格,因此采用3D RoPE嵌入来学习位置编码 - 序列通过颜色和二面体排列进行增强。推理时对测试输入应用增强,并对生成的输出应用逆增强。最终提交两个最常见输出(AAIVR) ### 相比上次的改进 主要目标是寻找提升模型样本效率的架构/算法改进 准确率提升主要源于: - 现代化架构(采用SwiGlu替代GELU,使用RMSnorm而非layernorm等) - 更多样化的数据,更优的数据打乱方式 - 模型扩展:8层替代4层 成本降低主要源于: - 大幅减少增强次数(提升样本效率!) - AdamW优化器改为Normuon - 采用支持变长训练的flash attention和推理用的flex attention内核 重大改变是我现在不再在输入token上训练。这意味着损失函数仅包含输出token(使该方法变为监督学习)。准确率从40%提升至44%,但我尚不清楚原因。可能源于有限的模型容量 我还通过添加ARC-2中非重叠任务扩充了训练数据。为确保无数据泄露,这一过程非常谨慎。若不喜欢额外数据,移除后仍能获得约40%的准确率,但需要约两倍的计算量 > 背景:ARC-2包含773个ARC-1谜题和347个新谜题。大多数ARC-1评估谜题会重复出现,若直接在ARC-2上训练会导致数据泄露,准确率将达100%。我通过仔细过滤773个重复谜题避免了泄露 还有许多其他改动带来了性能或速度的渐进式提升。完整改动列表请见此处:https://mvakde.github.io/blog/44-on-arc-1/#full-list-of-changes ## 有趣现象 由于不再在输入上训练,该方法现为监督学习。奇怪的是,尽管测试损失变差,准确率却提升了!且结果更稳定,分数方差更小 当前许多研究者通过追求小数据集上的最低验证损失来研究样本效率。这固然很好,但本文揭示了一种此类方法的失败模式(https://arxiv.org/pdf/2601.22950) 我认为无监督风格训练在某些场景下会更优,我正在对此进行评估 在使用NorMuon之前,我尝试过原版Muon。显然其训练速度远快于AdamW,但损失(和准确率)会在后期停滞不前而非收敛。我发现在此阶段大幅降低动量/学习率有所帮助,但不想进行此类手动调整。切换到NorMuon后问题得到解决 ## 消融实验 性能提升似乎主要源于良好的表征能力(3D RoPE + 逐任务嵌入) 移除3D RoPE或逐任务嵌入会导致性能急剧下降。两种消融都在25%处饱和: - 在输入上训练表现稍差(约39%) - 限制训练集仅为ARC-1+ConceptARC时表现相似(约40%) - 从3D RoPE切换到1D降至约24% - 移除逐任务嵌入降至约24% - 以CompressARC(https://github.com/iliao2345/CompressARC)风格运行模型(从头单独训练每个任务且无监督)性能降至约18% - CompressARC监督版获得约15% 其他消融实验最佳得分 寻找其他消融实验的最佳得分。此处比较成本意义不大,因为除首个消融外都需要大量计算 ## 其他人如何贡献? 代码已开源。欢迎修改以提升准确率或降低成本(请勿增加训练数据) 尝试达到65%准确率——无需太多修改。证据:我整合多次运行中所有已解决任务,达到55%准确率。另有部分任务“接近”解决。一些建议: - RoPE混合了位置和内容信息,可能损害性能。PoPE应能达到同等或更优效果。或可发明新的位置编码 - 架构肯定能进一步现代化 通过手工GPU代码成本可能降低10倍。某些架构改动也能实现此目标 最后,研究如何移除数据增强(我讨厌使用它,不认同任何认为这是合理做法的人)。有几种明显方法,但挑战在于保持训练成本低廉 ## 其他事项 坦白说,我未预料到仅使用Transformer就能达到45%,本以为需要新思路。更没预料到能在如此低成本/算力下达成。消融实验显示即使没有增强或合成数据,仍能保留惊人的性能。现在我相当确信在Transformer框架内能达到65% 我不理解为何其他人没有发现这点。这只是使用最明显表征的Transformer模型。该基准已开放6年,具有高关注度且设有百万美元奖金!或许研究者低估了深度学习?或许实验成本过高导致无法正确进行消融实验?被大型语言模型蒙蔽或使用框架限制? ## 附录 ## 著名研究者先前对我方法的批评/验证 我先前的结果在X平台爆火,许多经验丰富的研究者展开了正反辩论。相关讨论串:Jeremy(https://x.com/jeremyphoward/status/2002232292857819651)、Lucas(https://x.com/giffmana/status/2002128356901597509)、Susan(https://x.com/suchenzang/status/2002461736071541152)、Andreas(https://x.com/BlackHC/status/2002517862578336166)、Yoav(https://x.com/yoavgo/status/2002337963531776117)等。我在此列出所有批评及我的回应 ### 在评估谜题上训练属于作弊/"测试时训练" - 不,这是错误的。"测试时训练"特指使用测试数据的标签进行训练。本研究并未使用标签训练 - 此外,ARC作为元学习基准,本就应该从评估谜题中学习 - 术语解释:ARC包含训练谜题集和评估谜题集。每个谜题包含示例对和测试对。每个对由输入网格+输出网格组成。在ARC中,标签仅指评估谜题中测试对的输出网格。这些标签未被训练使用,它们是隐藏的。你可事先删除 ### 在评估谜题输入上训练会泄露信息 - 不,这是错误的。此类方法称为转导推理(https://en.wikipedia.org/wiki/Transduction_(machine_learning)),自Vapnik时代已有研究 - 此外,这种忽视评估输入的教条在追求持续学习的世界中毫无意义 - 其他方法训练元学习算法后,通过CoT运行或循环修改潜在变量进行部署学习。我的方法或本次尝试直接通过修改单次前向函数的权重进行元学习,与学习无异 - 注意:在44%的新结果中,输入训练已被移除,因表现略差 ### 即使允许在评估谜题输入上训练,也应特别禁止测试输入 - 不,这是错误的。同样的"转导"论点在此适用 - 元学习基准可通过两种方式转导: - 训练谜题→评估谜题 - 评估谜题内:示例对→测试对 - 此批评特指后者 ### 这违反测试政策 - 不,这是错误的 - 政策规定"测试者不应知道测试内容"。人们将此解读为禁止测试时训练。但实际上指人类设计者而非AI系统本身 - 例如:防止基于评估集设计归纳偏置 - 对ARC社区活跃者而言,自测试时训练被允许并鼓励以来,这一直很明确。Steven(https://x.com/sd_marlow/status/2002498207235125669)和Chew(https://x.com/chewkokwah/status/2002686360344527304)的评论阐明了这点及其他担忧 - 测试时训练也符合元学习基准的精神,因此完全可行 ### 未包含训练成本 - 不,这是错误的。我展示了全生命周期计算量。这是模型从初始化训练的成本加上在所有任务上运行推理的总成本。确实总计67美分。可在vast.ai上查看5090运行2小时的价格 ### 测试时训练传统上是单任务进行。同时训练所有测试任务不现实 - 是的,此批评有道理。但需细致分析 - 现实中确实少见同时面对所有问题的测试场景(如考试),人类通常也一次只能解决一个问题 - 但仅因人类不具备某种能力,不应否定构建具备该能力的AI模型的价值。否则我们可以说大型语言模型不现实,因为人类无法在整个互联网上训练/无法如此快速阅读token - 同时尚不清楚人类是否局限于单任务,我们可能能同时从多种感官获取不同数据进行训练 ### 提供每任务成本平摊了训练成本(因所有测试任务同时训练)。与其他模型比较不公平 - 是的,这很合理。我的辩护是: - 组织者正是如此比较所有模型,包括同样同时训练所有测试任务的TRM - 我更慷慨地包含了训练和推理成本,而大型语言模型和其他模型排除了预训练/离线训练成本 - 我现在已切换为:(a)展示全生命周期计算成本而非每任务成本;(b)仅与TRM、HRM和CompressARC比较,不与大型语言模型/其他方法比较;(c)添加了具有可比训练风格的消融实验 ## 关于ARC-AGI本身的批评回应 上次发布时,关于ARC-AGI本身存在很多讨论。部分合理,但许多是Chollet已多次回答过的问题: - ARC究竟测试什么?(流体智能) - 为何要关注ARC?(流体智能尚未完全解决) - 解决ARC-AGI不会导致AGI(无人如此声称) - ARC不断移动目标/针对LLM进行对抗性构建(两者皆非) Chollet的论文和这些推文1(https://mvakde.github.io/blog/44-on-arc-1/#fn:1)是良好参考。其立场总结:该基准旨在测试流体智能,他视其为AGI必要但不充分条件。解决ARC-1/2意味着非零流体智能,但非上限。基准不代表AGI已实现,而是旨在指明正确的研究方向。目标从未改变:ARC-1早于LLM出现,ARC-2在chatGPT前发布,ARC-3在ARC-2饱和前公布。他也对ARC的进展感到欣慰,因这记录了AI的进步 我主要关注ARC是因为它可用于测试样本效率——当今重要且未解决的问题!它也是构造精良的元学习基准,且对资源有限者友好。历史上,它擅长揭示大型语言模型的优势与缺陷(https://mvakde.github.io/blog/44-on-arc-1/#learnings-from-llms-on-arc-agi)。我也认为该基准在高关注度/设有高额奖金情况下保持6年未饱和很酷,因为我们现在知道深度学习能在ARC-1/2上表现卓越 我认为存在一些合理批评: - 应禁止ARC-1/2使用合成数据 - 违背基准精神,且当前大多数高分依赖大量合成数据 - 合成数据降低了谜题所需的流体智能门槛 - 仅在2024年前有意义,当时深度学习表现不佳 - 我们现在知道只要有足够训练数据,大型语言模型/深度学习能学会任何东西 - 这将使基准成为测试样本效率的绝佳工具,并与ARC-3完美互补 - 问题是如何防止合成数据?简单方法: - 禁止离线训练/预训练。模型提交后必须从头训练 - 此前被认为不可能,但我的模型证明可行 - 保证无法使用合成数据 - 使不同模型间比较公平。否则某些模型如大型语言模型可通过海量离线训练在ARC上刷分(因基准存在已久,已创建许多ARC类数据集) - 单个排行榜图表比较多种模型类型不合理。导致以下三个问题(解决方案:分离图表) - X轴是每任务成本,但仅计算在线计算成本。某些模型(如大型语言模型)有巨大的离线预训练阶段,其成本未计入。你可使用无限训练计算量有效将测试集纳入分布

相似文章

这很有趣。我终于可以跟进一个 RemindMe 评论了。今年3月25日,六个月前,没有模型在 ARC-AGI-3 上能拿到 1%。一位评论者问我们是否能在 $2 成本下看到 75%。现在成本仍然很高($26.1k),但 GPT-6-Astra-Max 达到了 62.7%(无需 harness!)

Reddit r/singularity

GPT-6-Astra-Max 在 ARC-AGI-3 基准测试中在六个月内达到了 62.7%,并且使用记忆适配器后,基准测试已饱和,尽管成本仍然很高,这表明 AI 模型朝着更便宜的趋势发展。