单张4090上11.67% ARC-AGI-2本地评估:TOPAS递归架构
摘要
作者介绍了TOPAS,一种递归AI架构,在单张RTX 4090上达到了ARC-AGI-2的11.67%,旨在证明架构效率可以超越原始计算能力。
我不确定还有多少人关心ARC-AGI-2竞赛,但我觉得有些人可能会对此感兴趣。今年是最后一次举办。目前排行榜上充斥着去年获胜的开源代码的提交结果,所以如果你去看一眼,会发现都是同样的分数。不过我们做了一些不同的事情——从头构建了一个高效、深度递归的模型。我们刚在公共排行榜上达到了11.67%,但这有一个巨大的星号。我们没有集群,只有**一张RTX 4090**,而且训练一个1亿参数的模型才进行了大约14天。在本地,这个检查点实际上达到了36%。在Kaggle提交时,由于递归循环,我们的TTT(thinking time)计算量很大。为了避免提交超时,我们将阈值设得过高,导致模型对近一半的谜题输出了 \[\] (null)……所以只有11.67%。我们想证明ARC不仅仅是算力战争,更是架构战争。使用生物记忆模型的小模型,只要能处理推理循环,就能发挥出远超自身规模的能力。我们今晚正在调整时间管理逻辑,预计明天让模型完成思考过程后,就能达到20%的分数。而且,模型本身仍在训练中,正处于Grokking阶段。我们坚信,如果再给它3-5周完全训练,我们就能在排行榜上刷新纪录。如果你对我们在消费级硬件上扩展递归推理的方法感兴趣,我们很乐意回答相关问题。
相似文章
在ARC-AGI-1基准测试中以67美分达到44%准确率
从头训练了一个小型Transformer模型,仅花费0.67美元就在ARC-AGI-1基准测试上实现了44%的准确率,在速度、准确性和成本效益方面均优于先前方法。
Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少
GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。
@gdb: arc-agi-3 现已饱和
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得最先进的性能,得分63%,在96%的层级上超越人类表现,展示了先进的符号建模能力。
面向ARC-AGI-1的抽象推理与泛化的经济型智能体框架
本文提出了面向ARC-AGI-1的经济型智能体框架,通过探索者-定义者流水线和反思型协调器,使用DeepSeek V3.2无需微调即可实现强大性能,以低成本达到67.25%的pass@2。
Astra 不使用思维链在 ARC-AGI-3 上获得 97%,在 ARC-AGI-1 上获得 86%
Astra 在不使用思维链的情况下,在 ARC-AGI-3 上达到 97%,在 ARC-AGI-1 上达到 86%,突显了 AI 推理能力的重大进步。