单张4090上11.67% ARC-AGI-2本地评估:TOPAS递归架构
摘要
作者介绍了TOPAS,一种递归AI架构,在单张RTX 4090上达到了ARC-AGI-2的11.67%,旨在证明架构效率可以超越原始计算能力。
我不确定还有多少人关心ARC-AGI-2竞赛,但我觉得有些人可能会对此感兴趣。今年是最后一次举办。目前排行榜上充斥着去年获胜的开源代码的提交结果,所以如果你去看一眼,会发现都是同样的分数。不过我们做了一些不同的事情——从头构建了一个高效、深度递归的模型。我们刚在公共排行榜上达到了11.67%,但这有一个巨大的星号。我们没有集群,只有**一张RTX 4090**,而且训练一个1亿参数的模型才进行了大约14天。在本地,这个检查点实际上达到了36%。在Kaggle提交时,由于递归循环,我们的TTT(thinking time)计算量很大。为了避免提交超时,我们将阈值设得过高,导致模型对近一半的谜题输出了 \[\] (null)……所以只有11.67%。我们想证明ARC不仅仅是算力战争,更是架构战争。使用生物记忆模型的小模型,只要能处理推理循环,就能发挥出远超自身规模的能力。我们今晚正在调整时间管理逻辑,预计明天让模型完成思考过程后,就能达到20%的分数。而且,模型本身仍在训练中,正处于Grokking阶段。我们坚信,如果再给它3-5周完全训练,我们就能在排行榜上刷新纪录。如果你对我们在消费级硬件上扩展递归推理的方法感兴趣,我们很乐意回答相关问题。
相似文章
面向ARC-AGI-1的抽象推理与泛化的经济型智能体框架
本文提出了面向ARC-AGI-1的经济型智能体框架,通过探索者-定义者流水线和反思型协调器,使用DeepSeek V3.2无需微调即可实现强大性能,以低成本达到67.25%的pass@2。
@rohanpaul_ai: GLM-5.2在ARC-AGI-2上获得22.8%,每任务$0.25。值得注意的是,2025年5月左右,经过验证的最佳模型在ARC-AGI-2上只有…
GLM-5.2在ARC-AGI-2上取得22.8%的成绩,在ARC-AGI-1上取得77%的成绩,每任务成本仅0.25美元,比2025年5月的最佳前沿得分提高了7.6倍。
Pathway是否刚刚揭示了Andrew Curran预测的架构突破?其150M模型树立了ARC-AGI-1成本效率新前沿
Pathway的150M参数BDH-CQ模型在ARC-AGI-1上达到29.5%的准确率,每个任务成本仅为0.0007美元,创下新低,采用循环记忆和潜在推理,而非长token链。该架构或许正是Andrew Curran预告的突破,OpenAI研究员Lukasz Kaiser担任投资者和顾问。
ARC-AGI 排行榜
ARC-AGI排行榜展示了模型在基准的三个版本上的性能,衡量流体智力和高效适应能力,并附有推理系统和原始LLM的趋势线。
Sakana Fugu(三分钟阅读)
Sakana AI 推出 AB-MCTS,一种推理时缩放算法,使多个前沿 AI 模型(Gemini 2.5 Pro、o4-mini、DeepSeek-R1-0528)协同工作,在 ARC-AGI-2 基准测试中显著优于单个模型。