单张4090上11.67% ARC-AGI-2本地评估:TOPAS递归架构

Reddit r/LocalLLaMA 模型

摘要

作者介绍了TOPAS,一种递归AI架构,在单张RTX 4090上达到了ARC-AGI-2的11.67%,旨在证明架构效率可以超越原始计算能力。

我不确定还有多少人关心ARC-AGI-2竞赛,但我觉得有些人可能会对此感兴趣。今年是最后一次举办。目前排行榜上充斥着去年获胜的开源代码的提交结果,所以如果你去看一眼,会发现都是同样的分数。不过我们做了一些不同的事情——从头构建了一个高效、深度递归的模型。我们刚在公共排行榜上达到了11.67%,但这有一个巨大的星号。我们没有集群,只有**一张RTX 4090**,而且训练一个1亿参数的模型才进行了大约14天。在本地,这个检查点实际上达到了36%。在Kaggle提交时,由于递归循环,我们的TTT(thinking time)计算量很大。为了避免提交超时,我们将阈值设得过高,导致模型对近一半的谜题输出了 \[\] (null)……所以只有11.67%。我们想证明ARC不仅仅是算力战争,更是架构战争。使用生物记忆模型的小模型,只要能处理推理循环,就能发挥出远超自身规模的能力。我们今晚正在调整时间管理逻辑,预计明天让模型完成思考过程后,就能达到20%的分数。而且,模型本身仍在训练中,正处于Grokking阶段。我们坚信,如果再给它3-5周完全训练,我们就能在排行榜上刷新纪录。如果你对我们在消费级硬件上扩展递归推理的方法感兴趣,我们很乐意回答相关问题。
查看原文

相似文章

ARC-AGI 排行榜

Hacker News Top

ARC-AGI排行榜展示了模型在基准的三个版本上的性能,衡量流体智力和高效适应能力,并附有推理系统和原始LLM的趋势线。

Sakana Fugu(三分钟阅读)

TLDR AI

Sakana AI 推出 AB-MCTS,一种推理时缩放算法,使多个前沿 AI 模型(Gemini 2.5 Pro、o4-mini、DeepSeek-R1-0528)协同工作,在 ARC-AGI-2 基准测试中显著优于单个模型。