ARC-AGI 3 并非 AGI 的诚实衡量标准
摘要
一篇批评文章认为,ARC-AGI 3 不公平地禁用了智能体在多次操作之间维持上下文的能力,使其成为对通用智能的不诚实衡量。文章指出,允许压缩(compaction)后得分增至原来的三倍,同时使用的 token 数量少得多,而现实世界的智能体正是这样工作的。
我希望大家花点时间看一下这张图。ARC-AGI 3 故意不允许推理智能体在多次操作之间保持其上下文。这实际上是在让模型一次又一次地忘记它已经搞清楚的内容,然后给这个残缺版本打分,仿佛它代表了系统真正的智能。当 OpenAI 允许智能体保留其推理并压缩较旧的上下文——这正是现实世界前沿智能体的工作方式——它的得分几乎增至原来的三倍,同时使用的 token 数量却少得多。压缩是现实世界智能体运作方式的基本组成部分。人类同样会做笔记并保留所学到的东西。没有人会在每次行动后擦除一个人的记忆来测试他,然后声称结果反映了真实能力。事实是,ARC-AGI 3 并没有在衡量通用智能。在现实世界中,如果一个使用推理和压缩的智能体能够以与人类几乎相同的方式运作,那就可以被称为 AGI。现有的智能体可以用少得多的 token 获得三倍的分数,因此这个基准作为通用智能的衡量标准是故意不诚实的。人类不需要在每次开始一个新谜题或在棋盘上移动一个棋子时重置记忆,所以在我看来这绝对令人震惊。一个 AI 仅仅通过记住已经想通的内容就能表现得这么好,这充分证明了上下文学习已经发展到了何种程度。在 ARC-AGI 对额外步骤施加二次方惩罚之后,我本来就已经不太喜欢它了,但这只是进一步证实了我的看法:这个基准已经偏离了最初的目标——衡量前沿模型的通用智能。不管怎样,我们最终还是会让它饱和的;仍然存在一些高难度的基准是件好事,但我只是想指出,这个特定基准的这副样子并不好看。
相似文章
ARC-AGI 排行榜
ARC-AGI排行榜展示了模型在基准的三个版本上的性能,衡量流体智力和高效适应能力,并附有推理系统和原始LLM的趋势线。
如果 Opus 是一个循环而非纯粹模型,ARC AGI 3 可能被利用
讨论 ARC AGI 3 基准测试中的一个潜在漏洞,如果 Opus 模型作为循环而非纯粹模型运行,则可能被利用。
ARC AGI 3 的普遍共识是否认为它无法被 benchmaxxed?你的看法是什么?
关于 ARC AGI 3 的普遍共识是否认为它无法被 'benchmaxxed'(针对基准测试进行优化)的讨论,征求对此话题的看法。
无论你的定义是什么,如果你认为我们现在拥有的是AGI,那么你的定义就是最宽松、最弱的“AGI”概念
认为当前AI不符合AGI标准,因为它缺乏递归自我改进,并批评那些声称相反的人拥有一个薄弱的AGI定义。
Seed IQ ARC-AGI 3 声称
一名 Reddit 用户驳斥了 Seed IQ (AGX) 关于以满分解决 ARC-AGI-3 基准测试的声称,认为拒绝提交到允许闭源提交的 Kaggle 排行榜表明这是一个骗局。