ARC AGI 3 的普遍共识是否认为它无法被 benchmaxxed?你的看法是什么?

Reddit r/singularity 新闻

摘要

关于 ARC AGI 3 的普遍共识是否认为它无法被 'benchmaxxed'(针对基准测试进行优化)的讨论,征求对此话题的看法。

暂无内容
查看原文

相似文章

ARC-AGI 3 并非 AGI 的诚实衡量标准

Reddit r/singularity

一篇批评文章认为,ARC-AGI 3 不公平地禁用了智能体在多次操作之间维持上下文的能力,使其成为对通用智能的不诚实衡量。文章指出,允许压缩(compaction)后得分增至原来的三倍,同时使用的 token 数量少得多,而现实世界的智能体正是这样工作的。

ARC-AGI 排行榜

Hacker News Top

ARC-AGI排行榜展示了模型在基准的三个版本上的性能,衡量流体智力和高效适应能力,并附有推理系统和原始LLM的趋势线。