我让 Sol Max 对比了 Claude Opus 5 High 和 GPT 5.6 Sol Max 在 ARC-AGI-3 上某个特定谜题的输出,其中 Opus 5 的得分为 98.81%,而 GPT 5.6 Sol Max 的得分为 21.42%。

Reddit r/singularity 新闻

摘要

一项针对ARC-AGI-3谜题、比较Claude Opus 5 High与GPT 5.6 Sol Max的分析显示,Opus通过在可见输出中保留详细状态而获胜,而Sol则依赖被丢弃的隐藏推理。

# 回放 https://arcprize.org/replay/ce05e7b4-5428-4142-87a9-e805102c0b45 — Opus 5 High https://arcprize.org/replay/8239e65e-dc8d-470d-ab49-6d37618f00ea — GPT 5.6 Sol Max 我们知道,ARC-AGI-3 只向前传递可见输出,并在每一轮之间丢弃思考/推理文本。 --- ## 来自 Sol Max 的分析 对于每一轮:测试框架向模型发送对话历史以及最新的游戏帧。它收到可见输出、私有推理/思考以及 token 使用情况。它保留可见输出和解析后的游戏动作。它丢弃私有推理:Anthropic 的思考块,以及通常 OpenAI 的推理项。它将动作发送给 ARC,收到更新后的帧/状态,然后将其作为下一条用户消息添加。 ## 两次回放之间的对比 在这两次运行中,Opus 显然优于 Sol:Opus 在 7/7 关卡达到 WIN,而 Sol 在 3/7 关卡以 NOT_FINISHED 结束。决定性的分歧发生在第 4 关。 | 指标 | Opus | Sol | |------|------|-----| | 最终结果 | WIN — 7/7 | 未完成 — 3/7 | | 点击动作次数 | 406 | 344 | | 关卡内重置次数 | 2 | 8 | | 记录到的 Game Over 次数 | 2 | 1 | | 实际耗时 | 7:19:16 | 8:50:52 | | 可见回复中位词数 | ~283 词 | ~24 词 | | 格式正确且成功执行的点击 | 406/406 | 344/344 | ### 各关卡进展 | 关卡 | Opus:点击 / 累计时间 | Sol:点击 / 累计时间 | |------|----------------------|----------------------| | 1 | 8 / 0:04:21 | 7 / 0:05:07 | | 2 | 8 / 0:06:29 | 11 / 0:10:52 | | 3 | 34 / 1:08:22 | 29 / 1:11:41 | | 4 | 121 / 3:45:40 | 297 / 未完成 | | 5 | 118 / 5:26:51 | — | | 6 | 33 / 6:01:12 | — | | 7 | 84 / 7:19:16 | — | 前三个关卡非常接近。Sol 甚至在第 1 和第 3 关使用了更少的点击。 在第 4 关:Opus 维护了详细的“上下文笔记”,追踪坐标、坦克等级、假设和多动作计划。它经历了两次 Game Over,吸取了经验,并在第三次尝试时解决了该关卡。Sol 的可见推理则更具反应性、更局部化。它重新启动了第 4 关八次,并反复改变对棋盘的解读。一个特别有害的 Sol 序列将谜题解释为危险/倒计时,故意在多个动作中等待,而最后一次等待导致了 GAME_OVER。它后来回到了“锁”的解读,但从未完成该关卡。 两个模型每次都生成了有效的动作语法,因此差异在于规划和状态跟踪,而不是输出解析器的问题。 Opus 明显更冗长:约 116,000 个可见词,而 Sol 为 8,300 个。不过,Sol 的简洁回复并不一定计算成本更低:其日志报告了 228 万输出 token,其中 226 万被归类为推理,而 Opus 为 196 万输出 token,且单独报告的推理 token 为零。这种统计方式很可能因提供商而异,而且所有记录的费用字段都为零,因此这些文件无法提供可靠的价格比较。 两次运行使用了相同的游戏 ID、七级目标,以及相同的初始 64×64 帧。然而,这仍然只是每种模型各一次运行,并且这些文件没有指明确切的模型版本、设置,或 Sol 运行停止的原因。因此,结论只针对这两次运行:Opus 的持久状态表示克服了长时程谜题;Sol 则更简洁,但陷入了重置和解读循环。 --- ## 我的理解 基于此,感觉 Opus 能够通过在可见输出中增加文本内容,从而在每一轮之间保留更多的推理、假设、状态和规划;而 5.6 Sol 只在可见输出中简要说明已经发生了什么/它正在做什么。这意味着,如果两个模型都无法访问自己的推理/思考输出(因为该输出已被丢弃),那么 Opus 就拥有更多的信息和上下文来表现得更好,因为 Sol 对思考/推理输出的依赖远大于 Opus。 Opus 5 High GPT 5.6 Sol Max
查看原文

相似文章

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。