我让 Sol Max 对比了 Claude Opus 5 High 和 GPT 5.6 Sol Max 在 ARC-AGI-3 上某个特定谜题的输出,其中 Opus 5 的得分为 98.81%,而 GPT 5.6 Sol Max 的得分为 21.42%。
摘要
一项针对ARC-AGI-3谜题、比较Claude Opus 5 High与GPT 5.6 Sol Max的分析显示,Opus通过在可见输出中保留详细状态而获胜,而Sol则依赖被丢弃的隐藏推理。
# 回放
https://arcprize.org/replay/ce05e7b4-5428-4142-87a9-e805102c0b45 — Opus 5 High
https://arcprize.org/replay/8239e65e-dc8d-470d-ab49-6d37618f00ea — GPT 5.6 Sol Max
我们知道,ARC-AGI-3 只向前传递可见输出,并在每一轮之间丢弃思考/推理文本。
---
## 来自 Sol Max 的分析
对于每一轮:测试框架向模型发送对话历史以及最新的游戏帧。它收到可见输出、私有推理/思考以及 token 使用情况。它保留可见输出和解析后的游戏动作。它丢弃私有推理:Anthropic 的思考块,以及通常 OpenAI 的推理项。它将动作发送给 ARC,收到更新后的帧/状态,然后将其作为下一条用户消息添加。
## 两次回放之间的对比
在这两次运行中,Opus 显然优于 Sol:Opus 在 7/7 关卡达到 WIN,而 Sol 在 3/7 关卡以 NOT_FINISHED 结束。决定性的分歧发生在第 4 关。
| 指标 | Opus | Sol |
|------|------|-----|
| 最终结果 | WIN — 7/7 | 未完成 — 3/7 |
| 点击动作次数 | 406 | 344 |
| 关卡内重置次数 | 2 | 8 |
| 记录到的 Game Over 次数 | 2 | 1 |
| 实际耗时 | 7:19:16 | 8:50:52 |
| 可见回复中位词数 | ~283 词 | ~24 词 |
| 格式正确且成功执行的点击 | 406/406 | 344/344 |
### 各关卡进展
| 关卡 | Opus:点击 / 累计时间 | Sol:点击 / 累计时间 |
|------|----------------------|----------------------|
| 1 | 8 / 0:04:21 | 7 / 0:05:07 |
| 2 | 8 / 0:06:29 | 11 / 0:10:52 |
| 3 | 34 / 1:08:22 | 29 / 1:11:41 |
| 4 | 121 / 3:45:40 | 297 / 未完成 |
| 5 | 118 / 5:26:51 | — |
| 6 | 33 / 6:01:12 | — |
| 7 | 84 / 7:19:16 | — |
前三个关卡非常接近。Sol 甚至在第 1 和第 3 关使用了更少的点击。
在第 4 关:Opus 维护了详细的“上下文笔记”,追踪坐标、坦克等级、假设和多动作计划。它经历了两次 Game Over,吸取了经验,并在第三次尝试时解决了该关卡。Sol 的可见推理则更具反应性、更局部化。它重新启动了第 4 关八次,并反复改变对棋盘的解读。一个特别有害的 Sol 序列将谜题解释为危险/倒计时,故意在多个动作中等待,而最后一次等待导致了 GAME_OVER。它后来回到了“锁”的解读,但从未完成该关卡。
两个模型每次都生成了有效的动作语法,因此差异在于规划和状态跟踪,而不是输出解析器的问题。
Opus 明显更冗长:约 116,000 个可见词,而 Sol 为 8,300 个。不过,Sol 的简洁回复并不一定计算成本更低:其日志报告了 228 万输出 token,其中 226 万被归类为推理,而 Opus 为 196 万输出 token,且单独报告的推理 token 为零。这种统计方式很可能因提供商而异,而且所有记录的费用字段都为零,因此这些文件无法提供可靠的价格比较。
两次运行使用了相同的游戏 ID、七级目标,以及相同的初始 64×64 帧。然而,这仍然只是每种模型各一次运行,并且这些文件没有指明确切的模型版本、设置,或 Sol 运行停止的原因。因此,结论只针对这两次运行:Opus 的持久状态表示克服了长时程谜题;Sol 则更简洁,但陷入了重置和解读循环。
---
## 我的理解
基于此,感觉 Opus 能够通过在可见输出中增加文本内容,从而在每一轮之间保留更多的推理、假设、状态和规划;而 5.6 Sol 只在可见输出中简要说明已经发生了什么/它正在做什么。这意味着,如果两个模型都无法访问自己的推理/思考输出(因为该输出已被丢弃),那么 Opus 就拥有更多的信息和上下文来表现得更好,因为 Sol 对思考/推理输出的依赖远大于 Opus。
Opus 5 High
GPT 5.6 Sol Max
相似文章
@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…
GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。
Artificial Analysis 的 GPT 5.6 系列基准测试
Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。
@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
@Saboo_Shubham_: 疯狂的时代。Anthropic: Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6。Tibo: 我改了两个设置,GPT-5.6 Sol 就成为 SoTA 了
Anthropic 的 Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6,但 Tibo 声称通过涉及多上下文推理和规范压缩的两个设置更改,GPT-5.6 Sol 成为了 SoTA。
@BenjaminDEKR:就这么结束了?GPT5.6 Sol Ultra 在 TerminalBench 上得分 91.9%,编程问题正在接近解决,就像算术一样……
GPT5.6 Sol Ultra 在 TerminalBench 编程基准测试中达到 91.9%,表明编程任务正在接近解决。