@Saboo_Shubham_: 疯狂的时代。Anthropic: Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6。Tibo: 我改了两个设置,GPT-5.6 Sol 就成为 SoTA 了
摘要
Anthropic 的 Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6,但 Tibo 声称通过涉及多上下文推理和规范压缩的两个设置更改,GPT-5.6 Sol 成为了 SoTA。
查看缓存全文
缓存时间: 2026/07/30 01:48
狂野时代。
Anthropic: Opus 5 击败 GPT-5.6,登顶 ARC-AGI-3
Tibo:我改了两个设置,GPT-5.6 Sol 就成 SoTA 了 https://t.co/iQl3GJJXCe
Tibo (@thsottiaux):
原来 GPT-5.6 Sol 在 ARC-AGI-3 上确实是 SoTA。
只是改了俩设置而已。你只需要允许它推理,并借助我们的规范浓缩实现,在多个上下文窗口中协同工作。
相似文章
@Saboo_Shubham_: 太疯狂了。每隔一周就变得更好。Opus 5 担任顾问,GPT-5.6 担任协调者,而 Gemini 3.6 Flash 是执行者…
Shubham Saboo 讨论了一个假设性的 AI 系统,其中 Opus 5 担任顾问,GPT-5.6 担任协调者,而 Gemini 3.6 Flash 作为执行者来解决复杂问题。
@sama: 哥布林级别的博文
声称GPT-5.6 Sol通过使用规范压缩实现跨多个上下文窗口的推理,在ARC-AGI-3上达到了最先进水平。
我让 Sol Max 对比了 Claude Opus 5 High 和 GPT 5.6 Sol Max 在 ARC-AGI-3 上某个特定谜题的输出,其中 Opus 5 的得分为 98.81%,而 GPT 5.6 Sol Max 的得分为 21.42%。
一项针对ARC-AGI-3谜题、比较Claude Opus 5 High与GPT 5.6 Sol Max的分析显示,Opus通过在可见输出中保留详细状态而获胜,而Sol则依赖被丢弃的隐藏推理。
@orca_build: Anthropic的新款Opus 4.8在Terminal-Bench 2.1上的得分比GPT 5.5低3.6%……但在UI任务上明显更出色。
Anthropic的Opus 4.8在Terminal-Bench 2.1上比GPT 5.5低3.6%,但擅长UI任务;Orca的编排功能让Codex能将UI任务委托给Claude Code。
@VraserX: 好吧,GPT-5.6 比我想象的要大得多。Sol 看起来不可思议,Terra 和 Luna 让成本方面真的吓人,而 Ul…
一位用户对 GPT-5.6 的规模表示惊讶,注意到 Sol、Terra、Luna 和 Ultra 模式等令人印象深刻的功能,支持并行多智能体执行,暗示这是一个重大进步。