@sama: 哥布林级别的博文
摘要
声称GPT-5.6 Sol通过使用规范压缩实现跨多个上下文窗口的推理,在ARC-AGI-3上达到了最先进水平。
哥布林级别的博文
查看缓存全文
缓存时间: 2026/07/30 01:47
goblin 级别的博客帖子
Tibo (@thsottiaux): 原来 GPT-5.6 Sol 在 ARC-AGI-3 上达到了 SoTA。
只需更改两个设置。你只需要允许它进行推理,并在我们标准压缩实现的帮助下跨多个上下文窗口工作。
相似文章
GPT-5.6 系列 (2分钟阅读)
OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。
@sama: 显然这是我们生产过的最好的模型,也是我们写过的最好的博客文章之一:
OpenAI 发布了 GPT-5.6 系列,包括 Sol、Terra 和 Luna,声称在编程、知识工作和科学领域具有最先进的性能,同时效率更高、成本更低。
@Saboo_Shubham_: 疯狂的时代。Anthropic: Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6。Tibo: 我改了两个设置,GPT-5.6 Sol 就成为 SoTA 了
Anthropic 的 Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6,但 Tibo 声称通过涉及多上下文推理和规范压缩的两个设置更改,GPT-5.6 Sol 成为了 SoTA。
@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
@gdb: arc-agi-3 现已饱和
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得最先进的性能,得分63%,在96%的层级上超越人类表现,展示了先进的符号建模能力。