@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…

X AI KOLs 新闻

摘要

GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。

GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3 这个由 2D 谜题游戏组成的基准测试中表现不佳呢? 我们进行了调查。测试框架没有让它记住学到的东西。 我们发现,启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
查看原文
查看缓存全文

缓存时间: 2026/07/30 01:46

GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3(一个 2D 谜题游戏基准测试)上表现挣扎?

我们进行了调查。发现测试框架不允许它记住自己学到的东西。

我们还发现,启用两个 API 设置后,我们的得分提高了两倍,而输出 token 减少了 6 倍。

相似文章

GPT-5.6 系列 (2分钟阅读)

TLDR AI

OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。

5.6 Sol 在通用工作中的潜力被低估(7分钟阅读)

TLDR AI

OpenAI 发布了 GPT-5.6 Sol,这是一款旗舰模型,适用于跨应用和企业数据的长时间自主工作,配备超频模式(Ultra mode)及子代理,可实现更快、更强的结果。该模型内部被用于辅助训练 Luna,并在成本和性能上相较此前版本有显著提升。