@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…
摘要
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
查看缓存全文
缓存时间: 2026/07/30 01:46
GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3(一个 2D 谜题游戏基准测试)上表现挣扎?
我们进行了调查。发现测试框架不允许它记住自己学到的东西。
我们还发现,启用两个 API 设置后,我们的得分提高了两倍,而输出 token 减少了 6 倍。
相似文章
GPT-5.6 系列 (2分钟阅读)
OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。
@OpenAI:基准分数既反映模型本身,也反映用于运行模型的测试框架和设置。对于长时间运行的智能体,保留…
OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。
启用两项设置使我们的ARC-AGI-3基准测试得分提高了三倍
OpenAI发现,在API工具中启用保留推理和压缩设置,使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提高了三倍,同时将输出令牌减少了6倍,表明基准测试性能在很大程度上受工具设计影响。
5.6 Sol 在通用工作中的潜力被低估(7分钟阅读)
OpenAI 发布了 GPT-5.6 Sol,这是一款旗舰模型,适用于跨应用和企业数据的长时间自主工作,配备超频模式(Ultra mode)及子代理,可实现更快、更强的结果。该模型内部被用于辅助训练 Luna,并在成本和性能上相较此前版本有显著提升。
@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…
OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。