@gdb:如今基准测试很快就会饱和
摘要
一条推文指出基准测试很快就会饱和,并以模型 GPT-5.6 Sol Pro 为例,该模型在 prinzbench 上获得了 91/99 的分数,还有两个问题未解决。
如今基准测试很快就会饱和
查看缓存全文
缓存时间: 2026/07/17 00:19
benchmarks get saturated very quickly these days
prinz (@deredleritt3r): 已添加到 prinzbench:GPT-5.6 Sol Pro。
正如几天前预告的那样,该模型已经使我的基准测试饱和,总得分为 91/99。
提供一点背景信息:prinzbench 包含两个截至目前所有经过测试的模型都无法解决的问题(其中一个需要极其彻底的
相似文章
@BenjaminDEKR:就这么结束了?GPT5.6 Sol Ultra 在 TerminalBench 上得分 91.9%,编程问题正在接近解决,就像算术一样……
GPT5.6 Sol Ultra 在 TerminalBench 编程基准测试中达到 91.9%,表明编程任务正在接近解决。
在 SWEBench Pro 上,GPT 5.5 的失败中有 68.5% 是由损坏或错误的测试用例引起的,占整个基准测试的 28.9%
分析显示,GPT 5.5 在 SWEBench Pro 上的失败中有 28.9% 是由于损坏或错误的测试用例所致,类似问题也影响了其他主要 AI 基准测试,引发了对当前评估方法准确性的担忧。
介绍 BenchBench(5分钟阅读)
介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。
GPT-5.6 Sol 预览版发布,基准差距超预期
OpenAI 发布了 GPT-5.6 Sol 预览版,显示基准差距超出预期。
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。