在一个困难的新SWE基准测试ProgramBench上,GPT5.5 high/xhigh首次解决了任务,显著优于Opus 4.7
摘要
GPT5.5在困难的ProgramBench SWE基准测试中首次实现求解,显著优于Opus 4.7。
推文链接:https://x.com/KLieret/status/2054215545663144217?s=20 GitHub链接:[https://github.com/facebookresearch/ProgramBench/](https://github.com/facebookresearch/ProgramBench/) ProgramBench网站链接:[https://programbench.com/blog/gpt-5-5-first-solve/](https://programbench.com/blog/gpt-5-5-first-solve/)
相似文章
@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…
GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。
Fable 5 的 ProgramBench 结果已出,性能是 Opus 4.8 的两倍,即使 99% 的运行回退到 4.8
ProgramBench 结果显示,Fable 5 的性能是 Opus 4.8 的两倍,即使在 99% 的运行中回退到 4.8。
@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!
Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。
@BenjaminDEKR:就这么结束了?GPT5.6 Sol Ultra 在 TerminalBench 上得分 91.9%,编程问题正在接近解决,就像算术一样……
GPT5.6 Sol Ultra 在 TerminalBench 编程基准测试中达到 91.9%,表明编程任务正在接近解决。
我让 Sol Max 对比了 Claude Opus 5 High 和 GPT 5.6 Sol Max 在 ARC-AGI-3 上某个特定谜题的输出,其中 Opus 5 的得分为 98.81%,而 GPT 5.6 Sol Max 的得分为 21.42%。
一项针对ARC-AGI-3谜题、比较Claude Opus 5 High与GPT 5.6 Sol Max的分析显示,Opus通过在可见输出中保留详细状态而获胜,而Sol则依赖被丢弃的隐藏推理。