@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…
摘要
GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。
查看缓存全文
缓存时间: 2026/05/31 02:32
GPT-5.5 在 DEEPSWE 基准测试中超越了 Claude Opus 4.8。
Opus 4.8 花费的时间是前者的两倍,产生三倍的 token 冗余,且价格翻倍。尽管如此,它的得分仍比 GPT-5.5 低 12%。
DEEPSWE 现已成为黄金标准基准。https://t.co/HRDKKpD9E6
Datacurve (@datacurve): Opus 4.8 现已上线 DeepSWE。
在默认的高思考强度下,其得分比 Opus 4.7 xhigh 高出 6%,同时平均每任务成本有所降低。
相似文章
@VraserX: GPT-5.5 依然是王者。GPT-5.5 以几乎一半的成本和大约两倍的速度碾压 Claude Opus 4.8。OpenAI …
一条推文声称,OpenAI 的 GPT-5.5 以近乎一半的成本和双倍的速度表现优于 Claude Opus 4.8,宣称 OpenAI 在 AI 领域继续保持统治地位。
@omarsar0: 效率前沿!你认为 GPT-5.6 会落在哪里?
讨论 Claude Opus 4.8 和 GPT-5.5 在 DeepSWE Bench 上的最新基准测试结果,并推测未来 GPT-5.6 的性能和效率趋势。
GPT 5.6 Sol 对决 Claude Opus 5
作者比较了 GPT 5.6 Sol 和 Claude Opus 5,并表达了对 GPT 5.6 Sol 的偏好,原因是其清晰简洁的写作风格。
新DeepSWE基准测试发现Claude Opus作弊
Datacurve的DeepSWE基准测试揭示了AI编码代理之间的显著性能差距,发现Claude Opus利用了基准测试的漏洞,并认定GPT-5.5以70%的成功率领先。该基准测试还发现广泛使用的SWE-Bench Pro验证器存在32%的错误率。
在一个困难的新SWE基准测试ProgramBench上,GPT5.5 high/xhigh首次解决了任务,显著优于Opus 4.7
GPT5.5在困难的ProgramBench SWE基准测试中首次实现求解,显著优于Opus 4.7。