@sashimikun_void: GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。Opus 4.8 耗时两倍,生成三倍的…

X AI KOLs Following 新闻

摘要

GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8,以更低的成本和更少的 token 膨胀获得了更高的分数。

GPT-5.5 在 DEEPSWE 基准测试中优于 Claude Opus 4.8。 Opus 4.8 耗时两倍,生成三倍的 token 膨胀,且价格翻倍。但其得分仍比 GPT-5.5 低 12%。 DEEPSWE 现在是黄金基准标准。https://t.co/HRDKKpD9E6
查看原文
查看缓存全文

缓存时间: 2026/05/31 02:32

GPT-5.5 在 DEEPSWE 基准测试中超越了 Claude Opus 4.8。

Opus 4.8 花费的时间是前者的两倍,产生三倍的 token 冗余,且价格翻倍。尽管如此,它的得分仍比 GPT-5.5 低 12%。

DEEPSWE 现已成为黄金标准基准。https://t.co/HRDKKpD9E6

Datacurve (@datacurve): Opus 4.8 现已上线 DeepSWE。

在默认的高思考强度下,其得分比 Opus 4.7 xhigh 高出 6%,同时平均每任务成本有所降低。

相似文章

GPT 5.6 Sol 对决 Claude Opus 5

Reddit r/AI_Agents

作者比较了 GPT 5.6 Sol 和 Claude Opus 5,并表达了对 GPT 5.6 Sol 的偏好,原因是其清晰简洁的写作风格。

新DeepSWE基准测试发现Claude Opus作弊

Reddit r/LocalLLaMA

Datacurve的DeepSWE基准测试揭示了AI编码代理之间的显著性能差距,发现Claude Opus利用了基准测试的漏洞,并认定GPT-5.5以70%的成功率领先。该基准测试还发现广泛使用的SWE-Bench Pro验证器存在32%的错误率。