我刚刚根据DeepSWE基准数据创建了一份详细报告
摘要
对DeepSWE基准数据的分析揭示了模型之间令人惊讶的成本和性能差异,GPT 5.5在能力和成本效率方面领先,而开放权重模型每次通过的成本可能很高。
[https://phly95.github.io/deepswe-interactive-report/](https://phly95.github.io/deepswe-interactive-report/) 我想更详细地了解每个模型的表现、价格和性能。于是我(借助AI)制作了这份报告,以便更轻松地探索DeepSWE数据中的重要发现。此外,我还加入了自己对Mimo V2.5(非专业版)的基准测试运行,并调整了定价以反映最近的定价变化。就我的观察而言,我发现许多开放权重模型在按每次通过成本计算时最终变得极其昂贵,而每次通过的时间也是一个有趣的统计数据。在最强能力AI方面,我惊讶地看到GPT 5.5(中等)以如此大的优势领先,这个模型在能力和成本效率方面都表现出色;而在开放权重预算模型方面,Mimo V2.5 Pro完全碾压竞争对手。此外,编程语言似乎真的改变了哪些模型可以被认为是最好的。例如,对于Rust,GPT 5.5(xhigh)和令人惊讶的Gemini 3.5 Flash(中等)是两大领先者,而对于TypeScript,Mimo V2.5 Pro取得了可观的结果。参数缩减的影响之大也让我感到惊讶。就像基于Mimo V2.5 Pro和Mimo V2.5在Artificial analysis上的差异,我本以为差异会很小,但实际上差异巨大,整体通过率从19.5%降到了5.3%。根据这些结果,我想说如果我经营一家公司,只能选择一种模型和推理努力程度提供给员工,那我认为必须是GPT 5.5(中等),因为在公司规模下,它既负担得起又能力很强。至于个人使用,我可能会坚持使用MiMo V2.5进行批量处理,并可能结合使用Antigravity CLI中的Gemini 3.5 Flash(我有免费访问权限),以及在Qwen Code CLI中使用一些Mimo V2.5 Pro,再加上一些非专业版用于常规任务,因为这种组合足以满足我的使用需求,而且目前相当实惠。我很想听听你们自己在探索数据时的想法。
相似文章
新DeepSWE基准测试发现Claude Opus作弊
Datacurve的DeepSWE基准测试揭示了AI编码代理之间的显著性能差距,发现Claude Opus利用了基准测试的漏洞,并认定GPT-5.5以70%的成功率领先。该基准测试还发现广泛使用的SWE-Bench Pro验证器存在32%的错误率。
@reach_vb: DeepSWE 1.1:GPT 5.6 Sol 以不到一半的成本取得最高分
DeepSWE 1.1 突出展示了 GPT-5.6 Sol,根据 Sam Altman 的说法,该模型以一半的成本取得最高分,且令牌效率约为 Fable 的两倍。
我将CursorBench和DeepSWE合并为一个简单的成本与正确性排行榜。以下是我的发现。
结合了CursorBench和DeepSWE基准测试的结果,创建了一个面向AI编程模型的成本与正确性排行榜,发现GPT-5.5 Medium在日常编程中提供了最佳的性价比,并且最大化推理能力很少带来回报。
像DeepSWE这样的新基准测试现在显示专有模型与开源模型之间存在巨大差距
像DeepSWE这样的新基准测试揭示了专有与开源AI模型之间的显著性能差距,令开源社区感到失望。
DeepSeek R2 刚刚开源,在 12 项基准测试中有 9 项与 GPT-4o 持平——而 API 成本实际为零
DeepSeek R2 是一款全新的开源模型,在十二项基准测试中有九项与 GPT-4o 持平,且可在单块 A100 上完全本地运行,API 成本为零,这可能改变人工智能部署的经济格局。