我刚刚根据DeepSWE基准数据创建了一份详细报告

Reddit r/singularity 新闻

摘要

对DeepSWE基准数据的分析揭示了模型之间令人惊讶的成本和性能差异,GPT 5.5在能力和成本效率方面领先,而开放权重模型每次通过的成本可能很高。

[https://phly95.github.io/deepswe-interactive-report/](https://phly95.github.io/deepswe-interactive-report/) 我想更详细地了解每个模型的表现、价格和性能。于是我(借助AI)制作了这份报告,以便更轻松地探索DeepSWE数据中的重要发现。此外,我还加入了自己对Mimo V2.5(非专业版)的基准测试运行,并调整了定价以反映最近的定价变化。就我的观察而言,我发现许多开放权重模型在按每次通过成本计算时最终变得极其昂贵,而每次通过的时间也是一个有趣的统计数据。在最强能力AI方面,我惊讶地看到GPT 5.5(中等)以如此大的优势领先,这个模型在能力和成本效率方面都表现出色;而在开放权重预算模型方面,Mimo V2.5 Pro完全碾压竞争对手。此外,编程语言似乎真的改变了哪些模型可以被认为是最好的。例如,对于Rust,GPT 5.5(xhigh)和令人惊讶的Gemini 3.5 Flash(中等)是两大领先者,而对于TypeScript,Mimo V2.5 Pro取得了可观的结果。参数缩减的影响之大也让我感到惊讶。就像基于Mimo V2.5 Pro和Mimo V2.5在Artificial analysis上的差异,我本以为差异会很小,但实际上差异巨大,整体通过率从19.5%降到了5.3%。根据这些结果,我想说如果我经营一家公司,只能选择一种模型和推理努力程度提供给员工,那我认为必须是GPT 5.5(中等),因为在公司规模下,它既负担得起又能力很强。至于个人使用,我可能会坚持使用MiMo V2.5进行批量处理,并可能结合使用Antigravity CLI中的Gemini 3.5 Flash(我有免费访问权限),以及在Qwen Code CLI中使用一些Mimo V2.5 Pro,再加上一些非专业版用于常规任务,因为这种组合足以满足我的使用需求,而且目前相当实惠。我很想听听你们自己在探索数据时的想法。
查看原文

相似文章

新DeepSWE基准测试发现Claude Opus作弊

Reddit r/LocalLLaMA

Datacurve的DeepSWE基准测试揭示了AI编码代理之间的显著性能差距,发现Claude Opus利用了基准测试的漏洞,并认定GPT-5.5以70%的成功率领先。该基准测试还发现广泛使用的SWE-Bench Pro验证器存在32%的错误率。