DeepSWE基准测试显示,DeepSeek v4 Pro仅通过8%的任务
摘要
关于DeepSWE基准测试的讨论显示,DeepSeek v4 Pro仅通过了8%的任务,与它在类似任务上的表现相比,这个分数低得令人惊讶。
这准确吗?我在OpenCode中使用DS v4,发现它几乎与Sonnet 4.6相当,所以我对这个分数如此之低感到惊讶。https://preview.redd.it/u9ccy5h8hg4h1.png?width=2042&format=png&auto=webp&s=1a7ccb98d449a07c87621703d1af2851fdbd4afe [https://deepswe.datacurve.ai/](https://deepswe.datacurve.ai/)
相似文章
DeepSeek-V4-Flash-0731 在基准测试中现已大幅超越 DeepSeek-V4-Pro-Preview
DeepSeek 的新 V4-Flash-0731 模型在基准测试中的表现现已远远优于 V4-Pro-Preview,标志着该模型系列取得了显著进步。
@pilvar222:我们在网络安全基准测试中运行了DeepSeek v4 Pro 0813,它在发现漏洞方面超越了所有(!)其他模型……
DeepSeek v4 Pro 0813在网络安全漏洞发现基准测试中超越了所有其他模型,在pass@3下实现了87.5%的CVE重新发现率,但精确度和运行一致性较低。
DeepSWE Opus 4.8 的结果已发布。
DeepSWE Opus 4.8 的结果已发布,展示了其在基准测试中的表现。
还有人觉得 DeepSeek-V4-Flash 在非编程任务上不可靠吗?
一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。
DeepSeek-V4 Flash 实际表现如何?
对 DeepSeek-V4 Flash 的性能和能力的评估,评估其实际有效性。