DeepSWE基准测试显示,DeepSeek v4 Pro仅通过8%的任务

Reddit r/LocalLLaMA 新闻

摘要

关于DeepSWE基准测试的讨论显示,DeepSeek v4 Pro仅通过了8%的任务,与它在类似任务上的表现相比,这个分数低得令人惊讶。

这准确吗?我在OpenCode中使用DS v4,发现它几乎与Sonnet 4.6相当,所以我对这个分数如此之低感到惊讶。https://preview.redd.it/u9ccy5h8hg4h1.png?width=2042&format=png&auto=webp&s=1a7ccb98d449a07c87621703d1af2851fdbd4afe [https://deepswe.datacurve.ai/](https://deepswe.datacurve.ai/)
查看原文

相似文章