Deepseek V4 如何能在编程排行榜上名列前茅,却依然落后前沿8个月?

Reddit r/LocalLLaMA 模型

摘要

分析 DeepSeek V4 在编程排行榜上的高分与其声称的落后前沿8个月的差距,突出狭窄基准优化与更广泛推理测试之间的差异,以及运行量化本地版本时实际性能的损失。

这个模型有两个数字,它们之间并不协调。Pro 配置在几乎所有排行榜上的编程得分都接近顶部——SWE-bench Verified 上 80.6,LiveCodeBench 上 93.5。然后 CAISI 在多个领域对其进行评估,结论是它大约落后美国前沿八个月,大致相当于 GPT-5 的时代。DeepSeek 自己在发布时的表述是落后两个月,正好在当时的领先水平之后。相同的权重,截然不同的结论。我的理解是,两者都正确,只是测量的内容不同。编程排行榜是一个狭窄的切片,也是所有人最努力优化的切片,因此在那里获得高分只表明它编程能力强,并不能说明推理能力或代理能力。CAISI 将测试范围扩大,差距出现在网络安全和抽象推理方面。而且前沿并没有停滞不前——Fable 5 本周发布,不过那是一个封闭模型,你无法在自己的机器上运行。这是所有这些问题中的本地化角度。每个人引用的数字都是 1.6T Pro 配置,但这并不是我们大多数人实际运行的东西。当你使用 Flash 或适合你机器的量化版本时,你又离头条数字远了一步。对于在本地运行它进行代理工作的人来说,一旦量化并进行工具调用(不仅仅是完成代码),实际表现如何?来源在评论中。
查看原文

相似文章

DeepSeek v4 Flash 能力显著提升

Reddit r/LocalLLaMA

DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。