Deepseek V4 如何能在编程排行榜上名列前茅,却依然落后前沿8个月?
摘要
分析 DeepSeek V4 在编程排行榜上的高分与其声称的落后前沿8个月的差距,突出狭窄基准优化与更广泛推理测试之间的差异,以及运行量化本地版本时实际性能的损失。
这个模型有两个数字,它们之间并不协调。Pro 配置在几乎所有排行榜上的编程得分都接近顶部——SWE-bench Verified 上 80.6,LiveCodeBench 上 93.5。然后 CAISI 在多个领域对其进行评估,结论是它大约落后美国前沿八个月,大致相当于 GPT-5 的时代。DeepSeek 自己在发布时的表述是落后两个月,正好在当时的领先水平之后。相同的权重,截然不同的结论。我的理解是,两者都正确,只是测量的内容不同。编程排行榜是一个狭窄的切片,也是所有人最努力优化的切片,因此在那里获得高分只表明它编程能力强,并不能说明推理能力或代理能力。CAISI 将测试范围扩大,差距出现在网络安全和抽象推理方面。而且前沿并没有停滞不前——Fable 5 本周发布,不过那是一个封闭模型,你无法在自己的机器上运行。这是所有这些问题中的本地化角度。每个人引用的数字都是 1.6T Pro 配置,但这并不是我们大多数人实际运行的东西。当你使用 Flash 或适合你机器的量化版本时,你又离头条数字远了一步。对于在本地运行它进行代理工作的人来说,一旦量化并进行工具调用(不仅仅是完成代码),实际表现如何?来源在评论中。
相似文章
更新基准测试:DeepSeek V4 Flash 在 SlopCodeBench(本地)上的表现
用户分享了使用本地量化(antirez imatrix 量化)和 pi 工具在 SlopCodeBench 上对 DeepSeek V4 Flash 的最新基准测试结果,显示性能较之前运行有所提升,但仍比托管 API 慢。
DeepSWE基准测试显示,DeepSeek v4 Pro仅通过8%的任务
关于DeepSWE基准测试的讨论显示,DeepSeek v4 Pro仅通过了8%的任务,与它在类似任务上的表现相比,这个分数低得令人惊讶。
DeepSeek v4 Flash 能力显著提升
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
我们对 DeepSeek V4 0731 进行了量化,并在 8× RTX 5090 上与其他流行的量化版本进行了基准测试
作者对 DeepSeek V4 0731 进行量化,修复了会导致基线偏差的 FP8 降转换问题,并在 8× RTX 5090 上对 38 个量化文件进行基准测试,展示了依赖 GPU 的结果和基于文件大小的比较。
@cline:DeepSeek 一小时前悄悄更新了其更新日志,带来了新的 V4-Flash 升级。其新的 Terminal-Bench 分数为 82.…
DeepSeek 悄悄更新了其更新日志,带来了 V4-Flash 升级,将其 Terminal-Bench 分数提升至 82.7,比 4 月预览版提高了 25.8 分。目前仅通过 API 提供,开源权重即将发布。