HumanEval基准测试:Deepseek V4 Flash 0731 对比 GLM5.3 Flash 在双DGX Spark配置上的表现
摘要
一项在双DGX Spark配置上的个人基准测试对比显示,GLM5.3 Flash在HumanEval上准确率更高,但上下文长度减小且速度较慢。
我最近搭建了一个双DGX Spark配置,并且一直在愉快地运行Deepseek V4 Flash 0731。自从本周GLM5.3 Flash和Qwen 3.8 Flash Next发布以来,许多人仍在根据自己的硬件情况等待观望该运行哪个模型。我非常有兴趣在本地运行GLM模型,看起来nvfp4对我的配置是个不错的选择,但我听到了很多关于GLM5.3 Flash在nvfp4量化上的矛盾意见(主要是负面的),这让我有些犹豫。所以我决定自己做一个简单的基准测试,希望这对同样配置的人有帮助:Deepseek V4 Flash 0731 配方:官方检查点,fp8 kv,1M上下文,4并发流 GLM 5.3 Flash 配方:NVFP4量化,fp8_e4m3 kv,256k上下文,6C模型思考模式 HumanEval Pass@1 (基础) HumanEval+ (对抗性边缘案例) 总基准测试运行时间 本地流速度 GLM-5.3-Flash NVFP4 思考启用(高) 97.0% (159 / 164) 92.1% (151 / 164) 20分52秒 ~50 tok/s (DFlash2) DeepSeek-V4-Flash-0731 思考启用(高) 94.5% (155 / 164) 88.4% (145 / 164) 38分16秒 ~70 tok/s (MTP-5) GLM-5.3-Flash NVFP4 直接零样本(关闭) 93.3% (153 / 164) 89.6% (147 / 164) 23分32秒 ~50 tok/s (DFlash2) DeepSeek-V4-Flash-0731 直接零样本(关闭) 92.7% (152 / 164) 87.8% (144 / 164) 14分52秒 ~70 tok/s (MTP-5) 所以原始数据显示,GLM 5.3f 相对于 DSv4f 0731 是一个不错的升级,尤其是当思考启用时。Unsloth 表示他们的 Q4 量化有大约 92% 的准确率,但看起来 nvfp4 仍然表现得很好(97% 在不久前会是 SOTA 分数,而且这甚至不是最大思考)。主要的权衡是 256 上下文。我相当确定拥有 512GB+ VRAM(或 4 个 sparks)的人将能够运行 fp8 模型 + 1M 上下文而不会有问题,我很嫉妒 🥹 无论如何,你自己的体验比任何基准测试都更重要。
相似文章
Deepseek V4 flash 在 DGX Spark 上的性能
一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。
针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s
DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。
@ViC305: 18小时后:DeepSeek-V4.1-Flash 现已量化至 4.75 bpw EXL3,适用于 4× DGX Spark TP4 目标。权重已完…
DeepSeek-V4.1-Flash 已量化至 4.75 bpw EXL3,以便部署在 4× DGX Spark 上,优化内存使用并实现高效本地推理,同时有计划进行验证和进一步优化。
新版DeepSeek V4-Flash在ArtificalAnalysis Index上取得50分,比GLM-5.2和GPT-5.6 Luna低1分
DeepSeek的新V4-Flash模型在ArtificalAnalysis Index上得分为50,仅比GLM-5.2和GPT-5.6 Luna低1分。
DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。