HumanEval基准测试:Deepseek V4 Flash 0731 对比 GLM5.3 Flash 在双DGX Spark配置上的表现

Reddit r/LocalLLaMA 新闻

摘要

一项在双DGX Spark配置上的个人基准测试对比显示,GLM5.3 Flash在HumanEval上准确率更高,但上下文长度减小且速度较慢。

我最近搭建了一个双DGX Spark配置,并且一直在愉快地运行Deepseek V4 Flash 0731。自从本周GLM5.3 Flash和Qwen 3.8 Flash Next发布以来,许多人仍在根据自己的硬件情况等待观望该运行哪个模型。我非常有兴趣在本地运行GLM模型,看起来nvfp4对我的配置是个不错的选择,但我听到了很多关于GLM5.3 Flash在nvfp4量化上的矛盾意见(主要是负面的),这让我有些犹豫。所以我决定自己做一个简单的基准测试,希望这对同样配置的人有帮助:Deepseek V4 Flash 0731 配方:官方检查点,fp8 kv,1M上下文,4并发流 GLM 5.3 Flash 配方:NVFP4量化,fp8_e4m3 kv,256k上下文,6C模型思考模式 HumanEval Pass@1 (基础) HumanEval+ (对抗性边缘案例) 总基准测试运行时间 本地流速度 GLM-5.3-Flash NVFP4 思考启用(高) 97.0% (159 / 164) 92.1% (151 / 164) 20分52秒 ~50 tok/s (DFlash2) DeepSeek-V4-Flash-0731 思考启用(高) 94.5% (155 / 164) 88.4% (145 / 164) 38分16秒 ~70 tok/s (MTP-5) GLM-5.3-Flash NVFP4 直接零样本(关闭) 93.3% (153 / 164) 89.6% (147 / 164) 23分32秒 ~50 tok/s (DFlash2) DeepSeek-V4-Flash-0731 直接零样本(关闭) 92.7% (152 / 164) 87.8% (144 / 164) 14分52秒 ~70 tok/s (MTP-5) 所以原始数据显示,GLM 5.3f 相对于 DSv4f 0731 是一个不错的升级,尤其是当思考启用时。Unsloth 表示他们的 Q4 量化有大约 92% 的准确率,但看起来 nvfp4 仍然表现得很好(97% 在不久前会是 SOTA 分数,而且这甚至不是最大思考)。主要的权衡是 256 上下文。我相当确定拥有 512GB+ VRAM(或 4 个 sparks)的人将能够运行 fp8 模型 + 1M 上下文而不会有问题,我很嫉妒 🥹 无论如何,你自己的体验比任何基准测试都更重要。
查看原文

相似文章

Deepseek V4 flash 在 DGX Spark 上的性能

Reddit r/LocalLLaMA

一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。