在一台 DGX Spark 上对 124B 模型进行了一周基准测试并全部公开——他找到的最快路径为 38.7 tok/s,比同机上的 DeepSeek V4 Flash 快 2.4 倍
摘要
sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。
sudoingX 在 X 上花了一周时间做这件事,并发布了总结。硬件是他自己的。他并非我们团队的人,发布之前我们也没看过任何内容——我在 inclusionAI 负责 Ling。他在单台 Spark 上得出的结果是:官方 INT4 配置正确后达到 38.7 tok/s,社区 GGUF 为 35.2 tok/s,是同机 DeepSeek V4 Flash 的 2.4 倍。他的原话是,Ling-3.0-flash 在他的机器上赢得了一个永久席位。让我注意的是中间的那条更正。他之前发帖说我们的官方量化在单台 Spark 上跑不起来。两天后他又发帖说其实能跑,而且是他现在最快的方法,并引用自己之前的帖子来说明这一点。他的时间线上大多数数字旁边都标注了方法,所以你不必只听我的一面之词。一台 Spark,一个人,超过一周。他搞这个的时间比我关注这件事的时间还长。
相似文章
Deepseek V4 flash 在 DGX Spark 上的性能
一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。
针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s
DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
A 124B 在单台 DGX Spark 上单次响应生成了 15,128 个 token,解码速度全程保持 35.62 → 35.68 tok/s
对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。
Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。
Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。