DGX Sparks与新模型:我的测试与结果

Reddit r/LocalLLaMA 新闻

摘要

本文介绍了在NVIDIA DGX Sparks硬件上测试DeepSeek V4 Flash和Qwen3.8等AI模型的结果,详细说明了性能指标、上下文长度、基准分数以及操作见解。

我们有四台Sparks,排列为两对ConnectX-7。在过去一周里,我们尝试了DeepSeek V4 Flash、Qwen3.8 Flash Next、Qwen3.8-27B和Qwen3.6-35B-A3B。以下表格是我们保留的本地结果——并非从模型卡中复制的估计值。 配方和上下文摘要 模型/配方 | 硬件 | 运行时/加速 | 提供的上下文 | 最长演示提示 | 活跃路径 DeepSeek V4 Flash 0731 | 2x Spark, TP2 | vLLM, NVFP4 MLA KV, DSpark MTP5概率性 | 1,048,576 | 899,994 通过 | 6 Qwen3.8 Flash Next NVFP4 | 2x Spark, TP2 | SGLang, QSA, NEXTN, FlashInfer GDN | 262,144 | 250,000 通过(在较慢的非NEXTN配方上) | 6 Qwen3.8-27B NVFP4 | 1x或2x Spark | SGLang, DFlash2 K8, FP8 KV | 262,144 | 基准提示;接近极限的浸泡测试待定 | 8 每个副本 / 12 有效 TP2 Qwen3.6-35B-A3B NVFP4 | 1x Spark | vLLM, Marlin MoE, DSpark K8, FP8 KV | 262,144 | 工作负载提示 | 16 这次本地试点使用了12个LCB_generation加12个coding_completion问题,四个并发API请求,流式输出,无工具以及相同的网络禁用执行评分器。这不是官方的LiveBench提交。 交付的tok/s是API账户输出除以整个批次的墙钟时间,包括预填充、调度、推理和尾部失败——而非仅解码速度。 模型/思考 | 分数 | API成功 | 墙钟时间 | 输出令牌 | 交付的tok/s | 中位任务 | 最差任务 Qwen3.8-27B TP2 — 关闭 | — | 18/24 | 24/24 | 2:49 | 32,186 | 190.0 | 5.33s | 140.01s Qwen3.8-27B TP2 — 低 | 19/24 | 23/24 | 10:47 | 56,339 记录;~89K实际 | 87.0 记录 | 26.63s | 583.73s Qwen3.8 Flash Next — 关闭 | 17/24 | 24/24 | 1:22 | 8,861 | 107.7 | 4.43s | 40.29s Qwen3.8 Flash Next — 低 | 21/24 | 24/24 | 8:32 | 43,528 | 85.0 | 28.95s | 447.88s Qwen3.8 Flash Next — 中等 | 22/24 | 24/24 | 11:07 | 51,931 | 77.9 | 35.31s | 581.91s Qwen3.8 Flash Next — 极高 | 19/24 | 22/24 | 46:46 | 171,111 | 61.0 | 191.43s | 1,453.16s DeepSeek V4 Flash — 低 | 20/24 | 24/24 | 25:09 | 149,236 | 98.9 | 146.25s | 993.19s DeepSeek V4 Flash — 高 | 16/24 | 20/24 | 1:05:15 | 至少255,175 | 至少65.2 | 556.85s | 1,449.81s 操作经验比单次运行分数差异更清晰:Flash Next中等模式获得了最佳观察分数22/24。低模式在21/24时是更好的日常平衡。Flash Next关闭模式最快完成整个批次,且非常简洁。Qwen27低模式为3.82倍墙钟时间多通过一个任务,且一个响应达到了其32K上限。DeepSeek低模式生成的输出令牌是Qwen27低模式的2.65倍,并耗时25分钟。其保留的理由是单独演示的约900K提示能力,而非本次测试的速度。高/极高思考模式在此主动适得其反。Flash Next极高模式使用的输出令牌是中等模式的3倍以上,但分数更差;DeepSeek高模式更差。 我们之前还在单独的RTX 4090 FP8端点上测试了Qwen3.6-35B-A3B:它达到了118.12 tok/s c1和784.68聚合在c16,仅提供32K上下文。在类似的12任务完整程序子集上,它在思考关闭时得分为11/12;低思考模式也得分为11/12,但使用了7.84倍令牌。该行被排除在24任务表之外,因为任务数和硬件都不同。 这些都是测量结果,但配方原生测试之间的提示形状和输出长度不同。它们是有用的部署操作点,而非单一架构归一化排行榜。 模型/拓扑 | 单流结果 | C4聚合 | C6/C8聚合 | 最佳有用饱和度 DeepSeek V4 Flash, 2x Spark TP2 | 79.4 tok/s(强制可预测解码;42.08自由形式) | 512 | 79.53(自由形式) | 99.26 在c6;89.81 在c8,有两个排队c6,99.26 tok/s Qwen3.8 Flash Next, 2x Spark TP2 | 51.06(固定512) | 96.32(固定512) | 184.03 在c6固定512 c6,184.03 tok/s Qwen3.8-27B, 1x Spark | 65.51代码/31.93散文(ndec);27.02固定-256测试工具 | — | 140.76 在c8固定256 c8,140.76 tok/s Qwen3.8-27B, 2x Spark TP2 | 100.08代码/47.06散文(ndec);39.29固定-256测试工具 | 124.58(固定256) | 175.34 在c8 c12,199.98 tok/s Qwen3.8-27B, 2个独立副本 | 65.51代码每个Spark | — | 157.38 在c8 c16,286.93 tok/s Qwen3.6-35B-A3B, 1x Spark | 80.69(固定256) | 195.10 | 277.55 在c8 c16,404.89 tok/s 对于Flash Next,禁用NEXTN在c1给出26.4 tok/s,在c6聚合给出111.8 tok/s。在当前固定512工作负载上,NEXTN将单流速度提高约1.9倍,c6吞吐量提高约1.65倍。DeepSeek的约80 tok/s标题是可复现的,但仅在可预测强制输出中,投机接受度高。相同的实时配方在开放式自由形式输出中管理42 tok/s。仅报告80在技术上是真实的,但在操作上具有误导性。 Qwen3.8-27B拓扑测试 以下所有行在思考关闭时生成256个令牌: 部署 | 并发 | 聚合tok/s | 墙钟时间 | 观察 一个Spark/一个副本 | 1 | 27.02 | 9.47s | 固定输出测试工具 一个Spark/一个副本 | 8 | 140.76 | 14.55s | 饱和 两个独立副本 | 8 | 157.38 | 12.79s | 无队列 两个独立副本 | 16 | 286.93 | 14.28s | 最佳共享容量点 两个独立副本 | 32 | 284.73 | 28.77s | 16个排队 两个Spark/TP2 | 1 | 39.29 | 6.52s | 在此测试工具中最快的拓扑 两个Spark/TP2 | 8 | 175.34 | — | 无队列 两个Spark/TP2 | 12 | 199.98 | 15.36s | 有用饱和 两个Spark/TP2 | 16 | 184.57 | 22.19s | 四个排队 TP2使一个长编码流加快了1.53倍——从65.51到100.08 tok/s在ndec代码探测中——但两个独立副本在饱和时提供了43%更多的聚合吞吐量,并隔离故障。 Qwen3.6-35B-A3B在一个Spark上 这个MoE是我们的非思考转录/JSON工作器。固定256令牌确定性输出: 并发 | 聚合tok/s | 平均流tok/s | 平均TTFT 1 | 80.69 | 80.72 | 0.118s 2 | 126.19 | 64.46 | 0.155s 4 | 195.10 | 50.53 | 0.189s 8 | 277.55 | 36.74 | 0.242s 16 | 404.89 | 26.81 | 0.348s 32 | 382.64 | 18.08 | 5.959s
查看原文

相似文章

Deepseek V4 flash 在 DGX Spark 上的性能

Reddit r/LocalLLaMA

一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。

DGX Spark 智能体使用数据

Reddit r/LocalLLaMA

一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。

Qwen 3.8 27b 对比 Deepseek Flash

Reddit r/LocalLLaMA

这篇文章对比了开源AI模型Qwen 3.8 (27B) 和 Deepseek Flash,讨论了基准测试,并寻求用户经验以评估它们的性能。