DGX Sparks与新模型:我的测试与结果
摘要
本文介绍了在NVIDIA DGX Sparks硬件上测试DeepSeek V4 Flash和Qwen3.8等AI模型的结果,详细说明了性能指标、上下文长度、基准分数以及操作见解。
我们有四台Sparks,排列为两对ConnectX-7。在过去一周里,我们尝试了DeepSeek V4 Flash、Qwen3.8 Flash Next、Qwen3.8-27B和Qwen3.6-35B-A3B。以下表格是我们保留的本地结果——并非从模型卡中复制的估计值。
配方和上下文摘要
模型/配方 | 硬件 | 运行时/加速 | 提供的上下文 | 最长演示提示 | 活跃路径
DeepSeek V4 Flash 0731 | 2x Spark, TP2 | vLLM, NVFP4 MLA KV, DSpark MTP5概率性 | 1,048,576 | 899,994 通过 | 6
Qwen3.8 Flash Next NVFP4 | 2x Spark, TP2 | SGLang, QSA, NEXTN, FlashInfer GDN | 262,144 | 250,000 通过(在较慢的非NEXTN配方上) | 6
Qwen3.8-27B NVFP4 | 1x或2x Spark | SGLang, DFlash2 K8, FP8 KV | 262,144 | 基准提示;接近极限的浸泡测试待定 | 8 每个副本 / 12 有效 TP2
Qwen3.6-35B-A3B NVFP4 | 1x Spark | vLLM, Marlin MoE, DSpark K8, FP8 KV | 262,144 | 工作负载提示 | 16
这次本地试点使用了12个LCB_generation加12个coding_completion问题,四个并发API请求,流式输出,无工具以及相同的网络禁用执行评分器。这不是官方的LiveBench提交。
交付的tok/s是API账户输出除以整个批次的墙钟时间,包括预填充、调度、推理和尾部失败——而非仅解码速度。
模型/思考 | 分数 | API成功 | 墙钟时间 | 输出令牌 | 交付的tok/s | 中位任务 | 最差任务
Qwen3.8-27B TP2 — 关闭 | — | 18/24 | 24/24 | 2:49 | 32,186 | 190.0 | 5.33s | 140.01s
Qwen3.8-27B TP2 — 低 | 19/24 | 23/24 | 10:47 | 56,339 记录;~89K实际 | 87.0 记录 | 26.63s | 583.73s
Qwen3.8 Flash Next — 关闭 | 17/24 | 24/24 | 1:22 | 8,861 | 107.7 | 4.43s | 40.29s
Qwen3.8 Flash Next — 低 | 21/24 | 24/24 | 8:32 | 43,528 | 85.0 | 28.95s | 447.88s
Qwen3.8 Flash Next — 中等 | 22/24 | 24/24 | 11:07 | 51,931 | 77.9 | 35.31s | 581.91s
Qwen3.8 Flash Next — 极高 | 19/24 | 22/24 | 46:46 | 171,111 | 61.0 | 191.43s | 1,453.16s
DeepSeek V4 Flash — 低 | 20/24 | 24/24 | 25:09 | 149,236 | 98.9 | 146.25s | 993.19s
DeepSeek V4 Flash — 高 | 16/24 | 20/24 | 1:05:15 | 至少255,175 | 至少65.2 | 556.85s | 1,449.81s
操作经验比单次运行分数差异更清晰:Flash Next中等模式获得了最佳观察分数22/24。低模式在21/24时是更好的日常平衡。Flash Next关闭模式最快完成整个批次,且非常简洁。Qwen27低模式为3.82倍墙钟时间多通过一个任务,且一个响应达到了其32K上限。DeepSeek低模式生成的输出令牌是Qwen27低模式的2.65倍,并耗时25分钟。其保留的理由是单独演示的约900K提示能力,而非本次测试的速度。高/极高思考模式在此主动适得其反。Flash Next极高模式使用的输出令牌是中等模式的3倍以上,但分数更差;DeepSeek高模式更差。
我们之前还在单独的RTX 4090 FP8端点上测试了Qwen3.6-35B-A3B:它达到了118.12 tok/s c1和784.68聚合在c16,仅提供32K上下文。在类似的12任务完整程序子集上,它在思考关闭时得分为11/12;低思考模式也得分为11/12,但使用了7.84倍令牌。该行被排除在24任务表之外,因为任务数和硬件都不同。
这些都是测量结果,但配方原生测试之间的提示形状和输出长度不同。它们是有用的部署操作点,而非单一架构归一化排行榜。
模型/拓扑 | 单流结果 | C4聚合 | C6/C8聚合 | 最佳有用饱和度
DeepSeek V4 Flash, 2x Spark TP2 | 79.4 tok/s(强制可预测解码;42.08自由形式) | 512 | 79.53(自由形式) | 99.26 在c6;89.81 在c8,有两个排队c6,99.26 tok/s
Qwen3.8 Flash Next, 2x Spark TP2 | 51.06(固定512) | 96.32(固定512) | 184.03 在c6固定512 c6,184.03 tok/s
Qwen3.8-27B, 1x Spark | 65.51代码/31.93散文(ndec);27.02固定-256测试工具 | — | 140.76 在c8固定256 c8,140.76 tok/s
Qwen3.8-27B, 2x Spark TP2 | 100.08代码/47.06散文(ndec);39.29固定-256测试工具 | 124.58(固定256) | 175.34 在c8 c12,199.98 tok/s
Qwen3.8-27B, 2个独立副本 | 65.51代码每个Spark | — | 157.38 在c8 c16,286.93 tok/s
Qwen3.6-35B-A3B, 1x Spark | 80.69(固定256) | 195.10 | 277.55 在c8 c16,404.89 tok/s
对于Flash Next,禁用NEXTN在c1给出26.4 tok/s,在c6聚合给出111.8 tok/s。在当前固定512工作负载上,NEXTN将单流速度提高约1.9倍,c6吞吐量提高约1.65倍。DeepSeek的约80 tok/s标题是可复现的,但仅在可预测强制输出中,投机接受度高。相同的实时配方在开放式自由形式输出中管理42 tok/s。仅报告80在技术上是真实的,但在操作上具有误导性。
Qwen3.8-27B拓扑测试
以下所有行在思考关闭时生成256个令牌:
部署 | 并发 | 聚合tok/s | 墙钟时间 | 观察
一个Spark/一个副本 | 1 | 27.02 | 9.47s | 固定输出测试工具
一个Spark/一个副本 | 8 | 140.76 | 14.55s | 饱和
两个独立副本 | 8 | 157.38 | 12.79s | 无队列
两个独立副本 | 16 | 286.93 | 14.28s | 最佳共享容量点
两个独立副本 | 32 | 284.73 | 28.77s | 16个排队
两个Spark/TP2 | 1 | 39.29 | 6.52s | 在此测试工具中最快的拓扑
两个Spark/TP2 | 8 | 175.34 | — | 无队列
两个Spark/TP2 | 12 | 199.98 | 15.36s | 有用饱和
两个Spark/TP2 | 16 | 184.57 | 22.19s | 四个排队
TP2使一个长编码流加快了1.53倍——从65.51到100.08 tok/s在ndec代码探测中——但两个独立副本在饱和时提供了43%更多的聚合吞吐量,并隔离故障。
Qwen3.6-35B-A3B在一个Spark上
这个MoE是我们的非思考转录/JSON工作器。固定256令牌确定性输出:
并发 | 聚合tok/s | 平均流tok/s | 平均TTFT
1 | 80.69 | 80.72 | 0.118s
2 | 126.19 | 64.46 | 0.155s
4 | 195.10 | 50.53 | 0.189s
8 | 277.55 | 36.74 | 0.242s
16 | 404.89 | 26.81 | 0.348s
32 | 382.64 | 18.08 | 5.959s
相似文章
@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…
一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。
Deepseek V4 flash 在 DGX Spark 上的性能
一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。
DGX Spark 智能体使用数据
一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。
Qwen 3.8 27b 对比 Deepseek Flash
这篇文章对比了开源AI模型Qwen 3.8 (27B) 和 Deepseek Flash,讨论了基准测试,并寻求用户经验以评估它们的性能。
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。