@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…
摘要
一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。
查看缓存全文
缓存时间: 2026/06/28 03:59
在您的 @NVIDIAAI DGX Spark 上可以运行的最佳模型是什么?
1× DGX Spark
- Qwen 3.6 35b NVFP4 - 256k 上下文, 110 token/秒
- DeepSeek v4 Flash REAP
- Qwen 3.6 27b - 256k 上下文, 19 token/秒
2× DGX Sparks ← 最佳平衡点!
- DeepSeek v4 Flash - 1M 上下文, 40-45 token/秒
- Step-3.7-Flash - 256k 上下文, 支持图像, 30 token/秒
4× DGX Sparks
- 全部四台运行 GLM 5.2 NVFP4
- 2 组 DeepSeek v4 Flash 配置,每组使用 2× DGX Sparks。
下方链接和仓库
相似文章
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
@MiaAI_lab: Nvidia又做到了!@NVIDIAAI的Qwen 3.6 27B NVFP4比Unsloth的Qwen 3.6 27B NVFP4在D…上快了约41%
Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。
@ivanfioravanti: DGX Spark 上下文基准测试基于 Qwen3.6-35B-A3B-UD-Q8_K_XL,使用 Mia 发布的 llamacpp 脚本。速度很快!是时候测试质…
基于 Qwen3.6-35B-A3B-UD-Q8_K_XL 在 DGX Spark 上的基准测试结果,使用 Mia 发布的 llama.cpp 脚本,展示了在不同上下文长度下快速的 token 生成时间。
DGX Spark 智能体使用数据
一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。
@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……
Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。