@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * ⁠Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…

X AI KOLs Timeline 新闻

摘要

一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。

在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么? 1× DGX Spark * ⁠Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s * DeepSeek v4 Flash REAP * ⁠Qwen 3.6 27b - 256k ctx 19, tok/s 2× DGX Sparks ← 甜点区! * DeepSeek v4 Flash - 1M ctx, 40-45 tok/s * Step-3.7-Flash - 256k ctx, 支持图像, 30 tok/s 4× DGX Sparks * GLM 5.2 NVFP4 on all 4 * 2× DeepSeek v4 Flash setups, each on 2× DGX Sparks. 链接和仓库见下方
查看原文
查看缓存全文

缓存时间: 2026/06/28 03:59

在您的 @NVIDIAAI DGX Spark 上可以运行的最佳模型是什么?

1× DGX Spark

  • Qwen 3.6 35b NVFP4 - 256k 上下文, 110 token/秒
  • DeepSeek v4 Flash REAP
  • Qwen 3.6 27b - 256k 上下文, 19 token/秒

2× DGX Sparks ← 最佳平衡点!

  • DeepSeek v4 Flash - 1M 上下文, 40-45 token/秒
  • Step-3.7-Flash - 256k 上下文, 支持图像, 30 token/秒

4× DGX Sparks

  • 全部四台运行 GLM 5.2 NVFP4
  • 2 组 DeepSeek v4 Flash 配置,每组使用 2× DGX Sparks。

下方链接和仓库

相似文章

DGX Spark 智能体使用数据

Reddit r/LocalLLaMA

一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。