来自@exolabs的帖子:https://x.com/exolabs/status/2103617535765573959

X AI KOLs Timeline 产品

摘要

这篇文章是NVIDIA DGX Spark的手册,该设备专为本地AI推理设计,详细介绍了其规格、如何连接多台设备以提升性能,以及其针对运行混合专家模型的优化。

https://t.co/c6i4mctkrK
查看原文
查看缓存全文

缓存时间: 2026/09/26 19:03

DGX Spark 使用手册

作者:@0xSero 审阅者:@alexocheema 和 @alexzfunk 特别鸣谢:@MiaAI_lab

如果您正在考虑本地运行推理,那么您无疑会了解到这款有趣的“金砖”。这是一台专为本地 AI 推理服务而设计的机器,旨在做到小巧、简洁、安静且价格相对实惠(NVIDIA 的 DGX Spark 页面)。

当我初次听说 DGX Spark 时,我并不看好它。 尽管它拥有 128 GB 的内存,但其 273 GB/s 的内存带宽似乎过低。作为参考,RTX 5090 的带宽大约是其 6.5 倍(1,792 GB/s),尽管其显存只有 32 GB。 在 Spark 首次发布时,诸如推测解码之类的推理工程技术尚未普及,大多数小型模型的能力也不够强。随着 AI 行业的进步和发展,智能正被压缩到越来越小的尺寸中,这使得这些小盒子能够充分发挥其潜力。

  • 推理工程的需求日益增长。
  • LLM 在推理工程方面正变得更加胜任。
  • 高质量的推理能提升系统表现。

现在的 DGX Spark 能够以与云服务相当的速度,在本地运行非常智能的模型,让您尽享家庭或办公室的舒适。有丰富的 AI 软件可以帮助您编程、报税、学习或单纯提供娱乐。我所说的“速度”是指单个用户看到的 tokens 每秒生成量。云硬件速度更快,但供应商将其与许多用户共享,并为每 token 的成本进行了优化,因此每个用户实际获得的算力较少。而在家里,这台机器完全属于您,所有算力都为您一人所用。更多细节请参见高级说明。

Spark 旨在连接

DGX Spark 的功耗非常低。在加载并运行模型时,它们通常维持在 95 瓦左右。因此,它们不需要太多冷却措施,与独立 GPU 相比相当安静。您可以在一个标准的美国家用电路中安全地堆叠 2 到 4 台 Spark。这一点——而非原始能效——才是关键:就单位内存带宽的能效而言,数据中心的 B300 每焦耳完成的工作量大约是其两倍(参见高级说明)。Spark 只需插入普通墙壁插座即可运行。

每台 Spark 都配备了一张 ConnectX-7 网卡,带有两个 QSFP 端口,额定速率为 200 Gb/s,即 25 GB/s。 这允许您将多台 Spark 连接起来,以增加总内存和有效内存带宽。

Spark 的连接方式 Spark 的连接方式

通过张量并行,每个权重矩阵被分割到各个 Spark 上,每个 Spark 仅从自身的内存中读取属于自己的那份数据,同时与其他 Spark 并行工作。因此,读取速度会叠加(来自 NVIDIA 自身的扩展测试):

  • 两台 Spark:546 GB/s
  • 三台:819 GB/s
  • 四台:1,092 GB/s

这种扩展接近线性。在 NVIDIA 自己的测试中,写入速度在两台 Spark 时提升 2 倍,在四台时提升 3.7 倍(表 3)。之所以效果如此之好,是因为 ConnectX-7 链路延迟极低,并且 CUDA 可以在 GPU 代码内部直接在 Spark 之间移动数据(更多原因见下文)。

内存以相同方式叠加:每台 128 GB,四台共 512 GB,每台约有 120 GB 可用于 AI 工作负载。能够堆叠 Spark 的特性缓解了其最大问题——较低的内存带宽。其通过普通插座实现的低功耗,对于单个用户或小型家庭来说堪称神奇。

实际连接使用的 Spark 实际连接使用的 Spark

稠密模型 vs MoE 模型

目前主要有两种模型架构:稀疏和稠密。像 Qwen3.6-35B 这样的混合专家模型,每生成一个 token 只激活 3B 参数,比 Qwen3.8-27B 减少了 9 倍。这使得稀疏 LLM 尤其适合 DGX Spark。 它们与 Spark 较低的内存带宽非常匹配,即使模型总体规模庞大,也能为用户提供快速体验。

MoE 不仅对 DGX Spark 有益。它在数据中心也是一种更好的架构。对于本地运行而言,改变的是一个阈值:我们期望一定的速度,而曾经足够聪明的稠密模型太大,无法在家庭环境中那样快地运行。MoE 模型跨过了这条线,因此它们现在在本地硬件上既实用又快速。稠密模型最终也可能达到这个水平。

稠密 LLM vs MoE 模型 稠密 LLM vs MoE 模型

推测解码

任何具有 MTP、DSpark 或 DFlash 功能的 LLM 都会更适合,因为草稿模型通常很小,不需要太多计算就能生成正确的 token。它以 1 到 2 GB 内存的代价(Spark 内存充足)显著提高了 Spark 的吞吐量。与 MoE 类似,推测解码在所有场景下都有帮助,不仅仅是家庭环境。但它们结合在一起,正是推动本地 AI 跨越那个阈值的力量。过去最好的开源模型在家庭硬件上运行起来痛苦地缓慢。

推测解码如何提升吞吐量 推测解码如何提升吞吐量

同时服务多个智能体 一台 Spark 可以同时服务八个或更多请求,每个请求仍保持对话速度。例如,具备基本编码、计算机和浏览器使用、视频和图像编辑以及通用支持能力的 Qwen3.6-35B,可以同时支持多达 8 个会话,每个会话速度约为 40 tok/s。作为参考,在 ChatGPT Pro 订阅中,GPT-6-Astra 的平均运行速度为 37 tok/s。

Astra 平均速度 Astra 平均速度

这之所以可行,是因为 Spark 相对其内存速度拥有大量算力。同时服务八个人仍然意味着每一步只需读取一次模型,但计算量是八倍,而 Spark 的算力绰绰有余。在 16 位精度下,它在 273 GB/s 的带宽下拥有约 100 TFLOPS,相当于每读取一字节内存执行约 370 次操作。M3 Ultra 在 819 GB/s 带宽下约有 26 TFLOPS,相当于每字节约 32 次操作(EXO 的数据)。这意味着 Spark 的每字节计算量多出约 11 倍,这还未计入 Spark 的 4 位硬件加速能力(Mac 没有此功能)。

实际应用

在单台 Spark 上运行的 Qwen3.6-35B 创作了一个视频,一天内获得了超过 8 万次观看。它只用了 3 分钟:取一个包含 3 个视频的文件夹,将它们拼接起来,并将视频速度加快 4 倍,同时保持帧率低于 X 平台的限制。

0xSero@0xSero·Jul 1这是我交给运行在 DGX Spark 上的 Qwen3.6-35B 的一项真实任务:取 3 个视频将它们拼接,并将第一个视频加速 4 倍。这是过去几个月我一直在用 LLM 做的事情,Qwen 表现得完美无瑕!它帮助本地工作室解决了你看到的对齐问题。181634789K

成本

DGX Spark 最初定价为 $3,999,后来涨到了 $4,699。2026 年所有硬件的价格都上涨了。

实际价格更高。 NVIDIA 官方商店已售罄。我能找到的最低价大约是 $5,000,二手设备售价约 $6,000,而在 9 月 21 日,我看到 NVIDIA 官网对我五周前花了 $4,699 购买的同款机器标价 $7,999。

GX10 定价 GX10 定价

NVIDIA 市场,9 月 21 日。 发布 4000$ - 4700% 4000$ - 4700%

购买建议

  • 任何 GB10 盒子都可以。 华硕、戴尔、微星等厂商都销售基于同一芯片的不同版本。它们运行相同的软件和相同的配置。请检查 SSD 容量:一旦您保留几个大模型,1 TB 会很快用完。我建议选择 4 TB。
  • 购买第二台 Spark 时同时购买线缆,您需要它将两台连接起来。
  • 一些 OEM 厂商提供散热设计更好的 Spark。

功耗、噪音与电费

独立 GPU 产生的噪音和热量不容小觑,4 块 3090 在提供仅五分之一内存容量的情况下,很容易达到 1600-2000W。我不得不将我的 RTX Pro 6000 塔式机搬出办公室,因为它经常将房间温度烘烤到 35°C。一个普通的美国家用电路可以安全地全天运行约 1,440 瓦(美国电气规范)。超过这个功率就需要新电路,这意味着需要请电工。

  • 一台 Spark 运行模型时功耗约 90-200 瓦(ServeTheHome)。如果全天候运行,每月电费约 $12。
  • 四台 Spark 总功耗约 500 瓦,加上一个交换机约 240 瓦。每月约 $66-100,并且它们都能接在一个插座上。
  • 我的四 GPU 服务器峰值功耗达 1,600 瓦。这超出了一个电路的处理能力,每月电费约 $300。

这些数字的来源。 每个数字代表不同类型的读数,因此将它们并列比较。月度成本假设机器以该功率全天候运行,电费按每千瓦时 18 美分计算:

我的测试 我的测试

为什么四台 Spark 的功耗超过 90W 的四倍。 90W 是指单台 Spark 运行模型时的功耗。当一个大模型分散到四台 Spark 上运行时,每台 Spark 都要处理每个词,并保持其网络链路繁忙,因此每台功耗都会增加,根据我的测量平均约为 125W。因此,$12 和 $66 的月费是全天候满负荷运行的费用。实际使用时,包含空闲时间,成本会更低。

电费也在上涨。美国家庭电价今年上涨了约 5%,达到约每千瓦时 18 美分,部分原因是大量新建的数据中心。八月份,我自己的电费翻了一倍,达到每月 $1,000,当时我的 GPU 服务器、两台 Spark 和四台空调都在运行。

DGX Spark 声音 DGX Spark 声音

噪音呢?我的 GPU 服务器听起来像喷气发动机。这是我的四台 Spark 从未超过的最嘈杂声音:

一些实用提示:

  • 用它们运行各种 AI 模型,包括世界模型、图像生成等。
  • 将它们侧放。 这样运行时温度更低,网状外壳周围有空间散热。
  • 加入 Discord/Reddit/X 社区寻求调试帮助。
  • 在您的设备群上部署 Tailscale。

我实际运行的六个模型

我尝试过几十个模型。这六个是我经常使用的。一个 token 大约相当于四分之三个单词,速度超过 30 tok/s 就像正常对话一样流畅。

为什么每个速度数字都标注了任务类型。 大多数配置都使用了推测解码,即一个小型助手模型预先猜测。代码和 JSON 容易猜测,散文则不然,因此同一模型在同一台机器上运行代码的速度可能是运行散文的两倍。较长的提示词也会减慢速度。因此,这里的每个速度都标明了当时正在生成的内容以及提示词的长度:

跨多种任务衡量此指标的合适方法是 NVIDIA 的 SPEED-Bench,它测试在来自 11 个类别、输入长度从 1K 到 32K token 的真实提示词上的推测解码性能。我还没在 Spark 上运行过它。

  • 单台 Spark: Qwen3.6-35B, Qwen3.8-Flash-Next, Qwen3.8-27B
  • 两台 Spark: GLM-5.3-Flash。
  • 四台 Spark: DeepSeek-V4.1-Flash。

两台 Spark 上的 Qwen3.8-Flash-Next 制作动画和小游戏。(9月21日) 发布

从哪里获取它们。 每个模型都有一个官方页面,第 6 节为每个模型提供了经过测试的 Spark 配置:

  • Qwen3.6-35B,或 NVIDIA 的 4 位版本
  • Qwen3.8-27B
  • Qwen3.8-Flash-Next
  • GLM-5.3-Flash,或我的单 Spark 构建版本
  • DeepSeek-V4.1-Flash
  • GLM-5.3,或我的 3 位构建版本

模型是如何装下的

答案是量化。量化压缩模型的权重,并且是有损的:每个权重用更少的位数存储(例如 4 位而非 16 位),因此模型大小缩小到四分之一,但会丢失一些细节。目标是在压缩权重的同时,尽可能接近原始模型的行为。压缩得越多,质量下降越明显。

Turboderp 针对 Qwen3.8-27B 测量了这一点。每个点代表一个压缩版本。越靠左表示越小,越靠下表示越接近原始模型: Qwen3.6-35B-A3B 压缩版本在不同提供商下的平均 KL 散度与磁盘大小关系图。对数刻度。 图表:https://huggingface.co/turboderp/Qwen3.8-27B-exl3

Spark 上有两种重要格式:

  • NVFP4 是 NVIDIA 的 4 位格式,Spark 芯片可直接读取。Qwen3.6-35B 从 72 GB 缩小到 24 GB,可以在一台 Spark 上轻松装下。
  • EXL3 允许您精确选择使用多少位。GLM-5.3-Flash 使用 4 位时为 176 GB,可装入两台 Spark。使用 2 位时为 85 GB,可装入一台,尽管精度会略有下降。

提示: 4 位是较小模型的最佳选择,3 位适用于较大的模型。

如何判断压缩后的模型是否仍然良好。 好的模型卡片会报告压缩版本与原始版本的接近程度。两个需要关注的指标:

  • Top-1 一致率: 小模型选择与原始模型相同下一个词的频率。越高越好。我的单 Spark GLM-5.3-Flash 约有 80% 的一致率。
  • KL 散度: 其猜测偏离原始模型的程度。越低越好。我的未剪枝 3 位 GLM-5.3 得分为 0.089。剪枝后 197 GB 版本得分为 0.511。这就是装入更少 Spark 的代价。

6. 从单台 Spark 到四台:分步路径

这是被问及最多的部分。请一步一步来。每一步都可以独立运行,因此在您满意的地方停下即可。下面的大多数配置来自 MiaAI Lab,他们将最佳 Spark 设置打包成仓库,您可以用一个脚本克隆并启动。少数是我的。每个配置都列出了测试环境和运行速度。

请对每台 Spark 执行一次以下操作:

  • 更新它。 在 DGX 控制面板中运行更新,然后重启。
  • 从您的笔记本电脑访问它。 使用 NVIDIA Sync 或普通 SSH。要从家庭外部访问,NVIDIA 提供了 Tailscale 部署指南。
  • 创建 Hugging Face 账号和令牌。 大多数配置用它下载模型。将其放入 .env 文件中,切勿放入仓库。
  • 检查磁盘空间。 模型很大。一个单 Spark 配置大约需要 25 到 130 GB 的空闲空间。四 Spark 的 DeepSeek 配置需要在第一台 Spark 上有约 476 GB。
  • Docker 已经就绪。 DGX OS 自带 Docker,几乎每个配置都在其中运行,因此您无需手动安装 Python 包。

第 1 步:单台 Spark

从 LM Studio 开始。 按照 NVIDIA 的分步指南,下载 Qwen3.6-35B,然后开始聊天。大约需要一个小时。这能让您确认盒子在接触更复杂内容前能正常工作。

然后转到使用配置。 配置使用 vLLM 或 SGLang,它们比 LM Studio 更快,并且可以同时服务多个智能体。选择一个:

  • Qwen3.6-35B (4位 NVFP4) MiaAI Lab 单用户 95 tok/s,8 用户总计 317 tok/s ~50 GB
  • Qwen3.8-27B (4位 NVFP4) MiaAI Lab 代码任务约 51 tok/s(使用 DSpark 助手),聊天约 23 tok/s ~24 GB
  • Qwen3.8-Flash-Next (4位 NVFP4) MiaAI Lab 单用户 48.7 tok/s,8 用户总计 162.9 tok/s ~130 GB
  • GLM-5.3-Flash (2位 EXL3) 我的版本,或 Mia 配置的单 Spark 版本 10 到 25 tok/s,262K 上下文,支持视觉 ~85 GB

第一个最简单。只需三行命令:

git clone <仓库地址>
cd Unsloth-Qwen3.6-35b-NVFP4-DGX-Spark
./start.sh

运行起来后,您会在 Spark 上获得一个 OpenAI 风格的地址。将 Pi、opencode、Open WebUI 或您使用的任何工具指向该地址。

提示: 如果模型无法启动,几乎总是内存不足。请先关闭其他模型。一台 Spark 同时只能运行一个大模型。

第 2 步:两台 Spark

这是我最推荐的配置。正如我在八月所说:“拥有 2 台 DGX Spark,您就准备好了。”

两台 DGX Spark 两台 DGX Spark

线缆。 您需要一根短的 QSFP 线缆连接两台的 QSFP 端口。以下任何一种都可以(线缆指南):

  • NVIDIA 原厂: QSFP Cable 0.4 m for DGX Spark,$99.99。经常缺货。
  • NVIDIA 文档提及的型号: Amphenol NJAAKK-N911 或 Luxshare LMTQF022-SD-R,0.5 米,约 $159 到 $187。
  • 更便宜的 200G 选项: NVIDIA MCP1650-V00AE30,约 $84。

无论您购买哪种,链路都以 200 Gb/s 运行。不要使用 USB-C 或 10 GbE 端口进行此连接,它们太慢了。

设置链路。 按照 NVIDIA 的两台 Spark 连接指南操作。它会为每个端口分配地址并检查速度。然后从第一台 Spark(“主机”)设置到第二台(“从机”)的免密 SSH。每个两台 Spark 的配置都需要这个。

我建议让 Claude 或 GPT 为您设置这个,这样更容易。

选择一个配置:

  • Qwen3.8-Flash-Next (4位 NVFP4) MiaAI Lab 使用 MTP 单用户 52.1 tok/s,支持高达 1M 上下文
  • GLM-5.3-Flash (4位 EXL3) MiaAI Lab 单用户 62.9 tok/s,4 用户总计 146.5 tok/s,850K 上下文
  • DeepSeek-V4.1-Flash (2.9位 EXL3) MiaAI Lab 代码任务 38.8 到 43.0 tok/s,600K 上下文
  • GLM-5.3 (3位 EXL3,剪枝至 197 GB) 我的配置,适配性良好;速度尚未测量

大多数两台 Spark 的配置看起来相似:复制示例设置,填入两台 Spark 的地址,下载,启动。这是 GLM-5.3-Flash 的示例:

cp .env.example .env # 设置 HEAD_IP 和 WORKER_IP
./download.sh
./start.sh

请注意: 连接 Spark 是可行的,但这正是软件最不成熟的地方。请遵循经过测试的配置,并在第一次时预留一个下午的时间。

第 3 步:三台 Spark

三台 Spark 不需要交换机。每台 Spark 有两

相似文章

“全火花”集群:从16台升级到36台DGX Spark

Reddit r/LocalLLaMA

本文详细介绍了将个人家庭实验室从16台升级到36台NVIDIA DGX Spark设备,形成一个集群用于同时执行AI推理任务,如模型服务和媒体生成。选择它是因为其成本效益和数据主权。

DGX Spark 智能体使用数据

Reddit r/LocalLLaMA

一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。