搭建16xGB10(DGX Spark)集群
摘要
用户正在搭建一个16节点的DGX Spark集群,以便本地运行前沿开放模型,并讨论200与100 Gbit/s之间的网络权衡。
准备这个是为了能够在本地运行前沿级别的开放模型。Deepseek v4 pro、Kimi K3,以及未来的像GLM 5.5和Minimax M4。16台Asus GX10通过mikrotik crs804-4ddq连接,使用4条400到100gbit的分支线缆。最有可能我会在8节点集群上分别运行2个模型,但我也希望需要时能够运行2T+的模型,以便在家跑AGI :))。https://x.com/i/status/2083568340870570208 附注:我需要一个更大的交换机。从200降到100gbit对token生成影响不大,只有2%的差异,但会把prefill速度减慢到-20%。
相似文章
DGX Spark 智能体使用数据
一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。
@onusoz: 16路并行 Gemma-4-26B-A4B-NVFP4 运行,每路18输出 token/s,合计300 tok/s 一台配备128GB统一内存的DGX Spark…
@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。
@Tech2Wild: 在家运行完整的GLM-5.2,744B参数,全部256个专家,未剪枝,跨4×NVIDIA DGX Spark (GB10)。200K上下文 · MTP …
一份详细的指南,介绍如何跨4个NVIDIA DGX Spark节点运行未剪枝的GLM-5.2模型(744B参数,256个专家),支持200K上下文,总吞吐量高达60.5 tok/s。包含性能基准测试、致谢和补丁。
GLM-5.2-Int4-Int8 在 8× GB10 上:约 1,200 t/s 预填充,33–54 t/s 平均解码
描述了在 8 节点 DGX Spark (GB10) 集群上使用定制 vLLM 分支部署和基准测试量化后的 GLM-5.2-Int4-Int8Mix 模型,实现了约 1,200 t/s 的预填充和约 35 t/s 的解码,支持 MTP 工具调用。
@MiaAI_lab: https://x.com/MiaAI_lab/status/2084629608062673379
为构建 DGX Spark 集群选择 MikroTik 交换机(CRS504、CRS804、CRS812)的实用指南,包含定价及 8 路 DGX Spark 配置的真实用户案例。