搭建16xGB10(DGX Spark)集群
摘要
用户正在搭建一个16节点的DGX Spark集群,以便本地运行前沿开放模型,并讨论200与100 Gbit/s之间的网络权衡。
准备这个是为了能够在本地运行前沿级别的开放模型。Deepseek v4 pro、Kimi K3,以及未来的像GLM 5.5和Minimax M4。16台Asus GX10通过mikrotik crs804-4ddq连接,使用4条400到100gbit的分支线缆。最有可能我会在8节点集群上分别运行2个模型,但我也希望需要时能够运行2T+的模型,以便在家跑AGI :))。https://x.com/i/status/2083568340870570208 附注:我需要一个更大的交换机。从200降到100gbit对token生成影响不大,只有2%的差异,但会把prefill速度减慢到-20%。
相似文章
“全火花”集群:从16台升级到36台DGX Spark
本文详细介绍了将个人家庭实验室从16台升级到36台NVIDIA DGX Spark设备,形成一个集群用于同时执行AI推理任务,如模型服务和媒体生成。选择它是因为其成本效益和数据主权。
DGX Spark 智能体使用数据
一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。
@onusoz: 16路并行 Gemma-4-26B-A4B-NVFP4 运行,每路18输出 token/s,合计300 tok/s 一台配备128GB统一内存的DGX Spark…
@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。
@Tech2Wild: 在家运行完整的GLM-5.2,744B参数,全部256个专家,未剪枝,跨4×NVIDIA DGX Spark (GB10)。200K上下文 · MTP …
一份详细的指南,介绍如何跨4个NVIDIA DGX Spark节点运行未剪枝的GLM-5.2模型(744B参数,256个专家),支持200K上下文,总吞吐量高达60.5 tok/s。包含性能基准测试、致谢和补丁。
来自@exolabs的帖子:https://x.com/exolabs/status/2103617535765573959
这篇文章是NVIDIA DGX Spark的手册,该设备专为本地AI推理设计,详细介绍了其规格、如何连接多台设备以提升性能,以及其针对运行混合专家模型的优化。