可在双DGX Spark上运行的新一波迷你大模型
摘要
新一波大型语言模型,包括GLM 4.5、Qwen 3.5、MiniMax M2.7、Deepseek V4 Flash、Xiaomi MiMo 2.5、StepFun 3.7 Flash和Tencent Hy3,现在可以在双DGX Spark配置上本地运行,拥有250GB可用内存(4位量化),成本约7,000–8,000美元。
两块DGX Spark加上一根Connect-X7电缆,你可以获得约250GB的可用内存,花费7000到8000美元。这可以在4位量化下运行一些有趣的模型。在很长一段时间里,这个规模唯一值得关注的模型只有GLM 4.5/4.6/4.7(194GB)、Qwen 3.5 397B(210GB)和较老的MiniMax。接着3个月前,我们有了MiniMax M2.7(131GB)、Deepseek V4 Flash(160GB)和Xiaomi MiMo 2.5(181GB)。不久之后又有了StepFun 3.7 Flash(129GB),而现在刚有了腾讯的Hy3(182GB)。我知道这个内存规模对这里很多人来说难以企及,但7k到8k对我来说似乎合理可接受,能够运行这种能力级别的模型。你用过它们了吗?最喜欢哪个?[附注:请勿看了这篇文章就跑去花7千美元,先花7美元在OpenRouter上试试这些模型。]
相似文章
@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…
一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。
DGX Sparks与新模型:我的测试与结果
本文介绍了在NVIDIA DGX Sparks硬件上测试DeepSeek V4 Flash和Qwen3.8等AI模型的结果,详细说明了性能指标、上下文长度、基准分数以及操作见解。
Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。
Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。
@DeRonin_: 我目前的本机AI配置:- 2x DGX Spark 链接 (256gb) > GLM 5.2 @ 2bit, 推理 + 代理循环 - Mac Studio M3 Ultr…
一位用户描述了他们完全本地的AI堆栈,使用多个硬件设备运行GLM、Qwen和Kimi等中国模型,声称相比GPT-5.5和Opus 4.8等前沿模型节省了87%的成本,同时提到了自托管视频生成的计划。
@TeksEdge:哇!全新开源计算机使用模型在单个 DGX Spark 上于 LLM 排行榜展现强劲本地性能!这…
H 公司发布了 Holo-3.1-35B-A3B-NVFP4,一款开源计算机使用模型,在单个 DGX Spark 节点上可实现每秒高达 195 个 token 的推理速度,性能超越 Qwen3.5-397B 和 Kimi-K2.5 等更大模型。