可在双DGX Spark上运行的新一波迷你大模型

Reddit r/LocalLLaMA 新闻

摘要

新一波大型语言模型,包括GLM 4.5、Qwen 3.5、MiniMax M2.7、Deepseek V4 Flash、Xiaomi MiMo 2.5、StepFun 3.7 Flash和Tencent Hy3,现在可以在双DGX Spark配置上本地运行,拥有250GB可用内存(4位量化),成本约7,000–8,000美元。

两块DGX Spark加上一根Connect-X7电缆,你可以获得约250GB的可用内存,花费7000到8000美元。这可以在4位量化下运行一些有趣的模型。在很长一段时间里,这个规模唯一值得关注的模型只有GLM 4.5/4.6/4.7(194GB)、Qwen 3.5 397B(210GB)和较老的MiniMax。接着3个月前,我们有了MiniMax M2.7(131GB)、Deepseek V4 Flash(160GB)和Xiaomi MiMo 2.5(181GB)。不久之后又有了StepFun 3.7 Flash(129GB),而现在刚有了腾讯的Hy3(182GB)。我知道这个内存规模对这里很多人来说难以企及,但7k到8k对我来说似乎合理可接受,能够运行这种能力级别的模型。你用过它们了吗?最喜欢哪个?[附注:请勿看了这篇文章就跑去花7千美元,先花7美元在OpenRouter上试试这些模型。]
查看原文

相似文章

DGX Sparks与新模型:我的测试与结果

Reddit r/LocalLLaMA

本文介绍了在NVIDIA DGX Sparks硬件上测试DeepSeek V4 Flash和Qwen3.8等AI模型的结果,详细说明了性能指标、上下文长度、基准分数以及操作见解。

Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。

Reddit r/LocalLLaMA

Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。