双 DGX Spark(华硕 GX10)MiniMax M2.7 实测
摘要
用户实测两台华硕 GX10(DGX Spark)运行 MiniMax-M2.7-AWQ-4bit,每块仅约 100 W,生成速度 30–40 tokens/s,彻底替代嘈杂的多 GPU 机架。
大家好,我原先用双 3090 加 8 张 MI50 32 GB,被噪音和发热折磨疯了。受 [这篇帖子](https://www.reddit.com/r/LocalLLaMA/comments/1sli7xr/2x_asus_ascent_gx10_minimax_m27_awq_cloud/) 和 NVIDIA 论坛讨论启发,我入手了两台华硕 GX10(DGX Spark),结果爽翻。每台推理功耗仅 100 W 左右,首 Token 时间确实长,但对我来说完全可接受。无需折腾,直接跑 [https://huggingface.co/cyankiwi/MiniMax-M2.7-AWQ-4bit/](https://huggingface.co/cyankiwi/MiniMax-M2.7-AWQ-4bit/),用开源代码加 Hermes Agent,零报错,一路丝滑,爱了!
下面是用 llama benchy 跑的详细数据(--depth 0 4096 8192 16384 32768 --latency-mode generation):
| test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|----------------:|----------------:|-------------:|------------------:|------------------:|------------------:|
| pp2048 | 3452.05 ± 73.32 | | 626.82 ± 19.83 | 511.74 ± 19.83 | 626.84 ± 19.83 |
| tg32 | 38.84 ± 0.01 | 40.09 ± 0.01 | | | |
| pp2048 @ d4096 | 2848.85 ± 35.82 | | 2022.61 ± 28.98 | 1907.54 ± 28.98 | 2022.65 ± 28.98 |
| tg32 @ d4096 | 37.37 ± 0.23 | 38.57 ± 0.24 | | | |
| pp2048 @ d8192 | 2579.85 ± 18.26 | | 3523.69 ± 61.33 | 3408.62 ± 61.33 | 3523.73 ± 61.33 |
| tg32 @ d8192 | 36.27 ± 0.14 | 37.44 ± 0.15 | | | |
| pp2048 @ d16384 | 2411.34 ± 7.68 | | 6791.62 ± 57.14 | 6676.55 ± 57.14 | 6791.66 ± 57.14 |
| tg32 @ d16384 | 34.12 ± 0.11 | 35.23 ± 0.12 | | | |
| pp2048 @ d32768 | 1988.05 ± 12.95 | | 15512.61 ± 147.98 | 15397.54 ± 147.98 | 15512.65 ± 147.98 |
| tg32 @ d32768 | 30.72 ± 0.08 | 31.00 ± 0.00 | | | |
| pp2048 @ d102400 | 1167.98 ± 9.19 | | 78208.55 ± 573.73 | 78118.97 ± 573.73 | 78208.59 ± 573.73 |
| tg32 @ d102400 | 21.63 ± 0.07 | 23.00 ± 0.00 | | | |
我已经考虑把 MI50 卖掉了 😉
编辑:补充 llama benchy 信息,并追加 100 k 深度测试。
相似文章
Deepseek V4 flash 在 DGX Spark 上的性能
一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。
1块RTX Pro 6000还是2台DGX Spark
针对AI计算任务,对单块RTX Pro 6000 GPU与两台DGX Spark系统进行比较。
@antirez: DS4 正在 DGX Spark (GB10 / CUDA) 上运行,目前为私有分支。12 tokens/sec,此系统的内存带宽受限……
Antirez 报告了在 DGX Spark (GB10) 上对 DS4 推理进行的基准测试,指出生成速度为 12 tokens/sec,预填充性能较高,并计划在该代码库成熟后将其合并。
@stevibe:MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:…
MiniMax M2.7 有 230B 参数,家里真能跑?我用 Unsloth 的 UD-IQ3_XXS(80 GB)在 4 套配置上实测:4×RTX 4090(96 GB):71.52 tok/s,首 token 延迟 1045 ms;4×RTX 5090(128 GB):120.54 tok/s,首 token 延迟 725 ms;1×RTX PRO 6000(96 GB):118.74 tok/s,首 token 延迟 765 ms;DGX
在一台 DGX Spark 上对 124B 模型进行了一周基准测试并全部公开——他找到的最快路径为 38.7 tok/s,比同机上的 DeepSeek V4 Flash 快 2.4 倍
sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。