M5 Ultra 96GB 对比 M5 Max 128GB — 双倍带宽是否值得牺牲32GB RAM,何况Qwen3.8-Flash-Next明天即将发布?
摘要
本文对比了Mac Studio M5 Ultra和M5 Max配置在运行AI模型时的取舍,聚焦于带宽、RAM与即将推出的Qwen3.8-Flash-Next模型之间的权衡,并探讨性能与量化问题。
我一周来反复纠结这个问题,无法做出决定,所以希望这里有人有实际使用数据。两种配置(德国价格,经销商报价,含增值税):
- 配置 价格
- Mac Studio M5 Max,128GB / 512GB SSD €5,859
- Mac Studio M5 Max,128GB / 1TB SSD €6,189
- Mac Studio M5 Ultra,96GB / 1TB SSD €6,599
Ultra是36核CPU / 80核GPU / ~1.2 TB/s带宽。Max是18核CPU / 40核GPU / 614 GB/s带宽。所以Ultra大约贵740欧元,换来双倍带宽和双倍GPU核心——但少了32GB统一内存。这个系列中没有128GB的Ultra选项,这才是麻烦所在。
我实际运行的是:目前使用Q8量化版的Qwen3.8-27B模型。用例是偶尔聊天加几个并行运行的代理。本地运行的核心目的是隐私和避免被锁定在别人的模型策略里——我知道订阅服务每月22欧元能用更好的模型,但这不是我优化的方向。
阻碍我的因素:Qwen3.8-Flash-Next明天发布。如果泄露的描述属实,它是一个多模态MoE模型,总参数176B——125B主模型加上51B的N-gram嵌入表——每个令牌仅约6B参数活跃。我的内存估算:
- IQ4_XS:约94GB权重,加上262k上下文后约107GB(混合注意力意味着KV缓存很小,约8-9GB fp16)
- Q4_K_M:约107GB权重,完整上下文下约120-125GB
- Q8:约187GB权重——在任何机器上都不可行
96GB统一内存在macOS上可能只提供约86GB有线内存。所以Ultra根本无法加载它,无论用哪种量化。128GB提供约115GB,可以容纳IQ4_XS完整上下文或Q4_K_M在64k上下文下。
所以权衡基本是:
- Ultra → 27B Q8从约15 tok/s提升到约29 tok/s,预填充快很多,但Flash-Next完全无法运行。
- Max → Flash-Next可以运行,但6B活跃参数下每个令牌仅读取约3.7GB,所以614 GB/s带宽已能提供40-60 tok/s,Ultra的额外带宽对它几乎无用。
我卡住的地方/希望得到建议:
1. 在96GB Mac上,你实际能有多少有线内存?我一直假设通过iogpu.wired_limit_mb约86GB。如果有人安全运行更高,整个计算就改变了。
2. 多代理/批量推理。这是我无法排除Ultra的一个理由。多个代理并行时,计算受限而非带宽受限,80个GPU核心应有实际帮助。有人在MLX或llama.cpp中测量过Ultra与Max在并发请求下的表现吗?我找到的所有基准都是单流的。
3. 这种架构上的IQ4_XS量化能用吗?MoE对激进量化的容忍度比密集模型低(路由器精度很重要),而且从来没人量化过51B的N-gram哈希表。imatrix校准运行基本上不会触及大多数行。我宁愿听到“等待UD风格的混合量化”,也不愿亲身试错。
4. 是否有人觉得96GB是死区?对27B来说太多,对100B+ MoE类模型来说太少,而目前趋势都在向后者靠拢。或者我高估了一个未发布的模型?转售价值也在我考虑中——二手Mac Studio市场似乎由本地推理买家驱动,他们首先看RAM,我怀疑128GB在三年后比96GB保值更好。
做过这个选择的人:你选了什么,后悔吗?
相似文章
既然 Qwen 这么强了,是不是该入手 128 GB 的 M5 Max?
用户考虑升级到 128 GB M5 Max,以便本地运行性能逼近 Opus 4.5 的改进版 Qwen 27B 模型。
Apple 发布新款 Mac Studio,配备 M5 Max 和 M5 Ultra - 统一内存高达 512GB
Apple 发布了新款 Mac Studio,搭载 M5 Max 和 M5 Ultra 芯片,提供高达 4.3 倍更快的 AI 性能和 512GB 统一内存,适用于设备端 AI 和专业工作流程。
Qwen3.8-27B 与 Qwen3.8-Flash-Next 较小量化版本对比?
一位用户在128GB内存环境下比较Qwen3.8-27B和Qwen3.8-Flash-Next模型的智能与编程性能,寻求关于哪个更好的建议。
榨干64GB内存:Qwen3.5 122B A10B(UD-Q2_K_XL,启用MTP)已完全取代我原本的Qwen3 Next 80B(UD-Q4_K_XL)
一位用户比较了在64GB内存系统上运行量化版Qwen3 Next 80B和Qwen3.5 122B的情况,指出了本地LLM推理中速度、质量和内存使用之间的权衡。
@jun_song: 如果苹果很快推出 M5 Ultra Mac Studio,我会立即下单最大内存版本。毫不犹豫。M3 Ultra…
作者表示,如果苹果很快发布 M5 Ultra Mac Studio,他会立即订购最大内存版本,理由是 M3 Ultra 的高转售价值以及 M5 在推理性能上的巨大飞跃。