M5 Ultra 96GB 对比 M5 Max 128GB — 双倍带宽是否值得牺牲32GB RAM,何况Qwen3.8-Flash-Next明天即将发布?

Reddit r/LocalLLaMA 新闻

摘要

本文对比了Mac Studio M5 Ultra和M5 Max配置在运行AI模型时的取舍,聚焦于带宽、RAM与即将推出的Qwen3.8-Flash-Next模型之间的权衡,并探讨性能与量化问题。

我一周来反复纠结这个问题,无法做出决定,所以希望这里有人有实际使用数据。两种配置(德国价格,经销商报价,含增值税): - 配置 价格 - Mac Studio M5 Max,128GB / 512GB SSD €5,859 - Mac Studio M5 Max,128GB / 1TB SSD €6,189 - Mac Studio M5 Ultra,96GB / 1TB SSD €6,599 Ultra是36核CPU / 80核GPU / ~1.2 TB/s带宽。Max是18核CPU / 40核GPU / 614 GB/s带宽。所以Ultra大约贵740欧元,换来双倍带宽和双倍GPU核心——但少了32GB统一内存。这个系列中没有128GB的Ultra选项,这才是麻烦所在。 我实际运行的是:目前使用Q8量化版的Qwen3.8-27B模型。用例是偶尔聊天加几个并行运行的代理。本地运行的核心目的是隐私和避免被锁定在别人的模型策略里——我知道订阅服务每月22欧元能用更好的模型,但这不是我优化的方向。 阻碍我的因素:Qwen3.8-Flash-Next明天发布。如果泄露的描述属实,它是一个多模态MoE模型,总参数176B——125B主模型加上51B的N-gram嵌入表——每个令牌仅约6B参数活跃。我的内存估算: - IQ4_XS:约94GB权重,加上262k上下文后约107GB(混合注意力意味着KV缓存很小,约8-9GB fp16) - Q4_K_M:约107GB权重,完整上下文下约120-125GB - Q8:约187GB权重——在任何机器上都不可行 96GB统一内存在macOS上可能只提供约86GB有线内存。所以Ultra根本无法加载它,无论用哪种量化。128GB提供约115GB,可以容纳IQ4_XS完整上下文或Q4_K_M在64k上下文下。 所以权衡基本是: - Ultra → 27B Q8从约15 tok/s提升到约29 tok/s,预填充快很多,但Flash-Next完全无法运行。 - Max → Flash-Next可以运行,但6B活跃参数下每个令牌仅读取约3.7GB,所以614 GB/s带宽已能提供40-60 tok/s,Ultra的额外带宽对它几乎无用。 我卡住的地方/希望得到建议: 1. 在96GB Mac上,你实际能有多少有线内存?我一直假设通过iogpu.wired_limit_mb约86GB。如果有人安全运行更高,整个计算就改变了。 2. 多代理/批量推理。这是我无法排除Ultra的一个理由。多个代理并行时,计算受限而非带宽受限,80个GPU核心应有实际帮助。有人在MLX或llama.cpp中测量过Ultra与Max在并发请求下的表现吗?我找到的所有基准都是单流的。 3. 这种架构上的IQ4_XS量化能用吗?MoE对激进量化的容忍度比密集模型低(路由器精度很重要),而且从来没人量化过51B的N-gram哈希表。imatrix校准运行基本上不会触及大多数行。我宁愿听到“等待UD风格的混合量化”,也不愿亲身试错。 4. 是否有人觉得96GB是死区?对27B来说太多,对100B+ MoE类模型来说太少,而目前趋势都在向后者靠拢。或者我高估了一个未发布的模型?转售价值也在我考虑中——二手Mac Studio市场似乎由本地推理买家驱动,他们首先看RAM,我怀疑128GB在三年后比96GB保值更好。 做过这个选择的人:你选了什么,后悔吗?
查看原文

相似文章