@karminski3: 想买Mac运行大模型? 这是劝退贴 其实估算方法很简单, 现在买 MacStudio 哪怕运行 Qwen3.6-27B 4bit 量化版本, 然后开 DFlash 使用Qwen的内置投机解码, 也就飙到 65token/s. 而现在普遍大…
摘要
作者通过计算Mac Studio运行大模型的token成本和回本周期,得出结论:普通用户购买Mac自用大模型不划算,建议使用API或租卡更经济。
查看缓存全文
缓存时间: 2026/06/22 13:45
想买Mac运行大模型? 这是劝退贴
其实估算方法很简单, 现在买 MacStudio 哪怕运行 Qwen3.6-27B 4bit 量化版本, 然后开 DFlash 使用Qwen的内置投机解码, 也就飙到 65token/s. 而现在普遍大模型都能跑到 40 token/s.
如果专门买 MacStudio M3 Ultra 96G 运行大模型, 如果把设备售价 (32999) 换算成使用API, 以 GLM-5.2 为例, 每百万token 28块, 一台 MacStudio 的价格大概能买到 32999/28 = 1178M token.
而为了输出这些token, 买到的 MacStudio 运行 Qwen3.6-27B 要持续运行 209天. 也就是说回本周期至少是200天不间断运行. 然后运行模型才是纯赚.
这还是没算电费和不直接买API而是买套餐的情况.而且, 最重要的是这还是在运行一个只有27B的小模型.
如果真的买512G的 MacStudio (108749, 而且好像已经断货了), 然后运行量化版本的 GLM-5.2, 速度就会跌到只有 17 token/s, 回本周期大概在 7 年左右…
对于现在1.5个月模型就发新版本的情况下, 普通用户自用是绝对不划算的. 所以大部分用户买 coding plan 会更划算, 如果像我一样要测新模型, 直接租卡也会比直接买划算很多.
当然, 如果你本身就有Mac或者显卡, 那么空闲的时候(比如睡觉的时候)让它跑大模型运行任务, 反而是划算的.
#本地大模型 #mac #qwen36 #glm52
相似文章
@ai_xiaomu: macbook 16g 就能跑的满血多模态本地模型来了: 1. 下载LM studio; 2. 搜索gemma 4 12B 并下载安装; 3. 告诉codex帮你配置好本地api参数; 4. 接下体验token自由的感觉吧。
指导用户在MacBook 16GB上通过LM Studio和Codex运行Gemma 4 12B多模态本地模型,实现自由使用token。
@nicekate8888: 最近二十天我都在折腾一件事——怎么让 Qwen3.6-27B 在我的 Mac 上跑得又快又好。 一开始我用 Unsloth Q5,18 tok/s,风扇呼啦呼啦响。 后来换成 MLX 6bit + DFlash,提到 22 tok/s,还…
用户分享在Mac上通过不同量化方法(Unsloth Q5、MLX 6bit + DFlash、MTPLX 4bit)优化Qwen3.6-27B推理速度的经验,最终达到43 tok/s。
@sanbuphy: K2.6 成功在 Mac 本地下载并部署了 Qwen3.5-0.8B 模型,通过使用小众 Zig 语言实现并优化模型推理,证明了新模型的泛化能力。经过 4,000 多次工具调用,超过 12 小时的不间断运行,K2.6 模型共迭代了 14 …
K2.6在Mac本地成功部署Qwen3.5-0.8B模型,使用Zig语言实现推理优化,经过14轮迭代将吞吐量从约15 tokens/s提升至约193 tokens/s,比LM Studio快20%。
@berryxia: 我靠,这不直接抢了苹果的活儿啊! 6.6B的小模型直接把Siri和一堆云端巨头干到闭嘴,还只吃7GB内存就跑在Mac本地。 CJ Zafir他们搞的Mac-1,不光参数小到离谱,还一次性接了487个Mac原生工具,能链式调用、自动推理、连…
CJ Zafir团队推出了Mac-1,一个6.6B参数的小模型,可在Mac本地运行仅需7GB内存,能链式调用487个Mac原生工具,推理速度达65 tok/s,旨在颠覆云端大模型主导的Agent范式。
@jun_song: 最佳中端本地LLM硬件:DGX Spark 对比 Mac Studio M5 Max 128GB(即将推出)价格:4700美元(二手或OEM更便宜)…
DGX Spark与Mac Studio M5 Max在本地运行LLM的对比,重点比较了解码速度、预填充性能、内存、功耗和成本。Mac在解码带宽上胜出,但DGX在预填充方面更快并支持批处理。