你可以在 Mac (M3 Max, 96GB) 上运行 Deepseek 4 flash

Reddit r/LocalLLaMA 模型

摘要

介绍如何在配备 96GB 内存的 Mac M3 Max 上,使用 Antirez 的 ds4 引擎和 SSD 流式传输运行 DeepSeek 4 flash,实现约每秒 12 token 的推理速度。

我直到今天才知道这居然可行。使用 [https://github.com/antirez/ds4#running-models-larger-than-ram](https://github.com/antirez/ds4#running-models-larger-than-ram) Antirez 的专用引擎加上他特定的 ds4 gguf,它就能直接运行。你需要在运行时传递 `--ssd-streaming` 参数,如果你的内存小于 128GB(我认为 64GB 以上也合理)。我还传递了:`iogpu.wired_limit_mb=86016` 来提升可用的 Metal 分配量。然后你可以修补仓库本身,将缓存安全值设为 `.70`(可选),尝试将更多专家加载到显存中。另外,我还构建了一个简单的菜单栏 `.app` 守护程序,这样我只需通过 Spotlight 搜索就能启动服务器。仅花了大约 20 分钟。 0614 15:50:38 ds4-server: chat ctx=140..190:50 gen=50 decoding chunk=11.72 t/s avg=11.72 t/s 4.268s 0614 15:50:42 ds4-server: chat ctx=190..240:50 gen=100 decoding chunk=13.31 t/s avg=12.46 t/s 8.025s 0614 15:50:46 ds4-server: chat ctx=240..290:50 gen=150 decoding chunk=12.88 t/s avg=12.60 t/s 11.907s 0614 15:50:46 ds4-server: chat ctx=290..300:10 gen=160 decoding chunk=13.53 t/s avg=12.65 t/s 12.647s **预填充/时间:** 在我的 M3 Max 96GB 上大约 **11-13tk/s**。冷启动时,在一个空的 Jan 助手聊天中大约需要 10 秒。之后首 Token 延迟约 **3-5 秒**。遗憾的是,较大的预填充很烦人,所以我不确定是否要用它来大量编码。36k 个 token 大约需要 2 分 30 秒。但一旦进入缓存,它能维持大约 12tk/s 的速度。 ------ 总之,也许这是常识,但我之前认为这不可能……它的速度并不比 qwen 27b 慢多少。不确定它与 qwen 27b 的基准测试对比如何,但显然它要大得多。
查看原文

相似文章

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。