DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps
摘要
一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。
目前我正在用这个子版块里流传的流式专家技巧以及我自己的一些小技巧做实验,让prefill跑得更快一点。到目前为止还挺好玩的——光是让一个300B模型在Air上跑起来这件事本身,就既荒诞又让人满足。仓库还没整理到能分享的程度——离一键部署还差得远。我尤其不太想分享,因为我朴素的流式专家实现会在每轮对话之间产生约30秒的开销,然后才开始实际的KV cache生成。现在好多了——我上次测大概约3秒。另外,这期间我还发现了一个有趣的点:你其实可以在prefill阶段运行比默认更少的专家,KV cache依然完全可用。保守一点跑的话,每个位置top logits有超过95%的一致性。更激进地跑会失去这一点,但似乎也不总是灾难性的,比如大海捞针(needle in haystack)的性能仍然可以保持。
相似文章
在 M3 Ultra 上原生支持 DSpark MTP 的 DeepSeek V4.1F Q4(40 t/s / 800 t/s)
作者针对 Apple M3 Ultra 优化了 DeepSeek V4.1 Flash,使用 DSpark 推测解码实现了高达 40 t/s 的解码速度,同时保持了与上游模型字节级一致的准确性。
DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s
一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。
你可以在 Mac (M3 Max, 96GB) 上运行 Deepseek 4 flash
介绍如何在配备 96GB 内存的 Mac M3 Max 上,使用 Antirez 的 ds4 引擎和 SSD 流式传输运行 DeepSeek 4 flash,实现约每秒 12 token 的推理速度。
DeepSeek V4 @ IQ3XXS 在 M1 Ultra 128GB 上的 LM Studio 中经补丁后可达 16 tok/s
一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。
@antirez: 我没想到 DeepSeek v4 PRO(非 Flash 版本)能在配备 512GB 内存的 Mac Studio M3 Ultra 上流畅运行。这是 2 位量化的……
Antirez 报告称,DeepSeek v4 PRO 在配备 512GB 内存的 Mac Studio M3 Ultra 上使用 2 位量化运行良好,预填充速度达到 130 t/s,生成速度达到 13 t/s。