DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps

Reddit r/LocalLLaMA 新闻

摘要

一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。

目前我正在用这个子版块里流传的流式专家技巧以及我自己的一些小技巧做实验,让prefill跑得更快一点。到目前为止还挺好玩的——光是让一个300B模型在Air上跑起来这件事本身,就既荒诞又让人满足。仓库还没整理到能分享的程度——离一键部署还差得远。我尤其不太想分享,因为我朴素的流式专家实现会在每轮对话之间产生约30秒的开销,然后才开始实际的KV cache生成。现在好多了——我上次测大概约3秒。另外,这期间我还发现了一个有趣的点:你其实可以在prefill阶段运行比默认更少的专家,KV cache依然完全可用。保守一点跑的话,每个位置top logits有超过95%的一致性。更激进地跑会失去这一点,但似乎也不总是灾难性的,比如大海捞针(needle in haystack)的性能仍然可以保持。
查看原文

相似文章

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。