DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s
摘要
一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。
以 DeepSeek-V4-Flash 的 REAP 改编版(0xSero/DeepSeek-V4-Flash-0731-REAP)以及 antirez/deepseek-v4-gguf 为灵感,决定看看我们能用标准量化技巧做到多激进,以打造一个经济实惠的“Mini”构建。当然,纯粹是为了好玩。从完整的 95GB bf16 GGUF 开始,将其压缩为采用混合量化(w2Q2K-AProjQ8-OutQ8)的 IQ2_XXS 变体。极端的 2 位量化对复杂推理是否实用?有争议。它是否削减了超过 40GB 的显存/内存占用,同时仍能生成连贯的内容?绝对可以。科学不在于为什么,而在于为什么不。
提示词评估时间 = 372.26 ms / 12 tokens(每个 token 31.02 ms,每秒 32.24 tokens)
评估时间 = 81141.35 ms / 1667 tokens(每个 token 48.68 ms,每秒 20.54 tokens)
总时间 = 81513.62 ms / 1679 tokens
图重用次数 = 1804
文件大小:
-rw-rw-r-- 1 jabbatheduck jabbatheduck 95G Aug 4 16:10 deepseek-v4-flash-bf16.gguf
-rw-rw-r-- 1 jabbatheduck jabbatheduck 54G Aug 4 17:41 DeepSeek-V4-Flash-REAP-IQ2XXS-w2Q2K-AProjQ8-OutQ8-chat-v2.gguf
-rw-rw-r-- 1 jabbatheduck jabbatheduck 353M Aug 4 16:37 DeepSeek-V4-Flash-REAP-IQ2XXS-w2Q2K-AProjQ8-OutQ8-chat-v2-imatrix-0731.gguf
相似文章
DeepSeek V4 Flash(98GB)在单块4060 Ti加CPU上本周速度提升300% [从2t/s到7t/s]
DeepSeek V4 Flash(98GB)现在通过CPU卸载,在单块RTX 4060 Ti上运行速度可达每秒7个token,相比上周的2t/s提升了3倍。
DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上
展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。
DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。
@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……
DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。
DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps
一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。