DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA 模型

摘要

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。

以 DeepSeek-V4-Flash 的 REAP 改编版(0xSero/DeepSeek-V4-Flash-0731-REAP)以及 antirez/deepseek-v4-gguf 为灵感,决定看看我们能用标准量化技巧做到多激进,以打造一个经济实惠的“Mini”构建。当然,纯粹是为了好玩。从完整的 95GB bf16 GGUF 开始,将其压缩为采用混合量化(w2Q2K-AProjQ8-OutQ8)的 IQ2_XXS 变体。极端的 2 位量化对复杂推理是否实用?有争议。它是否削减了超过 40GB 的显存/内存占用,同时仍能生成连贯的内容?绝对可以。科学不在于为什么,而在于为什么不。 提示词评估时间 = 372.26 ms / 12 tokens(每个 token 31.02 ms,每秒 32.24 tokens) 评估时间 = 81141.35 ms / 1667 tokens(每个 token 48.68 ms,每秒 20.54 tokens) 总时间 = 81513.62 ms / 1679 tokens 图重用次数 = 1804 文件大小: -rw-rw-r-- 1 jabbatheduck jabbatheduck 95G Aug 4 16:10 deepseek-v4-flash-bf16.gguf -rw-rw-r-- 1 jabbatheduck jabbatheduck 54G Aug 4 17:41 DeepSeek-V4-Flash-REAP-IQ2XXS-w2Q2K-AProjQ8-OutQ8-chat-v2.gguf -rw-rw-r-- 1 jabbatheduck jabbatheduck 353M Aug 4 16:37 DeepSeek-V4-Flash-REAP-IQ2XXS-w2Q2K-AProjQ8-OutQ8-chat-v2-imatrix-0731.gguf
查看原文

相似文章

DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上

Reddit r/LocalLLaMA

展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。