@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……
摘要
DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。
查看缓存全文
缓存时间: 2026/08/03 19:50
延迟了,但还是来了。DeepSeek-V4-Flash-0731 的 GGUF 版本,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行。Config-I 混合量化:2 比特专家,WHT 旋转 3 比特注意力,路由保持全精度。Wikitext PPL 15.6。
模型:https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF…
操作指南,包括那些会坑你的后端陷阱:https://github.com/TheTom/offlabel/blob/main/models/deepseek-v4-flash-0731.md…
感谢 Starlink 花了 3 天才上传完!
thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF · Hugging Face
来源:https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF
DeepSeek-V4-Flash — Config-I(GGUF)
95 GiB 内装下 284B 参数 MoE(21B 激活)— 可在 128 GB 统一内存机型(DGX Spark、Mac)上运行。 Config-I 混合量化,实际 2.88 bpw。
Config-I 量化基于 deepseek-ai/DeepSeek-V4-Flash-0731 (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) — 官方 2026-07-31 发布版,取代预览版 —(43 层,256 个路由专家 top-6,哈希路由,MLA 注意力,mHC 超连接,DSA 索引器)。配套发布:适用于 Apple Silicon 的 Config-I MLX (https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-MLX)。
📖 如何真正把它跑好: offlabel 操作指南 (https://github.com/TheTom/offlabel/blob/main/models/deepseek-v4-flash-0731.md) 在一个地方涵盖了后端陷阱、采样、重复循环修复以及 DwarfStar 速度对比。
⚠️ 运行时要求
此 GGUF 使用 TurboQuant 权重类型(TQ3_1S),需要 TurboQuant llama.cpp 分支 (https://github.com/TheTom/llama-cpp-turboquant)(deepseek4-merge 分支或更高版本)。原版 llama.cpp 无法加载它。
Metal(Mac)用户: 在环境中使用 TQ_NO_ROTATE=1 运行。当前融合的 rotate-act Metal 内核在此架构上会产生错误的批量 prefill 结果(decode 不受影响);该环境变量会走安全的反量化路径,代价是 prefill 速度略有降低。
CUDA 用户: 请使用 deepseek4-merge 分支顶端或之后的分支版本 — 早期分支构建会通过融合内核路由 TQ3_1S,在此架构上产生错误输出(已通过改为经过验证的反量化路径修复;会损失一些 decode 速度,但正确性优先)。
量化方案
| 张量组 | 类型 | bpw |
|---|---|---|
| 专家 gate/up(所有层) | Q2_0 | 2.25 |
| 专家 down、注意力、索引器、压缩器 | TQ3_1S(WHT 旋转) | 4.0 |
| Token 嵌入 | q8_0 | 8.5 |
| 输出头 | q6_K | 6.6 |
| 路由门控、mHC 混合、APE、归一化层、sinks | f32/bf16 | — |
压缩
| 类型 | 大小 |
|---|---|
| FP8/FP4 源 | 167 GB |
| BF16 等效 | ~570 GB |
| Config-I 混合(2.88 bpw) | 95 GiB(102 GB),3 个分片文件 ≤45 GB |
质量
- Wikitext PPL:15.64 ± 0.38(上下文 512,60 个分块)· 12.86 ± 0.29(上下文 2048,15 个分块)— 在 CUDA(GB10)上测得
- 在 CUDA、CPU 和 Metal 上验证了连贯的贪婪生成。
2.88 bpw 下观察到的行为(如实说明,在重度 I/O 争用下测得 — 安静环境下的重新运行待进行):
- 请使用官方采样设置:temperature 1.0、top_p 0.95(DeepSeek 的模型卡)。贪婪解码(temp 0)会在此模型系列上引发重复循环,因此不具备代表性。
</think>之后的内容流可能会退化为重复,而正确答案完整保留在推理块中 — 在启用推理的服务中请解析reasoning_content(在贪婪解码下观察到;官方采样可缓解)。- 仅在贪婪解码下观察到硬符号数学上的重复 — 正在使用官方采样设置重新评估。
- 更广泛的 MMLU/NIAH 数字将在安静环境运行完成后公布在此处。
示例
TQ_NO_ROTATE=1 ./build/bin/llama-cli -m DeepSeek-V4-Flash-0731-ConfigI-00001-of-00003.gguf \
-ngl 99 -c 8192 --temp 1.0 --top-p 0.95 -p "your prompt" -st < /dev/null
许可证
继承基础模型的 DeepSeek 模型许可证。量化由 thetom-ai (https://huggingface.co/thetom-ai) 完成。
相似文章
DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s
一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。
@no_stp_on_snek: https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-MLX… Fyi. Fits on 128GB of ram for metal. GGUF is coming jus…
TheTom releases an MLX quantized version of DeepSeek V4 Flash (284B MoE, 21B active) at 3.05 bpw, fitting in 101 GiB to run on 128GB Apple Silicon, with GGUF sibling also available.
DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上
展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。
Deepseek V4 Flash 2位、3位和4位 GGUFs
DeepSeek V4 Flash 的 2位、3位和4位精度 GGUF 量化版本,已在 Hugging Face 上发布,可用于 llama.cpp 和 Ollama 等工具的本地推理。
antirez/deepseek-v4-gguf
Antirez发布了专门为DS4推理引擎优化的DeepSeek V4 Flash GGUF量化版本,针对不同内存大小提供了优化配置,使得这个大型MoE模型可以在本地运行。