@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……

X AI KOLs Following 模型

摘要

DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。

延迟了,但来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在一台 128 GB 机器上运行。Config-I 混合量化:2 位专家,WHT 旋转 3 位注意力,路由保持全精度。Wikitext PPL 15.6。 模型:https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF… 操作指南,包括会坑你的后端陷阱:https://github.com/TheTom/offlabel/blob/main/models/deepseek-v4-flash-0731.md… 感谢 Starlink 花了 3 天才上传完!
查看原文
查看缓存全文

缓存时间: 2026/08/03 19:50

延迟了,但还是来了。DeepSeek-V4-Flash-0731 的 GGUF 版本,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行。Config-I 混合量化:2 比特专家,WHT 旋转 3 比特注意力,路由保持全精度。Wikitext PPL 15.6。

模型:https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF…

操作指南,包括那些会坑你的后端陷阱:https://github.com/TheTom/offlabel/blob/main/models/deepseek-v4-flash-0731.md…

感谢 Starlink 花了 3 天才上传完!


thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF · Hugging Face

来源:https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF

DeepSeek-V4-Flash — Config-I(GGUF)

95 GiB 内装下 284B 参数 MoE(21B 激活)— 可在 128 GB 统一内存机型(DGX Spark、Mac)上运行。 Config-I 混合量化,实际 2.88 bpw

Config-I 量化基于 deepseek-ai/DeepSeek-V4-Flash-0731 (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) — 官方 2026-07-31 发布版,取代预览版 —(43 层,256 个路由专家 top-6,哈希路由,MLA 注意力,mHC 超连接,DSA 索引器)。配套发布:适用于 Apple Silicon 的 Config-I MLX (https://huggingface.co/thetom-ai/DeepSeek-V4-Flash-ConfigI-MLX)。

📖 如何真正把它跑好: offlabel 操作指南 (https://github.com/TheTom/offlabel/blob/main/models/deepseek-v4-flash-0731.md) 在一个地方涵盖了后端陷阱、采样、重复循环修复以及 DwarfStar 速度对比。

⚠️ 运行时要求

此 GGUF 使用 TurboQuant 权重类型(TQ3_1S),需要 TurboQuant llama.cpp 分支 (https://github.com/TheTom/llama-cpp-turboquant)(deepseek4-merge 分支或更高版本)。原版 llama.cpp 无法加载它。

Metal(Mac)用户: 在环境中使用 TQ_NO_ROTATE=1 运行。当前融合的 rotate-act Metal 内核在此架构上会产生错误的批量 prefill 结果(decode 不受影响);该环境变量会走安全的反量化路径,代价是 prefill 速度略有降低。

CUDA 用户: 请使用 deepseek4-merge 分支顶端或之后的分支版本 — 早期分支构建会通过融合内核路由 TQ3_1S,在此架构上产生错误输出(已通过改为经过验证的反量化路径修复;会损失一些 decode 速度,但正确性优先)。

量化方案

张量组类型bpw
专家 gate/up(所有层)Q2_02.25
专家 down、注意力、索引器、压缩器TQ3_1S(WHT 旋转)4.0
Token 嵌入q8_08.5
输出头q6_K6.6
路由门控、mHC 混合、APE、归一化层、sinksf32/bf16

压缩

类型大小
FP8/FP4 源167 GB
BF16 等效~570 GB
Config-I 混合(2.88 bpw)95 GiB(102 GB),3 个分片文件 ≤45 GB

质量

  • Wikitext PPL:15.64 ± 0.38(上下文 512,60 个分块)· 12.86 ± 0.29(上下文 2048,15 个分块)— 在 CUDA(GB10)上测得
  • 在 CUDA、CPU 和 Metal 上验证了连贯的贪婪生成。

2.88 bpw 下观察到的行为(如实说明,在重度 I/O 争用下测得 — 安静环境下的重新运行待进行):

  • 请使用官方采样设置:temperature 1.0、top_p 0.95(DeepSeek 的模型卡)。贪婪解码(temp 0)会在此模型系列上引发重复循环,因此不具备代表性。
  • </think> 之后的内容流可能会退化为重复,而正确答案完整保留在推理块中 — 在启用推理的服务中请解析 reasoning_content(在贪婪解码下观察到;官方采样可缓解)。
  • 仅在贪婪解码下观察到硬符号数学上的重复 — 正在使用官方采样设置重新评估。
  • 更广泛的 MMLU/NIAH 数字将在安静环境运行完成后公布在此处。

示例

TQ_NO_ROTATE=1 ./build/bin/llama-cli -m DeepSeek-V4-Flash-0731-ConfigI-00001-of-00003.gguf \
  -ngl 99 -c 8192 --temp 1.0 --top-p 0.95 -p "your prompt" -st < /dev/null

许可证

继承基础模型的 DeepSeek 模型许可证。量化由 thetom-ai (https://huggingface.co/thetom-ai) 完成。

相似文章

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。

DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上

Reddit r/LocalLLaMA

展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。

Deepseek V4 Flash 2位、3位和4位 GGUFs

Reddit r/LocalLLaMA

DeepSeek V4 Flash 的 2位、3位和4位精度 GGUF 量化版本,已在 Hugging Face 上发布,可用于 llama.cpp 和 Ollama 等工具的本地推理。

antirez/deepseek-v4-gguf

Hugging Face Models Trending

Antirez发布了专门为DS4推理引擎优化的DeepSeek V4 Flash GGUF量化版本,针对不同内存大小提供了优化配置,使得这个大型MoE模型可以在本地运行。