DeepSeek-V4-Flash (MXFP4): 仅通过KV缓存量化类型(f16与q8_0)变化,计算缓冲区规模约扩大3倍——还有其他人在 llama.cpp 上看到这种情况吗?
摘要
一位用户报告称,在DeepSeek-V4-Flash (MXFP4)中将KV缓存量化类型从f16改为q8_0,导致计算缓冲区规模大约扩大了3倍,询问其他人是否在使用 llama.cpp 时也观察到了这一现象。
相似文章
我将量化KV缓存的修复合并到我的DeepSeek V4分支中
将量化KV缓存的修复合并到llama.cpp的DeepSeek V4分支中,并提供了f16、q8_0和q4_0缓存类型的基准困惑度结果。
切勿对 DeepSeek V4 Flash 的 KV 缓存进行量化
一篇技术文章警告不要对 DeepSeek V4 Flash 的 KV 缓存进行量化,与 Qwen 397B 相比,其在困惑度、KL 散度和 token 概率方面表现出显著的质量下降。
[llama.cpp] 非对称 KV q8/q4 缓存:当前注意事项及 GGML 仓库中的讨论
讨论了在 llama.cpp 中使用非对称 KV 缓存量化时的注意事项,其中不匹配的 q8/q4 类型会导致提示处理在 CPU 而非 GPU 上进行,并提出了通过编译标志进行修复的方案。
DeepSeek V4 Flash on a Single AMD MI300X
This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.
DeepSeek V4 @ IQ3XXS 在 M1 Ultra 128GB 上的 LM Studio 中经补丁后可达 16 tok/s
一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。