Home
/
Models
/
Deepseek V4 Flash 2-bit quant is the first model I can run locally that achieves 100% in this SQL benchmark
Deepseek V4 Flash 2-bit quant is the first model I can run locally that achieves 100% in this SQL benchmark
Summary
A user reports that DeepSeek V4 Flash, running as a 2-bit quantized GGUF on dual RTX 3080s, is the first local model to score 100% on a real-world SQL benchmark, matching frontier models like Opus 4.7 and GPT-5.5.
I really like to use this one SQL benchmark when testing new models. I had another post some time ago with my benchmarks, but I decided to post a new one because of how well Deepseek did. I like the benchmark because it's quick to run, is pretty "real-world" and requires good reasoning to build the correct SQL queries and almost no frontier models can achieve 100%. My old post: https://www.reddit.com/r/LocalLLaMA/comments/1s9mkm1/benchmarked_18_models_that_i_can_run_on_my_rtx/ Benchmark with results from other models: https://sql-benchmark.nicklothian.com https://github.com/nlothian/llm-sql-benchmark My setup is dual 3080 20GB GPUs with 96GB RAM and 9800X3D. I managed to run Deepseek V4 Flash with a custom IQ2_M GGUF with some tensors grafted from antirez GGUF and running it on a modified ds4 engine from antirez, getting 300pp and 11-12tg. Mainline llama.cpp gives me only 100pp and 8tg or something like that. To my surprise, Deepseek is the first local model I can realistically run locally that actually did ALL tests correctly. The only models according to the benchmark website that could do this were Opus 4.7 and GPT-5.5. Results together with all my old benches: 25: Deepseek-v4-Flash-IQ2_M-grafted π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© 24: unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© 24: unsloth/Qwen3.5-122B-A10B-GGUF:UD-Q4_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π©π©π©π©π© 23: unsloth/Qwen3.5-122B-A10B-GGUF:Q6_K π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π₯π©π©π©π© 23: unsloth/Qwen3.5-27B-MTP-GGUF:UD-Q6_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π₯π©π©π©π© 23: DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:Q4_K_M π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π©π©π©π₯π© π©π©π©π©π© 23: unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q8_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π©π©π©π₯π© π©π©π©π©π© 23: bartowski/Qwen_Qwen3.5-27B-GGUF:IQ4_XS π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π₯π©π©π©π© 23: bartowski/Qwen_Qwen3.5-27B-GGUF:IQ3_XS π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π₯π©π©π©π© 23: unsloth/Qwen3.5-122B-A10B-GGUF:UD-IQ3_XXS π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π₯π©π©π©π© 23: h34v7/Jackrong-Qwopus3.5-27B-v3-GGUF:Q3_K_M π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π₯π©π©π©π© 22: unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q6_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π©π©π©π₯π© π₯π©π©π©π© 22: mradermacher/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-i1-GGUF:Q3_K_M π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π₯π©π₯π© π₯π©π©π©π© 22: Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF:Q4_K_M π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π₯π₯π© π₯π©π©π©π© 21: unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q6_K_XL π©π©π©π©π© π©π©π©π©π© π©π₯π©π©π© π©π©π©π₯π© π©π¨π₯π©π© 21: unsloth/MiniMax-M2.7-GGUF:UD-IQ3_XXS π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π₯π₯π₯π©π© 21: unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-Q4_K_S π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π¨π₯ π₯π¨π©π©π© 20: unsloth/Qwen3-Coder-Next-GGUF:UD-Q5_K_XL π©π©π©π©π¨ π©π©π©π©π© π©π©π¨π©π© π©π©π©π₯π¨ π₯π©π©π©π© 20: unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL π©π©π©π©π© π©π©π©π©π© π₯π©π©π©π© π¨π©π©π₯π© π₯π©π©π₯π© 20: unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q6_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π©π©π©π₯π© π₯π₯π₯π©π© 20: bartowski/Qwen_Qwen3.5-397B-A17B-GGUF:IQ1_M π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π©π©π©π₯π© π₯π¨π₯π©π© 20: unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q6_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π₯ π¨π₯π©π₯π© 20: mradermacher/Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-i1-GGUF:Q6_K π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π₯π©π©π₯π© π₯π₯π©π©π© 19: unsloth/gemma-4-31B-it-GGUF:Q4_K_M π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π¨π©π©π¨π© π₯π₯π©π₯π© 19: unsloth/gemma-4-E4B-it-GGUF:UD-Q8_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π©π₯π© π©π©π©π₯π© π₯π₯π₯π₯π© 19: Goldkoron/Qwen3.5-397B-A17B-REAP35:IQ2_XS_Gv2 π©π©π©π©π© π©π©π©π©π© π₯π©π©π©π© π©π©π©π₯π© π₯π©π₯π₯π₯ 19: unsloth/GLM-4.7-Flash-GGUF:UD-Q6_K_XL π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π©π©π©π₯π¨ π₯π¨π©π₯π© 18: unsloth/GLM-4.5-Air-GGUF:Q5_K_M π©π©π©π©π© π©π©π©π©π© π©π©π₯π©π© π₯π©π©π₯π© π¨π¨π₯π©π¨ 18: bartowski/nvidia_Nemotron-Cascade-2-30B-A3B-GGUF:Q6_K_L π©π©π©π©π© π©π©π©π©π© π©π©π¨π©π© π©π©π©π₯π© π¨π¨π₯π¨π¨ 17: Jackrong/Qwopus3.5-9B-v3-GGUF:Q8_0 π©π©π©π©π© π©π©π©π©π© π©π₯π₯π©π© π₯π©π₯π₯π₯ π₯π©π©π©π¨ 16: unsloth/Qwen3-Coder-Next-GGUF:UD-Q4_K_XL π©π©π©π©π¨ π©π©π©π©π© π©π©π¨π©π© π₯π¨π©π₯π¨ π₯π¨π©π¨π© 16: byteshape/Devstral-Small-2-24B-Instruct-2512-GGUF:IQ3_S π©π©π©π©π© π©π©π©π©π© π₯π©π¨π©π© π©π©π¨π₯π¨ π¨π¨π₯π¨π© 16: mradermacher/Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-i1-GGUF:Q6_K π©π©π©π©π© π©π©π©π©π© π©π©π¨π₯π© π₯π©π₯π₯π¨ π₯π©π₯π©π¨ 14: mradermacher/Qwen3.5-9B-Claude-4.6-HighIQ-INSTRUCT-i1-GGUF:Q6_K π©π©π©π©π© π©π©π©π©π© π₯π©π₯π©π© π©π¨π₯π₯π¨ π¨π¨π₯π¨π¨ 14: unsloth/GLM-4.6V-GGUF:Q3_K_S π©π©π©π©π© π©π©π©π©π© π₯π©π¨π¨π© π₯π©π©π¨π¨ π¨π¨π¨π¨π¨ 5: bartowski/Tesslate_OmniCoder-9B-GGUF:Q6_K_L π¨π¨π¨π¨π¨ π¨π¨π¨π©π© π©π¨π¨π©π¨ π¨π¨π©π¨π¨ π¨π¨π¨π¨π¨ 5: unsloth/Qwen3.5-9B-GGUF:UD-Q6_K_XL π¨π¨π¨π¨π¨ π¨π¨π¨π©π© π¨π©π¨π¨π© π¨π©π¨π¨π¨ π¨π¨π¨π¨π¨ Note: unsloth/Qwen3.5-122B-A10B-GGUF:UD-Q4_K_XL is most likely a fluke. Q6_K doesn't achieve 24/25, it's just lucky rounding for this Q4 quant I suppose.
0
Like
0
Add to favorites
Similar Articles
Reddit r/LocalLLaMA
A community build crushes DeepSeek-V4-Flash down to a 54GB IQ2_XXS GGUF variant with aggressive 2-bit quantization, achieving ~20.5 tokens/s on local hardware while drastically reducing memory footprint.
Reddit r/LocalLLaMA
A developer successfully runs DeepSeek-V4-Flash (284B total, 13B active) locally on four RTX 2080 Ti GPUs with a $2,500 budget, achieving 255 prefill tokens/s using custom Turing CUDA kernels, W8A8 quantization, and heterogeneous inference. The implementation is open-sourced.
X AI KOLs Following
DeepSeek V4 Flash GGUF quantizations have been released by antirez, enabling the model to run on single GPUs like the RTX Pro 6000 and Macs with 128GB+ RAM. The quantized files are available on Hugging Face with instructions for the DS4 inference engine.
Reddit r/LocalLLaMA
DeepSeek's new V4-Flash model scores 50 on the ArtificalAnalysis Index, trailing GLM-5.2 and GPT-5.6 Luna by just 1 point.
Reddit r/LocalLLaMA
DeepSeek V4 Flash shows significant benchmark gains in preview updates, trading blows with GPT-5.6 Terra on agentic coding tasks.