@superalesha: 我在4张RTX 3090上把DeepSeek V4 Flash推理速度提升了29倍!!!不是开玩笑。15 → 443 t/s。一个23K的提示原本需要25分钟……
摘要
一位用户通过优化llama.cpp,在4张RTX 3090 GPU上实现了DeepSeek V4 Flash推理速度29倍提升,将23K提示从25分钟缩短至53秒。
查看缓存全文
缓存时间: 2026/07/10 06:10
我在4块3090上将deepseek v4 flash加速了29倍!!! 这不是开玩笑。 从15到443 t/s。之前一个23k的提示需要25分钟。现在只需53秒。284b 2bit量化,87gb,勉强塞进96gb。 我和Fable 5花了4天在llama.cpp上。修复了所有损坏的问题 https://t.co/i4PEerevOo
相似文章
DeepSeek V4 Flash(98GB)在单块4060 Ti加CPU上本周速度提升300% [从2t/s到7t/s]
DeepSeek V4 Flash(98GB)现在通过CPU卸载,在单块RTX 4060 Ti上运行速度可达每秒7个token,相比上周的2t/s提升了3倍。
Deepseek V4 Flash 在两块 Nvidia 4090d 48G (ada) 上以 vLLM 运行,速度约 105 t/s
技术文章:详细介绍如何使用自定义Triton内核和vLLM在两块Nvidia 4090d GPU上运行DeepSeek V4 Flash,在262k上下文环境下实现约105 tokens/秒的推理速度。
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
Deepseek v4 flash - prefill/pp中每秒处理速度提升100-150 t/s
这篇文章分享了提升DeepSeek v4 Flash预填充/PP速度的修复方法:将CUDA从13.3降级到13.1,或使用自定义fork,最高可实现1.3K的提示处理token/秒。
最终优化:在1块RTX 3090上,DeepSeek-V4-Flash-0731在128K上下文下从约10 tok/s提升至约15 tok/s
详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。