Deepseek v4 flash - prefill/pp中每秒处理速度提升100-150 t/s
摘要
这篇文章分享了提升DeepSeek v4 Flash预填充/PP速度的修复方法:将CUDA从13.3降级到13.1,或使用自定义fork,最高可实现1.3K的提示处理token/秒。
这里有两个选择(按优先顺序):
将CUDA从13.3降级到13.1(跳过13.2,因为有bug)<- 更推荐这个(感谢u/fairydreaming指出)
使用这个与CUDA 13.3兼容的vibed fork https://github.com/vektorprime/working_ds4_speed
我昨天用NVIDIA profiler和一些LLM的帮助下排查了这个问题(https://www.reddit.com/r/LocalLLaMA/comments/1vcs7bl/ds4_flash_full_model_in_offload_600_ts_pp_and/)
以下是关于第1点的更多信息(引用fairydreaming的话)
"降级你的CUDA并重新编译。从13.2开始,DeviceTopK被用于top-k而不是argsort,这会让PP速率变得很糟糕。"
简而言之,DS4 Flash在矩阵乘法之外的事情上花费了大量时间。
编辑:现在试试这个fork吧,因为我可以轻松达到1.3K的提示处理速度。
相似文章
Deepseek V4 Flash 在两块 Nvidia 4090d 48G (ada) 上以 vLLM 运行,速度约 105 t/s
技术文章:详细介绍如何使用自定义Triton内核和vLLM在两块Nvidia 4090d GPU上运行DeepSeek V4 Flash,在262k上下文环境下实现约105 tokens/秒的推理速度。
@superalesha: 我在4张RTX 3090上把DeepSeek V4 Flash推理速度提升了29倍!!!不是开玩笑。15 → 443 t/s。一个23K的提示原本需要25分钟……
一位用户通过优化llama.cpp,在4张RTX 3090 GPU上实现了DeepSeek V4 Flash推理速度29倍提升,将23K提示从25分钟缩短至53秒。
DeepSeek V4 Flash(98GB)在单块4060 Ti加CPU上本周速度提升300% [从2t/s到7t/s]
DeepSeek V4 Flash(98GB)现在通过CPU卸载,在单块RTX 4060 Ti上运行速度可达每秒7个token,相比上周的2t/s提升了3倍。
@malikwas1f:四行修复让 DeepSeek-V4-Flash 的预填充速度在 10K 下从 127 提升至 312 t/s,在 40K 下从 91 提升至 283 t/s,并通过了召回率检查……
据报道,一个四行修复将 DeepSeek-V4-Flash 的预填充速度从 10K 上下文下的 127 t/s 提升至 312 t/s,从 40K 上下文下的 91 t/s 提升至 283 t/s,解码速度保持不变。该补丁通过 club-3090 项目分享,该项目用于在 RTX 3090 上提供 LLM 服务。
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。