Deepseek v4 flash - prefill/pp中每秒处理速度提升100-150 t/s

Reddit r/LocalLLaMA 工具

摘要

这篇文章分享了提升DeepSeek v4 Flash预填充/PP速度的修复方法:将CUDA从13.3降级到13.1,或使用自定义fork,最高可实现1.3K的提示处理token/秒。

这里有两个选择(按优先顺序): 将CUDA从13.3降级到13.1(跳过13.2,因为有bug)<- 更推荐这个(感谢u/fairydreaming指出) 使用这个与CUDA 13.3兼容的vibed fork https://github.com/vektorprime/working_ds4_speed 我昨天用NVIDIA profiler和一些LLM的帮助下排查了这个问题(https://www.reddit.com/r/LocalLLaMA/comments/1vcs7bl/ds4_flash_full_model_in_offload_600_ts_pp_and/) 以下是关于第1点的更多信息(引用fairydreaming的话) "降级你的CUDA并重新编译。从13.2开始,DeviceTopK被用于top-k而不是argsort,这会让PP速率变得很糟糕。" 简而言之,DS4 Flash在矩阵乘法之外的事情上花费了大量时间。 编辑:现在试试这个fork吧,因为我可以轻松达到1.3K的提示处理速度。
查看原文

相似文章

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。