@YRSM_Simon: 太厉害了
摘要
shi3z分享在不支持FP4的A100 GPU上运行DeepSeek v4.1 Flash的优化经验,将推理速度从33 tok/s提升至673 tok/s,超过官方API速度。
太厉害了
查看缓存全文
缓存时间: 2026/09/14 01:16
shi3z (@shi3z): 写了超过一万字。为了运行DeepSeek v4.1 Flash,我将不支持FP4的A100显卡性能从33 tok/s提升到了673 tok/s。等我反应过来时,发现速度已经比官方API还快了。 |shi3z @shi3z
相似文章
有人在NVIDIA A100上让DeepSeek V4.1的运行速度超越了官方API
有人优化了DeepSeek V4.1,使其在NVIDIA A100 GPU上的运行速度超过了官方API,尽管A100不支持FP4精度,并将实现分享在GitHub上。
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
DeepSeek-V4-Flash W4A16+FP8 结合 MTP 自推测:在 2 张 RTX PRO 6000 Max-Q 上以 524K 上下文长度实现 85 tok/s
这篇文章详细介绍了一个经过定制并量化的 DeepSeek-V4-Flash 模型版本,启用了 MTP 自推测功能。通过修改后的 vLLM 设置,在双 RTX PRO 6000 Max-Q GPU 上实现了显著的速度提升。
@superalesha: 我在4张RTX 3090上把DeepSeek V4 Flash推理速度提升了29倍!!!不是开玩笑。15 → 443 t/s。一个23K的提示原本需要25分钟……
一位用户通过优化llama.cpp,在4张RTX 3090 GPU上实现了DeepSeek V4 Flash推理速度29倍提升,将23K提示从25分钟缩短至53秒。
DeepSeek v4 Flash 在 4090 + DDR5 上的体验
一位用户分享了在 24GB 显卡和 DDR5 内存上运行 DeepSeek v4 Flash 模型的体验,包括性能数据和优化技巧。