@YRSM_Simon: 太厉害了

X AI KOLs Timeline 新闻

摘要

shi3z分享在不支持FP4的A100 GPU上运行DeepSeek v4.1 Flash的优化经验,将推理速度从33 tok/s提升至673 tok/s,超过官方API速度。

太厉害了
查看原文
查看缓存全文

缓存时间: 2026/09/14 01:16

shi3z (@shi3z): 写了超过一万字。为了运行DeepSeek v4.1 Flash,我将不支持FP4的A100显卡性能从33 tok/s提升到了673 tok/s。等我反应过来时,发现速度已经比官方API还快了。 |shi3z @shi3z

相似文章

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。