有人在NVIDIA A100上让DeepSeek V4.1的运行速度超越了官方API

Reddit r/LocalLLaMA 新闻

摘要

有人优化了DeepSeek V4.1,使其在NVIDIA A100 GPU上的运行速度超过了官方API,尽管A100不支持FP4精度,并将实现分享在GitHub上。

他们的做法相当惊人,因为A100不支持FP4 https://preview.redd.it/5o22pjk2k2ph1.png?width=781&format=png&auto=webp&s=ab0994fa63e1a65b34a26195f7e99f383cb4cc75 https://github.com/shi3z/deepseekv4.1-A100-custom
查看原文

相似文章

@YRSM_Simon: 太厉害了

X AI KOLs Timeline

shi3z分享在不支持FP4的A100 GPU上运行DeepSeek v4.1 Flash的优化经验,将推理速度从33 tok/s提升至673 tok/s,超过官方API速度。

我在家运行了(更快的)DeepSeek V4 Pro

Reddit r/LocalLLaMA

用户报告成功使用 ktransformers 在本地运行 DeepSeek V4 Pro 模型,并分享了在不同上下文深度下的详细基准测试结果,展示了改进的推理速度。

DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上

Reddit r/LocalLLaMA

展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。