有人在NVIDIA A100上让DeepSeek V4.1的运行速度超越了官方API
摘要
有人优化了DeepSeek V4.1,使其在NVIDIA A100 GPU上的运行速度超过了官方API,尽管A100不支持FP4精度,并将实现分享在GitHub上。
他们的做法相当惊人,因为A100不支持FP4 https://preview.redd.it/5o22pjk2k2ph1.png?width=781&format=png&auto=webp&s=ab0994fa63e1a65b34a26195f7e99f383cb4cc75 https://github.com/shi3z/deepseekv4.1-A100-custom
相似文章
@YRSM_Simon: 太厉害了
shi3z分享在不支持FP4的A100 GPU上运行DeepSeek v4.1 Flash的优化经验,将推理速度从33 tok/s提升至673 tok/s,超过官方API速度。
DeepSeek-V4-Pro-0813-NVFP4 (7分钟阅读)
NVIDIA在Hugging Face上发布了DeepSeek的V4-Pro-0813模型的量化版本,通过NVFP4优化,以便在智能体AI和推理应用中高效部署。
在本地用4张老款RTX 2080 Ti运行DeepSeek-V4(2000美元预算配置)。自定义图灵内核、W8A8量化,以及255个预填充token/秒!
一位开发者成功在四张RTX 2080 Ti GPU上以2500美元预算本地运行DeepSeek-V4-Flash(总计284B,激活13B),通过自定义图灵CUDA内核、W8A8量化和异构推理实现了255个预填充token/秒。该实现已开源。
我在家运行了(更快的)DeepSeek V4 Pro
用户报告成功使用 ktransformers 在本地运行 DeepSeek V4 Pro 模型,并分享了在不同上下文深度下的详细基准测试结果,展示了改进的推理速度。
DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上
展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。