DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上

Reddit r/LocalLLaMA 模型

摘要

展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。

配备 40GB 显存的 A100:162GB Q8_K_XL 约 16.1 tok/s 生成速度,40GB 显存仅使用了 15.8GB,所有专家均置于 CPU 上。注意:刚刚在 Linux 机器上测试了编码,DeepSeek-V4-Flash-0731 在单块 40GB A100 上无损运行,速度为 17.7 tok/s,且 6 个专家加载到显存中,由 Codex 驱动其完成完整的智能体编码循环。
查看原文

相似文章

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。