DeepSeek-V4-Flash-Vision-Exp (285B MoE) 在 10-12 张 RTX 3090 上 — 推测解码,视觉

Reddit r/LocalLLaMA 模型

摘要

在 10-12 张 RTX 3090 GPU 上运行 DeepSeek-V4-Flash-Vision-Exp 285B MoE 模型,可实现超过 60-120 tok/s 的解码速度,支持视觉和工具调用,文档完整,便于重现。

在消费级 Ampere 架构上运行完整的 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp — 10-12 张 RTX 3090,SM86 兼容的 vLLM 构建。285B MoE 模型,FP4 专家 + FP8 注意力,权重大小 157 GB。亮点: - **60+ tok/s** 解码,DSpark 推测 (k=3) 在 10 张 GPU 上 (TP2xPP5),功耗限制 240 W - **120+ tok/s** 在 12 张 GPU 上 (TP4xPP3) - **视觉 + 推测 + 工具调用全部正常工作** - **1M 上下文** (无卸载) / **4M** (RAM 卸载) - ~3,500 tok/s 长上下文预填充 完整记录且可重现: - 预构建镜像:`docker pull ghcr.io/ciprianveg/3090-vllm:dsv4-flash-vision-sm86` - 仓库:https://github.com/ciprianveg/3090-vllm (构建指南,启动脚本,运行时补丁) 补丁涵盖了 DSpark propose-gate (推测 + 视觉修复)、调度器 mm x spec 行交叉、语法位掩码验证、视觉 ViT 内存溢出修复、FlashInfer 工作区通道键控等。
查看原文

相似文章

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。