DeepSeek-V4-Flash-Vision-Exp (285B MoE) 在 10-12 张 RTX 3090 上 — 推测解码,视觉
摘要
在 10-12 张 RTX 3090 GPU 上运行 DeepSeek-V4-Flash-Vision-Exp 285B MoE 模型,可实现超过 60-120 tok/s 的解码速度,支持视觉和工具调用,文档完整,便于重现。
在消费级 Ampere 架构上运行完整的 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp — 10-12 张 RTX 3090,SM86 兼容的 vLLM 构建。285B MoE 模型,FP4 专家 + FP8 注意力,权重大小 157 GB。亮点:
- **60+ tok/s** 解码,DSpark 推测 (k=3) 在 10 张 GPU 上 (TP2xPP5),功耗限制 240 W
- **120+ tok/s** 在 12 张 GPU 上 (TP4xPP3)
- **视觉 + 推测 + 工具调用全部正常工作**
- **1M 上下文** (无卸载) / **4M** (RAM 卸载)
- ~3,500 tok/s 长上下文预填充
完整记录且可重现:
- 预构建镜像:`docker pull ghcr.io/ciprianveg/3090-vllm:dsv4-flash-vision-sm86`
- 仓库:https://github.com/ciprianveg/3090-vllm (构建指南,启动脚本,运行时补丁)
补丁涵盖了 DSpark propose-gate (推测 + 视觉修复)、调度器 mm x spec 行交叉、语法位掩码验证、视觉 ViT 内存溢出修复、FlashInfer 工作区通道键控等。
相似文章
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
DeepSeek-V4-Flash W4A16+FP8 结合 MTP 自推测:在 2 张 RTX PRO 6000 Max-Q 上以 524K 上下文长度实现 85 tok/s
这篇文章详细介绍了一个经过定制并量化的 DeepSeek-V4-Flash 模型版本,启用了 MTP 自推测功能。通过修改后的 vLLM 设置,在双 RTX PRO 6000 Max-Q GPU 上实现了显著的速度提升。
DeepSeek V4 Flash(98GB)在单块4060 Ti加CPU上本周速度提升300% [从2t/s到7t/s]
DeepSeek V4 Flash(98GB)现在通过CPU卸载,在单块RTX 4060 Ti上运行速度可达每秒7个token,相比上周的2t/s提升了3倍。
[Deepseek-V4-Flash-0731] 在单张RTX5090 + DDR5桌面配置下,通过VLLM CPU/内存卸载实现完整1M上下文,~800 tps预填充 & 15+ tps解码 [智能体编码]
关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。
DeepSeek v4 Flash 在 4090 + DDR5 上的体验
一位用户分享了在 24GB 显卡和 DDR5 内存上运行 DeepSeek v4 Flash 模型的体验,包括性能数据和优化技巧。