@sgl_project: 我们刚刚为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 在 2x DGX Spark 上添加了指南。 https://docs.sglang.io/coo…

X AI KOLs Timeline 工具

摘要

SGLang 已经为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 模型在 2x DGX Spark 硬件上添加了部署指南,支持多种配置和优化。

我们刚刚为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 在 2x DGX Spark 上添加了指南。 http://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4… - Flash-Vision 原生支持视觉功能 - Flash-0731 支持 fp4 和 @NVIDIAAI 官方 nvfp4 - 两者都运行在 b12x 内核库上 尽情享受!
查看原文
查看缓存全文

缓存时间: 2026/09/04 00:16

我们刚刚在 2x DGX Spark 上为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 添加了部署方案。

http://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4…

  • Flash-Vision 原生支持视觉功能
  • Flash-0731 支持 fp4 和 @NVIDIAAI 官方的 nvfp4 格式
  • 两者均运行于 b12x 内核库

享用吧!


DeepSeek-V4 - SGLang 文档

来源:https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4

部署

安装 SGLang

所有方法和硬件平台,请参阅官方 SGLang 安装指南 (https://docs.sglang.io/docs/get-started/install)。下面的两种路径对应命令面板中的 Python / Docker 切换开关。

  • Python (pip / uv)
  • Docker

然后在该环境中运行下面命令面板的 Python 输出内容。

如何启动镜像,请参阅安装 → 方法3:使用 Docker (https://docs.sglang.io/docs/get-started/install#method-3-using-docker)。一个最小化示例(将内部的 sglang serve ... 替换为下方命令生成器产生的任何命令):NVIDIA GPUs 单个镜像 lmsysorg/sglang:latest 覆盖了本食谱中的 数据中心 GPU(B200 / B300 / GB200 / GB300 / H100 / H200 / RTX PRO 6000)。唯一的例外是 Flash Vision (实验版),其支持尚未在正式发布版中提供:它的单元格使用预览镜像 lmsysorg/sglang:dev-dsv4-flash-vision(命令面板会自动选择——请参阅 Flash Vision 说明 (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#vision-note))。DGX Spark 是另一个例外:它的三个单元格(Flash Official FP4, Flash Official NVFP4, Flash Vision FP4)使用专为 DGX Spark 打造的预览镜像 lmsysorg/sglang:dev-v4f-2dgx-v2(命令面板会自动选择——请参阅 DGX Spark 说明 (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#spark-note));请勿在任何其他硬件上使用该镜像。

AMD GPUs (ROCm) AMD 使用每日更新的 lmsysorg/sglang-rocm 镜像。您可以在 Docker Hub (https://hub.docker.com/r/lmsysorg/sglang-rocm/tags) 找到最新镜像。我们推荐使用 ROCm 7.2 版本。例如:

  • MI355Xlmsysorg/sglang-rocm:v0.5.18-rocm720-mi35x-20260829
  • MI300Xlmsysorg/sglang-rocm:v0.5.18-rocm720-mi30x-20260829

选择您的硬件 + 配方以生成启动命令。三种服务策略涵盖了常见的运行场景:

  • 低延迟 — 为单个用户提供最快回复。适用于聊天。
  • 均衡 — 在多个用户同时使用时提供良好速度。用于典型的多用户服务。
  • 高吞吐 — 在多用户下实现最高每秒 token 数。最适合批处理作业。

面板控件(命令框顶部):

  • Python / Docker — 针对已有 SGLang 环境的裸 sglang serve ... 命令,或针对上述安装 SGLang (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#install) 面板中按硬件划分的镜像的 docker run ... sglang serve ... 包装。
  • ⧉ Copy — 将当前命令(无论采用哪种框架)复制到剪贴板。
  • $ cURL — 针对 localhost:30000 的示例请求,用于确认服务器已启动。
  • ⚙ Env — 编辑命令和 cURL 共享的占位符(HOST_IP, PORT, HF_TOKEN, NODE_RANK, NODE0_IP)。在不同食谱间的 localStorage 中持久保存。
  • 已验证 / 未验证徽章 — 当 (硬件, 变体, 量化, 策略, 节点) 组合已在真实硬件上端到端运行时为绿色;当从相邻组合自动派生且尚未重新验证时为黄色。

实验场

实验场是您探索 超出已验证矩阵的 SGLang 功能 的地方。上面的部署面板只输出 SGLang 团队认可的组合;实验场允许您在部署面板当前显示的单元格基础上,启用更多旋钮。基础配置从您的部署选择中实时读取——只有您的覆盖设置会改变。旋钮分为两种类型:

  • 内置 SGLang 功能 — 并行覆盖(TP / CP / DP-Attention — DP-Attention 的值是 DP 度数,off 表示禁用)、MoE 后端 + EP、推理/工具调用解析器、推测解码预设、预填充/解码分离、HiCache 层级和 HiSparse 分层稀疏注意力(仅解码角色——一旦 PD-Disagg 模式设置为解码,该卡片才会出现)。
  • DeepSeek-V4 特定功能 — MegaMoE W4A8 / W4A4 融合内核(仅限 Blackwell;Hopper SM90 使用单独的全 FP8 MegaMoE 路径——请参阅下方的配置提示)。

绿色高亮的行是您覆盖设置添加的;带有红色删除线的行是在已验证基础中存在但被覆盖设置剥离的。当没有覆盖设置与基础单元格不同时,实验场继承基础的 已验证 徽章;任何实际更改都会将其切换为 未验证,直到新配置被端到端运行并提交回来。

面板控件 复用部署面板的 Python / Docker · ⧉ Copy · $ cURL · ⚙ Env,另加一个:

  • Submit ↗ — 打开一个预填写的 GitHub issue,以便您可以将您的覆盖组合作为新的已验证食谱单元格提交。仅在徽章显示为 未验证 时显示;当您已在硬件上实际运行该命令并确认其工作后,请点击它。

1. 模型介绍

DeepSeek-V4 是 DeepSeek 推出的下一代混合专家模型,于 2026-04-24 以 MIT 许可证 发布。0731 Flash 和 0813 Pro 更新版本添加了捆绑 DSpark 投稿头(draft head)的检查点,实验性的 Flash Vision 检查点则在 0731 Flash 基础上构建了图像理解能力:

变体总参数激活参数 (MoE)用途
DeepSeek-V4-Flash (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash)284B13B单节点部署在 B200 / B300 / GB200 / GB300 / H200 (TP=4);RTX PRO 6000 (TP=2);H100 (TP=8)
DeepSeek-V4-Flash-0731 (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)304B13BFlash Official (0731),捆绑 DSpark 投稿头;在 8×B200、4×GB300 和 4×H200 上验证
DeepSeek-V4-Flash-Vision-Exp (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp)305B13BFlash Vision (实验版) — 实验性多模态(图像-文本转文本):基于 0731 Flash 基础 + 视觉编码器和对齐器;在 4×B200 (TP=4) 上验证,需要预览构建 (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#vision-note)
DeepSeek-V4-Pro (https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)1.6T49B高容量:B200 / B300 (TP=8) · GB300 (TP=4) · H200 FP4 (TP=8) · GB200 (2节点, TP=8) · H200 FP8 (2节点, TP=16) · H100 (2节点, TP=16)
DeepSeek-V4-Pro-0813 (https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813)1.65T49BPro Official (0813),捆绑 DSpark 投稿头;在 4×GB300 (TP=4) · B200 / B300 / H200 FP4 (TP=8) · GB200 (2节点, TP=8) · H100 (2节点, TP=16) · MI355X 上验证

指令微调检查点以 FP4 MoE 专家 + FP8 注意力/稠密 形式发布(一个混合精度检查点覆盖所有支持 FP4 的 GPU)。匹配的 *-Base 仓库提供纯 FP8 混合格式,仅用于进一步预训练——不适用于聊天或工具调用。亮点: 混合 CSA + HCA 注意力(与 DSv3.2 在 1M 上下文下相比,推理 FLOPs 降低约 27% / KV 缓存减少约 10%),流形约束超连接 (mHC),Muon 优化器,1M token 上下文(32T+ 预训练 token),三种推理模式(Non-think/Think High/Think Max——使用 ≥ 384K 上下文进行 Think Max),以及专用的 encoding_dsv4.encode_messages Python 编码器 + DSML 工具调用语法。推荐生成参数: temperature=1.0, top_p=1.0资源: HuggingFace · Flash Official (0731) (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) · Flash (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) · Flash Vision (实验版) (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp) · Pro (https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro) · Pro Official (0813) (https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813) · ModelScope · Flash (https://modelscope.cn/models/deepseek-ai/DeepSeek-V4-Flash) · Pro (https://modelscope.cn/models/deepseek-ai/DeepSeek-V4-Pro)。

2. 配置提示

并发与 DeepEP 分发缓冲区 必须满足:max-running-requests × MTP_draft_tokens ≤ SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK。违反此规则会在稳态负载下损坏 DeepEP 的分发缓冲区(deep_ep.cpp:1105)。调整时,请一起移动 --cuda-graph-max-bs-decode--max-running-requests 和环境变量。生成器当前选择的值偏保守(反映了内部压力测试矩阵)。它们开箱即用安全运行,但可能未充分利用吞吐量——请根据您实际工作负载的峰值并发调高它们,并将发现反馈回来,以便修订默认值。

推测解码 原始的 Flash 和 Pro 配方使用 EAGLE。Flash Official (0731) 和 Pro Official (0813) 使用捆绑的 DSpark 投稿头;请参阅 DSpark (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#3-4-dspark-speculative-decoding) 了解其启动和调优说明。

对于原始的 Flash 和 Pro 检查点:

  • low-latency:步数=3,起草token数=4 → 在 bs=1 时获益最大。
  • balanced:步数=1,起草token数=2 → 更温和的 MTP,在更高批处理下减少吞吐量损失。
  • high-throughput:禁用 MTP — 在饱和时,验证步骤的成本超过其节省。
  • MTP 在 v2 推测路径上运行。

DGX Spark (2x GB10):Flash Official FP4 / NVFP4,Flash Vision FP4 DGX Spark 行有三个配方,均为均衡 · 多节点Flash Official (0731) · FP4Flash Official (0731) · NVFP4Flash Vision (实验版) · FP4。这些检查点都无法装入单个 128GB GB10,因此每个配方都在通过 ConnectX-7 (RoCE) 连接的两个 DGX Spark 上以 TP=2 运行。所有其他 DGX Spark 组合均被有意置灰。

  • Docker 镜像 — 所有三个单元格使用 lmsysorg/sglang:dev-v4f-2dgx-v2,一个专为 DGX Spark 制作的预览构建(分支 b12x-vision @ 452239a74f):它集成了 SM12x b12x MoE (W4A8) 和压缩 MLA 注意力内核(#34878 (https://github.com/sgl-project/sglang/pull/34878), #35899 (https://github.com/sgl-project/sglang/pull/35899), #34018 (https://github.com/sgl-project/sglang/pull/34018))、Flash Vision 模型支持(#37253 (https://github.com/sgl-project/sglang/pull/37253))、使 Flash Vision 能在 SM12x 上服务图像的 b12x 图像预填充修复、NVFP4 MTP 层分发修复,以及 GB10 双节点所需的 CuTeDSL 和 NCCL 版本锁定。请勿在其他硬件上使用,并使用面板的 Docker 模式——裸 Python 命令需要该镜像附带的 b12x 内核包。
  • 在两个 Spark 上运行相同的命令,使用 --node-rank 0 / --node-rank 1 并且 --dist-init-addr 指向通过 ConnectX-7 链接连接的节点 0。面板发出的 docker run 标志(--network host --ulimit memlock=-1:-1 --cap-add IPC_LOCK --device /dev/infiniband)是让 NCCL 使用 RDMA 所必需的;没有它们,NCCL 会静默回退到 TCP,解码速度将减慢约 40%。
  • 单元格中的 Env 旋钮 是配方的一部分:SGLANG_SM120_FLASHMLA_BACKEND=b12x 选择 b12x 注意力路径,SGLANG_B12X_MAX_TOKENS 必须等于 --chunked-prefill-sizePYTORCH_CUDA_ALLOC_CONF=expandable_segments:True 可避免 GB10 上的统一内存碎片导致的 OOM。
  • NVFP4 (nvidia/DeepSeek-V4-Flash-0731-NVFP4) — 仅路由专家为 NVFP4;注意力、共享专家和 DSpark MTP 层保持检查点的原生格式。在 SM12x 上,这需要三个额外标志:--moe-runner-backend flashinfer_cutlass(b12x 的 MoE 仅支持 MXFP4,trtllm-gen 内核仅限 sm100)、--speculative-moe-runner-backend b12x(DSpark 投稿的 MTP 专家为 MXFP4,运行于 b12x)和 --disable-shared-experts-fusion(在 cutlass 运行器下,HashTopK 拒绝融合共享专家)。吞吐量和 DSpark 接受率与 FP4 单元格在误差范围内匹配。
  • Flash Vision — 在 b12x 配方上,图像通过与 Flash Official 相同的标志原生提供服务(在 /v1/chat/completions 上发送 image_url 内容,请参阅 Vision (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#3-5-vision-image-inputs));纯文本请求保持不变。在该检查点上,文本吞吐量预计比 Flash Official 低约 15-20%——其捆绑的 DSpark 头接受的草稿更少(约 3.2 对比约 3.9)——但文本准确性得以保持。

DeepSeek-V4-Flash-Vision-Exp(实验版) deepseek-ai/DeepSeek-V4-Flash-Vision-Exp (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp) 是 DeepSeek 首个实验性多模态 V4 检查点:基于 0731 Flash 基础加上视觉编码器和对齐器,通过相同的 sglang serve 流程提供服务,支持 OpenAI 风格的 image_url 输入(请参阅下方 Vision (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#3-5-vision-image-inputs))。在部署面板中选择 Flash Vision 变体以获取其配方。

  • 需要预览构建 — 支持通过 sgl-project/sglang#37253 (https://github.com/sgl-project/sglang/pull/37253) 加入,尚未在正式发布版中提供。Flash Vision 单元格的 Docker 模式已发出预览镜像 lmsysorg/sglang:dev-dsv4-flash-vision;对于 Python 环境,请从该 PR 的分支安装 SGLang。DGX Spark Flash Vision 单元格是例外:它使用 DGX Spark 镜像 lmsysorg/sglang:dev-v4f-2dgx-v2(请参阅 DGX Spark 说明 (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#spark-note))。
  • 已验证矩阵 — 通过 sgl-eval 进行 MMMU-Pro 测试,参数为 temperature 1.0top-p 0.95--reasoning-effort max
  • 引擎自动配置 — 引擎为此检查点选择 flashinfer_mxfp4 MoE 运行器并自动禁用共享专家融合(其 HashTopK 路由拒绝融合共享专家);请勿传递 --enforce-shared-experts-fusion
  • 分块预填充和基数缓存保持启用 — 调度器自动保持图像跨度一致:分块预填充截断点是对齐跨度的(图像跨度总是在单次扩展内完成预填充,最多超出分块预算一个跨度),并且结束于图像跨度深处的基数缓存前缀匹配会从跨度起点重新发出。
  • 推测解码 — 该检查点捆绑了 DSpark 头,低延迟配方通过 --speculative-algorithm DSPARK 启用它(在 B200 上通过 MMMU-Pro 轮次在图像批处理上已验证;其他硬件行待验证)。均衡和高吞吐配方仅运行目标端:它们使用 DP Attention,而 DSpark 在当前版本中与其不兼容。与 0731/0813 检查点一样,请勿传递 EAGLE 标志。

共享专家融合(Blackwell,flashinfer_mxfp4) 在 Blackwell fp4 配方(--moe-runner-backend flashinfer_mxfp4)上,默认情况下共享专家作为单独的 FP8 MLP 在备用流上运行。添加: --enable-shared-experts-fusion 会将它作为额外的 MXFP4 专家路由通过同一个 trtllm-gen MoE 内核,这样整个 MoE 在单个流上运行(每 MoE 层约减少 4 次内核启动和 2 次流同步)。共享专家在加载时从 FP8 重新量化为 MXFP4。在 GB200 tp4 上测量:gsm8k 和 AIME25 准确性与未融合基线持平;平均首 token 时间 (TTFT) -13% 至 -21%,P99 token 间隔时间 (ITL) -15% 至 -53%(在 QPS 1-8 下,吞吐量中性)。仅适用于没有专家并行的部署(例如单节点低延迟配方):当 moe_ep_size > 1 时,该标志在启动时会被拒绝,除非使用 DeepEP/MegaMOE 每秩共享插槽路径。不适用于 Flash Vision (实验版) (https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4#vision-note)——引擎在该检查点上会自动禁用融合。

压缩注意力状态数据类型 DeepSee

相似文章

Deepseek V4 flash 在 DGX Spark 上的性能

Reddit r/LocalLLaMA

一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。