DeepSeek-V4-Pro-0813-NVFP4 (7分钟阅读)

TLDR AI 模型

摘要

NVIDIA在Hugging Face上发布了DeepSeek的V4-Pro-0813模型的量化版本,通过NVFP4优化,以便在智能体AI和推理应用中高效部署。

DeepSeek-V4-Pro-0813-NVFP4是DeepSeek-V4-Pro-0813的量化版本,一个自回归混合专家语言模型。该模型适用于高级推理、智能体AI应用、工具使用场景,以及在数学、软件工程和企业AI助手等领域中的复杂问题解决。DeepSeek-V4-Pro-0813-NVFP4使用Model Optimizer进行了量化。它可供商业和非商业使用。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:43

nvidia/DeepSeek-V4-Pro-0813-NVFP4 · Hugging Face

来源:https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#model-overview

模型概述

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#description

描述: NVIDIA DeepSeek-V4-Pro-0813-NVFP4 模型是 DeepSeek AI 的 DeepSeek-V4-Pro-0813 模型的量化版本。后者是一个自回归混合专家(Mixture-of-Experts)语言模型,采用优化的 Transformer 架构,使用混合注意力(压缩稀疏注意力和高度压缩注意力)和流形约束超连接(Manifold-Constrained Hyper-Connections)。 DeepSeek-V4-Pro-0813 是官方发布的 DeepSeek-V4-Pro,具有增强的智能体能力,并在同一个检查点中包含 DeepSeek 的 DSpark 推测解码模块。更多信息请参阅 DeepSeek-V4-Pro-0813 模型卡(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813)。

NVIDIA DeepSeek-V4-Pro-0813-NVFP4 模型使用 Model Optimizer(https://github.com/NVIDIA/Model-Optimizer)进行量化。此模型可直接用于商业或非商业用途。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#third-party-community-consideration

第三方社区考量 此模型非 NVIDIA 所有或开发。此模型是根据第三方在此应用和使用场景下的需求开发和构建的;请参阅非 NVIDIA(DeepSeek-V4-Pro-0813)模型卡(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813)。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#license-terms-of-use

许可证/使用条款: MIT(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813/blob/main/LICENSE)

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#deployment-geography

部署地域: 全球

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#use-case

使用案例: DeepSeek V4 非常适合高级推理、智能体 AI 应用、工具使用场景以及数学、软件工程和企业 AI 助理等领域的复杂问题解决。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#release-date

发布日期: Hugging Face 08/27/2026 通过 https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#references

参考 Nvidia Model Optimizer:https://github.com/NVIDIA/Model-Optimizer

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#model-architecture

模型架构: 架构类型: Transformers 网络架构: DeepseekV4ForCausalLM — 混合专家(MoE),具有混合注意力(压缩稀疏注意力 + 高度压缩注意力) 模型参数数量: 总参数 1.65T,激活参数 49B 此模型基于 DeepSeek-V4-Pro-0813(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813)开发。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#input

输入: 输入类型: 文本 输入格式: 字符串 输入参数: 一维(1D):序列 与输入相关的其他属性: 支持多轮对话,包含系统提示、用户消息和助手响应。最大上下文长度为 100 万个 token。使用自定义编码管道(encoding_dsv4),支持推理努力等级(lowhighmax)。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#output

输出: 输出类型: 文本 输出格式: 字符串 输出参数: 一维(1D):序列 与输出相关的其他属性: 支持结构化 JSON 输出、函数/工具调用,并在启用时支持推理内容。 我们的人工智能模型旨在和/或针对 NVIDIA GPU 加速系统进行设计和优化。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),与仅使用 CPU 的解决方案相比,该模型可实现更快的训练和推理时间。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#software-integration

软件集成: 支持的运行时引擎:

  • SGLang

支持的硬件微架构兼容性:

  • NVIDIA Blackwell B200

首选操作系统:

  • Linux

将基础模型和微调模型集成到 AI 系统中,需要使用特定用例数据进行额外测试,以确保安全有效的部署。遵循 V 型开发方法,在单元和系统层面进行迭代测试和验证对于缓解风险、满足技术和功能要求以及确保符合安全和伦理标准至关重要。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#model-versions

模型版本: 此模型是使用 nvidia-modelopt v0.47.0rc1 量化的 DeepSeek-V4-Pro-0813 NVFP4。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#training-and-evaluation-datasets

训练和评估数据集:

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#calibration-dataset

校准数据集: 链接: cnn_dailymail(https://huggingface.co/datasets/abisee/cnn_dailymail), Nemotron-Post-Training-Dataset-v2(https://huggingface.co/datasets/nvidia/Nemotron-Post-Training-Dataset-v2) 各数据集的数据收集方法: 自动化。 各数据集的标注方法: 自动化。 属性: cnn_dailymail 是一个英文数据集,包含超过 30 万篇由 CNN 和 Daily Mail 记者撰写的独特新闻文章。Nemotron-Post-Training-Dataset-v2 是由 NVIDIA 策划的后训练数据集,包含涵盖各种主题的多轮对话。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#training-dataset

训练数据集: 数据模态: 未公开 各数据集的数据收集方法: 未公开 各数据集的标注方法: 未公开 属性: 未公开

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#evaluation-dataset

评估数据集: 数据集: GPQA Diamond, AA-LCR, τ2-Bench Telecom, SciCode, IFBench, Terminal-Bench Hard 各数据集的数据收集方法: 混合:自动化、人工收集 各数据集的标注方法: 混合:人工标注、自动化 属性: 我们在以下基准上评估了模型:推理、长上下文召回、智能体工具使用、编码和指令遵循。

  • GPQA Diamond 包含 448 个由生物学、物理学和化学领域专家撰写的研究生水平多项选择题。
  • AA-LCR(Artificial Analysis Long Context Recall)评估模型从长输入上下文中准确检索和回忆信息的能力。
  • τ2-Bench Telecom 评估双控制电信客服场景中的智能体工具使用和策略遵循能力,模型与模拟用户和外部工具交互以解决账户问题。
  • SciCode 评估科学编码能力。
  • IFBench 是一个用于评估在不同和结构化任务约束下指令遵循能力的基准。
  • Terminal-Bench Hard 在真实终端环境中评估智能体软件工程能力,模型必须规划并执行 shell 命令以端到端完成任务。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#inference

推理: 加速引擎: SGLang 测试硬件: NVIDIA Blackwell B200

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#post-training-quantization

训练后量化 此模型通过将 DeepSeek-V4-Pro-0813 的权重和激活量化为 NVFP4 数据类型获得,可直接使用 SGLang 进行推理。仅量化了 MoE 中 Transformer 块内线性运算符的权重和激活。DeepSeek 的 DSpark 推测解码头在量化过程中保持原样不变。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#quantization-recipe

量化配方 该配方位于 Model Optimizer 仓库的 examples/deepseek/deepseek_v4(https://github.com/NVIDIA/Model-Optimizer/tree/main/examples/deepseek/deepseek_v4)目录下(ptq.py(https://github.com/NVIDIA/Model-Optimizer/blob/main/examples/deepseek/deepseek_v4/ptq.py)和 quantize_to_nvfp4.py(https://github.com/NVIDIA/Model-Optimizer/blob/main/examples/deepseek/deepseek_v4/quantize_to_nvfp4.py))。它分三个阶段运行:

1. 将源检查点重新分片以适配模型并行布局(仅 CPU),使用 DeepSeek 自己的 convert.py

convert.py \
  --hf-ckpt-path \
  --save-path \
  --n-experts 384 \
  --model-parallel 8 \
  --expert-dtype fp4

2. 在路由专家上收集激活范围(amax):

torchrun --nproc-per-node 8 deepseek_v4/ptq.py \
  --model_path \
  --config /inference/config.json \
  --calib_size 512 \
  --calib_seq 4096 \
  --output_path

校准使用脚本的默认数据集——cnn_dailymailNemotron-Post-Training-Dataset-v2——各 512 个样本(总计 1024)。--calib_seq 4096 设置了分词器截断上限;这是对此模型影响最大的设置,因为默认值 512 无法覆盖长上下文激活范围。上述命令使用了 ptq.py 内置的量化配置。相同的配置也作为声明式配方提供,可通过 --recipe 选择:

torchrun --nproc-per-node 8 deepseek_v4/ptq.py \
  --recipe huggingface/models/deepseek-ai/DeepSeek-V4-Pro-0813/ptq/nvfp4_experts_only \
  ...

该配方 YAML(https://github.com/NVIDIA/Model-Optimizer/blob/main/modelopt_recipes/huggingface/models/deepseek-ai/DeepSeek-V4-Pro-0813/ptq/nvfp4_experts_only.yaml)已通过测试固定,与内置默认值匹配,因此任一路径都产生相同的量化器配置。

3. 导出 NVFP4 检查点:

python deepseek_v4/quantize_to_nvfp4.py \
  --amax_path \
  --source_ckpt \
  --output_ckpt \
  --cast_mxfp4_to_nvfp4 \
  --device cuda

--cast_mxfp4_to_nvfp4 对此模型尤其重要。DeepSeek-V4 的路由专家默认以 MXFP4(E2M1 半字节,每 32 个元素一个 E8M0 缩放因子)格式提供。NVFP4 重用相同的 E2M1 半字节网格,但每 16 个元素存储一个 E4M3 缩放因子,因此权重位保持不变——这是无损的位类型转换——仅重写了块缩放因子。因此,来自阶段 2 的激活 amax 是唯一被校准并保留在产物中的量,并且该检查点比其源文件略(缩放因子字节数翻倍,而权重字节数保持不变)。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#usage

用法

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#deploy-with-sglang

使用 SGLang 部署

python3 -m sglang.launch_server \
  --model-path nvidia/DeepSeek-V4-Pro-0813-NVFP4 \
  --tp 8 \
  --trust-remote-code \
  --tool-call-parser deepseekv4 \
  --reasoning-parser deepseek-v4

基础 DeepSeek-V4-Pro-0813 检查点包含 DSpark,这些头在此版本中得以保留,但在此版本的验证过程中未启用推测解码——仅在验证此 NVFP4 检查点后才启用它。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#evaluation

评估 精度基准结果如下表所示: 精度 | GPQA Diamond | AA-LCR | τ2-Bench Telecom | SciCode | IFBench | Terminal-Bench Hard — | — | — | — | — | — | — MXFP4(源) | 88.51 | 68.67 | 96.49 | 53.45 | 76.53 | 51.39 NVFP4 | 88.42 | 69.33 | 98.25 | 53.75 | 75.68 | 50.69

基准:DeepSeek-V4-Pro-0813(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813),其路由专家默认以 MXFP4 提供。两个检查点均为混合精度,共享相同的 FP8 注意力、共享专家投影、BF16 归一化层和嵌入;仅路由专家格式不同(MXFP4 → NVFP4)。 所有分数均在 SGLang 上测量,使用 temperature 1.0top_p 1.0、最大推理努力等级。 GPQA Diamond、SciCode、τ2-Bench Telecom 和 Terminal-Bench Hard 为单次运行;IFBench 为每侧运行 4 次取平均;AA-LCR 为匹配配置对(每侧运行 2 次)。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#model-limitations

模型局限性: 基础模型是在包含从互联网爬取的有害语言和社会偏见的数据上训练的。因此,模型可能会放大这些偏见,并在提示具有毒性时返回有害响应。模型可能会生成可能不准确、遗漏关键信息或包含无关或冗余文本的答案,从而产生社会不可接受或不良的文本,即使提示本身不包含任何明确冒犯性内容。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-0813-NVFP4#ethical-considerations

伦理考量 NVIDIA 认为可信赖的 AI 是共同责任,我们已建立相应的政策和实践,以支持各种 AI 应用的开发。开发者应与其内部模型团队合作,确保此模型满足相关行业和用例的要求,并解决未预见的产品滥用问题。用户对模型的输入和输出负责。用户有责任在部署前确保此模型的安全集成,包括实施护栏和其他安全机制。 请在此处(https://app.intigriti.com/programs/nvidia/nvidiavdp/detail)报告模型质量、风险、安全漏洞或 NVIDIA AI 问题。

相似文章

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。

DeepSeek V4 Flash 0731

Hacker News Top

DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。