@julien_c: 刚刚发布了由 @NVIDIAAI 提供的 DeepSeek-V4-Pro-NVFP4 修复版

X AI KOLs Following 模型

摘要

NVIDIA 发布了 DeepSeek-V4-Pro-NVFP4 的量化修复版,这是一个拥有 1.6 万亿参数、激活参数 490 亿的 MoE 模型,针对高级推理和智能体 AI 进行了优化。

刚刚发布 🧑‍🍳 由 @NVIDIAAI 提供的 DeepSeek-V4-Pro-NVFP4 修复版 https://t.co/1h2Q3I52z7
查看原文
查看缓存全文

缓存时间: 2026/05/31 06:41

刚刚发布了 🧑🍳

NVIDIA 出品的 DeepSeek-V4-Pro-NVFP4 修正版

https://t.co/1h2Q3I52z7


nvidia/DeepSeek-V4-Pro-NVFP4 · Hugging Face

来源:https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#model-overview模型概览

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#description描述:

NVIDIA DeepSeek-V4-Pro-NVFP4 模型是 DeepSeek-V4-Pro 模型的量化版本,后者是一个专家混合(MoE)语言模型,拥有 1.6 万亿总参数和 490 亿激活参数。更多信息请点击此处(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)。NVIDIA DeepSeek V4 Pro NVFP4 模型使用 Model Optimizer(https://github.com/NVIDIA/Model-Optimizer)进行量化。

该模型可用于商业和非商业用途。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#third-party-community-consideration第三方社区注意事项

此模型非 NVIDIA 所有或开发。该模型是根据第三方对该应用和用例的要求开发和构建的;请参阅非 NVIDIA(DeepSeek V4 Pro)模型卡片(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#licenseterms-of-use许可/使用条款:

MIT(https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/LICENSE)

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#deployment-geography部署地域:

全球

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#use-case用例:

DeepSeek V4 非常适合高级推理、智能体 AI 应用、工具使用场景以及数学、软件工程和企业 AI 助手等领域的复杂问题求解。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#release-date发布日期:

HuggingFace 于 2026 年 5 月 27 日通过 https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4 发布

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#model-architecture模型架构:

架构类型: Transformer 网络架构: 专家混合(MoE)与混合注意力(压缩稀疏注意力 + 高度压缩注意力) 总参数: 1.6 万亿(490 亿激活)

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#input输入:

输入类型: 文本 输入格式: 字符串 输入参数: 一维 输入的其他属性: 支持包含系统提示、用户消息和助手回复的多轮对话。最大上下文长度为 100 万个 token。使用自定义编码管线(encoding_dsv4),支持三种推理模式:非思考(快速)、深度思考(逻辑分析)和极限思考(完全推理范围)。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#output输出:

输出类型: 文本 输出格式: 字符串 输出参数: 一维 输出的其他属性: 支持结构化 JSON 输出、函数/工具调用以及启用时的推理内容。

我们的 AI 模型旨在/优化在 NVIDIA GPU 加速系统上运行。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),该模型相比纯 CPU 方案实现了更快的训练和推理速度。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#software-integration软件集成:

支持的运行时引擎:

  • SGLang
  • vLLM

支持的硬件微架构兼容性:

  • NVIDIA Blackwell

首选操作系统:

  • Linux

将基础模型和微调模型集成到 AI 系统中需要额外的测试,使用特定于用例的数据以确保安全有效部署。遵循 V 模型方法,在单元和系统层面进行迭代测试和验证对于降低风险、满足技术和功能要求以及部署前确保符合安全和道德标准至关重要。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#model-versions模型版本:

**该模型为量化后的 DeepSeek-V4-Pro-NVFP4,使用 nvidia-modelopt v0.44

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#training-and-evaluation-datasets训练与评估数据集:

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#calibration-dataset校准数据集:

** 链接:cnn_dailymail(https://huggingface.co/datasets/abisee/cnn_dailymail)、Nemotron-Post-Training-Dataset-v2(https://huggingface.co/datasets/nvidia/Nemotron-Post-Training-Dataset-v2) ** 数据集数据采集方式:自动化。 ** 数据集标注方式:自动化。 ** 属性:cnn_dailymail 是一个英文数据集,包含 CNN 和每日邮报记者撰写的超过 30 万篇独特新闻文章。Nemotron-Post-Training-Dataset-v2 是由 NVIDIA 整理的后训练数据集,包含跨多种主题的多轮对话。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#training-dataset-训练数据集:

数据模态: 未公开 数据集数据采集方式: 混合:人工、自动化 数据集标注方式: 混合:人工、自动化

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#testing-dataset-测试数据集:

数据集数据采集方式: 混合:人工、自动化 数据集标注方式: 混合:人工、自动化 数据集属性: 未公开

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#evaluation-dataset-评估数据集:

数据集数据采集方式: 混合:人工、自动化 数据集标注方式: 混合:人工、自动化 数据集属性: 我们在基于文本的推理、编码和智能体工具使用基准上评估了模型:GPQA Diamond 包含 448 道由生物学、物理学和化学领域专家编写的研究生水平多选题;AA-LCR(Artificial Analysis Long Context Recall)评估模型从长输入上下文中准确检索和回忆信息的能力;τ2-Bench Telecom 评估智能体工具使用和策略遵循能力,涉及双控电信客服场景,模型与模拟用户和外部工具交互以解决账户问题;SciCode 评估科学编码能力;IFBench 是一个用于评估指令遵循能力的基准,涵盖多样化的结构化任务约束。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#inference推理:

加速引擎: SGLang、vLLM 测试硬件: NVIDIA Blackwell B200

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#post-training-quantization训练后量化

该模型通过将 DeepSeek-V4-Pro 的权重和激活量化到 NVFP4 数据类型而获得,可用于 SGLang 和 vLLM 的推理。仅量化 MoE 中 transformer 块内线性算子的权重和激活。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#usage使用方法

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#deploy-with-vllm使用 vLLM 部署

python -m vllm.entrypoints.cli.main serve \
    nvidia/DeepSeek-V4-Pro-NVFP4 \
    --tensor-parallel-size 8 \
    --trust-remote-code \
    --kv-cache-dtype fp8 \
    --served-model-name nvfp4

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#deploy-with-sglang使用 SGLang 部署

需要 SGLang PR #25820(https://github.com/sgl-project/sglang/pull/25820)。集成会自动检测检查点中的 hf_quant_config.json(权重以 FP8 存储,"moe_quant_algo": "NVFP4"):

python3 -m sglang.launch_server --model nvidia/DeepSeek-V4-Pro-NVFP4 --tensor-parallel-size 8 --trust-remote-code

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#evaluation评估

准确率基准测试结果如下表所示:

精度GPQA DiamondAA-LCRτ2-Bench TelecomSciCodeIFBench
FP8(AA参考)89.0066.0096.0050.0076.00
FP8(我们的)89.4966.8994.2551.0877.82
NVFP489.3366.3394.8353.4577.21

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#model-limitations模型局限性:

基础模型是在包含有毒语言和社会偏见的数据上训练的,这些数据最初从互联网爬取。因此,模型可能放大这些偏见,并在使用有毒提示时返回有毒回复。即使提示本身不包含任何明显冒犯性内容,模型也可能生成不准确、遗漏关键信息、或包含无关或冗余文本的答案,产生社会不可接受或不理想的输出。

https://huggingface.co/nvidia/DeepSeek-V4-Pro-NVFP4#ethical-considerations道德考量

NVIDIA 认为可信赖 AI 是共同责任,并已建立政策和实践以支持开发各种 AI 应用。当按照我们的服务条款下载或使用时,开发者应与内部模型团队合作,确保该模型满足相关行业和用例的要求,并解决潜在的误用问题。

用户应对模型输入和输出负责。用户负责确保模型的安全集成,包括在部署前实施护栏以及其他安全机制。

如发现模型质量、风险、安全漏洞或 NVIDIA AI 相关问题,请在此报告(https://app.intigriti.com/programs/nvidia/nvidiavdp/detail)。

相似文章

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。

deepseek-ai/DeepSeek-V4-Pro

Hugging Face Models Trending

DeepSeek 发布了 V4-Pro 和 V4-Flash,这些混合专家模型采用混合注意力机制和 Muon 优化器,支持百万 token 级上下文。