nvidia/Qwen3.6-27B-NVFP4

Hugging Face Models Trending 模型

摘要

NVIDIA发布了Qwen3.6-27B-NVFP4,这是阿里巴巴Qwen3.6-27B模型的量化版本,针对在NVIDIA GPU上的部署进行了优化,支持文本、图像和视频输入。

任务:文本生成 标签:Model Optimizer, safetensors, qwen3_5, nvidia, ModelOpt, Qwen3.6, quantized, FP4, fp4, text-generation, conversational, base_model:Qwen/Qwen3.6-27B, base_model:quantized:Qwen/Qwen3.6-27B, license:apache-2.0, 8-bit, modelopt, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:33

nvidia/Qwen3.6-27B-NVFP4 · Hugging Face

来源:https://huggingface.co/nvidia/Qwen3.6-27B-NVFP4

模型概述

描述

NVIDIA Qwen3.6-27B NVFP4 模型是阿里巴巴 Qwen3.6-27B 模型的量化版本,后者是一种采用优化 Transformer 架构的自回归语言模型。更多信息请查看此处。NVIDIA Qwen3.6-27B NVFP4 模型通过 Model Optimizer 进行量化。

该模型可用于商业或非商业用途。

许可/使用条款

下载条款: 使用该模型需遵守 Apache 2.0 协议。

部署地域

全球

使用场景

面向希望直接使用预量化模型进行部署的开发者,应用于 AI 代理系统、聊天机器人、RAG 系统及其他 AI 驱动的应用。

发布日期

Hugging Face 2026/06/26,通过 https://huggingface.co/nvidia/Qwen3.6-27B-NVFP4 发布

参考文献

NVIDIA Model Optimizer:https://github.com/NVIDIA/Model-Optimizer

模型架构

架构类型: Transformers
网络架构: 混合注意力(Gated DeltaNet 和 Gated Attention)
模型参数数量: 27B

输入

输入类型: 文本、图像、视频
输入格式: 字符串、RGB、视频(MP4/WebM)
输入参数: 一维(1D)、二维(2D)、三维(3D)
其他输入相关属性: 上下文长度最高达 262K

输出

输出类型: 文本
输出格式: 字符串
输出参数: 1D(一维):序列
其他输出相关属性:

我们的 AI 模型针对 NVIDIA GPU 加速系统进行设计和/或优化。借助 NVIDIA 硬件(如 GPU 核心)和软件框架(如 CUDA 库),该模型与纯 CPU 解决方案相比,可实现更快的训练和推理时间。

软件集成

支持的运行时引擎:

  • vLLM

支持的硬件微架构兼容性:

  • NVIDIA Hopper
  • NVIDIA Blackwell

首选操作系统:

  • Linux

将基础模型和微调模型集成到 AI 系统时,需要额外使用针对特定用例的数据进行测试,以确保安全有效的部署。遵循 V 模型方法论,在单元和系统层面进行迭代测试和验证,对于降低风险、满足技术和功能需求、确保在部署前符合安全和伦理标准至关重要。

模型版本

模型版本为 NVFP4 1.0,通过 nvidia-modelopt v0.45.0 进行量化。

训练与评估数据集

校准数据集

链接: cnn_dailymailNemotron-Post-Training-Dataset-v2
数据收集方法(按数据集): 自动
标注方法(按数据集): 自动
属性: cnn_dailymail 数据集是英文数据集,包含 CNN 和 Daily Mail 记者撰写的 30 多万篇独特新闻文章。Nemotron-Post-Training-Dataset-v2 是由 NVIDIA 整理的训练后数据集,包含跨多种主题的多轮对话。

训练数据集

数据模态: 未公开
数据收集方法(按数据集): 未公开
标注方法(按数据集): 未公开
属性: 未公开
音频训练数据量: 未公开
图像训练数据量: 未公开
文本训练数据量: 未公开
视频训练数据量: 未公开

评估数据集

数据集: MMLU Pro, GPQA Diamond, HLE, τ2-Bench Telecom, MMMU Pro, SciCode, AIME 2025, AA-LCR, IFBench
数据收集方法(按数据集): 混合:自动、人工
标注方法(按数据集): 混合:人工、自动
属性: 我们在基于文本的推理、编码、智能体工具使用和多模态基准上评估了该模型:MMLU Pro 是一个多任务语言理解基准,包含跨多个学术领域的具有挑战性的多选题;GPQA Diamond 包含 448 个由生物学、物理学和化学领域专家编写的研究生水平多选题;HLE(Humanity’s Last Exam)是一个专家级学术基准,包含 2158 个关于数学、人文和自然科学的纯文本问题;τ2-Bench Telecom 在双控电信客户服务场景中评估智能体工具使用和策略合规能力,模型需与模拟用户和外部工具交互以解决账户问题;MMMU Pro 是 Massive Multi-discipline Multimodal Understanding 基准的更具挑战性版本,衡量大学层次的多模态推理能力,具有扩展的选项和仅视觉输入设置;SciCode 评估科学编码能力;AIME 2025 包含美国邀请赛数学考试的问题;AA-LCR(Artificial Analysis Long Context Recall)评估模型从长输入上下文中准确检索和回忆信息的能力;IFBench 是评估指令遵循能力的基准,涵盖多样化的结构化任务约束。

推理

加速引擎: vLLM
测试硬件: NVIDIA GB300

训练后量化

该模型通过将 Qwen3.6-27B 的权重和激活量化到 NVFP4 数据类型获得,可直接用于 vLLM 推理。仅量化 Transformer 块内线性算子的权重和激活。此优化将每个参数的位数从 16 位减少到 4 位,使磁盘大小和 GPU 内存需求降低约 2.5 倍。

使用说明

要使用 vLLM 提供此检查点,可以启动 docker vllm/vllm-openai:nightly,然后运行以下命令示例:

vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3

评估

准确率基准结果如下表所示:

精度MMLU ProGPQA DiamondHLEτ2-Bench TelecomMMMU ProSciCodeAIME 2025AA-LCRIFBench
FP886.186.021.795.274.644.893.168.865.1
NVFP486.385.521.895.474.344.592.768.365.5

基线:Qwen3.6-27B-FP8。基准测试参数:temperature=1.0, top_p=0.95, max_num_tokens=81920(SciCode 为 temperature=0.6,τ2-Bench Telecom 为 temperature=0.0, top_p=1.0)。

模型限制

基础模型训练数据包含从互联网爬取的毒性语言和社会偏见。因此,该模型可能会放大这些偏见,尤其是在使用毒性提示时返回毒性响应。模型可能生成不准确、遗漏关键信息或包含无关或冗余文本的答案,从而产生社会不可接受或不理想的文本,即使提示本身并不包含明显冒犯内容。

伦理考量

NVIDIA 认为可信 AI 是共同责任,我们已建立政策和实践以支持广泛 AI 应用的开发。开发者应与内部模型团队合作,确保该模型满足相关行业和用例的要求,并应对不可预见的产品滥用问题。

请确保您对所有输入图像和视频内容拥有正当权利和许可;如果图像或视频包含人物、个人健康信息或知识产权,生成的图像或视频不会模糊或保持图像主体比例。

请在此报告模型质量、风险、安全漏洞或 NVIDIA AI 相关关切。

相似文章

nvidia/Qwen3.6-35B-A3B-NVFP4 · Hugging Face

Reddit r/LocalLLaMA

NVIDIA发布了Qwen3.6-35B-A3B-NVFP4,这是阿里巴巴混合专家多模态语言模型的量化版本,使用Model Optimizer优化以在NVIDIA GPU上部署。

Qwen/Qwen3.6-27B-FP8

Hugging Face Models Trending

阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。