nvidia/Qwen3.6-27B-NVFP4
摘要
NVIDIA发布了Qwen3.6-27B-NVFP4,这是阿里巴巴Qwen3.6-27B模型的量化版本,针对在NVIDIA GPU上的部署进行了优化,支持文本、图像和视频输入。
查看缓存全文
缓存时间: 2026/07/01 05:33
nvidia/Qwen3.6-27B-NVFP4 · Hugging Face
来源:https://huggingface.co/nvidia/Qwen3.6-27B-NVFP4
模型概述
描述
NVIDIA Qwen3.6-27B NVFP4 模型是阿里巴巴 Qwen3.6-27B 模型的量化版本,后者是一种采用优化 Transformer 架构的自回归语言模型。更多信息请查看此处。NVIDIA Qwen3.6-27B NVFP4 模型通过 Model Optimizer 进行量化。
该模型可用于商业或非商业用途。
许可/使用条款
下载条款: 使用该模型需遵守 Apache 2.0 协议。
部署地域
全球
使用场景
面向希望直接使用预量化模型进行部署的开发者,应用于 AI 代理系统、聊天机器人、RAG 系统及其他 AI 驱动的应用。
发布日期
Hugging Face 2026/06/26,通过 https://huggingface.co/nvidia/Qwen3.6-27B-NVFP4 发布
参考文献
NVIDIA Model Optimizer:https://github.com/NVIDIA/Model-Optimizer
模型架构
架构类型: Transformers
网络架构: 混合注意力(Gated DeltaNet 和 Gated Attention)
模型参数数量: 27B
输入
输入类型: 文本、图像、视频
输入格式: 字符串、RGB、视频(MP4/WebM)
输入参数: 一维(1D)、二维(2D)、三维(3D)
其他输入相关属性: 上下文长度最高达 262K
输出
输出类型: 文本
输出格式: 字符串
输出参数: 1D(一维):序列
其他输出相关属性: 无
我们的 AI 模型针对 NVIDIA GPU 加速系统进行设计和/或优化。借助 NVIDIA 硬件(如 GPU 核心)和软件框架(如 CUDA 库),该模型与纯 CPU 解决方案相比,可实现更快的训练和推理时间。
软件集成
支持的运行时引擎:
- vLLM
支持的硬件微架构兼容性:
- NVIDIA Hopper
- NVIDIA Blackwell
首选操作系统:
- Linux
将基础模型和微调模型集成到 AI 系统时,需要额外使用针对特定用例的数据进行测试,以确保安全有效的部署。遵循 V 模型方法论,在单元和系统层面进行迭代测试和验证,对于降低风险、满足技术和功能需求、确保在部署前符合安全和伦理标准至关重要。
模型版本
模型版本为 NVFP4 1.0,通过 nvidia-modelopt v0.45.0 进行量化。
训练与评估数据集
校准数据集
链接: cnn_dailymail、Nemotron-Post-Training-Dataset-v2
数据收集方法(按数据集): 自动
标注方法(按数据集): 自动
属性: cnn_dailymail 数据集是英文数据集,包含 CNN 和 Daily Mail 记者撰写的 30 多万篇独特新闻文章。Nemotron-Post-Training-Dataset-v2 是由 NVIDIA 整理的训练后数据集,包含跨多种主题的多轮对话。
训练数据集
数据模态: 未公开
数据收集方法(按数据集): 未公开
标注方法(按数据集): 未公开
属性: 未公开
音频训练数据量: 未公开
图像训练数据量: 未公开
文本训练数据量: 未公开
视频训练数据量: 未公开
评估数据集
数据集: MMLU Pro, GPQA Diamond, HLE, τ2-Bench Telecom, MMMU Pro, SciCode, AIME 2025, AA-LCR, IFBench
数据收集方法(按数据集): 混合:自动、人工
标注方法(按数据集): 混合:人工、自动
属性: 我们在基于文本的推理、编码、智能体工具使用和多模态基准上评估了该模型:MMLU Pro 是一个多任务语言理解基准,包含跨多个学术领域的具有挑战性的多选题;GPQA Diamond 包含 448 个由生物学、物理学和化学领域专家编写的研究生水平多选题;HLE(Humanity’s Last Exam)是一个专家级学术基准,包含 2158 个关于数学、人文和自然科学的纯文本问题;τ2-Bench Telecom 在双控电信客户服务场景中评估智能体工具使用和策略合规能力,模型需与模拟用户和外部工具交互以解决账户问题;MMMU Pro 是 Massive Multi-discipline Multimodal Understanding 基准的更具挑战性版本,衡量大学层次的多模态推理能力,具有扩展的选项和仅视觉输入设置;SciCode 评估科学编码能力;AIME 2025 包含美国邀请赛数学考试的问题;AA-LCR(Artificial Analysis Long Context Recall)评估模型从长输入上下文中准确检索和回忆信息的能力;IFBench 是评估指令遵循能力的基准,涵盖多样化的结构化任务约束。
推理
加速引擎: vLLM
测试硬件: NVIDIA GB300
训练后量化
该模型通过将 Qwen3.6-27B 的权重和激活量化到 NVFP4 数据类型获得,可直接用于 vLLM 推理。仅量化 Transformer 块内线性算子的权重和激活。此优化将每个参数的位数从 16 位减少到 4 位,使磁盘大小和 GPU 内存需求降低约 2.5 倍。
使用说明
要使用 vLLM 提供此检查点,可以启动 docker vllm/vllm-openai:nightly,然后运行以下命令示例:
vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3
评估
准确率基准结果如下表所示:
| 精度 | MMLU Pro | GPQA Diamond | HLE | τ2-Bench Telecom | MMMU Pro | SciCode | AIME 2025 | AA-LCR | IFBench |
|---|---|---|---|---|---|---|---|---|---|
| FP8 | 86.1 | 86.0 | 21.7 | 95.2 | 74.6 | 44.8 | 93.1 | 68.8 | 65.1 |
| NVFP4 | 86.3 | 85.5 | 21.8 | 95.4 | 74.3 | 44.5 | 92.7 | 68.3 | 65.5 |
基线:Qwen3.6-27B-FP8。基准测试参数:temperature=1.0, top_p=0.95, max_num_tokens=81920(SciCode 为 temperature=0.6,τ2-Bench Telecom 为 temperature=0.0, top_p=1.0)。
模型限制
基础模型训练数据包含从互联网爬取的毒性语言和社会偏见。因此,该模型可能会放大这些偏见,尤其是在使用毒性提示时返回毒性响应。模型可能生成不准确、遗漏关键信息或包含无关或冗余文本的答案,从而产生社会不可接受或不理想的文本,即使提示本身并不包含明显冒犯内容。
伦理考量
NVIDIA 认为可信 AI 是共同责任,我们已建立政策和实践以支持广泛 AI 应用的开发。开发者应与内部模型团队合作,确保该模型满足相关行业和用例的要求,并应对不可预见的产品滥用问题。
请确保您对所有输入图像和视频内容拥有正当权利和许可;如果图像或视频包含人物、个人健康信息或知识产权,生成的图像或视频不会模糊或保持图像主体比例。
请在此报告模型质量、风险、安全漏洞或 NVIDIA AI 相关关切。
相似文章
nvidia/Qwen3.6-35B-A3B-NVFP4 · Hugging Face
NVIDIA发布了Qwen3.6-35B-A3B-NVFP4,这是阿里巴巴混合专家多模态语言模型的量化版本,使用Model Optimizer优化以在NVIDIA GPU上部署。
@TheAhmadOsman: 顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以在单个 RTX 5090 上运行。
Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。
更新:适用于ik_llama.cpp的Qwen-27B-IQ4_KS和Qwen-27B-IQ_KS_KT量化版本,尤其针对16GB显存的NVIDIA显卡
面向16GB显存NVIDIA GPU优化的新型Qwen3.6-27B GGUF量化版本,包含实验性Trellis变体,并附带了困惑度基准测试。
@MiaAI_lab: 仅供参考,运行的最佳Qwen 3.6 35b nvfp4是@NVIDIAAI的nvfp4。不要使用unsloth nvfp4,其性能较差。https://hug…
推荐使用NVIDIA的nvfp4量化版Qwen 3.6 35B,而非Unsloth版本,其性能更优。该模型可在HuggingFace上获取,用于AI应用。
Qwen/Qwen3.6-27B-FP8
阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。