unsloth/Qwen3.6-27B-NVFP4

Hugging Face Models Trending 模型

摘要

Unsloth 发布了 Qwen3.6-27B 的 NVFP4 量化检查点,声称吞吐量提升 2.5 倍,精度与 FP8 和 BF16 相当,并提供了在 24GB GPU 上通过 vLLM 运行的说明。

任务: image-text-to-text 标签: transformers, safetensors, qwen3_5, image-text-to-text, unsloth, qwen, conversational, 基础模型: Qwen/Qwen3.6-27B, 基础模型量化: Qwen/Qwen3.6-27B, 许可证: apache-2.0, 端点兼容, compressed-tensors, 部署: azure, 区域: us
查看原文
查看缓存全文

缓存时间: 2026/07/12 22:52

unsloth/Qwen3.6-27B-NVFP4 · Hugging Face

来源:https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4

查看 Unsloth Dynamic 2.0 GGUFs (https://unsloth.ai/docs/basics/unsloth-dynamic-v2.0-gguf) 以获取我们的量化基准测试结果。

  • 吞吐量是其他 NVFP4 量化的 2.5 倍
  • 这是一个使用 Unsloth 数据集和 UltraChat 数据集的混合数据校准的 Unsloth NVFP4 量化检查点。
  • 可在 24GB 显存的 GPU 上运行。基准测试基于 1 块 B200,128 并发。

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#nvfp4-accuracy-benchmarks

NVFP4 精度基准测试

在精度基准测试方面,我们对 FP8、BF16、NVIDIA 的 NVFP4 以及我们的 NVFP4 进行了 MMLU-Pro、AIME 2025、GPQA 测试 —— 结果显示我们的快速量化在各项测试中表现相似:

提供方MMLU-ProGPQAAIME 2025
Unsloth NVFP486.2586.3493.12
NVIDIA NVFP485.9686.8793.12
FP886.1186.8793.75
BF1685.9688.1393.33

NVFP4 博客 中阅读所有基准测试结果。

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#vllm-run-instructions

vLLM 运行说明

要在独立的虚拟环境中安装 vLLM:

uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \
    --torch-backend=auto

然后提供 27B NVFP4 量化服务:

vllm serve unsloth/Qwen3.6-27B-NVFP4 \
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'

另外,不要使用 Marlin 后端(因其慢 2 倍)—— 请使用原生的 vLLM 或 cute-DSL / CUTLASS / flashinfer_trtllm 后端!

模型后端decode tok/s输出 tok/s
nvidia 27Bmarlin (auto)115.62,403
unsloth 27Bcute-DSL (auto)125.96,863
nvidia 35B-A3Bmarlin (auto)240.88,721
unsloth 35B-A3Bcute-DSL + trtllm (auto)295.215,636

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#dgx-spark

DGX Spark

必须使用以下设置,否则推理速度会慢 2 倍

export CUTE_DSL_ARCH=sm_121a
vllm serve unsloth/Qwen3.6-27B-NVFP4 --moe-backend flashinfer_b12x

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#multi-token-prediction-mtp

多 Token 预测(MTP)

该检查点包含 MTP 模块,因此它可以作为自身的推测草稿,实现更快的解码,但吞吐量略有下降。

vllm serve unsloth/Qwen3.6-27B-NVFP4 \
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'

Qwen Chat (https://chat.qwen.ai/)

该存储库包含训练后模型的权重和配置文件,格式为 Hugging Face Transformers。这些产物与 Hugging Face Transformers、vLLM、SGLang、KTransformers 等兼容。
继二月份发布 Qwen3.5 系列后,我们很高兴分享 Qwen3.6 的首个开放权重版本。基于社区的反馈,Qwen3.6 优先考虑稳定性和实际效用,为开发者提供更直观、更灵敏且真正高效的编码体验。

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#qwen36-highlights

Qwen3.6 亮点

本次发布带来了重大升级,尤其是在以下方面:

  • 智能编码(Agentic Coding):模型现在能够更流畅、更精确地处理前端工作流和仓库级别的推理。
  • 思考保留(Thinking Preservation):我们引入了一个新选项,可以保留历史消息中的推理上下文,从而简化迭代开发并减少开销。

基准测试结果

更多详情请参阅我们的博客文章 Qwen3.6-27B

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#model-overview

模型概述

  • 类型:因果语言模型 + 视觉编码器
  • 训练阶段:预训练 & 后训练
  • 语言模型
    • 参数量:27B
    • 隐藏层维度:5120
    • Token 嵌入:248320(已填充)
    • 层数:64
    • 隐藏布局:16 × (3 × (门控 DeltaNet → FFN) → 1 × (门控注意力 → FFN))
    • 门控 DeltaNet:
      • 线性注意力头数:V 的 48 个,QK 的 16 个
      • 头维度:128
    • 门控注意力:
      • 注意力头数:Q 的 24 个,KV 的 4 个
      • 头维度:256
      • 旋转位置嵌入维度:64
    • 前馈网络:
      • 中间层维度:17408
    • LM 输出:248320(已填充)
    • MTP:经过多步训练
    • 上下文长度:原生 262,144,可扩展至最多 1,010,000 个 token。

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#original-qwen36-bf16-reference-benchmarks

原始 Qwen3.6 BF16 参考基准测试

语言能力

项目Qwen3.5-27BQwen3.5-397B-A17BGemma4-31BClaude 4.5 OpusQwen3.6-35B-A3BQwen3.6-27B
编码 Agent
SWE-bench Verified75.076.252.080.973.477.2
SWE-bench Pro51.250.935.757.149.553.5
SWE-bench Multilingual69.369.351.777.567.271.3
Terminal-Bench 2.041.652.542.959.351.559.3
SkillsBench527.230.023.645.328.7
QwenWebBench106811861197153613971487
NL2Repo27.332.215.543.229.436.2
Claw-Eval64.370.748.576.668.772.4
Claw-EvalPass^346.248.125.059.650.060.6
QwenClawBench52.251.841.752.352.653.4
知识
MMLU-Pro86.187.885.289.585.286.2
MMLU-Redux93.294.993.795.693.393.5
SuperGPQA65.670.465.770.664.766.0
C-Eval90.593.082.692.290.091.4
STEM 与推理
GPQA Diamond85.588.484.387.086.087.8
HLE24.328.719.530.821.424.0
LiveCodeBench v680.783.680.084.880.483.9
HMMT Feb 2592.094.888.792.990.993.8
HMMT Nov 2589.892.787.593.389.190.7
HMMT Feb 2684.387.977.285.383.684.3
IMOAnswerBench79.980.974.584.078.980.8
AIME2692.693.389.295.192.794.1
  • SWE-Bench 系列:内部 Agent 脚手架(bash + file-edit 工具);temp=1.0,top_p=0.95,200K 上下文窗口。我们对 SWE-bench Pro 公开集中的一些有问题的任务进行了修正,并在修正后的基准上评估所有基线。
  • Terminal-Bench 2.0:Harbor/Terminus-2 测试工具;3h 超时,32 CPU/48 GB RAM;temp=1.0,top_p=0.95,top_k=20,max_tokens=80K,256K 上下文;5 次运行的平均值。
  • SkillsBench:通过 OpenCode 评估 78 个任务(自包含子集,排除依赖 API 的任务);5 次运行的平均值。
  • NL2Repo:其他模型通过 Claude Code 评估(temp=1.0,top_p=0.95,max_turns=900)。
  • QwenClawBench:基于真实用户分布的 Claw Agent 基准;temp=0.6,256K 上下文。
  • QwenWebBench:内部前端代码生成基准;双语(EN/CN),7 个类别(Web 设计、Web 应用、游戏、SVG、数据可视化、动画、3D);自动渲染 + 多模态评判(代码/视觉正确性);BT/Elo 评分系统。
  • AIME 26:我们使用完整的 AIME 2026(I 和 II),分数可能与 Qwen 3.5 说明中的不同。

视觉语言

项目Qwen3.5-27BQwen3.5-397B-A17BGemma4-31BClaude 4.5 OpusQwen3.6-35B-A3BQwen3.6-27B
STEM 与谜题
MMMU82.385.080.480.781.782.9
MMMU-Pro75.079.076.970.675.375.8
MathVistamini87.8-79.3-86.487.4
DynaMath87.786.379.579.782.885.6
VlmsAreBlind96.9-87.2-96.697.0
通用 VQA
RealWorldQA83.783.972.377.085.384.1
MMStar81.083.877.373.280.781.4
MMBench EN-DEV-v1.192.6-90.9-92.892.3
SimpleVQA56.067.152.965.758.956.1
文档理解
CharXivRQ79.580.867.968.578.078.4
CC-OCR81.082.075.776.981.981.2
OCRBench89.4-86.1-90.089.4
空间智能
ERQA60.567.557.546.861.862.5
CountBench97.897.296.190.696.197.8
RefCOCOavg90.992.3---92.0
EmbSpatialBench84.5----84.3
RefSpatialBench67.7-4.7-64.370.0
视频理解
VideoMME (w sub.)87.087.5-77.786.687.7
VideoMMMU82.384.781.684.483.784.4
MLVU85.986.7-81.786.286.6
MVBench74.677.6-67.274.675.5
视觉 Agent
V*93.795.8-67.090.194.7
AndroidWorld64.2----70.3
  • 空单元格(–)表示分数尚未获得或不适用。

https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4#quickstart

快速开始

为简化集成,我们建议通过 API 使用 Qwen3.6。以下是使用 OpenAI 兼容 API 的指南。

提供 Qwen3.6 服务

Qwen3.6 可以通过流行的推理框架实现 API 服务。下面我们展示了为 Qwen3.6 模型启动 OpenAI 兼容 API 服务器的示例命令。

不同框架的推理效率和吞吐量差异很大。我们建议使用最新的框架版本以确保最佳性能和兼容性。对于生产工作负载或高吞吐量场景,强烈推荐使用 SGLang、KTransformers 或 vLLM 等专用服务引擎。
该模型默认上下文长度为 262,144 个 token。如果遇到显存不足(OOM)错误,请考虑减小上下文窗口。然而,由于 Qwen3.6 利用长上下文处理复杂任务,我们建议至少保持 128K 的上下文长度以保留思考能力。

SGLang

SGLang 是一个用于大语言模型和视觉语言模型的快速服务框架。建议使用 sglang>=0.5.10,可在新环境中通过以下命令安装:

uv pip install sglang[all]

详细信息请参阅 其文档

以下命令将在 http://localhost:8000/v1 创建 API 端点:

  • 标准版本:以下命令可创建最大上下文长度 262,144 个 token 的 API 端点,使用 8 张 GPU 进行张量并行:

    python -m sglang.launch_server --model-path Qwen/Qwen3.6-27B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3
    
  • 工具使用:要支持工具使用,可以使用以下命令:

    python -m sglang.launch_server --model-path Qwen/Qwen3.6-27B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
    
  • 多 Token 预测(MTP):建议使用以下命令进行 MTP:

    python -m sglang.launch_server --model-path Qwen/Qwen3.6-27B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
    

详细部署指南请参见 SGLang Qwen3.5 Cookbook

vLLM

vLLM 是此 NVFP4 检查点的推荐服务路径。建议使用 vllm>=0.19.0

uv pip install vllm --torch-backend=auto

以下命令在 http://localhost:8000/v1 创建 OpenAI 兼容 API 端点:

vllm serve unsloth/Qwen3.6-27B-NVFP4 --trust-remote-code --dtype bfloat16 --max-model-len 4096

在检查可用 GPU 显存后再增加 --max-model-len。对于长上下文服务,请参考下面的 YaRN 说明,并将模型 ID 保持指向 unsloth/Qwen3.6-27B-NVFP4

KTransformers

KTransformers 是一个灵活的框架,用于体验 CPU-GPU 异构计算的最先进 LLM 推理优化。使用 KTransformers 运行 Qwen3.6,请参见 KTransformers 部署指南

Hugging Face Transformers

Hugging Face Transformers 包含一个轻量级服务,可用于快速测试和中度负载部署。Qwen3.6 需要最新的 transformers

pip install "transformers[serving]"

详细信息请参阅 其文档。请同时确保安装 torchvision 和 pillow。然后运行 transformers serve 启动服务器,API 端点在 http://localhost:8000/v1;它会将模型放在可用的加速器上:

transformers serve Qwen/Qwen3.6-27B --port 8000 --continuous-batching

通过 Chat Completions API 使用 Qwen3.6

Chat Completions API 可通过标准 HTTP 请求或 OpenAI SDK 访问。这里我们展示使用 OpenAI Python SDK 的示例。开始前,确保已安装并配置好 API 密钥和 API 基础 URL,例如:

pip install -U openai
# 设置相应的环境变量
export OPENAI_BASE_URL="http://localhost:8000/v1"
export OPENAI_API_KEY="EMPTY"

我们建议在生成时使用以下采样参数组合:

  • 思考模式(适用于一般任务):temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
  • 思考模式(适用于精确编码任务,如 WebDev):temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
  • 指令(或非思考)模式:temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
    请注意,不同推理框架对采样参数的支持有所不同。
    Qwen3.6 模型默认以思考模式运行,在生成最终回答前会输出以 \n...\n\n 标识的思考内容。要禁用思考内容并直接获得响应,请参考 此处 的示例。
纯文本输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {"role": "user", "content": '将 "I love Qwen3.6" 反向拼写'},
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B",
    messages=messages,
    max_tokens=81920,
    temperature=1.0,
    top_p=0.95,
    presence_penalty=0.0,
    extra_body={
        "top_k": 20,
    },
)

print("Chat response:", chat_response)
图像输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
                }
            },
            {
                "type": "text",
                "text": "图中四个圆的圆心位于正方形的四个角。两个大圆彼此相切,同时也与两个小圆相切。要将小圆的半径乘以什么因子才能得到大圆的半径?\n选项:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
            }
        ]
    }
]

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-27B",
    messages=messages,
    max_tokens=81920,
    temperature=1.0,
    top_p=0.95,
    presence_penalty=0.0,
    extra_body={
        "top_k": 20,
    },
)

print("Chat response:", response)
视频输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "video_url",
                "video_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
                }
            },
            {
                "type": "text",
                "text": "墓室主室壁龛中发现了多少件瓷器?"
            }
        ]
    }
]

相似文章

unsloth/Qwen3.8-27B-NVFP4

Hugging Face Models Trending

Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。

unsloth/Qwen3.6-27B-GGUF

Hugging Face Models Trending

Unsloth 发布了 Qwen3.6-27B 模型的 GGUF 量化版本,具备更强的智能体编程能力、工具调用功能,并支持 Unsloth Studio。