采用 QUASAR QAD 的完全量化 NVFP4 Qwen3.8-27B

Reddit r/LocalLLaMA 模型

摘要

这是 Qwen3.8-27B AI 模型的完全量化 4-bit NVFP4 版本,采用 QUASAR 方法进行训练,以在保持高质量的同时减小模型大小。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:28

QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4 · Hugging Face

来源:https://huggingface.co/QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4

https://huggingface.co/QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4#qwen38-27b-nvfp4-trained-with-quasarQwen3.8-27B NVFP4,采用QUASAR训练

QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4Qwen/Qwen3.8-27B (https://huggingface.co/Qwen/Qwen3.8-27B) 的 4 位 NVFP4 版本,通过 QUASAR (https://arxiv.org/abs/2608.13966) 量化感知训练(QAT)方法生成。

其使用方式应与训练后量化(PTQ)的 Qwen3.8-27B 模型完全相同:它是原始模型的直接替换、更低精度的版本,而非微调模型。量化后的权重通过从冻结的 BF16 原始模型(作为教师模型)直接蒸馏训练得到,基于教师模型自身的输出分布,因此模型能够保持原始行为而不偏离。与 PTQ 的区别仅在于权重是在量化约束下学习得到的,而非事后取整,这能恢复更多的原始质量。

📄 论文:QUASAR:通过损失感知重建降低量化感知训练的损失下限 (https://arxiv.org/abs/2608.13966)

本模型使用了针对 Qwen3.8-27B 最激进的量化设置:每个 Transformer 层中的每个线性层均为 NVFP4(W4A4)——包括自注意力、门控Delta网络和 MLP 层,共 496 层中的 496 层。通常,对该模型进行 NVFP4 量化时,注意力和门控Delta网络层会保持更高精度(FP8 或 BF16),因为当这些层被量化到 NVFP4 时,模型质量可能会崩溃。然而,QUASAR 在所有线性层(注意力、门控Delta网络、MLP)均被量化到 NVFP4 的情况下,仍能保持与原始模型相似的质量,这使得它成为 Qwen3.8-27B 最小的可用 NVFP4 检查点,并且是质量最高的检查点之一

https://huggingface.co/QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4#how-to-run运行方式

兼容 vLLM,无需转换步骤:

pip install "vllm>=0.27"

vllm serve QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4 \
  --max-model-len 262144 \
  --gpu-memory-utilization 0.85

需要支持 FP4 的 NVIDIA GPU(Blackwell 架构,计算能力 10.0 以上)。

https://huggingface.co/QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4#quality-and-size-comparison质量与大小比较

我们与该模型的另外两个公开 NVFP4 版本进行了比较,它们均通过将大量网络层保持在 4 位以上来控制大小:unsloth/Qwen3.8-27B-NVFP4(23.4 GB)仅将 496 个线性层中的 168 个量化到 NVFP4,将所有自注意力层和大部分 Delta 网络保持在 FP8;Inferact/Qwen3.8-27B-NVFP4(26.4 GB)量化了 304 层,将 240 个 Delta 网络投影层中的 192 个保持在 BF16。

模型大小GPQA-Diamond(2 次运行,n=396)AIME26(3 次重复,n=90)Qwen/Qwen3.8-27B(BF16 原始版)55.6 GB0.91411.0000QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4(本模型)19.7 GB0.90911.0000unsloth/Qwen3.8-27B-NVFP423.4 GB0.89390.9778Inferact/Qwen3.8-27B-NVFP426.4 GB0.87630.9667

https://huggingface.co/QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4#training训练

针对冻结的 BF16 教师模型进行了一个轮次的损失感知 NVFP4 量化感知蒸馏:全局批大小为 32,学习率为 1e-6,共 2446 步。

https://huggingface.co/QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4#citation引用

arxiv.org/abs/2608.13966 (https://arxiv.org/abs/2608.13966)

@article{counathe2026quasar,
  title={QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction},
  author={Counathe, Vincent and Athiwaratkun, Ben and De Sa, Christopher and Zhang, Tianyi},
  journal={arXiv preprint arXiv:2608.13966},
  year={2026}
}

相似文章

RedHatAI/Qwen3.6-35B-A3B-NVFP4

Hugging Face Models Trending

Red Hat AI 发布 NVFP4 量化的 35B MoE 版 Qwen3.6,在保持 96.28% GSM8K 精度的同时,通过 vLLM 实现 4-bit 推理。

unsloth/Qwen3.8-27B-NVFP4

Hugging Face Models Trending

Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。

empero-ai/Qwen3.8-27B-Ridge-GGUF

Hugging Face Models Trending

本文介绍了Qwen3.8-27B AI模型的量化GGUF版本发布,该版本针对有限显存硬件上的高效本地推理进行了优化。