2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本
摘要
Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。
暂无内容
相似文章
unsloth/Qwen3.6-27B-NVFP4
Unsloth 发布了 Qwen3.6-27B 的 NVFP4 量化检查点,声称吞吐量提升 2.5 倍,精度与 FP8 和 BF16 相当,并提供了在 24GB GPU 上通过 vLLM 运行的说明。
@MiaAI_lab: Nvidia又做到了!@NVIDIAAI的Qwen 3.6 27B NVFP4比Unsloth的Qwen 3.6 27B NVFP4在D…上快了约41%
Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。
unsloth/Qwen3.8-27B-NVFP4
Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。
@MiaAI_lab: 仅供参考,运行的最佳Qwen 3.6 35b nvfp4是@NVIDIAAI的nvfp4。不要使用unsloth nvfp4,其性能较差。https://hug…
推荐使用NVIDIA的nvfp4量化版Qwen 3.6 35B,而非Unsloth版本,其性能更优。该模型可在HuggingFace上获取,用于AI应用。
采用 QUASAR QAD 的完全量化 NVFP4 Qwen3.8-27B
这是 Qwen3.8-27B AI 模型的完全量化 4-bit NVFP4 版本,采用 QUASAR 方法进行训练,以在保持高质量的同时减小模型大小。