@mr_r0b0t: 叫上兄弟们,新的 @UnslothAI NVFP4 刚刚发布
摘要
Unsloth AI 发布了新的 NVFP4 量化 Qwen3.6 模型,在 GPU 上运行速度提升 2.5 倍,并提高了准确性和工具调用能力。
查看缓存全文
缓存时间: 2026/07/10 22:16
叫上兄弟们,@UnslothAI 的 NVFP4 新版本刚上线了 🔥 https://t.co/Y7RQKPiWhC
Unsloth AI (@UnslothAI): 我们发布了全新的 Qwen3.6 量化版本,在 GPU 上运行速度提升 2.5 倍。
Qwen3.6-27B NVFP4 可在 24GB 显存下运行。 35B-A3B 可达 17,561 tok/s(B200)。
我们还提升了准确性、工具调用、智能体使用和循环性能。
指南:https://t.co/EEQIlFrR0c Qwen3.6 NVFP4:
相似文章
unsloth/Qwen3.8-27B-NVFP4
Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。
2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本
Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。
@MiaAI_lab: 仅供参考,运行的最佳Qwen 3.6 35b nvfp4是@NVIDIAAI的nvfp4。不要使用unsloth nvfp4,其性能较差。https://hug…
推荐使用NVIDIA的nvfp4量化版Qwen 3.6 35B,而非Unsloth版本,其性能更优。该模型可在HuggingFace上获取,用于AI应用。
unsloth/Qwen3.6-27B-NVFP4
Unsloth 发布了 Qwen3.6-27B 的 NVFP4 量化检查点,声称吞吐量提升 2.5 倍,精度与 FP8 和 BF16 相当,并提供了在 24GB GPU 上通过 vLLM 运行的说明。
@MiaAI_lab: Nvidia又做到了!@NVIDIAAI的Qwen 3.6 27B NVFP4比Unsloth的Qwen 3.6 27B NVFP4在D…上快了约41%
Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。