@populartourist: 在仓库上持续使用 Qwen3.6 27B NVFP4 后,很明显这个量化版本并不可靠,至少在编…

X AI KOLs Timeline 模型

摘要

用户报告称 Qwen3.6 27B NVFP4 量化版本在编码方面不可靠,尽管吞吐量高但质量不稳定,并建议 Q4_K_M 可能更稳定。

在仓库上持续使用 Qwen3.6 27B NVFP4 后,很明显这个量化版本并不可靠,至少在编码方面。 质量参差不齐——结果要么非常好,要么很差。 吞吐量惊人,但在调试迭代中有所损失。 Ornestein Q6_K 到目前为止是黑马。 我确信 Q4_K_M 可以比这个 NVFP4 变体更稳定。
查看原文
查看缓存全文

缓存时间: 2026/06/15 21:09

在与 Qwen3.6 27B NVFP4 量化模型长期打交道后——很明显,这个量化版本并不可靠,至少在编程任务上如此。

质量极不稳定——结果要么非常好,要么很差。

吞吐量惊人,但在调试迭代上消耗严重。

到目前为止,Ornestein Q6_K 才是真正的黑马。

我相信 Q4_K_M 能比这个 NVFP4 变体表现得更稳定。

wd 🔺(@populartourist): 质量不错的 Qwen3.6 27B NVFP4 嫁接 MTP,附带图片。

适配 RTX 5090,配合 FP8 KV 最多支持 180k/190k 上下文窗口(max_num_seqs=1时),若不并行耗尽上下文还能容纳更多。

编码任务吞吐量达 2-8k tok/s,使用 MTP 时峰值可达 +11k。

初始质量看起来不错。

相似文章

Qwen3.6-27B 量化基准测试

Reddit r/LocalLLaMA

本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。

# Qwen 3.6 27B - VLLM 性能基准测试结果(BF16、FP8、NVFP4)

Reddit r/LocalLLaMA

使用 VLLM 对 Qwen 3.6 27B 在 BF16、FP8 和 NVFP4 三种量化方式下的详细基准测试显示:NVFP4 在 token 生成方面最快,但 FP8 在提示处理方面表现最佳。本文还提供了针对编码任务选择合适量化的实用建议。

V4-Flash-0731 - 首个周末使用后的感受

Reddit r/LocalLLaMA

一位用户在周末测试后分享了V4-Flash-0731的实际使用感受,指出量化会严重降低性能,Q3权重可以在代理工作流中替代Qwen3.6-27B,全精度版本以极低的成本接近GLM 5.2级别,但在通用知识方面较弱。