@populartourist: 在仓库上持续使用 Qwen3.6 27B NVFP4 后,很明显这个量化版本并不可靠,至少在编…
摘要
用户报告称 Qwen3.6 27B NVFP4 量化版本在编码方面不可靠,尽管吞吐量高但质量不稳定,并建议 Q4_K_M 可能更稳定。
查看缓存全文
缓存时间: 2026/06/15 21:09
在与 Qwen3.6 27B NVFP4 量化模型长期打交道后——很明显,这个量化版本并不可靠,至少在编程任务上如此。
质量极不稳定——结果要么非常好,要么很差。
吞吐量惊人,但在调试迭代上消耗严重。
到目前为止,Ornestein Q6_K 才是真正的黑马。
我相信 Q4_K_M 能比这个 NVFP4 变体表现得更稳定。
wd 🔺(@populartourist): 质量不错的 Qwen3.6 27B NVFP4 嫁接 MTP,附带图片。
适配 RTX 5090,配合 FP8 KV 最多支持 180k/190k 上下文窗口(max_num_seqs=1时),若不并行耗尽上下文还能容纳更多。
编码任务吞吐量达 2-8k tok/s,使用 MTP 时峰值可达 +11k。
初始质量看起来不错。
相似文章
Qwen3.6-27B 量化基准测试
本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。
# Qwen 3.6 27B - VLLM 性能基准测试结果(BF16、FP8、NVFP4)
使用 VLLM 对 Qwen 3.6 27B 在 BF16、FP8 和 NVFP4 三种量化方式下的详细基准测试显示:NVFP4 在 token 生成方面最快,但 FP8 在提示处理方面表现最佳。本文还提供了针对编码任务选择合适量化的实用建议。
我无法让Qwen3.6 27B超越Qwen-Coder-Next,不确定原因
用户报告称,Qwen-Coder-Next 在实际测试和合成基准测试中均优于 Qwen3.6 27B,尽管其他人称赞 27B,用户寻求关于可能设置问题的建议。
Qwen 3.6 27B 的量化是否会破坏 pelican?
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
V4-Flash-0731 - 首个周末使用后的感受
一位用户在周末测试后分享了V4-Flash-0731的实际使用感受,指出量化会严重降低性能,Q3权重可以在代理工作流中替代Qwen3.6-27B,全精度版本以极低的成本接近GLM 5.2级别,但在通用知识方面较弱。