@superalesha: 别急着埋葬RTX 3090,先读完这个!@UnslothAI本周发布了qwen3.6-35b的两个新4位量化版本。我花了…
摘要
对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。
查看缓存全文
缓存时间: 2026/07/12 12:56
在读完这篇文章之前,千万别急着把 RTX 3090 埋了!
@UnslothAI 本周发布了 qwen3.6-35b 的两个新 4 位量化版本。我花了一整晚,在我的 4 块 RTX 3090 上让它们与 AWQ 赛跑,找出最快的。
nvfp4、nvfp4-fast 和 AWQ 在解码阶段差距在 17% 以内,预填充阶段约 3%,在 GPQA、MMLU-Pro 和代码基准上相差不到 3 个百分点。格式之战打成平手。3090 没有 FP4 单元,所以 vLLM 在 Marlin 上把所有模型都当作 w4a16 运行。“fast”根本无处发挥。
然后我打开了检查点里自带的 MTP 头部。从 173 tok/s 飙到 246 tok/s,提升了 41%,接受率达到 95%。
依然野兽般强劲。
相似文章
在 2x3090 NVLINK 上对 Qwen 3.6 27B MTP 进行基准测试
对 Qwen 3.6 27B MTP 在 4 张 RTX 3090 GPU 上的基准分析表明,基于 NVLink 的张量并行相较于 PCIe 配置可实现显著的吞吐量提升(最高达 +53%)。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
I benchmarked Unsloth's Qwen3.6-27B NVFP4 on 1x/2x 5090s. MTP is great until it really isn't.
详细基准测试:Unsloth的Qwen3.6-27B NVFP4模型在RTX 5090 GPU上的表现,显示MTP(多令牌预测)在短上下文的单次请求中能显著加速,但在批量并发或长上下文场景下则会带来不利影响。
@TheAhmadOsman: 顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以在单个 RTX 5090 上运行。
Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。