@Snixtp: RTX Pro 6000 有两个矩阵乘法引擎,当我运行 Qwen3.6 27B NVFP4 时,vLLM 只使用了其中一个。Marlin 很不错…
摘要
一位开发者发现,在 RTX Pro 6000 上运行 Qwen3.6 27B 模型时,vLLM 只使用了两个矩阵乘法引擎中的一个。Fable 5 编写的一个插件在每次调用时选择正确的引擎,使预填充性能几乎翻倍。
查看缓存全文
缓存时间: 2026/07/05 00:55
RTX Pro 6000 有两个 matmul 引擎,而当我运行 Qwen3.6 27B NVFP4 时,vLLM 只用了其中一个。
Marlin 在解码时表现不错,但 CUTLASS 在处理大量 token 的提示时速度快 3.5 倍。不知何故,vLLM 对两者都使用了 Marlin,因为 NVIDIA 的 checkpoint 文件错误地标记了模型实际能做什么。
Fable 5 发现了这一切,并编写了一个 vLLM 插件,该插件检查批次大小,并在每次调用时选择合适的引擎。
结果:在所有上下文长度下,预填充速度几乎提升 2 倍:
相似文章
Qwen 3.6 在双 RTX PRO 6000 上的基准测试
使用 VLLM 在双 RTX PRO 6000 GPU 上对 Qwen 3.6 27B 和 35B 模型进行基准测试,生成吞吐量高达每秒 3500 个令牌。
RTX Pro 4500 Blackwell - Qwen 3.6 27B?
一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。
@Snixtp: https://x.com/Snixtp/status/2055734339346768225
某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。
@superalesha: 别急着埋葬RTX 3090,先读完这个!@UnslothAI本周发布了qwen3.6-35b的两个新4位量化版本。我花了…
对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。
在24GB显存环境中运行Qwen 3.6 27B的配置:后端对比、量化选择与设置(llama.cpp, ik_llama.cpp, BeeLlama, vllm)
本文对比了在RTX 3090 24GB上运行Qwen 3.6 27B使用的llama.cpp后端,发现搭配IQ4_KS量化的ik_llama.cpp性能最佳(预填充1261 tok/s,解码72.9 tok/s)。