@Snixtp: RTX Pro 6000 有两个矩阵乘法引擎,当我运行 Qwen3.6 27B NVFP4 时,vLLM 只使用了其中一个。Marlin 很不错…

X AI KOLs Timeline 工具

摘要

一位开发者发现,在 RTX Pro 6000 上运行 Qwen3.6 27B 模型时,vLLM 只使用了两个矩阵乘法引擎中的一个。Fable 5 编写的一个插件在每次调用时选择正确的引擎,使预填充性能几乎翻倍。

RTX Pro 6000 有两个矩阵乘法引擎,当我运行 Qwen3.6 27B NVFP4 时,vLLM 只使用了其中一个。 Marlin 适用于解码,但 CUTLASS 在处理大量 token 提示时速度快 3.5 倍。由于某种原因,vLLM 对两者都使用了 Marlin,因为 NVIDIA 的检查点文件错误标记了模型的实际能力。 Fable 5 发现了这一切,并编写了一个 vLLM 插件,该插件根据批次大小选择每次调用时使用的正确引擎。 结果是,在所有上下文长度下,预填充性能几乎翻倍:
查看原文
查看缓存全文

缓存时间: 2026/07/05 00:55

RTX Pro 6000 有两个 matmul 引擎,而当我运行 Qwen3.6 27B NVFP4 时,vLLM 只用了其中一个。

Marlin 在解码时表现不错,但 CUTLASS 在处理大量 token 的提示时速度快 3.5 倍。不知何故,vLLM 对两者都使用了 Marlin,因为 NVIDIA 的 checkpoint 文件错误地标记了模型实际能做什么。

Fable 5 发现了这一切,并编写了一个 vLLM 插件,该插件检查批次大小,并在每次调用时选择合适的引擎。

结果:在所有上下文长度下,预填充速度几乎提升 2 倍:

相似文章

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。

@Snixtp: https://x.com/Snixtp/status/2055734339346768225

X AI KOLs Timeline

某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。