这效果如何? 262k Qwen3.8:27B-Q4_K_M

Reddit r/LocalLLaMA 模型

摘要

用户已在异构 GPU 环境中为 Qwen3.8 模型实现了 nvfp4 KV 缓存支持,使用自定义 CUDA 内核和量化来优化性能。

https://preview.redd.it/j13iin0jsfqh1.png?width=1129&format=png&auto=webp&s=3efdd2ad5c10de908aed1a673a6c7e6440177c09 https://preview.redd.it/k3fsrdspzfqh1.png?width=391&format=png&auto=webp&s=1c8176876ac03a79e779c9b67f3def57f42a4064 我在现有的 ollama 分支的异构上游端口上实现了 nvfp4 KV 缓存支持。我不得不编辑 llama.cpp、自定义 CUDA 内核,并且一开始就修复了现有内核中的实际错误。我使用计算感知层分布将模型分割在 RTX 5090 和 RTX 3090TI 之间,同时将输出层锁定在 5090 上以实现最大性能。我还使用巧妙的 f16 重打包自己从 fp16 源量化了 Qwen3.8:27B,采用自定义 Q4_K_M 权重。简要总结:计算感知分发。通过 CUDA_ARCH 拆分 FA 内核,而不仅仅是 FP16 能力。SM86 TILE。SM120 VEC 路径分开。q8_0 基线。修复了 262k 上下文下的 TILE 边界 nwarps 溢出,q8_0 在两张卡上都通过。MXFP4 17B 错误。仅 SM120 的 block_mxfp4=17B+向量加载 ld.global = 未对齐 0x7ff95b398141。修复 3 memcpy 字节加载 + 螺距 17-> 32 NVFP4 8B - 相同模式,block_nvfp4 缩放,相同字节加载修复适用 结果:神奇的修复是 fattn-vec.cuh memcpy(&k, K+off*17, 17) // Blackwell 无法向量加载 17B
查看原文

相似文章

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。

v100s上Qwen3.6 27B NVFP4达366 t/s

Reddit r/LocalLLaMA

介绍了v100-skinny,一个自定义内核库,支持在V100(sm70)GPU上进行快速NVFP4推理,在最佳情况下的抽取中为Qwen3.6 27B实现366 t/s,而结构化生成和代码生成的速度较低。