在4080与64GB DDR5上运行Qwen Flash Q4_K_M,约8tk/s,98304上下文。
摘要
作者演示了如何在4080 GPU和64GB DDR5上运行182B的Qwen模型,通过将ngrams转移到SSD,实现了比27B模型更快、更智能的性能,使大型模型推理在消费级硬件上变得可行。
成功将182B模型塞入我的小型设置中。技巧是将ngrams转移到SSD,从而能够容纳模型的其余部分。信不信由你,这比Qwen3.8 27B模型更快、更智能。这对小型GPU用户来说是个福音,因为我们通常无法使用27B模型。注意在运行此命令之前,请确保关闭所有不必要的后台任务、应用程序等。
llama.exe serve ` -hf "AtomicChat/Qwen3.8-Flash-Next-GGUF" ` -hff "Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64/Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64-00001-of-00033.gguf" ` --no-mmproj ` --offline ` --load-mode mmap ` --tensor-read-lazy on ` --fit off ` -ngl all ` -ncmoe 41 ` -t 16 ` -tb 16 ` -c 8192 ` -b 256 ` -ub 128 ` -fa on ` --jinja ` --parallel 1 ` --temp 1 ` --top-p 0.95 ` --top-k 20 ` --min-p 0 ` --cors-origins localhost ` --host 127.0.0.1 ` --port 8080
相似文章
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
@iotcoi:Qwen3.6-27B-FP8 + Dflash + DDTree,256k 上下文,10 个智能体,单颗 49W GB10 上峰值 200 tokens/s,平均解码 136 tokens/s
量化版 27B Qwen3.6 在单颗 49W GB10 GPU 上借助 Dflash+DDTree 优化,256k 上下文、10 智能体并发,峰值达 200 tok/s,平均 136 tok/s。
大家忽略了 Qwen 3.8 27B Q2 + Q2 DFlash + Q5 KV 的实力
一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。