在4080与64GB DDR5上运行Qwen Flash Q4_K_M,约8tk/s,98304上下文。

Reddit r/LocalLLaMA 模型

摘要

作者演示了如何在4080 GPU和64GB DDR5上运行182B的Qwen模型,通过将ngrams转移到SSD,实现了比27B模型更快、更智能的性能,使大型模型推理在消费级硬件上变得可行。

成功将182B模型塞入我的小型设置中。技巧是将ngrams转移到SSD,从而能够容纳模型的其余部分。信不信由你,这比Qwen3.8 27B模型更快、更智能。这对小型GPU用户来说是个福音,因为我们通常无法使用27B模型。注意在运行此命令之前,请确保关闭所有不必要的后台任务、应用程序等。 llama.exe serve ` -hf "AtomicChat/Qwen3.8-Flash-Next-GGUF" ` -hff "Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64/Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64-00001-of-00033.gguf" ` --no-mmproj ` --offline ` --load-mode mmap ` --tensor-read-lazy on ` --fit off ` -ngl all ` -ncmoe 41 ` -t 16 ` -tb 16 ` -c 8192 ` -b 256 ` -ub 128 ` -fa on ` --jinja ` --parallel 1 ` --temp 1 ` --top-p 0.95 ` --top-k 20 ` --min-p 0 ` --cors-origins localhost ` --host 127.0.0.1 ` --port 8080
查看原文

相似文章