Qwen3.8-Flash-Next 在 NVIDIA 5090 和 64GB 内存配置下使用 Llama.cpp - 似乎未使用 RAM?

Reddit r/LocalLLaMA 新闻

摘要

用户分享了在配备 NVIDIA 5090 GPU 和 64GB RAM 的系统上使用 Llama.cpp 运行 Qwen3.8-Flash-Next 模型的性能结果和设置细节,指出推理过程中 RAM 使用量异常低。

实际上,我对我的 Qwen3.8-27b 设置相当满意,我一直在使用 Ninfer 调整一个版本,使其“快速但可能有点笨”,速度作为一个不错的后备选项。但我对 Flash-Next 版本的工作方式感到好奇,因为我了解到它不需要全部装入 VRAM 才能工作。我选择了 Atomic 量化(如果有更好的版本请告诉我,从我找到的信息来看这个似乎不错)。我使用了下面的构建设置。它仍然可以进一步调整,因为我目前只使用了大约 27GB 的显存。 ./build/bin/llama-server \ --model "/mnt/SPCC-2TB/Projects/AI-APPS/LLM-Models/Qwen3.8-Flash-Next-Atomic/Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64 -00001-of-00033.gguf" \ --no-mmproj \ --load-mode mmap \ --lazy-mode on \ --fit off \ --gpu-layers all \ --n-cpu-moe 32 \ --ctx-size 64768 \ --flash-attn on \ --jinja \ --parallel 1 但我注意到一件奇怪的事——我知道其中一些部分旨在从 SSD 运行以节省显存空间等,这没问题。但我有点期望至少有一部分会缓冲到系统内存中,因为从内存运行会比从我的 NVMe 驱动器运行高效得多。但这次运行给了我以下结果:解码速度 40tok/s。提示处理速度 50tok/s(这是一个短提示,所以可能不准确)使用了 27GB 显存 使用了 8GB 系统内存... 所以... 我的意思是,我是不是错了,这是正常的?速度似乎没有我预期的那么差(我以为最多只有 10tok/s),但我觉得我可能错过了某个技巧?
查看原文

相似文章