Qwen3.8-Flash-Next 在 NVIDIA 5090 和 64GB 内存配置下使用 Llama.cpp - 似乎未使用 RAM?
摘要
用户分享了在配备 NVIDIA 5090 GPU 和 64GB RAM 的系统上使用 Llama.cpp 运行 Qwen3.8-Flash-Next 模型的性能结果和设置细节,指出推理过程中 RAM 使用量异常低。
实际上,我对我的 Qwen3.8-27b 设置相当满意,我一直在使用 Ninfer 调整一个版本,使其“快速但可能有点笨”,速度作为一个不错的后备选项。但我对 Flash-Next 版本的工作方式感到好奇,因为我了解到它不需要全部装入 VRAM 才能工作。我选择了 Atomic 量化(如果有更好的版本请告诉我,从我找到的信息来看这个似乎不错)。我使用了下面的构建设置。它仍然可以进一步调整,因为我目前只使用了大约 27GB 的显存。
./build/bin/llama-server \
--model "/mnt/SPCC-2TB/Projects/AI-APPS/LLM-Models/Qwen3.8-Flash-Next-Atomic/Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64 -00001-of-00033.gguf" \
--no-mmproj \
--load-mode mmap \
--lazy-mode on \
--fit off \
--gpu-layers all \
--n-cpu-moe 32 \
--ctx-size 64768 \
--flash-attn on \
--jinja \
--parallel 1
但我注意到一件奇怪的事——我知道其中一些部分旨在从 SSD 运行以节省显存空间等,这没问题。但我有点期望至少有一部分会缓冲到系统内存中,因为从内存运行会比从我的 NVMe 驱动器运行高效得多。但这次运行给了我以下结果:解码速度 40tok/s。提示处理速度 50tok/s(这是一个短提示,所以可能不准确)使用了 27GB 显存 使用了 8GB 系统内存... 所以... 我的意思是,我是不是错了,这是正常的?速度似乎没有我预期的那么差(我以为最多只有 10tok/s),但我觉得我可能错过了某个技巧?
相似文章
在6GB显存和16GB系统内存上运行Qwen 3.8 flash next的体验
一位用户分享了在配备6GB显存和16GB内存的系统上使用llama.cpp运行Qwen 3.8 flash next模型的体验,通过1位量化实现了6-7个每秒的生成速度,并寻求量化变体的推荐。
在16GB显存+32GB内存下运行Qwen 3.8 - 写给贫民窟GPU玩家的实用/趣味指南
一位Reddit用户分享了如何在拥有16GB显存和32GB内存的系统上,通过激进量化及特定llama.cpp设置成功运行Qwen 3.8 Next MoE模型,实现了在有限硬件上高效运行大模型的效果。
Qwen3.8-Flash-Next (UD-IQ4_XS) 在 2x RTX 3060 + 7800X3D 上的基准测试:从初始 36 tps 预填充到 400 tps 及其他基准测试(-sm tensor 陷阱)+ VRAM/RAM 使用情况
本文对 llama.cpp 和 ik_llama.cpp 在双 RTX 3060 硬件上运行 Qwen3.8-Flash-Next 模型进行基准测试,展示了优化 tensor splitting 和 ubatch 设置可以将预填充速度从 36 t/s 大幅提升至 400 t/s,并对比了 RAM 使用情况。
Qwen3.8-Flash 在 RTX3090 + 64GB RAM 上运行(但你只需 12GB VRAM)
本文提供了在 RTX 3090 和 64GB RAM 上运行 Qwen3.8-Flash AI 模型的详细指南,讨论了性能指标、量化设置以及使用 llamacpp 等工具的部署步骤。
榨干64GB内存:Qwen3.5 122B A10B(UD-Q2_K_XL,启用MTP)已完全取代我原本的Qwen3 Next 80B(UD-Q4_K_XL)
一位用户比较了在64GB内存系统上运行量化版Qwen3 Next 80B和Qwen3.5 122B的情况,指出了本地LLM推理中速度、质量和内存使用之间的权衡。