Qwen3.8-Flash 在 RTX3090 + 64GB RAM 上运行(但你只需 12GB VRAM)
摘要
本文提供了在 RTX 3090 和 64GB RAM 上运行 Qwen3.8-Flash AI 模型的详细指南,讨论了性能指标、量化设置以及使用 llamacpp 等工具的部署步骤。
我已将 Qwen3.8-Flash-next 运行在 RTX 3090、Ryzen 9 3950X、一块 PCIe 3.0 主板和 2020 年的 64GB DDR RAM 上。使用 IQ4_XS 权重、完整的 kvarn5 上下文、视觉在 GPU 上、专家在主机 RAM 上、n-gram 在磁盘上。MTP 可用,但实际上减慢了即使在 80% 草稿接受率下的解码速度,正如预期,因为每个被拒绝的令牌都消耗主机 RAM 带宽。我获得了 160 tok/s 的预填充速度和 16 tok/s 的解码速度,这使得它在我知道要离开至少几个小时时成为一个不错的选择,但不适合交互式工作。对于 Qwen 模型的 KLD 图表,kvarn5 的变体设置与 q8/q8 无法区分。如果你不想使用 Beellama,q5_0/q5_0 也可以(只是有非常微小的下降)。不过,有足够的余地,所以如果你愿意,可以将 KV 量化提升到 q8/q8。如果你将 KV 降低到 kvarn4 并将视觉塔卸载到 CPU,你可以将 VRAM 降至 16GB,为桌面留出足够空间——但那样的话,你必须确保不要呼吸太重,因为你的主机 RAM 几乎没有剩余空间来运行其他任何东西。我不推荐使用普通的 q4_0/q4_0 KV,因为下降开始变得可测量。你可以通过将 ub 从 2048 进一步降低到 512 来适应 12GB 显卡,但你的预填充速度将减半。如何部署 一键部署(CUDA Linux):https://github.com/crusaderky/pixi-llm-recipes。启动服务器时选择 llamacpp-source-cuda。它也应该适用于 Vulkan 和 ROCm,但未经测试。仅 llamacpp 分支:https://github.com/crusaderky/llama.cpp/releases/tag/beellama-staging-v0.4.4-r9;如果你等待,它最终会进入主 beellama 分支。或者你可以直接使用不带 kvarn 的 llamacpp 主版本。仅 llamacpp 预设:https://github.com/crusaderky/pixi-llm-recipes/blob/26ed50ace2a40772aa2b45d1358aaf0993fd5596/models.ini#L3-L94 u/andbeeld 我们能在 v0.4.4 最终版之前再从 llamacpp 主分支合并一次吗?你最新的合并是在添加 Qwen3.8-Flash 支持之前不久。但我听说你不应该将 KV 缓存量化降低到 q8/q8 以下?我不在乎人们的感受。我还没有测试这个模型,但我测试了
相似文章
Qwen3.8-Flash-Next (UD-IQ4_XS) 在 2x RTX 3060 + 7800X3D 上的基准测试:从初始 36 tps 预填充到 400 tps 及其他基准测试(-sm tensor 陷阱)+ VRAM/RAM 使用情况
本文对 llama.cpp 和 ik_llama.cpp 在双 RTX 3060 硬件上运行 Qwen3.8-Flash-Next 模型进行基准测试,展示了优化 tensor splitting 和 ubatch 设置可以将预填充速度从 36 t/s 大幅提升至 400 t/s,并对比了 RAM 使用情况。
在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
运行 Qwen3.8-Flash-Next 的最低配置要求是什么?
用户询问运行 Qwen3.8-Flash-Next AI 模型所需的最低硬件规格(如内存和显存),包括预期性能指标。
在4080与64GB DDR5上运行Qwen Flash Q4_K_M,约8tk/s,98304上下文。
作者演示了如何在4080 GPU和64GB DDR5上运行182B的Qwen模型,通过将ngrams转移到SSD,实现了比27B模型更快、更智能的性能,使大型模型推理在消费级硬件上变得可行。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。