Qwen3.8-Flash 在 RTX3090 + 64GB RAM 上运行(但你只需 12GB VRAM)

Reddit r/LocalLLaMA 工具

摘要

本文提供了在 RTX 3090 和 64GB RAM 上运行 Qwen3.8-Flash AI 模型的详细指南,讨论了性能指标、量化设置以及使用 llamacpp 等工具的部署步骤。

我已将 Qwen3.8-Flash-next 运行在 RTX 3090、Ryzen 9 3950X、一块 PCIe 3.0 主板和 2020 年的 64GB DDR RAM 上。使用 IQ4_XS 权重、完整的 kvarn5 上下文、视觉在 GPU 上、专家在主机 RAM 上、n-gram 在磁盘上。MTP 可用,但实际上减慢了即使在 80% 草稿接受率下的解码速度,正如预期,因为每个被拒绝的令牌都消耗主机 RAM 带宽。我获得了 160 tok/s 的预填充速度和 16 tok/s 的解码速度,这使得它在我知道要离开至少几个小时时成为一个不错的选择,但不适合交互式工作。对于 Qwen 模型的 KLD 图表,kvarn5 的变体设置与 q8/q8 无法区分。如果你不想使用 Beellama,q5_0/q5_0 也可以(只是有非常微小的下降)。不过,有足够的余地,所以如果你愿意,可以将 KV 量化提升到 q8/q8。如果你将 KV 降低到 kvarn4 并将视觉塔卸载到 CPU,你可以将 VRAM 降至 16GB,为桌面留出足够空间——但那样的话,你必须确保不要呼吸太重,因为你的主机 RAM 几乎没有剩余空间来运行其他任何东西。我不推荐使用普通的 q4_0/q4_0 KV,因为下降开始变得可测量。你可以通过将 ub 从 2048 进一步降低到 512 来适应 12GB 显卡,但你的预填充速度将减半。如何部署 一键部署(CUDA Linux):https://github.com/crusaderky/pixi-llm-recipes。启动服务器时选择 llamacpp-source-cuda。它也应该适用于 Vulkan 和 ROCm,但未经测试。仅 llamacpp 分支:https://github.com/crusaderky/llama.cpp/releases/tag/beellama-staging-v0.4.4-r9;如果你等待,它最终会进入主 beellama 分支。或者你可以直接使用不带 kvarn 的 llamacpp 主版本。仅 llamacpp 预设:https://github.com/crusaderky/pixi-llm-recipes/blob/26ed50ace2a40772aa2b45d1358aaf0993fd5596/models.ini#L3-L94 u/andbeeld 我们能在 v0.4.4 最终版之前再从 llamacpp 主分支合并一次吗?你最新的合并是在添加 Qwen3.8-Flash 支持之前不久。但我听说你不应该将 KV 缓存量化降低到 q8/q8 以下?我不在乎人们的感受。我还没有测试这个模型,但我测试了
查看原文

相似文章

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。