Muse Glimmer 居然真的能装进单张 RTX 3090

Reddit r/LocalLLaMA 模型

摘要

用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。

今天早上我做了一些测试,惊讶地发现 Muse Glimmer 实际上可以轻松地在单张 RTX 3090 上运行,使用完整上下文 + DFlash + mmproj,量化级别为 Q4_K_XL,这与 Qwen3.6-27B 和 Gemma-4-31B 不同。根据 Unsloth 的说法,Muse Glimmer 支持最高 256k 上下文。这是我的命令: llama-server \ --model Muse-Glimmer-30B-UD-Q4_K_XL.gguf \ --mmproj Muse-Glimmer-30B-mmproj-kquant.gguf \ --spec-draft-model Muse-Glimmer-30B-DFlash-kquant.gguf \ --spec-draft-ngl 999 \ --spec-draft-n-max 15 \ --spec-type draft-dflash \ -c 262144 \ --override-kv muse-glimmer.context_length=int:262144,dflash.context_length=int:262144 \ -ngl 999 \ -fit off \ --parallel 1 \ --flash-attn on \ --no-warmup \ --cache-type-k f16 \ --cache-type-v f16 \ --temp 1.0 \ --top-p 0.95 \ --top-k 64 \ --reasoning-preserve \ --jinja \ --host 127.0.0.1 \ --port 8080 这大约占用 22GB 到 23GB 的显存,实际上还剩下不少未使用的内存。在这张 RTX 3090 上,对于 Qwen3.6-27B 和 Gemma-4-31B,我使用它们的 Q4_K_XL 模型配合 MTP + mmproj,已经达到了 RTX 3090 显存的极限: 模型 F16 KV 缓存 Q8 KV 缓存 Qwen3.6-27B 70,000 tokens 125,000 tokens Gemma-4-31B 52,000 tokens 81,000 tokens 这些较小的上下文在 f16 下几乎无法使用,而且除非绝对必要,我不喜欢使用 Q8 KV,所以我大多使用较慢的 DGX Spark 来以完整上下文运行这些模型。对于 Muse Glimmer,似乎没有必要使用我的 DGX Spark,因为它在 RTX 3090 上运行得非常好。也许我可以在 Spark 上以完整 KV 运行多个并行智能体。Muse Glimmer 在我的 DFlash 测试中运行速度在 64 tok/s 到 124 tok/s 之间,取决于它输出的是散文还是代码。无论哪种方式,速度都相当不错。我观察到提示词处理速度约为 1400 tok/s。我还做了一次大约 150k tokens 的双针大海捞针测试,一根针放在开头,另一根放在结尾,模型第一次尝试就完美地找了出来,所以这绝对没有软限制到 128k 上下文。
查看原文

相似文章

Qwen 35B-A3B 在 12GB 显存下非常可用。

Reddit r/LocalLLaMA

一位用户在12GB的RTX 3060上对Qwen 35B-A3B(一个35B参数的MoE模型)进行了基准测试,发现12GB显存是运行该模型并支持32k上下文时的实用甜点区,生成速度可达约47 token/秒。