Muse Glimmer 居然真的能装进单张 RTX 3090
摘要
用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。
今天早上我做了一些测试,惊讶地发现 Muse Glimmer 实际上可以轻松地在单张 RTX 3090 上运行,使用完整上下文 + DFlash + mmproj,量化级别为 Q4_K_XL,这与 Qwen3.6-27B 和 Gemma-4-31B 不同。根据 Unsloth 的说法,Muse Glimmer 支持最高 256k 上下文。这是我的命令:
llama-server \
--model Muse-Glimmer-30B-UD-Q4_K_XL.gguf \
--mmproj Muse-Glimmer-30B-mmproj-kquant.gguf \
--spec-draft-model Muse-Glimmer-30B-DFlash-kquant.gguf \
--spec-draft-ngl 999 \
--spec-draft-n-max 15 \
--spec-type draft-dflash \
-c 262144 \
--override-kv muse-glimmer.context_length=int:262144,dflash.context_length=int:262144 \
-ngl 999 \
-fit off \
--parallel 1 \
--flash-attn on \
--no-warmup \
--cache-type-k f16 \
--cache-type-v f16 \
--temp 1.0 \
--top-p 0.95 \
--top-k 64 \
--reasoning-preserve \
--jinja \
--host 127.0.0.1 \
--port 8080
这大约占用 22GB 到 23GB 的显存,实际上还剩下不少未使用的内存。在这张 RTX 3090 上,对于 Qwen3.6-27B 和 Gemma-4-31B,我使用它们的 Q4_K_XL 模型配合 MTP + mmproj,已经达到了 RTX 3090 显存的极限:
模型 F16 KV 缓存 Q8 KV 缓存
Qwen3.6-27B 70,000 tokens 125,000 tokens
Gemma-4-31B 52,000 tokens 81,000 tokens
这些较小的上下文在 f16 下几乎无法使用,而且除非绝对必要,我不喜欢使用 Q8 KV,所以我大多使用较慢的 DGX Spark 来以完整上下文运行这些模型。对于 Muse Glimmer,似乎没有必要使用我的 DGX Spark,因为它在 RTX 3090 上运行得非常好。也许我可以在 Spark 上以完整 KV 运行多个并行智能体。Muse Glimmer 在我的 DFlash 测试中运行速度在 64 tok/s 到 124 tok/s 之间,取决于它输出的是散文还是代码。无论哪种方式,速度都相当不错。我观察到提示词处理速度约为 1400 tok/s。我还做了一次大约 150k tokens 的双针大海捞针测试,一根针放在开头,另一根放在结尾,模型第一次尝试就完美地找了出来,所以这绝对没有软限制到 128k 上下文。
相似文章
可达 253 t/s - unsloth/Muse Glimmer 30B UD-Q5_K_M 在 5090 上
在 RTX 5090 上对 unsloth 的 Muse Glimmer 30B 进行基准测试,采用推测解码,使用 DFlash 草稿模型和基于 GPU 的 argmax PR,最高可达 253 t/s,不过该 PR 仍是草稿状态。
使用一天后,我觉得可以这么说:Muse-Glimmer-30B 在部分使用场景下终于以同等规模击败了 3.6-27B
一位用户报告称,Muse-Glimmer-30B 在推理效率和常识知识方面优于 Qwen3.6-27B,但在编码方面稍弱,使其成为 24GB GPU 上的可行选择。
Glimmer:5090上使用Dflash实现233.4 tps
据报道,Glimmer在RTX 5090上使用Dflash达到了233.4 tps,256k上下文可装进24GB显存,令用户兴奋不已。
Qwen 35B-A3B 在 12GB 显存下非常可用。
一位用户在12GB的RTX 3060上对Qwen 35B-A3B(一个35B参数的MoE模型)进行了基准测试,发现12GB显存是运行该模型并支持32k上下文时的实用甜点区,生成速度可达约47 token/秒。
RTX 5080 16GB:Qwen3.6 35B MoE 在 128k 上下文下的表现——56 tok/s,以及 MTP 为何无济于事
Qwen3.6 35B MoE 在 RTX 5080 16GB 上的详细基准测试表明,MTP(多令牌预测)由于显存限制,在 128k 上下文中无法提升推理速度;最佳配置为不带 MTP 的 Q4_K_XL,在 128k 上下文下生成速度约 56 tok/s。