Glimmer:5090上使用Dflash实现233.4 tps

Reddit r/LocalLLaMA 模型

摘要

据报道,Glimmer在RTX 5090上使用Dflash达到了233.4 tps,256k上下文可装进24GB显存,令用户兴奋不已。

这太疯狂了!我还没机会在家里的4090上测试,但听起来非常有前途。而且这里读到,与Qwen不同,24GB上轻松达到256k CTX。超级兴奋!
查看原文

相似文章

Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s

Reddit r/LocalLLaMA

一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。

Muse Glimmer 居然真的能装进单张 RTX 3090

Reddit r/LocalLLaMA

用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。