GPU热专家重载功能是社区所需
摘要
请求LLaMA维护者实现一个名为'GPU热专家重载'的功能,以提高具有中等活跃参数的MOE模型的解码速度,使其在像3090这样的GPU上更易于本地使用。
请求LLaMA维护者大量帮忙——请实现这个功能。即使只有一张3090显卡,对于具有中等数量活跃参数的MOE模型,如Qwen3.8-Flash-Next、Deepseek V4/V4.1 Flash、GLM 5.3 Flash,解码速度也会有明显提升。使用2张3090,速度将非常接近将这些模型完全卸载到显存中的速度。这将使这些几乎达到最新水平的模型在本地真正可用。
相似文章
一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s
一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。
专家优先的llama.cpp
一位开发者创建了llama.cpp的实验性分支,该分支仅将已使用的专家(expert)而非完整层卸载到显存,从而在RTX 2060 12GB等显存有限的GPU上为MoE模型带来了速度提升。作者正在寻找测试者,以验证其在其他Nvidia GPU上的性能表现。
llama.cpp 专家池分支:针对 Qwen 3.8 Flash next IQ4 + 16Gb 显存在 MI50 gfx906 上带参数测试
llama.cpp 的一个非官方分支为混合专家模型引入了持久化的专家池,优化以减少在 16GB AMD gfx906 GPU 上通过 PCIe 的专家重新拷贝,从而提升大上下文长度的解码吞吐量。
多层级MoE缓存
讨论MoE模型的多层级缓存策略,通过将频繁激活的专家保留在GPU上来提升推理速度,参考了PowerInfer和llama.cpp分支等现有实现。
尝试预测下一个token会用到哪些MoE专家来加速CPU/GPU offload,得到了一些实际数据,这真的可实现吗还是我在浪费时间(30tg/s -> 150-200tg/s)
探索通过预测下一个token将使用的MoE专家来改进CPU/GPU offload,实现了30->150-200 tg/s的加速,并质疑实现可行性。