GPU热专家重载功能是社区所需

Reddit r/LocalLLaMA 工具

摘要

请求LLaMA维护者实现一个名为'GPU热专家重载'的功能,以提高具有中等活跃参数的MOE模型的解码速度,使其在像3090这样的GPU上更易于本地使用。

请求LLaMA维护者大量帮忙——请实现这个功能。即使只有一张3090显卡,对于具有中等数量活跃参数的MOE模型,如Qwen3.8-Flash-Next、Deepseek V4/V4.1 Flash、GLM 5.3 Flash,解码速度也会有明显提升。使用2张3090,速度将非常接近将这些模型完全卸载到显存中的速度。这将使这些几乎达到最新水平的模型在本地真正可用。
查看原文

相似文章

专家优先的llama.cpp

Reddit r/LocalLLaMA

一位开发者创建了llama.cpp的实验性分支,该分支仅将已使用的专家(expert)而非完整层卸载到显存,从而在RTX 2060 12GB等显存有限的GPU上为MoE模型带来了速度提升。作者正在寻找测试者,以验证其在其他Nvidia GPU上的性能表现。

多层级MoE缓存

Reddit r/LocalLLaMA

讨论MoE模型的多层级缓存策略,通过将频繁激活的专家保留在GPU上来提升推理速度,参考了PowerInfer和llama.cpp分支等现有实现。