基于 llama.cpp 的专家扩展

Reddit r/LocalLLaMA 工具

摘要

一位开发者构建了 llama.cpp 的自定义分支,为混合专家(MoE)模型实现了专家扩展功能,已在 Metal 上完成测试,现寻求跨平台反馈。

借助 Glm 5.3 flash,我构建了 llama.cpp 的自定义分支,用于支持 MOE 模型的专家扩展。该版本目前仅在 Metal 上测试过,效果优于我的 DS4 版本。我希望能获得来自其他平台及不同模型的反馈。moex-expansion
查看原文

相似文章

专家优先的llama.cpp

Reddit r/LocalLLaMA

一位开发者创建了llama.cpp的实验性分支,该分支仅将已使用的专家(expert)而非完整层卸载到显存,从而在RTX 2060 12GB等显存有限的GPU上为MoE模型带来了速度提升。作者正在寻找测试者,以验证其在其他Nvidia GPU上的性能表现。