基于 llama.cpp 的专家扩展
摘要
一位开发者构建了 llama.cpp 的自定义分支,为混合专家(MoE)模型实现了专家扩展功能,已在 Metal 上完成测试,现寻求跨平台反馈。
借助 Glm 5.3 flash,我构建了 llama.cpp 的自定义分支,用于支持 MOE 模型的专家扩展。该版本目前仅在 Metal 上测试过,效果优于我的 DS4 版本。我希望能获得来自其他平台及不同模型的反馈。moex-expansion
相似文章
专家优先的llama.cpp
一位开发者创建了llama.cpp的实验性分支,该分支仅将已使用的专家(expert)而非完整层卸载到显存,从而在RTX 2060 12GB等显存有限的GPU上为MoE模型带来了速度提升。作者正在寻找测试者,以验证其在其他Nvidia GPU上的性能表现。
大型语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行
一篇关于LLM中混合专家架构的技术综述,沿着专家粒度、拓扑、路由、负载均衡和执行来组织演进,并提出了架构里程碑和控制平面的互补视角。
llama.cpp 在混合专家模型(MoE)和 GPU+CPU 卸载场景下,P 核比 E 核更慢?
观察到在使用 GPU+CPU 卸载运行混合专家模型时,llama.cpp 在 P 核上的运行速度比 E 核慢。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。
每次在 vLLM 和 llama.cpp 上换模型都要重写参数,所以我建了个工具来管理它们(llmux, MIT)
一位开发者构建了 llmux,这是一个开源工具,用于简化跨不同引擎(如 vLLM 和 llama.cpp)管理模型配置,支持一键切换,并集成了 Docker 和 NVIDIA GPU 支持。