我构建了LEMoE:一个用于本地LLM的无状态、轻量级专家混合(MoE)路由器。开源,欢迎反馈!

Reddit r/ArtificialInteligence 工具

摘要

LEMoE是一个开源、无状态的专家混合(MoE)路由器,作为API代理将提示路由到专门的LLM,具有级联上下文路由和静默自纠正功能。

大家好,我想和大家分享一个我正在进行的项目,名为LEMoE(Light Easy Mix of Experts)。 **背景与构建原因**:我一直对专家混合(MoE)架构着迷,但我想进一步扩展这个概念并以更广泛的方式使用它。我觉得大多数现有方案要么过于臃肿,嵌入特定模型权重,要么缺乏高级路由逻辑。我想要一个灵活的外部路由层,能够协调不同的专用API(如Ollama、OpenAI等),并具备更实用、更适合生产环境的特性。 **功能与工作原理**:LEMoE作为API代理(完全兼容OpenAI和Ollama客户端)。您通过JSON配置不同的“专家”(专门用于编码、写作、推理等的LLM)。当有提示输入时,它会将其路由到最佳专家。但我想添加一些智能特性,使其脱颖而出: * **级联上下文路由**:大多数API路由器只评估最后一条提示,当用户说“缩短它”这样模糊的话时就会失效。LEMoE无状态地评估对话历史中的最后2-3条消息,以保持主题连续性,仅在置信度低时进行级联。 * **静默自纠正**:如果某个后端专家失败(API超时、服务器宕机等),LEMoE会静默且立即将请求重定向到备用专家。最终用户永远不会看到错误,管理端会在服务器端记录日志。 * **完全无状态**:无需数据库、复杂会话或大量内存占用。一切通过标准API消息数组即时处理。 与竞品对比:与原生MoE模型(需要大量显存和专用硬件来加载多个专家)不同,LEMoE允许您在标准硬件上运行轻量级本地模型(或将其与外部API混合)。与简单的API路由器相比,LEMoE能处理多轮对话上下文以进行路由,并内置静默错误故障转移功能。 **当前状态与许可证**:该项目正在积极开发中。它已准备就绪,但由于处于积极开发阶段,可能仍存在一些错误。我非常希望各位能测试一下,并给我反馈、建议或功能请求!它完全免费且开源,仅限个人/非商业用途。 **链接:** GitHub仓库:[https://github.com/lemoelink/LeMoE](https://github.com/lemoelink/LeMoE) 文档(英文):[https://docs.lemoe.link/en/](https://docs.lemoe.link/en/) 官方网站:[https://lemoe.link/](https://lemoe.link/)
查看原文

相似文章

dMoE: 具有可学习块专家的扩散大语言模型

arXiv cs.CL

dMoE 提出了用于扩散大语言模型的块级专家路由,将唯一激活的专家数量从 69.5 降至 14.6,同时保留了 99.11% 的性能,并实现了 76-80% 的内存减少和 1.14-1.66 倍的加速。

粘性路由:训练MoE模型以实现内存高效推理

arXiv cs.LG

StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。

专家感知的拒绝引导

arXiv cs.CL

本文将拒绝引导(基于激活的越狱方法)扩展至混合专家(MoE)大语言模型,发现 MoE 的路由模式并不会阻碍引导效果,并提出了专家感知方法,可基于单个专家的输出来抑制拒绝行为。