标签
一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。
一位开发者构建了 llama.cpp 的自定义分支,为混合专家(MoE)模型实现了专家扩展功能,已在 Metal 上完成测试,现寻求跨平台反馈。