通过增加MOE(Qwen 35B A4B+)中每个token的活跃参数,推理token减少8.5%——无需训练或微调!

Reddit r/LocalLLaMA 论文

摘要

一篇论文介绍了一种针对稀疏MoE模型的推理时优化方法,通过调整后期transformer层中的专家选择,在无需重新训练的情况下,将推理token减少8.5%,延迟降低10.9%,同时保持准确性。

我想分享一篇刚发表的短文,探讨了一种针对稀疏MoE推理模型的简单但效果出奇的优化方法。其想法是:无需重新训练任何东西,我们只需在运行时微调路由器。具体来说,我们仅在后期的transformer层中扩展专家选择预算(N≥KN≥K),并对额外的专家应用线性衰减因子。早期层保持不变。因此,Qwen 3.6 35B A3B 变成了 Qwen 3.6 35B A4B+!我们发现——“简洁收敛”:当在关键决策的最终层给予模型更多专家容量时,它就不再啰嗦。它通过显著更短的推理轨迹达到相同的正确答案。在完整的MMLU-Pro(714个问题,Qwen3.6-35B-A3B)上的结果:📉 平均推理token减少8.5% ⚡ 延迟降低10.9%(p=6.5×10−6) 🎯 准确性未变(84.5% vs 84.0% 原生,p=0.77 — 统计上无显著差异) 🆓 零训练成本——纯推理时路由修改 链接:📄 论文:https://zenodo.org/records/22255483 在那里你也可以查看我的github仓库(含beta版本代码)和MMLU-Pro基准的详细json结果。未来我希望能在更大的模型如DeepSeek V4 Flash Q2.0上进行同样的实验。我是一位非英语母语者,这篇文章的部分内容是借助AI生成的,以方便翻译。
查看原文

相似文章

少即是MoE:裁剪领域专用语言模型中的专家

arXiv cs.LG

本文介绍了Fisher-MoE,一种通过使用Fisher重要性裁剪FFN层中间维度来压缩混合专家模型的方法,实现了45%的权重内存减少和21%的吞吐量提升,且未造成显著的能力损失。