标签
本文提出了一种针对LLM的复合稀疏框架,结合了静态参数剪枝与动态令牌级计算,表明混合这两种机制优于单维压缩,并能延迟性能退化。
论文发现MoE大模型中约50%的专家计算浪费在不需要专家处理的token上,提出的ZEDA方法让模型学会跳过这些计算,最高节省一半专家计算。