标签
本文提出一种使用基于幅值的专家掩码对混合专家模型进行系统敏感性分析的方法,发现后层对抗掩码更具韧性,这为模型压缩提供了实用途径。
一个采用融合架构的新型sub-6B稀疏激活AI模型,结合了LFM2.5-2.6B和Qwen3.6-35B-A3B的权重,以极小的尺寸实现了接近Qwen3.6-35B的性能。
提出了Generic TB-Coverage,一种覆盖感知的专家剪枝方法,用于稀疏Mixture-of-Experts语言模型,该方法仅使用通用文本语料库进行校准,并保留跨语料库专家覆盖,从而提高了准确率并减少了困惑度下降。