基于幅值的专家掩码实现混合专家模型的深度感知敏感性分析
摘要
本文提出一种使用基于幅值的专家掩码对混合专家模型进行系统敏感性分析的方法,发现后层对抗掩码更具韧性,这为模型压缩提供了实用途径。
arXiv:2608.13565v1 公告类型:新
摘要:混合专家架构在保持计算效率的同时,通过稀疏激活扩展了大型语言模型。尽管该架构被广泛采用,但各混合专家层的相对重要性尚未得到充分研究,尤其在模型压缩方面。本文基于幅值的专家掩码,在XLCoST跨语言代码翻译基准测试中,对Qwen3.6-35B-A3B模型进行了系统性逐层敏感性分析。该模型包含40个混合专家层,每层256个专家,采用top-8路由机制。我们在三个H100 GPU服务器上,针对100、300和500个提示的评估规模进行了多阶段研究。核心发现表明层敏感性与深度强相关:早期层和中间层对抗掩码高度敏感,而后期层可容忍对低幅值专家的激进掩码。全局30%掩码率在300提示规模下仅保留150/300个“良好+相似”输出,而聚焦后期层的掩码策略在掩码640-1,145个专家时仍能保留249-255/300个输出。在后续500提示验证集上,极后期策略实现了最佳质量/掩码专家平衡,仅掩码10,240个总专家中的640个即保留419/500个输出。此外,将top-k路由宽度从每令牌8个缩减至6个活跃专家时,在100提示测试中观察到显著运行时间缩短且无质量损失,但尚未与激进专家掩码有效结合。这些发现为深度感知的混合专家掩码提供了实证基础,确立了走向物理权重剪枝、基于激活的专家评分与训练恢复的实用路径。
查看缓存全文
缓存时间: 2026/08/17 09:36
# 基于幅度的专家屏蔽:混合专家模型的深度感知敏感性分析 来源:https://arxiv.org/abs/2608.13565 查看PDF(https://arxiv.org/pdf/2608.13565) > **摘要**:混合专家(MoE)架构通过稀疏激活机制在保持计算效率的同时扩展了大语言模型(LLM)。尽管该架构已被广泛应用,但各MoE层的相对重要性仍缺乏充分研究,尤其在模型压缩领域。本文针对Qwen3.6-35B-A3B模型(含40个MoE层,每层256个专家,Top-8路由机制)在XLCoST跨语言代码翻译基准测试上,采用基于幅度的专家屏蔽方法进行系统性的逐层敏感性分析。我们在三台H100 GPU服务器上,通过100、300、500提示词规模的多阶段实验进行研究。核心发现表明层敏感性具有显著的深度依赖性:早期层(0-9)和中间层(10-29)对专家屏蔽极为敏感,而后期层(30-39),特别是极后期层(35-39),能容忍对低幅度专家的激进屏蔽。在300提示词规模下,30%的全局均等屏蔽策略仅保留150/300个良好/相似输出,而聚焦后期层的策略在屏蔽640-1145个专家的同时可保留249-255/300个输出。在后续500提示词验证集上,窄范围极后期策略(层35-39 @ 50%屏蔽率)在质量与屏蔽专家数量的权衡中表现最优,保留了419/500个良好/相似输出且仅屏蔽640个专家(总专家数10240)。此外,我们将每标记活跃专家数从8降至6的路由宽度缩减实验显示:在100提示词测试中观察到显著的时间缩减且无质量损失,但该方法尚无法与激进专家屏蔽策略有效结合。这些发现为深度感知的MoE专家屏蔽提供了实证基础,并为物理权重手术、基于激活的专家评分及训练恢复等实用路径奠定理论基础。 ## 投稿历史 来自:Hritvik Shrivastava [查看邮件(https://arxiv.org/show-email/ccc7963c/2608.13565)] **[v1]** 2026年6月25日(周四)05:00:34 UTC(277 KB)
相似文章
PuzzleMoE:通过稀疏专家合并和位打包推理实现大型混合专家模型的高效压缩
PuzzleMoE 提出了一种成对双掩码专家合并算法和位级打包技术,用于压缩大型混合专家模型,在保持性能的同时减少存储并加速推理。
输出稀释:MoE 模型中冗余但脆弱的表示
本文揭示,Mixture-of-Experts 模型在探测中编码道德内容的鲁棒性与密集模型相当,但由于输出稀释,它们更为脆弱。输出稀释是指聚合的专家输出稀释了信号,使表示容易受到噪声的影响。
将混合专家模型剪枝与蒸馏为稠密语言模型
一个系统框架通过专家评分、选择、分组和知识蒸馏将混合专家模型转换为稠密架构,相比传统剪枝方法实现了更优的性能和效率。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。
形状变换专家压缩:LorExperts与BTExperts
本文介绍了LorExperts和BTExperts,这两种面向混合专家大语言模型的保留路由器压缩方法,通过聚类专家并将非主导成员表示为低秩修正,相较于D2-MoE等先前方法提升了压缩质量。