关于生物医学领域中剪枝混合专家模型的效用和事实可靠性

arXiv cs.LG 论文

摘要

本文研究了在生物医学领域对混合专家(MoE)模型进行领域特定专家剪枝对效用和事实可靠性的影响。研究发现,适度剪枝能保持领域内效用且不会立即导致可靠性下降,但极端剪枝会增加幻觉风险,且跨领域设置下的泛化能力会迅速恶化。

arXiv:2607.01444v1 公告类型:新 摘要:混合专家(MoE)模型通过选择性激活实现推理加速,但由于需加载整个网络,内存占用较大。结构化专家剪枝是一种在资源受限环境中降低部署成本的实用方法。然而,先前研究主要评估基准效用,对剪枝如何影响事实可靠性的探讨不足,尤其是在生物医学等高风险领域。本文研究了领域特定专家剪枝对效用和可靠性的影响。我们评估了四种MoE模型、六种剪枝方法以及多种剪枝比例,涉及领域内(生物医学)和跨领域设置下的生成与分类任务。结果表明,适度剪枝能保持领域内效用且不会立即导致可靠性下降,但极端剪枝比例下幻觉风险会增加。当转向通用领域时,效用和可靠性均迅速恶化。这些发现表明,安全压缩高度依赖于任务和领域。仅通过效用评估剪枝后的MoE模型不足以支持高风险部署,还需进行可靠性评估。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:40

# 关于生物医学领域剪枝混合专家模型的实用性与事实可靠性 来源:https://arxiv.org/html/2607.01444 Atsuki Yamaguchi1,2Szymon Palucha2Léo Bijar2 Aline Villavicencio1,3,4Nikolaos Aletras1 1谢菲尔德大学,英国2阿斯利康 3埃克塞特大学,英国4北里奥格兰德联邦大学,巴西 \{ayamaguchi1,a\.villavicencio,n\.aletras\}@sheffield\.ac\.uk ###### 摘要 混合专家(MoE)模型通过选择性激活实现推理加速,但由于必须加载整个网络,带来了巨大的内存需求。结构化专家剪枝是一种在资源受限环境下降低部署成本的实用方法。然而,先前的研究主要评估基准实用性,剪枝对事实可靠性的影响尚未得到充分探索,尤其是在生物医学等高风险领域。在本文中,我们研究了领域特定专家剪枝如何同时影响实用性和可靠性。我们评估了四种MoE模型、六种剪枝方法以及多种剪枝比率,涵盖领域内(生物医学)和跨领域设置下的生成与分类任务。结果表明,适度剪枝可在不立即降低可靠性的情况下保持领域内实用性,尽管在极端剪枝比率下幻觉风险会增加。当迁移到通用领域时,实用性和可靠性均迅速下降。这些发现表明,安全压缩在很大程度上取决于任务和领域。仅凭实用性评估剪枝后的MoE模型对于高风险部署是不够的,必须同时进行可靠性评估。111我们的代码可在https://github.com/gucci-j/moe-pruning-reliability获取。 ## 1引言 现代大型语言模型(LLM),如Qwen3.6(Qwen团队,2026(https://arxiv.org/html/2607.01444#bib.bib48))、GPT-OSS(OpenAI等,2025(https://arxiv.org/html/2607.01444#bib.bib45))和Nemotron3(NVIDIA等,2025(https://arxiv.org/html/2607.01444#bib.bib44)),均采用混合专家(MoE)架构。在前向传播过程中,MoE模型仅激活网络的一个子集,通过将每个token路由到称为专家的专门子网络(Du等,2022(https://arxiv.org/html/2607.01444#bib.bib14);Cai等,2025(https://arxiv.org/html/2607.01444#bib.bib3))。它们实现了强大的性能,同时提供了显著的推理加速。然而,这种效率并未消除部署期间的内存开销。在推理时,所有专家必须保持加载在内存中,这导致内存占用比具有可比活动参数数量的密集模型大得多。 参见图注 图1:生物医学文本摘要中的幻觉示例,其中红色高亮文本表示一个术语,它颠倒了原文的含义,同时仍然看似合理。缓解这一约束的一种流行方法是专家剪枝,它基于从小型校准数据集(Chen等,2022(https://arxiv.org/html/2607.01444#bib.bib6);Muzio等,2024(https://arxiv.org/html/2607.01444#bib.bib43);Lu等,2024(https://arxiv.org/html/2607.01444#bib.bib40),以及其他)估计的信息量(即显著性)标准来消除冗余专家。在这些方法中,已经提出了领域特定专家剪枝,以针对特定领域(如生物医学)定制压缩模型(Dong等,2025(https://arxiv.org/html/2607.01444#bib.bib13))。然而,先前的研究主要在下游基准性能(即实用性)上评估剪枝方法。因此,他们忽略了所得压缩模型的可靠性,包括事实一致性、忠实性和幻觉预防(Ji等,2023(https://arxiv.org/html/2607.01444#bib.bib28);Pal等,2023(https://arxiv.org/html/2607.01444#bib.bib46))。这种疏忽在生物医学等高危领域尤其严重,因为事实错误可能导致关键的现实世界失败(Weidinger等,2022(https://arxiv.org/html/2607.01444#bib.bib55);Moor等,2023(https://arxiv.org/html/2607.01444#bib.bib42))。此外,基准实用性并不总是与事实可靠性一致。Chrysostomou等人(2024(https://arxiv.org/html/2607.01444#bib.bib10))指出,修剪密集模型可以导致幻觉减少。然而,与密集模型剪枝不同,专家剪枝完全移除整个权重矩阵,从根本上改变了模型架构。这迫使模型依赖后备专家;这些替代方案可能生成上下文流畅的文本,同时悄然引入细微的事实不准确性(见图1(https://arxiv.org/html/2607.01444#S1.F1))。因此,MoE剪枝中实用性与可靠性之间的关系仍不清楚。在本文中,我们研究了高风险设置下领域特定专家剪枝如何同时影响实用性和可靠性。聚焦于生物医学领域,我们评估了四种MoE模型、六种剪枝方法以及多种剪枝比率。我们的评估涵盖生成和分类任务,比较领域内行为与互补的通用领域分析。该框架考察剪枝是否降低性能、实用性与可靠性是否保持耦合、性能下降从何处开始出现,以及这些结果如何在任务类型和领域之间变化。我们的贡献如下: - •我们首次系统研究了专家剪枝如何影响高风险设置下MoE模型的事实可靠性,主要关注生物医学领域。 - •我们描述了实用性和可靠性如何在剪枝比率、模型系列和剪枝策略之间变化,表明适度的领域内剪枝保持稳健,而在极端剪枝比率和领域转移时性能下降更为明显。 - •我们表明MoE压缩的安全性强烈依赖于任务和领域,并且仅使用实用性评估剪枝后的MoE模型对于高风险部署是不够的,必须进行明确的可靠性评估。 ## 2相关工作 #### 减少MoE模型内存占用。减少MoE模型内存占用的努力涵盖多种方法,包括权重量化(Li等,2024a(https://arxiv.org/html/2607.01444#bib.bib36);Huang等,2025(https://arxiv.org/html/2607.01444#bib.bib25);Chen等,2025c(https://arxiv.org/html/2607.01444#bib.bib8),以及其他)、专家合并(He等,2023(https://arxiv.org/html/2607.01444#bib.bib21);Zhang等,2025(https://arxiv.org/html/2607.01444#bib.bib64);Zhou等,2025(https://arxiv.org/html/2607.01444#bib.bib67),以及其他)和专家剪枝(Kim等,2021(https://arxiv.org/html/2607.01444#bib.bib31);Lu等,2024(https://arxiv.org/html/2607.01444#bib.bib40);Chen等,2025b(https://arxiv.org/html/2607.01444#bib.bib7);Bai等,2025(https://arxiv.org/html/2607.01444#bib.bib2))。量化技术通过减少参数位宽来最小化网络存储需求。示例包括基于结构敏感性改变位宽的方法(Li等,2024a(https://arxiv.org/html/2607.01444#bib.bib36);Huang等,2025(https://arxiv.org/html/2607.01444#bib.bib25))、优化校准(Chen等,2025c(https://arxiv.org/html/2607.01444#bib.bib8)),或采用极端1位压缩(Yuan等,2023(https://arxiv.org/html/2607.01444#bib.bib62);Frantar和Alistarh,2024(https://arxiv.org/html/2607.01444#bib.bib15))。量化降低数值精度而不改变网络拓扑,因此与专家合并和剪枝是正交的(Lu等,2024(https://arxiv.org/html/2607.01444#bib.bib40))。专家合并通过将参数矩阵数学混合成一个统一矩阵来缓解内存限制(He等,2023(https://arxiv.org/html/2607.01444#bib.bib21);Li等,2024b(https://arxiv.org/html/2607.01444#bib.bib37);Chen等,2025a(https://arxiv.org/html/2607.01444#bib.bib4)),而专家剪枝则基于校准数据永久移除一个子集的冗余或低显著性专家(Muzio等,2024(https://arxiv.org/html/2607.01444#bib.bib43);Hu等,2026(https://arxiv.org/html/2607.01444#bib.bib24);Lasby等,2026(https://arxiv.org/html/2607.01444#bib.bib34))。专家合并通过消除路由器保持对专家进行细粒度、独立控制的能力而引入不可避免的错误(Dong等,2025(https://arxiv.org/html/2607.01444#bib.bib13);Lasby等,2026(https://arxiv.org/html/2607.01444#bib.bib34);Liu等,2026(https://arxiv.org/html/2607.01444#bib.bib39))。相反,专家剪枝保留了原始功能拓扑和路由独立性,在高压缩比下表现出优越的性能(Bai等,2025(https://arxiv.org/html/2607.01444#bib.bib2);Lasby等,2026(https://arxiv.org/html/2607.01444#bib.bib34))。因此,我们专门关注专家剪枝。 #### 专家剪枝。专家剪枝方法通常分为两种范式:需要后续微调的和完全无需训练(即训练后或一次性剪枝)的(Lu等,2024(https://arxiv.org/html/2607.01444#bib.bib40))。需要训练的方法基于路由统计或正则化移除专家,随后应用基于梯度的优化来恢复性能下降(Kim等,2021(https://arxiv.org/html/2607.01444#bib.bib31);Chen等,2022(https://arxiv.org/html/2607.01444#bib.bib6);Muzio等,2024(https://arxiv.org/html/2607.01444#bib.bib43);Yang等,2024(https://arxiv.org/html/2607.01444#bib.bib60))。相比之下,免训练专家剪枝使用一次性校准数据移除冗余专家,绕过参数更新。突出的例子通过重建损失(Lu等,2024(https://arxiv.org/html/2607.01444#bib.bib40))、领域特定演示(Dong等,2025(https://arxiv.org/html/2607.01444#bib.bib13))、专家选择频率(Chen等,2025b(https://arxiv.org/html/2607.01444#bib.bib7))或先进的函数标准(无需梯度更新即可保持路由独立性)来估计专家显著性(Hu等,2026(https://arxiv.org/html/2607.01444#bib.bib24);Lasby等,2026(https://arxiv.org/html/2607.01444#bib.bib34);Liu等,2026(https://arxiv.org/html/2607.01444#bib.bib39))。我们专注于这种免训练范式,因为它提供了轻量级解决方案,有助于在设备上高效部署大规模MoE架构。这种方法还可以隔离检查剪枝效果,避免微调带来的混淆变量。 #### 模型压缩与事实可靠性。模型压缩与LLM事实可靠性之间的关系已在密集模型剪枝、模型合并和权重量化方面得到广泛研究。Chrysostomou等人(2024(https://arxiv.org/html/2607.01444#bib.bib10))发现,密集模型剪枝通过强制依赖源文档来减少抽象摘要中的幻觉。其他研究表明,它会降低整体可信度(Hong等,2024(https://arxiv.org/html/2607.01444#bib.bib23))并破坏稳健谎言检测所需的内部激活特征(Fu等,2025a(https://arxiv.org/html/2607.01444#bib.bib17))。因此,密集模型剪枝产生依赖于任务的结果。虽然关于合并模型的研究仍然很少,但Yang等人(2025b(https://arxiv.org/html/2607.01444#bib.bib61))展示了其作为参数级冲突解决策略的效用,以协调有用性、诚实性和无害性。对于权重量化,先前的工作(Hong等,2024(https://arxiv.org/html/2607.01444#bib.bib23);Singh和Sajjad,2025(https://arxiv.org/html/2607.01444#bib.bib50))表明,适度的位宽减少通常能保持可信度和内部校准。然而,量化模型容易受到欺骗性提示的影响,即使保持真实的内部表示(Fu等,2025b(https://arxiv.org/html/2607.01444#bib.bib18)),并且在生成自然语言自我解释时表现出降低的忠实度(Wang等,2026(https://arxiv.org/html/2607.01444#bib.bib54))。因此,权重量化在数值效率和语义精度之间呈现微妙的权衡。尽管在这些方法上进行了广泛的研究,但专家剪枝对事实可靠性的影响仍未探索。本文首次系统探索专家剪枝如何影响MoE模型的可靠性,为其安全部署提供了关键见解。 ## 3免训练领域特定专家剪枝 ### 3.1MoE剪枝框架 考虑一个具有层层的MoE模型,其中每一层包含一组专家,。对于给定的剪枝比率,目标是每层保留一个包含个专家的子集,其中,并丢弃剩余的个专家。在这项工作中,我们专注于领域特定专家剪枝(Dong等,2025(https://arxiv.org/html/2607.01444#bib.bib13)),压缩MoE模型以保持对感兴趣领域(此处为生物医学领域)的实用性。为实现这一目标,剪枝过程使用从感兴趣领域采样的校准集。对于中的每个样本,其序列长度为个token,使用显著性度量(在§3.2(https://arxiv.org/html/2607.01444#S3.SS2)中定义)评估专家重要性。在计算上的平均重要性后,移除得分最低的专家。在推理过程中,路由器被限制从剩下的个专家中进行选择。 ### 3.2显著性度量 为了量化每个专家的重要性,我们考虑了六种不同的度量,从随机基线到最先进的方法。我们的目的是研究不同的重要性度量如何影响领域实用性和事实可靠性。具体而言,我们首先使用一个随机基线(Random),然后通过一系列数据驱动复杂性的渐进:从静态度量(Frequency),到动态激活方法,最后到最近的前后文感知公式。 #### Random。随机剪枝度量从均匀分布中采样个专家进行保留。这种方法作为弱基线,排除了重要性估计和数据驱动信号。 #### Frequency。该度量测量路由器选择专家的频率(Chen等,2022(https://arxiv.org/html/2607.01444#bib.bib6))。它对每个激活事件赋予相同的权重,而不考虑路由算法分配的幅度。对于专家,得分为激活次数:,其中是指示函数,对于正的门控值返回1,否则返回0。 #### Gate。该度量基于路由激活幅度评估专家重要性(Chen等,2022(https://arxiv.org/html/2607.01444#bib.bib6))。与Frequency将所有激活视为平等不同,门控度量识别路由器优先考虑的专家。对于层中的专家,得分为所有token的门控值之和:,其中表示层中第个专家对于第个token的门控值。 #### EAN。专家活动

相似文章

修剪不良专家需要MAESTRO

arXiv cs.CL

本文介绍了Maestro,一种针对混合专家语言模型的结构化剪枝框架。该框架利用马尔可夫链对专家激活轨迹进行建模,实现全局感知剪枝,在50%压缩率下,性能优于基线模型最高达10.61%。

输出稀释:MoE 模型中冗余但脆弱的表示

arXiv cs.LG

本文揭示,Mixture-of-Experts 模型在探测中编码道德内容的鲁棒性与密集模型相当,但由于输出稀释,它们更为脆弱。输出稀释是指聚合的专家输出稀释了信号,使表示容易受到噪声的影响。

SlimQwen:探索大规模MoE模型预训练中的剪枝与蒸馏

Hugging Face Daily Papers

本文探讨了在预训练阶段压缩大规模混合专家(MoE)模型的结构化剪枝和知识蒸馏技术。研究表明,渐进式剪枝以及结合多标记预测蒸馏等策略,能够提升下游任务的性能。例如,通过将Qwen3-Next-80A3B压缩为更高效的23A2B模型,展示了这一方法的有效性。