sparse-activation

标签

Cards List
#sparse-activation

基于幅值的专家掩码实现混合专家模型的深度感知敏感性分析

arXiv cs.AI · 2026-08-17 缓存

本文提出一种使用基于幅值的专家掩码对混合专家模型进行系统敏感性分析的方法,发现后层对抗掩码更具韧性,这为模型压缩提供了实用途径。

0 人收藏 0 人点赞
#sparse-activation

@maximelabonne: 哇,这让我想起了早期的模型合并。完全疯狂,我喜欢!

X AI KOLs Following · 2026-08-06 缓存

一个采用融合架构的新型sub-6B稀疏激活AI模型,结合了LFM2.5-2.6B和Qwen3.6-35B-A3B的权重,以极小的尺寸实现了接近Qwen3.6-35B的性能。

0 人收藏 0 人点赞
#sparse-activation

用于剪枝稀疏混合专家语言模型的通用专家覆盖方法

arXiv cs.AI · 2026-07-03 缓存

提出了Generic TB-Coverage,一种覆盖感知的专家剪枝方法,用于稀疏Mixture-of-Experts语言模型,该方法仅使用通用文本语料库进行校准,并保留跨语料库专家覆盖,从而提高了准确率并减少了困惑度下降。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈