expert-pruning

标签

Cards List
#expert-pruning

ESTS at WMT26: 路由感知的专家剪枝用于模型压缩

arXiv cs.CL · 2天前 缓存

本文描述了向WMT26模型压缩共享任务提交的六个作品,使用路由感知的专家剪枝和MXFP4量化将GPT-OSS-20B压缩成更小的翻译模型,参数范围从4.186B到7.770B。

0 人收藏 0 人点赞
#expert-pruning

轻量级微调下的路由器灵敏度识别混合专家模型中的可剪枝专家

arXiv cs.LG · 2026-08-11 缓存

本文提出在轻量级微调(如 LoRA)下利用路由器权重灵敏度来识别并剪枝混合专家模型中的专家,从而在最小化精度损失的同时显著降低内存和延迟。

0 人收藏 0 人点赞
#expert-pruning

形状变换专家压缩:LorExperts与BTExperts

arXiv cs.LG · 2026-08-11 缓存

本文介绍了LorExperts和BTExperts,这两种面向混合专家大语言模型的保留路由器压缩方法,通过聚类专家并将非主导成员表示为低秩修正,相较于D2-MoE等先前方法提升了压缩质量。

0 人收藏 0 人点赞
#expert-pruning

jabbatheduck/DeepSeek-v4-flash-mini · Hugging Face

Reddit r/LocalLLaMA · 2026-08-05 缓存

jabbatheduck 发布了 REAP 专家剪枝后的 DeepSeek-V4-Flash 检查点的 GGUF 量化版本,为消费级 GPU 上的内存受限推理进行了大幅压缩,同时保留了路由器和注意力的精度。

0 人收藏 0 人点赞
#expert-pruning

有人测试过 IQ1_M 342GB 剪枝版 Kimi K3 吗?能用吗?

Reddit r/LocalLLaMA · 2026-07-30 缓存

这是一个高度实验性的 GGUF 版本,基于 2.8T 参数的 Kimi K3 MoE 模型,剪枝了 55% 的专家并量化至约 2.15 bpw(319 GiB)。运行它需要特定的 llama.cpp PR 和自定义补丁,并包含详细的使用说明。

0 人收藏 0 人点赞
#expert-pruning

SHAPE: 面向稀疏混合专家大语言模型的联盟感知专家剪枝

arXiv cs.LG · 2026-06-10 缓存

SHAPE提出了一种面向稀疏MoE大语言模型的联盟感知专家剪枝框架,该框架利用路由轨迹上的Shapley式归因来识别关键专家,在20-40%剪枝率下实现了有竞争力的准确率,并降低了GPU内存占用。

0 人收藏 0 人点赞
#expert-pruning

ConMoE: 基于原型重分配的专家池整合实现MoE压缩

arXiv cs.AI · 2026-05-29 缓存

ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈