expert-pruning

标签

Cards List
#expert-pruning

有人测试过 IQ1_M 342GB 剪枝版 Kimi K3 吗?能用吗?

Reddit r/LocalLLaMA · 3天前 缓存

这是一个高度实验性的 GGUF 版本,基于 2.8T 参数的 Kimi K3 MoE 模型,剪枝了 55% 的专家并量化至约 2.15 bpw(319 GiB)。运行它需要特定的 llama.cpp PR 和自定义补丁,并包含详细的使用说明。

0 人收藏 0 人点赞
#expert-pruning

SHAPE: 面向稀疏混合专家大语言模型的联盟感知专家剪枝

arXiv cs.LG · 2026-06-10 缓存

SHAPE提出了一种面向稀疏MoE大语言模型的联盟感知专家剪枝框架,该框架利用路由轨迹上的Shapley式归因来识别关键专家,在20-40%剪枝率下实现了有竞争力的准确率,并降低了GPU内存占用。

0 人收藏 0 人点赞
#expert-pruning

ConMoE: 基于原型重分配的专家池整合实现MoE压缩

arXiv cs.AI · 2026-05-29 缓存

ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈