model-pruning

标签

Cards List
#model-pruning

Kimi K3 (Unsloth) IQ2-XXS 从 711GB 降至 478GB!!! 仅移除多语言来缩减体积

Reddit r/LocalLLaMA · 2026-08-08

Kimi K3 (IQ2-XXS) 的精简版纯英文 GGUF 通过移除多语言组件,将模型大小从 711GB 降至 478GB,早期测试表明它在编码任务上可能达到或超过标准 2-bit 版本。

0 人收藏 0 人点赞
#model-pruning

修剪不良专家需要MAESTRO

arXiv cs.CL · 2026-07-10 缓存

本文介绍了Maestro,一种针对混合专家语言模型的结构化剪枝框架。该框架利用马尔可夫链对专家激活轨迹进行建模,实现全局感知剪枝,在50%压缩率下,性能优于基线模型最高达10.61%。

0 人收藏 0 人点赞
#model-pruning

基于熵正则化概率门控的稀疏模型发现方法用于稀缺数据联邦学习

arXiv cs.LG · 2026-07-02 缓存

本文提出熵正则化概率门控机制,在稀疏联邦优化中保持不确定性,从而在数据异质性和稀缺数据条件下提升稀疏性恢复能力与测试性能。

0 人收藏 0 人点赞
#model-pruning

@dealignai: MiniMax m3,专为 128GB Mac 打造。感谢 @hornsby_andrew 准备剪枝校准数据集并进行…

X AI KOLs Timeline · 2026-06-18 缓存

经过剪枝和量化的 MiniMax-M3 版本(MiniMax-M3-Medium-JANG_2L),针对使用 vMLX 在 128GB Mac 上运行进行了优化,采用 32% 专家剪枝和 JANG_2L 混合精度量化,使其占用空间约 105 GB。

0 人收藏 0 人点赞
#model-pruning

超越余弦相似度:重新思考大语言模型中的层相关性

arXiv cs.LG · 2026-05-15 缓存

本文证明,余弦相似度作为评估大语言模型中层重要性的指标效果不佳,并提出使用层移除后实际准确率下降作为更稳健的度量标准。

0 人收藏 0 人点赞
#model-pruning

修剪不安全票:一种资源高效的框架,用于更安全、更鲁棒的大型语言模型

arXiv cs.CL · 2026-04-20 缓存

本文介绍了一种资源高效的修剪框架,该框架能够识别并移除大型语言模型中与不安全行为相关的参数,同时保持模型的实用性。该方法利用无梯度归因和彩票假说视角,在最小化性能损失的前提下,显著减少了不安全内容的生成,并增强了对越狱攻击的鲁棒性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈