标签
RAPTOR是一个角色感知的框架,用于专家混合模型的差分隐私微调,解决了诸如裁剪干扰和噪声稀释等失败模式,并在实验中显示出相对于标准差分隐私基线的改进。
本仓库提供使用基于梯度的 GSQ 和 RCO 方法对 Qwen3.8-Flash-Next 模型进行的 GGUF 量化,以优化低比特表示,从而实现在标准工具中的高效部署。
一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。
M系列模型采用稀疏混合专家架构,其中M2在每次前向传播中路由到230B参数中的10B,M3路由到428B中的23B,使得可以在4xH100 GPU上以特定定价部署。
ToMoE提出了一种利用动态结构剪枝将稠密大语言模型转换为混合专家模型的方法,无需权重更新,且优于现有方法。
关于专家混合模型(MoE)的讨论,该模型总参数为124B但仅约5B活跃,表明低激活参数的MoE可能成为本地最佳选择。
本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。
作者认为,当前迫切需要80-160B参数范围的AI模型,以支持使用统一内存设备的用户(例如高内存的Apple/AMD系统),因为最近的模型对于他们的硬件来说要么太小,要么太大。
DOT-MoE将密集层分解形式化为可微最优传输问题,能够高效训练稀疏MoE模型,在将活跃参数减少50%的同时保留原始模型90%的性能。
EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。