sparse-models

标签

Cards List
#sparse-models

总共124B参数但仅~5B活跃——这正是我想要的本地模型形态。低激活参数的MoE现在成为了本地最佳选择吗?

Reddit r/singularity · 2026-07-25

关于专家混合模型(MoE)的讨论,该模型总参数为124B但仅约5B活跃,表明低激活参数的MoE可能成为本地最佳选择。

0 人收藏 0 人点赞
#sparse-models

权重稀疏Transformer中的单个参数具有可解释性

arXiv cs.LG · 2026-07-07 缓存

本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。

0 人收藏 0 人点赞
#sparse-models

我们迫切需要一款80-160B的模型。统一内存设备市场需要更多模型。

Reddit r/LocalLLaMA · 2026-06-17

作者认为,当前迫切需要80-160B参数范围的AI模型,以支持使用统一内存设备的用户(例如高内存的Apple/AMD系统),因为最近的模型对于他们的硬件来说要么太小,要么太大。

0 人收藏 0 人点赞
#sparse-models

DOT-MoE:面向MoE化的可微最优传输

Hugging Face Daily Papers · 2026-06-01 缓存

DOT-MoE将密集层分解形式化为可微最优传输问题,能够高效训练稀疏MoE模型,在将活跃参数减少50%的同时保留原始模型90%的性能。

0 人收藏 0 人点赞
#sparse-models

EMO:用于涌现模块化的专家混合模型预训练

Hugging Face Daily Papers · 2026-05-07 缓存

EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。

0 人收藏 0 人点赞
#sparse-models

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog · 2026-02-26 缓存

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈