sparse-models

标签

Cards List
#sparse-models

RAPTOR: 用于专家混合模型的角色感知隐私训练

arXiv cs.LG ↗ · 2026-09-10 缓存

RAPTOR是一个角色感知的框架,用于专家混合模型的差分隐私微调,解决了诸如裁剪干扰和噪声稀释等失败模式,并在实验中显示出相对于标准差分隐私基线的改进。

0 人收藏 0 人点赞
#sparse-models

ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF

Hugging Face Models Trending ↗ · 2026-09-07 缓存

本仓库提供使用基于梯度的 GSQ 和 RCO 方法对 Qwen3.8-Flash-Next 模型进行的 GGUF 量化,以优化低比特表示,从而实现在标准工具中的高效部署。

0 人收藏 0 人点赞
#sparse-models

一种稀疏 MoE 模型推理架构:通过分层与线性衰减增加激活参数量,无需训练或微调即可实现精简推理 [p]

Reddit r/MachineLearning ↗ · 2026-09-06

一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。

0 人收藏 0 人点赞
#sparse-models

@ArizePhoenix: M系列采用稀疏MoE架构:M2在每次前向传播中路由到230B参数中的约10B,M3路由到428B中的约23B。这就是为什么……

X AI KOLs Following ↗ · 2026-09-03

M系列模型采用稀疏混合专家架构,其中M2在每次前向传播中路由到230B参数中的10B,M3路由到428B中的23B,使得可以在4xH100 GPU上以特定定价部署。

0 人收藏 0 人点赞
#sparse-models

[论文] ToMoE:通过动态结构剪枝将稠密大语言模型转换为混合专家模型

Reddit r/LocalLLaMA ↗ · 2026-08-24 缓存

ToMoE提出了一种利用动态结构剪枝将稠密大语言模型转换为混合专家模型的方法,无需权重更新,且优于现有方法。

0 人收藏 0 人点赞
#sparse-models

总共124B参数但仅~5B活跃——这正是我想要的本地模型形态。低激活参数的MoE现在成为了本地最佳选择吗?

Reddit r/singularity ↗ · 2026-07-25

关于专家混合模型(MoE)的讨论,该模型总参数为124B但仅约5B活跃,表明低激活参数的MoE可能成为本地最佳选择。

0 人收藏 0 人点赞
#sparse-models

权重稀疏Transformer中的单个参数具有可解释性

arXiv cs.LG ↗ · 2026-07-07 缓存

本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。

0 人收藏 0 人点赞
#sparse-models

我们迫切需要一款80-160B的模型。统一内存设备市场需要更多模型。

Reddit r/LocalLLaMA ↗ · 2026-06-17

作者认为,当前迫切需要80-160B参数范围的AI模型,以支持使用统一内存设备的用户(例如高内存的Apple/AMD系统),因为最近的模型对于他们的硬件来说要么太小,要么太大。

0 人收藏 0 人点赞
#sparse-models

DOT-MoE:面向MoE化的可微最优传输

Hugging Face Daily Papers ↗ · 2026-06-01 缓存

DOT-MoE将密集层分解形式化为可微最优传输问题,能够高效训练稀疏MoE模型,在将活跃参数减少50%的同时保留原始模型90%的性能。

0 人收藏 0 人点赞
#sparse-models

EMO:用于涌现模块化的专家混合模型预训练

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。

0 人收藏 0 人点赞
#sparse-models

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog ↗ · 2026-02-26 缓存

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈