N-gram 与专家模型详解

Reddit r/LocalLLaMA 模型

摘要

文章阐释了人工智能模型中混合专家模型与N-gram技术的架构差异,重点介绍了Qwen新模型如何利用N-gram技术卸载参数,通过分离推理和回忆任务来提升效率。

自Qwen发布Qwen4Exp架构重磅消息以来,该架构专注于将参数卸载到N-gram而非纯混合专家模型,我深入探究并学到了很多。以下是总结。人类写作难免有误,请见谅。简而言之:MoE负责推理,N-gram负责回忆。在当前技术前沿,N-gram可以卸载高达约25%的权重而不失优势,并且通过使用SSD而非RAM存储这些参数,我们能获得最大收益。因此,176B参数的模型变为125B(RAM)+ 51B(SSD)。详细版本如下。专家模型(MoE)执行算术工作。路由器检查模型的隐藏状态,选择几个前馈块,然后这些块进行乘法运算。选择发生在层已经开始之后,并且负载很大,因此将专家模型发送到磁盘通常很慢。机器发现所需内容太晚,然后通过慢速总线传输数GB数据,仅为了立即计算它们。N-gram表是另一种记忆。它存储短期本地短语的向量,通过最后几个令牌的哈希进行寻址。这些地址在令牌存在时即存在。网络不会乘以整个表。它收集少量行,通常只有几KB,并将它们折叠到流中。Qwen 3.8 Flash Next(Qwen4Exp)在MoE网络中保留约125B参数,在N-gram表中另外保留51B参数,并且每个令牌仅激活约6B。额外的51B是容量,而非额外的算术工作。因此它运行快速,类似于125B-A6B模型,但有前提条件,同时利用了176B的训练参数。专家模型负责推理工作,N-gram负责回忆工作。但你不能偷懒,只进行回忆而不推理来完成工作。否则质量会下降,推理LLM会变成记忆获取机器。将专家模型卸载到表中有限度。在固定预算下,给予表大约20-25%的总参数通常有益。早期层不再浪费深度重建常见本地模式,深层堆栈可以推理。
查看原文

相似文章

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

AI2推出的新MoE模型:EMO

Reddit r/LocalLLaMA

AI2发布了EMO,一个混合专家(MoE)语言模型,总参数量14B,其中1B活跃参数,基于1万亿tokens训练,并采用文档级路由,即专家会按领域(如健康、新闻等)进行聚类。