N-gram 与专家模型详解
摘要
文章阐释了人工智能模型中混合专家模型与N-gram技术的架构差异,重点介绍了Qwen新模型如何利用N-gram技术卸载参数,通过分离推理和回忆任务来提升效率。
自Qwen发布Qwen4Exp架构重磅消息以来,该架构专注于将参数卸载到N-gram而非纯混合专家模型,我深入探究并学到了很多。以下是总结。人类写作难免有误,请见谅。简而言之:MoE负责推理,N-gram负责回忆。在当前技术前沿,N-gram可以卸载高达约25%的权重而不失优势,并且通过使用SSD而非RAM存储这些参数,我们能获得最大收益。因此,176B参数的模型变为125B(RAM)+ 51B(SSD)。详细版本如下。专家模型(MoE)执行算术工作。路由器检查模型的隐藏状态,选择几个前馈块,然后这些块进行乘法运算。选择发生在层已经开始之后,并且负载很大,因此将专家模型发送到磁盘通常很慢。机器发现所需内容太晚,然后通过慢速总线传输数GB数据,仅为了立即计算它们。N-gram表是另一种记忆。它存储短期本地短语的向量,通过最后几个令牌的哈希进行寻址。这些地址在令牌存在时即存在。网络不会乘以整个表。它收集少量行,通常只有几KB,并将它们折叠到流中。Qwen 3.8 Flash Next(Qwen4Exp)在MoE网络中保留约125B参数,在N-gram表中另外保留51B参数,并且每个令牌仅激活约6B。额外的51B是容量,而非额外的算术工作。因此它运行快速,类似于125B-A6B模型,但有前提条件,同时利用了176B的训练参数。专家模型负责推理工作,N-gram负责回忆工作。但你不能偷懒,只进行回忆而不推理来完成工作。否则质量会下降,推理LLM会变成记忆获取机器。将专家模型卸载到表中有限度。在固定预算下,给予表大约20-25%的总参数通常有益。早期层不再浪费深度重建常见本地模式,深层堆栈可以推理。
相似文章
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
除了更快之外,MoE 模型的意义何在?
讨论混合专家(MoE)模型在速度之外相对于密集模型的优势,考虑内存限制和扩展限制。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。
为什么我们不能让MoE路由器预测接下来5-10个token所需的专家?
用户质疑是否可以设计混合专家(MoE)路由器来预测token序列的未来专家需求,以实现RAM和VRAM之间的更快缓存,或者是否可以为此训练一个单独的神经网络。
AI2推出的新MoE模型:EMO
AI2发布了EMO,一个混合专家(MoE)语言模型,总参数量14B,其中1B活跃参数,基于1万亿tokens训练,并采用文档级路由,即专家会按领域(如健康、新闻等)进行聚类。