为什么我们不能让MoE路由器预测接下来5-10个token所需的专家?

Reddit r/LocalLLaMA 新闻

摘要

用户质疑是否可以设计混合专家(MoE)路由器来预测token序列的未来专家需求,以实现RAM和VRAM之间的更快缓存,或者是否可以为此训练一个单独的神经网络。

同标题。如果我们能做到这一点,是否可以潜在地从RAM到VRAM进行专家缓存,使其更快?如果路由器本身不行,我们能否训练一个小型神经网络来预测未来的专家?如果这是一个愚蠢的问题,请原谅,我试图理解MoEs的工作原理。
查看原文

相似文章

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

N-gram 与专家模型详解

Reddit r/LocalLLaMA

文章阐释了人工智能模型中混合专家模型与N-gram技术的架构差异,重点介绍了Qwen新模型如何利用N-gram技术卸载参数,通过分离推理和回忆任务来提升效率。