为什么我们不能让MoE路由器预测接下来5-10个token所需的专家?
摘要
用户质疑是否可以设计混合专家(MoE)路由器来预测token序列的未来专家需求,以实现RAM和VRAM之间的更快缓存,或者是否可以为此训练一个单独的神经网络。
同标题。如果我们能做到这一点,是否可以潜在地从RAM到VRAM进行专家缓存,使其更快?如果路由器本身不行,我们能否训练一个小型神经网络来预测未来的专家?如果这是一个愚蠢的问题,请原谅,我试图理解MoEs的工作原理。
相似文章
除了更快之外,MoE 模型的意义何在?
讨论混合专家(MoE)模型在速度之外相对于密集模型的优势,考虑内存限制和扩展限制。
尝试预测下一个token会用到哪些MoE专家来加速CPU/GPU offload,得到了一些实际数据,这真的可实现吗还是我在浪费时间(30tg/s -> 150-200tg/s)
探索通过预测下一个token将使用的MoE专家来改进CPU/GPU offload,实现了30->150-200 tg/s的加速,并质疑实现可行性。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
N-gram 与专家模型详解
文章阐释了人工智能模型中混合专家模型与N-gram技术的架构差异,重点介绍了Qwen新模型如何利用N-gram技术卸载参数,通过分离推理和回忆任务来提升效率。
先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。