标签
本文以NVIDIA的Nemotron 3 Super和Moonshot AI的Kimi K3为例,分析了LatentMoE架构如何通过压缩Expert计算维度来解决传统MoE的效率瓶颈,并指出这是下一代MoE架构的转折点。
讨论具有极端稀疏性(16/896专家)的LatentMoE架构以及Kimi Delta Attention,声称有2.5倍更高效的扩展,并猜测Kimi K3模型的能力。
Sebastian Raschka 指出,从 LatentMoE 到特征分解的灵感链:MLA、LoRA 和 SVD 层层启发。