标签
北京大学研究人员提出 NAMOH,这是一种架构原生的稀疏注意力机制,每个 token 仅激活 H 个头中的 K 个,使头路由同时决定活跃参数量和可用上下文。该机制使参数扩展能够直接支撑高效的长上下文扩展,在总参数量相同的情况下优于全激活模型,同时与 GQA 及现有稀疏注意力方法保持兼容。