mixture-of-heads

标签

Cards List
#mixture-of-heads

扩展注意力机制中的参数与上下文:源自 Mixture-of-Head 的原生稀疏注意力

arXiv cs.CL ↗ · 14小时前 缓存

北京大学研究人员提出 NAMOH,这是一种架构原生的稀疏注意力机制,每个 token 仅激活 H 个头中的 K 个,使头路由同时决定活跃参数量和可用上下文。该机制使参数扩展能够直接支撑高效的长上下文扩展,在总参数量相同的情况下优于全激活模型,同时与 GQA 及现有稀疏注意力方法保持兼容。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈