标签
该论文引入了Grouped Query Experts,通过在分组查询注意力基础上将每个token路由到少数几个查询头专家,改进了长上下文注意力,在匹配准确率的同时实现了1.7-1.8倍的预填充速度提升。