head-sharing

标签

Cards List
#head-sharing

@che_shr_cat: 1/ 多年来我们一直通过头部共享(GQA/MQA)来优化KV缓存,但我们忽略了一个基本假设:为什么……

X AI KOLs Timeline · 2026-06-09 缓存

这条推文挑战了关于Transformer需要独立的Q、K和V投影的基本假设,提出合并它们可以为KV缓存带来巨大的内存节省。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈