@rohanpaul_ai: 有趣,这篇论文表明Transformer可能不需要独立的键和值投影就能表现良好。这篇论文…
摘要
本论文研究了Transformer是否需要独立的键和值投影,发现共享它们可将KV缓存减少50%,而困惑度仅增加3.1%,并且与GQA和MQA结合时进一步减少。
查看缓存全文
缓存时间: 2026/06/09 14:51
有趣的是,这篇论文表明,Transformer 可能并不需要独立的键(Key)和值(Value)投影即可良好运作。
该论文的设计在语言建模中将 KV 缓存削减了 50%,而困惑度仅升高了 3.1%,这意味着推理内存大幅下降,同时预测质量保持接近。
常规注意力层设置了查询(Query)来询问每个令牌需要什么、键(Key)来标记每个令牌提供什么、值(Value)来承载被回传的信息。
这里,令人惊讶的结果是,Key 和 Value 常常可以共享同一套学习到的映射,因为模型可以将同一个表示既用作地址,又用作被检索的内容。
最佳变体 Q-K=V 保留了独立的 Query,因此注意力仍然具有方向性:一个令牌可以询问另一个令牌的信息,而不是所有关系都变成镜像式的。
当与 GQA 和 MQA 结合堆叠时,同样的思路实现了 87.5% 和 96.9% 的缓存削减,因为它在减少投影存储的同时,这些方法也减少了存储的头数。
较弱的变体是 Q=K-V,因为将 Query 和 Key 绑定会使注意力对因果语言来说过于对称,并且它不会节省任何 KV 缓存。
链接 – arxiv.org/abs/2606.04032v2
标题:《Transformer 需要三个投影吗?QKV 变体的系统研究》
相似文章
Transformer 真的需要三个投影矩阵吗?QKV 变体的系统性研究
本文系统研究了 Transformer 中 QKV 投影共享的各种变体,发现共享键和值投影(Q-K=V)可在仅造成 3.1% 困惑度下降的情况下实现 50% 的 KV 缓存压缩,结合 GQA/MQA 最高可达 96.9% 的缓存压缩率——以极小的质量损失实现实用的端侧推理。
@che_shr_cat: 1/ 多年来我们一直通过头部共享(GQA/MQA)来优化KV缓存,但我们忽略了一个基本假设:为什么……
这条推文挑战了关于Transformer需要独立的Q、K和V投影的基本假设,提出合并它们可以为KV缓存带来巨大的内存节省。
@rohanpaul_ai: 新微软论文认为,Transformer在学会紧凑内部状态时泛化更好,而不仅仅是预测下一个token……
微软的NextLat论文提出了一种自监督训练方法,让Transformer预测其下一个隐藏状态而非仅仅下一个token,从而形成更紧凑的世界模型,更好地进行规划和推理,并且生成速度提升高达3.3倍。
Grouped Value Attention: 通过按需键重建实现高效KV缓存
Grouped Value Attention通过存储分组值并通过学习到的线性映射重建键来减少Transformer的KV缓存大小,以更小的持久缓存实现接近GQA的准确率。
FourierQK:对查询-键投影进行频谱预处理提升Transformer注意力
本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。