@rohanpaul_ai: 有趣,这篇论文表明Transformer可能不需要独立的键和值投影就能表现良好。这篇论文…

X AI KOLs Timeline 论文

摘要

本论文研究了Transformer是否需要独立的键和值投影,发现共享它们可将KV缓存减少50%,而困惑度仅增加3.1%,并且与GQA和MQA结合时进一步减少。

有趣,这篇论文表明Transformer可能不需要独立的键和值投影就能表现良好。 该论文的设计在语言建模中将KV缓存减少了50%,而困惑度仅增加3.1%,这意味着推理内存大幅下降,而预测质量保持接近。 普通的注意力层会生成查询(Query)来询问每个token需要什么,键(Key)来标记每个token提供什么,值(Value)来携带需返回的信息。 而这里,令人惊讶的结果是键和值通常可以共享同一个学习映射,因为模型可以将同一表示既作为地址又作为检索的内容。 最佳变体Q-K=V保持了查询的独立性,因此注意力仍然具有方向性:一个token可以向另一个不同的token请求信息,而不是每个关系都变成镜像式的。 当与GQA和MQA堆叠使用时,同样的思路达到了87.5%和96.9%的缓存削减,因为它减少了投影存储,而这两种方法减少了存储的头数。 较弱的变体是Q=K-V,因为绑定查询和键会使注意力对因果语言来说过于对称,而且它没有带来KV缓存的节省。 ---- 链接 – arxiv. org/abs/2606.04032v2 标题:"Do Transformers Need Three Projections? Systematic Study of QKV Variants"
查看原文
查看缓存全文

缓存时间: 2026/06/09 14:51

有趣的是,这篇论文表明,Transformer 可能并不需要独立的键(Key)和值(Value)投影即可良好运作。

该论文的设计在语言建模中将 KV 缓存削减了 50%,而困惑度仅升高了 3.1%,这意味着推理内存大幅下降,同时预测质量保持接近。

常规注意力层设置了查询(Query)来询问每个令牌需要什么、键(Key)来标记每个令牌提供什么、值(Value)来承载被回传的信息。

这里,令人惊讶的结果是,Key 和 Value 常常可以共享同一套学习到的映射,因为模型可以将同一个表示既用作地址,又用作被检索的内容。

最佳变体 Q-K=V 保留了独立的 Query,因此注意力仍然具有方向性:一个令牌可以询问另一个令牌的信息,而不是所有关系都变成镜像式的。

当与 GQA 和 MQA 结合堆叠时,同样的思路实现了 87.5% 和 96.9% 的缓存削减,因为它在减少投影存储的同时,这些方法也减少了存储的头数。

较弱的变体是 Q=K-V,因为将 Query 和 Key 绑定会使注意力对因果语言来说过于对称,并且它不会节省任何 KV 缓存。


链接 – arxiv.org/abs/2606.04032v2

标题:《Transformer 需要三个投影吗?QKV 变体的系统研究》

相似文章

Transformer 真的需要三个投影矩阵吗?QKV 变体的系统性研究

Hacker News Top

本文系统研究了 Transformer 中 QKV 投影共享的各种变体,发现共享键和值投影(Q-K=V)可在仅造成 3.1% 困惑度下降的情况下实现 50% 的 KV 缓存压缩,结合 GQA/MQA 最高可达 96.9% 的缓存压缩率——以极小的质量损失实现实用的端侧推理。

FourierQK:对查询-键投影进行频谱预处理提升Transformer注意力

arXiv cs.CL

本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。