输出感知的INT2 KV缓存量化旋转方法
摘要
提出了OptR,一种用于INT2 KV缓存量化的输出感知旋转方法,可最小化输出后的注意力误差,在多个模型和基准上改进QuaRot和OSCAR。
arXiv:2608.02691v1 公告类型:新
摘要:键值(KV)缓存已成为长上下文大语言模型推理中的主要内存和带宽瓶颈,使得超低位宽量化变得越来越重要。然而,现有的基于旋转的INT2方法优化的是完整注意力读出之前的缓存统计量或代理误差,尽管模型最终受到通过注意力和输出投影$W_O$传播的误差的影响。为了解决这一不匹配问题,我们提出了\textit{OptR},一种输出感知的旋转方法,用于最小化$W_O$之后的注意力输出误差。OptR将$W_O$之后的注意力输出误差分解为键引起和值引起的项,并通过完整的INT2量化和注意力路径学习逐头正交校正。OptR还应用了一种注意力等价的键重参数化,在不改变softmax分布的情况下减少较大的通道级偏移。在三个模型和五个推理与编码基准上,OptR持续改进了QuaRot和OSCAR,并增强了长上下文检索,同时保持了分页KV缓存格式,推理开销可忽略不计。
查看缓存全文
缓存时间: 2026/08/05 07:41
# 面向输出的旋转用于INT2 KV缓存量化
来源:https://arxiv.org/html/2608.02691
Vincent\-Daniel Yun1,†, Woosang Lim2,†, Minsoo Cheong2, Sunwoo Lee3 Murali Annavaram1, Sai Praneeth Karimireddy1, Sungjoo Yoo2
1南加州大学 \{yunjuyou, annavara, karimire\}@usc\.edu 2首尔大学 \{ftyg656512, icycle0409\}@snu\.ac\.kr 3仁荷大学 \{sunwool\}@inha\.ac\.kr
†共同贡献
###### 摘要
在长上下文大语言模型推理中,键值(KV)缓存已成为主要的内存和带宽瓶颈,这使得超低位宽量化变得愈发重要。然而,现有的基于旋转的INT2方法在完整注意力读出之前优化缓存统计量或代理误差,尽管模型最终受到通过注意力和输出投影WOW\_\{O\}传播的误差影响。为解决这一错配,我们提出OptR,一种面向输出的旋转方法,用于最小化WOW\_\{O\}之后的注意力输出误差。OptR将WOW\_\{O\}之后的注意力输出误差分解为键引入项和值引入项,并通过完整的INT2量化和注意力路径学习每头正交校正。OptR进一步应用注意力等价的键重参数化,在不改变softmax分布的情况下减小较大的逐通道偏移。在三个模型和五个推理与编程基准上,OptR一致地改进了QuaRot和OSCAR,并增强了长上下文检索能力,同时保持分页KV缓存格式且推理开销可忽略不计。
## 1引言
随着大语言模型(LLM)在模型规模和上下文长度上的增长,键值(KV)缓存成为长上下文推理中的主要瓶颈Dao et al\. \(2022 (https://arxiv.org/html/2608.02691#bib.bib1)\); Ainslie et al\. \(2023 (https://arxiv.org/html/2608.02691#bib.bib2)\)。在自回归解码过程中,每一层都会存储所有先前token的键和值,并在每个生成步骤读取它们。因此,KV缓存的存储和内存流量会随上下文长度、批大小和模型深度而增加。KV缓存量化通过以较低精度存储缓存来降低这些成本。我们关注INT2,因为它仅需BF16 KV缓存存储的1/81/8和INT4存储的1/21/2,从而在相同内存预算下支持更长的上下文或更大的批次。由于量化组中的所有值共享一个缩放因子,少量大值会扩大仅由四个INT2电平表示的范围。这增加了大多数值的舍入误差,而激进的裁剪又会在离群值本身中引入大误差Zhang et al\. \(2023 (https://arxiv.org/html/2608.02691#bib.bib3)\); Hooper et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib4)\); Zhou et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib5)\)。
基于旋转的方法通过将少数极端通道值分散到各个维度来减少这种误差,并使缓存更易于量化。给定一个正交矩阵RR,缓存向量zz在量化前被变换为zRzR,并在反量化后用R⊤R^\{\top\}映射回来Chee et al\. \(2023 (https://arxiv.org/html/2608.02691#bib.bib6)\); Ashkboos et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib7)\)。旋转保持了缓存的形状和规则的内存布局,从而与分页KV缓存系统和融合解码内核保持兼容Kwon et al\. \(2023 (https://arxiv.org/html/2608.02691#bib.bib8)\); Zheng et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib9)\); Zhou et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib5)\)。主要挑战在于选择RR。现有的基于旋转的INT2 KV缓存流水线依赖于固定变换,或者依赖于在完整注意力读出之前定义的代理目标Ashkboos et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib7)\); Su et al\. \(2025 (https://arxiv.org/html/2608.02691#bib.bib10)\); Zhou et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib5)\)。
参见图说明Figure 1:Qwen3\-8B在BF16和INT2 KV缓存量化下的AIME25准确率。\+\+OptR表示将键重参数化和面向输出的旋转校正应用于相应的基础旋转。虚线标记BF16准确率。然而,这些代理目标并未直接度量传递到后续层的误差。KV量化会改变注意力读出,而输出投影WOW\_\{O\}会将这种变化映射到模型隐藏空间中。由此产生的输出误差进入残差流,并通过后续层传播,可能影响最终预测。因此,能够最好地重建缓存键和值的旋转,不一定是在WOW\_\{O\}之后最好地保持输出的旋转。这种目标错配促使我们在输出空间中优化旋转。
为解决这一错配,我们提出OptR,一种用于INT2 KV缓存量化的面向输出旋转方法。OptR首先在旋转和量化之前对键进行中心化。这会为某个查询的所有logits平移相同的常数,因此保持softmax分布不变。由于INT2只有四个量化电平,离群值可能导致大的量化误差。这种重参数化通过缩小量化范围来降低其影响。然后,OptR通过INT2注意力路径最小化WOW\_\{O\}之后的注意力输出误差,为任何基础旋转学习每头正交校正。它先优化键旋转,再优化值旋转,因为量化后的键决定了用于值聚合的注意力权重。只有旋转参数在校准数据上优化。模型权重保持冻结,学习到的旋转在推理期间固定。
我们将OptR集成到基于SGLang的INT2 KV缓存流水线中,同时保留分页和前缀缓存支持,且运行时开销可忽略不计Zhou et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib5)\)。Figure1 (https://arxiv.org/html/2608.02691#S1.F1)显示,OptR将Qwen3\-8B上的AIME25准确率从QuaRot的17\.33%提升到66\.67%,从OSCAR的54\.67%提升到66\.00%,而BF16为68\.00%。在两种基础旋转上的增益表明,OptR不依赖于特定的旋转初始化。
我们的贡献总结如下。
- •我们将INT2 KV缓存量化表述为输出空间的优化问题,并将WOW\_\{O\}之后的注意力输出误差分解为键引入项和值引入项。
- •我们提出OptR,它首先应用注意力等价的键重参数化来减小较大的逐通道偏移,然后通过完整的INT2量化和注意力路径学习每头正交校正。
- •我们表明,OptR一致地改进了现有的基于旋转的INT2 KV缓存流水线,同时保留其缓存布局且服务开销可忽略不计。
## 2相关工作
#### KV缓存量化。
KV缓存随上下文长度增长,并在解码过程中被反复读取,使其成为主要的内存和带宽瓶颈。先前的工作通过细粒度量化、混合精度和向量量化来降低这一成本Liu et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib11)\); Hooper et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib4)\); Xia et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib12)\); Son et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib13)\)。这些设计通常引入残差缓冲区、逐通道元数据、提升的高精度通道或专门的缓存布局,这使得它们与分页KV缓存系统和融合解码内核的集成变得复杂。相比之下,基于旋转的量化将缓存的向量变换为易于量化的基,而不改变其张量形状或规则缓存布局,因此更易于部署到现有推理系统中Ashkboos et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib7)\); Zhou et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib5)\)。
#### 基于旋转的KV缓存量化。
QuaRot使用Hadamard旋转来处理权重、激活和KV缓存Ashkboos et al\. \(2024 (https://arxiv.org/html/2608.02691#bib.bib7)\),而RotateKV使旋转适应特定头部的键离群值并保护注意力汇聚点Su et al\. \(2025 (https://arxiv.org/html/2608.02691#bib.bib10)\)。OSCAR从离线的注意力感知协方差统计中推导键和值旋转Zhou et al\. \(2026 (https://arxiv.org/html/2608.02691#bib.bib5)\)。尽管存在这些差异,现有方法使用固定变换、缓存统计量或在完整注意力读出之前定义的代理目标来选择旋转。相比之下,OptR针对完整INT2注意力路径产生的WOW\_\{O\}之后的注意力输出误差来优化旋转。
## 3问题表述
#### 预备知识。
我们考虑一个仅有解码器的Transformer层l\\ell,采用分组查询注意力(GQA)Vaswani et al\. \(2017 (https://arxiv.org/html/2608.02691#bib.bib14)\); Ainslie et al\. \(2023 (https://arxiv.org/html/2608.02691#bib.bib2)\)。设h∈\{1,...,Hkv\}h\\in\\\{1,\\ldots,H\_\{\\mathrm\{kv\}\}\\\}表示一个KV头,设Gh⊆\{1,...,Hq\}G\_\{h\}\\subseteq\\\{1,\\ldots,H\_\{q\}\\\}表示共享该KV头的查询头集合。对于每个查询头j∈Ghj\\in G\_\{h\},我们写qt,jl,ks,hl,vs,hl∈R1×d,q\_\{t,j\}^\{\\ell\},k\_\{s,h\}^\{\\ell\},v\_\{s,h\}^\{\\ell\}\\in\\mathbb\{R\}^\{1\\times d\},其中s≤ts\\leq t,tt是当前解码位置,ss索引一个缓存的源token。等价地,KV头hh在位置tt之前的缓存键和值为K1:t,hl=\[k1,hl;...;kt,hl\]∈Rt×d,K\_\{1:t,h\}^\{\\ell\}=\[k\_\{1,h\}^\{\\ell\};\\ldots;k\_\{t,h\}^\{\\ell\}\]\\in\\mathbb\{R\}^\{t\\times d\},以及V1:t,hl=\[v1,hl;...;vt,hl\]∈Rt×d。V\_\{1:t,h\}^\{\\ell\}=\[v\_\{1,h\}^\{\\ell\};\\ldots;v\_\{t,h\}^\{\\ell\}\]\\in\\mathbb\{R\}^\{t\\times d\}。BF16注意力logits和概率为:
at,sl,j,h=⟨qt,jl,ks,hl⟩d,ptl,j,h=softmaxs≤t\(at,sl,j,h\)a\_\{t,s\}^\{\\ell,j,h\}=\\frac\{\\langle q\_\{t,j\}^\{\\ell\},k\_\{s,h\}^\{\\ell\}\\rangle\}\{\\sqrt\{d\}\},\\quad p\_\{t\}^\{\\ell,j,h\}=\\operatorname\{softmax\}\_\{s\\leq t\}\\left\(a\_\{t,s\}^\{\\ell,j,h\}\\right\)\(1\)相应的注意力输出为
ot,jl=∑s≤tpt,sl,j,hvs,hl=\(ptl,j,h\)⊤V1:t,hl∈R1×do\_\{t,j\}^\{\\ell\}=\\sum\_\{s\\leq t\}p\_\{t,s\}^\{\\ell,j,h\}v\_\{s,h\}^\{\\ell\}=\(p\_\{t\}^\{\\ell,j,h\}\)^\{\\top\}V\_\{1:t,h\}^\{\\ell\}\\in\\mathbb\{R\}^\{1\\times d\}\(2\)设WO,jl∈Rdmodel×dW\_\{O,j\}^\{\\ell\}\\in\\mathbb\{R\}^\{d\_\{\\mathrm\{model\}\}\\times d\}为查询头jj的输出投影。该头的注意力输出贡献为:
yt,jl=\(\(ptl,j,h\)⊤V1:t,hl\)\(WO,jl\)⊤∈R1×dmodely\_\{t,j\}^\{\\ell\}=\\left\(\\left\(p\_\{t\}^\{\\ell,j,h\}\\right\)^\{\\top\}V\_\{1:t,h\}^\{\\ell\}\\right\)\(W\_\{O,j\}^\{\\ell\}\)^\{\\top\}\\in\\mathbb\{R\}^\{1\\times d\_\{\\mathrm\{model\}\}\}\(3\)因此,KV缓存通过注意力加权读出\(ptl,j,h\)⊤V1:t,hl\(p\_\{t\}^\{\\ell,j,h\}\)^\{\\top\}V\_\{1:t,h\}^\{\\ell\}及其被WO,jlW\_\{O,j\}^\{\\ell\}的投影来影响模型。
参见图说明Figure 2:Qwen3\-8B(AIME25)在五种INT2 KV缓存设置下,按缓存token统计的键幅度(上)和键引入的注意力输出误差(下):仅OSCAR、普通INT2、重参数化(均值平移)、带OSCAR旋转的重参数化,以及完整的OptR流水线。越低越好;示例细节见附录。
### 3\.1旋转INT2 KV缓存量化
我们考虑长上下文解码,其中长历史KV缓存以INT2存储,并保留一个小的BF16窗口。设Q2\(⋅;c,G\)Q\_\{2\}\(\\cdot;c,G\)表示裁剪率cc和组大小GG下的INT2量化-反量化映射。对于正交旋转R∈O\(d\)R\\in O\(d\),定义
DR,c\(z\)=Q2\(zR;c,G\)R⊤D\_\{R,c\}\(z\)=Q\_\{2\}\(zR;c,G\)R^\{\\top\}\(4\)如果Q2Q\_\{2\}替换为恒等映射,则DR,c\(z\)=zD\_\{R,c\}\(z\)=z。因此,旋转只改变INT2量化误差引入的坐标系。我们用k~s,hl\\widetilde\{k\}\_\{s,h\}^\{\\ell\}和v~s,hl\\widetilde\{v\}\_\{s,h\}^\{\\ell\}表示在旋转INT2量化和BF16窗口恢复之后,注意力实际使用的有效键和值。
### 3\.2KV量化引起的输出空间误差
现在我们追踪有效INT2缓存通过注意力和WOW\_\{O\}的传播,并将由此产生的WOW\_\{O\}之后的注意力输出误差分解为键引入项和值引入项。在INT2键下,注意力logits和概率变为
a~t,sl,j,h\\displaystyle\\widetilde\{a\}\_\{t,s\}^\{\\ell,j,h\}=⟨qt,jl,k~s,hl⟩d,p~tl,j,h=softmaxs≤t\(a~t,sl,j,h\)\\displaystyle=\\frac\{\\langle q\_\{t,j\}^\{\\ell\},\\widetilde\{k\}\_\{s,h\}^\{\\ell\}\\rangle\}\{\\sqrt\{d\}\},\\quad\\widetilde\{p\}\_\{t\}^\{\\ell,j,h\}=\\operatorname\{softmax\}\_\{s\\leq t\}\\left\(\\widetilde\{a\}\_\{t,s\}^\{\\ell,j,h\}\\right\)\(5\)
设Δks,hl=k~s,hl−ks,hl\\Delta k\_\{s,h\}^\{\\ell\}=\\widetilde\{k\}\_\{s,h\}^\{\\ell\}\-k\_\{s,h\}^\{\\ell\}和Δvs,hl=v~s,hl−vs,hl\\Delta v\_\{s,h\}^\{\\ell\}=\\widetilde\{v\}\_\{s,h\}^\{\\ell\}\-v\_\{s,h\}^\{\\ell\}分别表示键和值的量化误差。键误差首先扰动注意力logits:
Δat,sl,j,h=a~t,sl,j,h−at,sl,j,h=⟨qt,jl,Δks,hl⟩d\\Delta a\_\{t,s\}^\{\\ell,j,h\}=\\widetilde\{a\}\_\{t,s\}^\{\\ell,j,h\}\-a\_\{t,s\}^\{\\ell,j,h\}=\\frac\{\\langle q\_\{t,j\}^\{\\ell\},\\Delta k\_\{s,h\}^\{\\ell\}\\rangle\}\{\\sqrt\{d\}\}\(6\)由此产生的注意力误差为Δptl,j,h=p~tl,j,h−ptl,j,h\\Delta p\_\{t\}^\{\\ell,j,h\}=\\widetilde\{p\}\_\{t\}^\{\\ell,j,h\}\-p\_\{t\}^\{\\ell,j,h\}。
因此,键误差的影响取决于查询和softmax注意力图,而不仅仅是‖Δk‖22\\\|\\Delta k\\\|\_\{2\}^\{2\}。
在INT2键和值下,注意力输出贡献变为
y~t,jl=\(∑s≤tp~t,sl,j,hv~s,hl\)\(WO,jl\)⊤\\widetilde\{y\}\_\{t,j\}^\{\\ell\}=\\left\(\\sum\_\{s\\leq t\}\\widetilde\{p\}\_\{t,s\}^\{\\ell,j,h\}\\widetilde\{v\}\_\{s,h\}^\{\\ell\}\\right\)\(W\_\{O,j\}^\{\\ell\}\)^\{\\top\}\(7\)
减去BF16读出得到精确分解。设Δyt,jl:=y~t,jl−yt,jl\\Delta y\_\{t,j\}^\{\\ell\}:=\\widetilde\{y\}\_\{t,j\}^\{\\ell\}\-y\_\{t,j\}^\{\\ell\}。则
Δyt,jl=\(∑s≤tΔpt,sl,j,hvs,hl\)\(WO,jl\)⊤⏟键引入的输出误差\+\(∑s≤tp~t,sl,j,hΔvs,hl\)\(WO,jl\)⊤⏟值引入的输出误差\\displaystyle\\Delta y\_\{t,j\}^\{\\ell\}=\\underbrace\{\\left\(\\sum\_\{s\\leq t\}\\Delta p\_\{t,s\}^\{\\ell,j,h\}v\_\{s,h\}^\{\\ell\}\\right\)\\left\(W\_\{O,j\}^\{\\ell\}\\right\)^\{\\top\}\}\_\{\\text\{键引入的输出误差\}\}\+\\underbrace\{\\left\(\\sum\_\{s\\leq t\}\\widetilde\{p\}\_\{t,s\}^\{\\ell,j,h\}\\Delta v\_\{s,h\}^\{\\ell\}\\right\)\\left\(W\_\{O,j\}^\{\\ell\}\\right\)^\{\\top\}\}\_\{\\text\{值引入的输出误差\}\}\(8\)
我们将上述两项分别记为δyK,t,jl,h\\delta y\_\{K,t,j\}^\{\\ell,h\}和δyV,t,jl,h\\delta y\_\{V,t,j\}^\{\\ell,h\}。这里δyK,t,jl,h\\delta y\_\{K,t,j\}^\{\\ell,h\}是键量化通过注意力分布引起的输出误差,而δyV,t,jl,h\\delta y\_\{V,t,j\}^\{\\ell,h\}是值误差经注意力加权聚合和输出投影后的结果。
这一分解说明了为什么原始缓存重建只是一个代理目标。基于重建的目标度量
Erec=‖K−K~‖F2\+‖V−V~‖F2E\_\{\\mathrm\{rec\}\}=\\\|K\-\\widetilde\{K\}\\\|\_\{F\}^\{2\}\+\\\|V\-\\widetilde\{V\}\\\|\_\{F\}^\{2\}\(9\)而模型观察到的是注意力输出误差
Eout=‖y~t,jl−yt,jl‖22=‖δyK,t,jl,h\+δyV,t,jl,h‖22E\_\{\\mathrm\{out\}\}=\\left\\\|\\widetilde\{y\}\_\{t,j\}^\{\\ell\}\-y\_\{t,j\}^\{\\ell\}\\right\\\|\_\{2\}^\{2\}=\\left\\\|\\delta y\_\{K,t,j\}^\{\\ell,h\}\+\\delta y\_\{V,t,j\}^\{\\ell,h\}\\right\\\|\_\{2\}^\{2\}\(10\)Eq\. \(9相似文章
OSCAR: 离线谱协方差感知旋转用于2位KV缓存量化
OSCAR是一种离线谱协方差感知旋转方法,用于2位KV缓存量化,该方法将量化与注意力协方差结构对齐,为长上下文LLM服务实现了高精度和高效率。
新的 KV 量化方案来了 😍 Welcome OSCAR kv quant 由 Together AI 开源
Together AI 开源了 OSCAR,一种注意力感知的 2 位 KV 缓存量化系统,通过根据注意力重要性重新分配量化误差,实现了高效的长上下文 LLM 服务。
RateQuant:基于率失真理论的优化混合精度KV Cache量化
本文介绍了 RateQuant,一种用于优化混合精度 KV Cache 量化的方法。该方法利用率失真理论解决失真模型不匹配问题,与 KIVI 和 QuaRot 等现有方法相比,在极低的校准开销下显著降低了困惑度。
超越旋转:AuroOFT用于表达性量化正交微调
介绍了AuroOFT,一种通过零起点门控低秩非线性残差增强量化正交微调(QOFT)的方法,在低比特语言模型上以更少的可训练参数提升了数学推理准确率,优于QOFT和QLoRA。
在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化
本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。