OSCAR: 离线谱协方差感知旋转用于2位KV缓存量化

Hugging Face Daily Papers 论文

摘要

OSCAR是一种离线谱协方差感知旋转方法,用于2位KV缓存量化,该方法将量化与注意力协方差结构对齐,为长上下文LLM服务实现了高精度和高效率。

INT2 KV缓存量化对长上下文LLM服务很有吸引力,但要同时实现准确性和可部署性仍然困难。简单的旋转方法如Hadamard变换可以减少异常值,但在INT2下仍然会退化,因为它们与下游注意力不一致。我们提出OSCAR,一种超低位KV缓存量化方法,它离线估计注意力感知的协方差结构,并利用它们推导出固定的旋转和量化裁剪阈值。这样,它将KV量化与注意力实际消耗的协方差结构对齐。更重要的是,我们不仅提供了理论证明,还开发了一个完全可部署的OSCAR系统,配备了自定义的INT2注意力内核,该内核与分页KV缓存服务和融合内核流水线兼容,从而能够无缝集成到现代LLM服务框架如SGLang和vLLM中。 我们在最新的推理模型上评估了我们的方法,这些模型在5个任务上有长达32k个token的推理轨迹。在Qwen3-4B-Thinking-2507和Qwen3-8B上,OSCAR将BF16精度差距分别缩小到3.78和1.42个点,而简单的旋转INT2几乎降为零。我们进一步将OSCAR扩展到Qwen3-32B和GLM-4.7(358B参数),在这些模型上OSCAR仍然与BF16基本持平。在长达128K的长上下文RULER-NIAH任务上,OSCAR在两个Qwen3模型上都保持稳健,而简单的旋转INT2则完全崩溃。系统层面,OSCAR将KV缓存内存减少了约8倍,在相同内存预算下,大batch size时吞吐量提升高达7倍,并且由于减少了内存带宽开销,batch size为1的解码速度比BF16快高达3倍。
查看原文
查看缓存全文

缓存时间: 2026/05/19 22:34

论文页面 - OSCAR:面向2位KV缓存量化的离线谱协方差感知旋转

来源:https://huggingface.co/papers/2605.17757

摘要

OSCAR 是一种超低位 KV 缓存量化方法,它将量化与注意力感知的协方差结构对齐,实现了长上下文大语言模型服务中的高精度与高效率。

INT2(https://huggingface.co/papers?q=INT2)KV 缓存量化(https://huggingface.co/papers?q=KV-cache%20quantization)对于长上下文大语言模型服务(https://huggingface.co/papers?q=long-context%20LLM%20serving)很有吸引力,但要做到既准确又可部署仍然困难。简单的旋转(如 Hadamard 变换)可以减少异常值,但在 INT2(https://huggingface.co/papers?q=INT2)下仍会退化,因为它们与下游注意力不对齐。我们提出 OSCAR,一种超低位 KV 缓存量化方法,它离线估计注意力感知的协方差结构(https://huggingface.co/papers?q=attention-aware%20covariance%20structures),并利用它们推导出用于量化的固定旋转(https://huggingface.co/papers?q=fixed%20rotations)和裁剪阈值(https://huggingface.co/papers?q=clipping%20thresholds)。这样,它将 KV 量化与注意力实际消耗的协方差结构对齐。更重要的是,我们不仅提供了理论证明,还开发了一个完全可部署的 OSCAR 系统,包含自定义的 INT2(https://huggingface.co/papers?q=INT2)注意力核(https://huggingface.co/papers?q=attention%20kernel),该核与分页 KV 缓存服务(https://huggingface.co/papers?q=paged%20KV-cache%20serving)和融合核流水线(https://huggingface.co/papers?q=fused%20kernel%20pipelines)兼容,能够无缝集成到 SGLang 和 vLLM 等现代大语言模型服务框架中。我们在最近的推理模型上评估我们的方法,这些模型的推理轨迹长达 32k token,涵盖 5 个任务。在 Qwen3-4B-Thinking-2507 和 Qwen3-8B 上,OSCAR 将 BF16 精度差距(https://huggingface.co/papers?q=BF16%20accuracy%20gap)分别降低到 3.78 和 1.42 个点,而简单的旋转 INT2(https://huggingface.co/papers?q=INT2)几乎崩溃。我们进一步将 OSCAR 扩展到 Qwen3-32B 和 GLM-4.7(358B 参数),在这些模型上它实际上与 BF16 持平。在长上下文(RULER-NIAH 最长 128K)下,OSCAR 在 Qwen3 两个模型上保持稳健,而简单的旋转 INT2(https://huggingface.co/papers?q=INT2)崩溃。系统方面,OSCAR 将 KV 缓存内存减少约 8 倍,在相同内存预算下,大 batch 大小的吞吐量提升高达 7 倍,并且由于降低了内存带宽开销,batch-size-1 的解码速度比 BF16 提升高达 3 倍。

查看 arXiv 页面(https://arxiv.org/abs/2605.17757)查看 PDF(https://arxiv.org/pdf/2605.17757)项目页面(https://oscar-quantize.github.io/)GitHub7(https://github.com/FutureMLS-Lab/OSCAR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17757)

在你的智能体中获取这篇论文:

hf papers read 2605.17757

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

Zhongzhu/OSCAR-RotationZoo 更新于约19小时前 • 2 (https://huggingface.co/Zhongzhu/OSCAR-RotationZoo)

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.17757 以从此页面链接。

引用此论文的空间0

没有空间链接此论文

在空间的 README.md 中引用 arxiv.org/abs/2605.17757 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

输出感知的INT2 KV缓存量化旋转方法

arXiv cs.LG

提出了OptR,一种用于INT2 KV缓存量化的输出感知旋转方法,可最小化输出后的注意力误差,在多个模型和基准上改进QuaRot和OSCAR。

基于局部分布还原的高精度低位KV缓存量化

arXiv cs.LG

本文发现低位KV缓存量化会因logits的结构化局部误排名而降低大语言模型精度,提出DGAP方法,通过恢复Top-K候选的局部分布,在Llama-3.1-8B模型上将RULER准确率从47.8%恢复至83.2%,且仅增加极小的开销。