OSCAR: 离线谱协方差感知旋转用于2位KV缓存量化
摘要
OSCAR是一种离线谱协方差感知旋转方法,用于2位KV缓存量化,该方法将量化与注意力协方差结构对齐,为长上下文LLM服务实现了高精度和高效率。
查看缓存全文
缓存时间: 2026/05/19 22:34
论文页面 - OSCAR:面向2位KV缓存量化的离线谱协方差感知旋转
来源:https://huggingface.co/papers/2605.17757
摘要
OSCAR 是一种超低位 KV 缓存量化方法,它将量化与注意力感知的协方差结构对齐,实现了长上下文大语言模型服务中的高精度与高效率。
INT2(https://huggingface.co/papers?q=INT2)KV 缓存量化(https://huggingface.co/papers?q=KV-cache%20quantization)对于长上下文大语言模型服务(https://huggingface.co/papers?q=long-context%20LLM%20serving)很有吸引力,但要做到既准确又可部署仍然困难。简单的旋转(如 Hadamard 变换)可以减少异常值,但在 INT2(https://huggingface.co/papers?q=INT2)下仍会退化,因为它们与下游注意力不对齐。我们提出 OSCAR,一种超低位 KV 缓存量化方法,它离线估计注意力感知的协方差结构(https://huggingface.co/papers?q=attention-aware%20covariance%20structures),并利用它们推导出用于量化的固定旋转(https://huggingface.co/papers?q=fixed%20rotations)和裁剪阈值(https://huggingface.co/papers?q=clipping%20thresholds)。这样,它将 KV 量化与注意力实际消耗的协方差结构对齐。更重要的是,我们不仅提供了理论证明,还开发了一个完全可部署的 OSCAR 系统,包含自定义的 INT2(https://huggingface.co/papers?q=INT2)注意力核(https://huggingface.co/papers?q=attention%20kernel),该核与分页 KV 缓存服务(https://huggingface.co/papers?q=paged%20KV-cache%20serving)和融合核流水线(https://huggingface.co/papers?q=fused%20kernel%20pipelines)兼容,能够无缝集成到 SGLang 和 vLLM 等现代大语言模型服务框架中。我们在最近的推理模型上评估我们的方法,这些模型的推理轨迹长达 32k token,涵盖 5 个任务。在 Qwen3-4B-Thinking-2507 和 Qwen3-8B 上,OSCAR 将 BF16 精度差距(https://huggingface.co/papers?q=BF16%20accuracy%20gap)分别降低到 3.78 和 1.42 个点,而简单的旋转 INT2(https://huggingface.co/papers?q=INT2)几乎崩溃。我们进一步将 OSCAR 扩展到 Qwen3-32B 和 GLM-4.7(358B 参数),在这些模型上它实际上与 BF16 持平。在长上下文(RULER-NIAH 最长 128K)下,OSCAR 在 Qwen3 两个模型上保持稳健,而简单的旋转 INT2(https://huggingface.co/papers?q=INT2)崩溃。系统方面,OSCAR 将 KV 缓存内存减少约 8 倍,在相同内存预算下,大 batch 大小的吞吐量提升高达 7 倍,并且由于降低了内存带宽开销,batch-size-1 的解码速度比 BF16 提升高达 3 倍。
查看 arXiv 页面(https://arxiv.org/abs/2605.17757)查看 PDF(https://arxiv.org/pdf/2605.17757)项目页面(https://oscar-quantize.github.io/)GitHub7(https://github.com/FutureMLS-Lab/OSCAR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17757)
在你的智能体中获取这篇论文:
hf papers read 2605.17757
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
Zhongzhu/OSCAR-RotationZoo 更新于约19小时前 • 2 (https://huggingface.co/Zhongzhu/OSCAR-RotationZoo)
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.17757 以从此页面链接。
引用此论文的空间0
没有空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2605.17757 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
输出感知的INT2 KV缓存量化旋转方法
提出了OptR,一种用于INT2 KV缓存量化的输出感知旋转方法,可最小化输出后的注意力误差,在多个模型和基准上改进QuaRot和OSCAR。
新的 KV 量化方案来了 😍 Welcome OSCAR kv quant 由 Together AI 开源
Together AI 开源了 OSCAR,一种注意力感知的 2 位 KV 缓存量化系统,通过根据注意力重要性重新分配量化误差,实现了高效的长上下文 LLM 服务。
在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化
本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。
基于局部分布还原的高精度低位KV缓存量化
本文发现低位KV缓存量化会因logits的结构化局部误排名而降低大语言模型精度,提出DGAP方法,通过恢复Top-K候选的局部分布,在Llama-3.1-8B模型上将RULER准确率从47.8%恢复至83.2%,且仅增加极小的开销。
RateQuant:基于率失真理论的优化混合精度KV Cache量化
本文介绍了 RateQuant,一种用于优化混合精度 KV Cache 量化的方法。该方法利用率失真理论解决失真模型不匹配问题,与 KIVI 和 QuaRot 等现有方法相比,在极低的校准开销下显著降低了困惑度。