标签
Together AI 开源了 OSCAR,一种注意力感知的 2 位 KV 缓存量化系统,通过根据注意力重要性重新分配量化误差,实现了高效的长上下文 LLM 服务。
OSCAR是一种离线谱协方差感知旋转方法,用于2位KV缓存量化,该方法将量化与注意力协方差结构对齐,为长上下文LLM服务实现了高精度和高效率。