@JakeKAllDay: 华为发布了一篇关于一种名为KVarN的新型KV压缩方法的论文:它证明了低至 *2 bit* 量化时损失极小…

X AI KOLs Timeline 论文

摘要

华为发布了一篇关于KVarN的论文,这是一种新型KV缓存压缩方法,在2位量化下与FP16相比实现了极小损失,优于TurboQuant和KIVI等方法,且几乎不引入推理延迟。

华为发布了一篇关于一种名为KVarN的新型KV压缩方法的论文:它证明了在多个模型上,与FP16相比,低至 *2 bit* 量化时损失极小,优于TurboQuant和KIVI等其他方法。几乎同样重要的是,它几乎不引入延迟。https://t.co/1hyzPjLFpU
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:23

华为发布了一篇关于新型KV压缩方法KVarN的论文:实验表明,与FP16相比,在多个模型上,该方法量化到2比特时损失极小,超越了TurboQuant和KIVI等其他方法。同样重要的是,其速度几乎没有降低。https://t.co/1hyzPjLFpU

相似文章

KVarN:华为推出的原生 vLLM KV 缓存量化后端

Hacker News Top

华为 CSL 发布 KVarN,这是一个原生 vLLM 注意力后端,专为 KV 缓存量化设计。它无需校准即可实现 3-5 倍的 KV 缓存容量提升,以及高达约 1.3 倍于 FP16 的吞吐量。在 Qwen3-32B 等模型上,其吞吐量最高可达 TurboQuant 的约 2.4 倍,同时保持与 FP16 相当的精度。

KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍

Hacker News Top

一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。