标签
KVBoost 是一个块级键值缓存重用系统,用于高效大语言模型推理。它通过双哈希键控和偏差引导的重计算,实现高缓存命中率和首 token 时间的显著加速,且不损失质量。
介绍了MaSRead,一种用于复制潜在存储的内容寻址读取机制,其中代理共享KV缓存片段,使后续查询能够通过不透明的键控标签集和硬注意力掩码可靠地检索缓存的推理结果。
本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。
KVpop提出了一种由未来注意力目标监督的学习型KV缓存驱逐策略,在Qwen3模型上实现了高压缩率(例如,75%压缩率下保持98%性能),同时保持质量。
本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。
作者对键值缓存量化(q4_0)即使在长上下文窗口下依然有效感到惊讶,并引用了从 10 万上下文中准确检索的结果。
介绍了KV-Compression Aware Training (KV-CAT) 方法,该方法鼓励Transformer在训练过程中学习可压缩的键值缓存,在不牺牲性能的情况下提高长上下文任务的记忆效率。
提出了自剪枝键值注意力(SP-KV),一种通过学习预测键值对未来效用的机制,动态剪枝KV缓存,将内存使用和解码速度提升3-10倍,且性能下降极小。模型和效用预测器通过下一词元预测进行端到端联合训练。