eviction

标签

Cards List
#eviction

PAGE: 分区感知门控KV-Cache淘汰

arXiv cs.LG ↗ · 2026-09-22 缓存

本文介绍了PAGE,一种分区感知的门控KV-Cache淘汰方法,它使用标量度量预测输入类别,仅在安全时应用淘汰,从而减少大语言模型中的精度损失。

0 人收藏 0 人点赞
#eviction

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

arXiv cs.LG ↗ · 2026-08-07 缓存

This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.

0 人收藏 0 人点赞
#eviction

来自未来的回望:基于反因果惊奇度的键值缓存管理

arXiv cs.LG ↗ · 2026-07-31 缓存

本文提出了一种KV缓存逐出策略,通过反因果惊奇度对令牌进行评分,移除那些可以从未来上下文中很好预测的过去令牌。该方法无需训练、分布内,并通过快速的单层近似实现了具有竞争力的性能。

0 人收藏 0 人点赞
#eviction

全局计算,局部物化:稀疏事件键值缓存的内存契约

Hugging Face Daily Papers ↗ · 2026-07-26 缓存

本文研究了稀疏事件键值(KV)服务中的内存契约,表明被驱逐的源事件仍可通过缓存行影响答案,并且刻意措辞的事件可以在不提及数值的情况下实现与捐赠者对齐的恢复。

0 人收藏 0 人点赞
#eviction

无需妥协的遗忘:固定预算下流式KV-Cache驱逐的Nexus采样

arXiv cs.LG ↗ · 2026-06-24 缓存

介绍了Nexus Sampling,一种无需训练的KV-cache驱逐方法,采用加权蓄水池采样代替确定性top-k选择,在固定内存预算下提升了长上下文LLM推理性能,在80%驱逐率下达到与密集注意力相匹配的性能。

0 人收藏 0 人点赞
#eviction

针对推理模型的价值感知随机KV缓存驱逐方法

Hugging Face Daily Papers ↗ · 2026-06-02 缓存

VaSE是一种无需训练的KV缓存驱逐方法,它保护大数值幅度的值状态,并引入随机性,以提高压缩下推理模型的准确性,超越了现有方法。

0 人收藏 0 人点赞
#eviction

@no_stp_on_snek: 首批体验:triattention v3 在长上下文中安全驱逐,✓命中每个层级 32k → 256k 在 qwen3.5-2b-4bit (混合 mamba…

X AI KOLs Following ↗ · 2026-05-08

介绍了 triattention v3,一种新的注意力机制,能够在长上下文推理中实现安全驱逐且不丢失召回,并在混合 mamba+attention 模型上演示了高达 256k 令牌的效果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈