全局计算,局部物化:稀疏事件键值缓存的内存契约
摘要
本文研究了稀疏事件键值(KV)服务中的内存契约,表明被驱逐的源事件仍可通过缓存行影响答案,并且刻意措辞的事件可以在不提及数值的情况下实现与捐赠者对齐的恢复。
查看缓存全文
缓存时间: 2026/08/04 13:39
论文页面 - Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV
来源:https://huggingface.co/papers/2607.23693
摘要
长期智能体越来越倾向于将 KV 缓存复用为记忆:服务系统保留缓存条目的一个子集,并丢弃其余部分。因此,逐出(eviction)和情景记忆(episodic-memory)方案都依赖一个很少被直接检验的前提:即使产生某个事件的观测已不存在,该保留事件仍然具有信息量。我们通过在所有其他方面相同的智能体历史中,从所服务的内容里省略一个较早的观测来检验这一前提。在对该观测敏感的项目中,答案绝大多数都遵循被省略的值,尽管没有任何被服务的片段说明哪个值才是正确的。我们将此称为语义物化(semantic materialization):下游事件的缓存行充当了一组可独立服务的计算视图,而该计算的输入已不存在。这种视图也可以有意写入。一个精心措辞、不含答案的事件,在 Qwen3-8B 上无需点名该值,就能将供体对齐恢复(donor-aligned recovery)从 6% 提升到 51%;而从长期对话中被动收集自然提及则没有检测到任何优势。这样的行所携带的内容是具体且有界的。紧凑的状态能够存续,较大的负载则向随机水平衰减;而一次构造是否会产生写入,取决于措辞而非仅取决于语义,因此模型对两种措辞的理解能力相同,结果却可能截然不同。最终形成的是稀疏事件-KV 服务的内存契约:应该写入什么、内容落在哪里、以及当来源消失后什么能够存续。对于任何进行逐出的系统,其推论是:丢弃一个来源事件且未观察到准确率下降,并不能说明该来源是不必要的。
在您的智能体中获取此论文:
hf papers read 2607\.23693
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.23693 以从本页链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.23693 以从本页链接到它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.23693 以从本页链接到它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏以从本页链接到它。
相似文章
信任质量:KV-Cache淘汰中的强制权重
本文分析了稀疏注意力模型中的KV-Cache淘汰策略,表明选择最大权重近乎最优,且已发表的差距源于内存和查询信息,其中ContourKV取得了强劲性能。
基于顿悟感知的KV缓存淘汰方法(无需注意力矩阵)
本文介绍了EpiKV,一种基于内部表征变化(顿悟分数)而非注意力权重来评估token重要性的KV缓存淘汰方法,无需具体化注意力矩阵。该方法在推理基准测试中取得了具有竞争力的性能,同时支持长达16倍的上下文长度。
PagedAttention:KV Cache的虚拟内存(15分钟阅读)
PagedAttention将虚拟内存概念应用于语言模型中的KV cache,减少内存碎片化,并使推理引擎能够在每个GPU上服务2-4倍的用户。
利用指数衰减记忆增强注意力提升查询感知的KV稀疏性
本文探讨了RAT+中的指数衰减记忆模块如何提升长上下文语言模型的查询感知稀疏推理方法,在针尖干草垛任务中,跨多种稀疏预算展示了一致的准确率提升。
连续性而非重要性:文档编辑后陈旧KV缓存的预算修复
本文研究了文档编辑后LLM系统中陈旧KV缓存的预算修复方法,证明了连续的编辑本地窗口能有效恢复性能,并且比完全重新预填充更快。