全局计算,局部物化:稀疏事件键值缓存的内存契约

Hugging Face Daily Papers 论文

摘要

本文研究了稀疏事件键值(KV)服务中的内存契约,表明被驱逐的源事件仍可通过缓存行影响答案,并且刻意措辞的事件可以在不提及数值的情况下实现与捐赠者对齐的恢复。

长程智能体日益将键值缓存(KV cache)复用为内存:服务系统保留一部分缓存条目,丢弃其余部分。因此,驱逐(eviction)和情景记忆(episodic-memory)方案建立在一个很少被直接检验的前提上,即一旦产生某条保留事件的观测数据消失,该事件仍然具有信息价值。我们通过在其他完全相同的智能体历史中省略一条较早的观测来检验这一前提。在对该观测敏感的项目中,答案绝大多数遵循被省略的数值,尽管没有任何被服务的片段说明哪个数值是正确的。我们将此称为语义物化(semantic materialization):下游事件缓存行充当计算的一种可独立服务的视图,而该计算的输入已不存在。这种效果也可以有意为之。一个刻意措辞、不含答案的事件将Qwen3-8B上捐赠者对齐恢复率从6%提升到51%,且从未提及该数值;而被动地从长期对话中收集自然提及则未检测到任何优势。此类行所携带的内容是具体且有界的。紧凑状态得以保留,较大载荷则趋于随机衰减,而且一种构造能否写入取决于措辞而非仅凭语义,因此模型同样能理解的两种措辞可能产生截然不同的结果。其结果是稀疏事件键值服务的内存契约:写什么、落在何处、以及源消失后什么得以存续。对于任何执行驱逐操作的人来说,推论是:删除源事件而未观察到准确率下降,并不能证明该源事件是不必要的。
查看原文
查看缓存全文

缓存时间: 2026/08/04 13:39

论文页面 - Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV

来源:https://huggingface.co/papers/2607.23693

摘要

长期智能体越来越倾向于将 KV 缓存复用为记忆:服务系统保留缓存条目的一个子集,并丢弃其余部分。因此,逐出(eviction)和情景记忆(episodic-memory)方案都依赖一个很少被直接检验的前提:即使产生某个事件的观测已不存在,该保留事件仍然具有信息量。我们通过在所有其他方面相同的智能体历史中,从所服务的内容里省略一个较早的观测来检验这一前提。在对该观测敏感的项目中,答案绝大多数都遵循被省略的值,尽管没有任何被服务的片段说明哪个值才是正确的。我们将此称为语义物化(semantic materialization):下游事件的缓存行充当了一组可独立服务的计算视图,而该计算的输入已不存在。这种视图也可以有意写入。一个精心措辞、不含答案的事件,在 Qwen3-8B 上无需点名该值,就能将供体对齐恢复(donor-aligned recovery)从 6% 提升到 51%;而从长期对话中被动收集自然提及则没有检测到任何优势。这样的行所携带的内容是具体且有界的。紧凑的状态能够存续,较大的负载则向随机水平衰减;而一次构造是否会产生写入,取决于措辞而非仅取决于语义,因此模型对两种措辞的理解能力相同,结果却可能截然不同。最终形成的是稀疏事件-KV 服务的内存契约:应该写入什么、内容落在哪里、以及当来源消失后什么能够存续。对于任何进行逐出的系统,其推论是:丢弃一个来源事件且未观察到准确率下降,并不能说明该来源是不必要的。

查看 arXiv 页面查看 PDFGitHub2添加到收藏

在您的智能体中获取此论文:

hf papers read 2607\.23693

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.23693 以从本页链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.23693 以从本页链接到它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.23693 以从本页链接到它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏以从本页链接到它。

相似文章

信任质量:KV-Cache淘汰中的强制权重

arXiv cs.LG

本文分析了稀疏注意力模型中的KV-Cache淘汰策略,表明选择最大权重近乎最优,且已发表的差距源于内存和查询信息,其中ContourKV取得了强劲性能。

基于顿悟感知的KV缓存淘汰方法(无需注意力矩阵)

arXiv cs.LG

本文介绍了EpiKV,一种基于内部表征变化(顿悟分数)而非注意力权重来评估token重要性的KV缓存淘汰方法,无需具体化注意力矩阵。该方法在推理基准测试中取得了具有竞争力的性能,同时支持长达16倍的上下文长度。