@bojie_li:如果你在生产环境中运行LLM智能体,你就会明白其中的代价。每一轮都要重新读取相同的长上下文——系统策略、工具……

X AI KOLs Timeline 论文

摘要

研究人员提出了可编程KV缓存(Programmable KV Cache),这是一种用于编辑和组合KV缓存的方法,旨在避免LLM智能体推理过程中重新预填充长上下文,在保持决策一致性的同时,将p90首令牌时间减少了53至398倍。

如果你在生产环境中运行LLM智能体,你就会明白其中的代价。每一轮都要重新读取相同的长上下文——系统策略、工具规范、检索到的文档——而提示缓存(Anthropic的、OpenAI的)仅在完全共享的前缀下才有帮助。 提前更改一个词元——时间戳、用户ID、订单状态——后续所有词元的键和值都会失效。你的支持智能体将订单状态改为"订单#4471:运输中",然后不得不重新预填它一秒钟前刚计算过的10,000个词元。 于是你尝试了明显的手术:只刷新那个字段的键和值,保留其余部分。模型立即按旧值行动,仿佛编辑从未发生。这个谜题困扰了我数周——直到我们因果性地追踪了四个模型系列的原因:Transformer不会将推理推迟到解码阶段。在预填充时,模型已经将基于字段的结论写入了下游词元——写入到后续位置通过读取的聚合器和分隔符词元中。字段自身的KV对决策的影响不到1%。KV缓存不是冻结的副产品;它是一本记录了记忆化结论的笔记。 这样解读,就引申出两种能力。可编辑:不要重新计算笔记,而是修改它们——一个仅追加的"勘误"("X现在是Y")覆盖了过时的结论。可组合:笔记是位置可移植的,因此预编译的技能可以通过RoPE重新定位并拼接到任何上下文中,与完全重计算(在十二个模型上logit余弦相似度为0.90–0.999)在O(L)而非O(L²)的复杂度下无法区分。 关键的威力在于:由于勘误是仅追加的,它可以利用生产环境中的前缀缓存而不是与之对抗——在真实的vLLM基准测试中,它保持了98.5%的缓存命中率,并将p90首令牌时间减少了53至398倍,与完全重计算的决策相同。这是一种你可以编程而不仅仅是扩展的KV缓存。 网站:https://01.me/research/programmable-kv… 代码:https://github.com/19PINE-AI/programmable-kv… 论文:https://arxiv.org/abs/2606.17107
查看原文
查看缓存全文

缓存时间: 2026/07/07 13:32

如果你在生产环境中运行 LLM 代理,就会知道其中的代价。每一次轮询都会重新读取相同的长上下文——系统策略、工具规范、检索到的文档——而提示缓存(Anthropic 的、OpenAI 的)只在精确共享前缀的情况下才有帮助。只要前面改动一个词——时间戳、用户 ID、订单状态——后面每个词元的键和值都会失效。你的支持代理刚翻到“订单 #4471:运输中”,就要为重新填充 10,000 个词元付费,而这些词元半秒钟前刚计算过。

于是你尝试了显而易见的修补术:只刷新那个字段的键和值,保留其余部分。然而模型立即对旧值作出反应,仿佛编辑从未发生过。这个谜题困扰了我好几周——直到我们跨四个模型家族追查到了因果根源:变换器不会将其推理推迟到解码时进行。在预填充阶段,模型就已经将基于字段条件的结论写入了下游词元——写入了聚合器和分隔符词元,后面位置通过它们来读取。该字段自身的 KV 对决策的贡献不到 1%。KV 缓存并非冻结的副产品;它是一本记录了已记忆结论的笔记本。

这样理解的话,两个能力就浮现出来了。可编辑性:不要重新计算笔记,而是修正它们——一个只追加的“勘误表”(“X 现在变为 Y”)覆盖了过时的结论。可组合性:笔记是位置可移植的,因此预编译的技能可以通过 RoPE 重新定位并拼接进任何上下文,其结果与完全重新计算无法区分(十二个模型上的 logit 余弦值为 0.90–0.999),代价为 O(L) 而非 O(L²)。

关键点在于:由于勘误表是只追加的,它是在生产级前缀缓存之上运行的,而不是与之对抗——在实时的 vLLM 基准测试中,它保持了 98.5% 的缓存命中率,并将 p90 首次输出词元时间缩短了 53–398 倍,且决策结果与完全重新计算一致。你可以编程的 KV 缓存,而不仅仅是扩展它。

网站:https://01.me/research/programmable-kv… 代码:https://github.com/19PINE-AI/programmable-kv… 论文:https://arxiv.org/abs/2606.17107

相似文章

TokenPilot:面向LLM代理的缓存高效上下文管理

Hugging Face Daily Papers

TokenPilot是一个双粒度上下文管理框架,通过稳定提示前缀和保守管理上下文片段,降低长时程LLM会话中的推理成本。在基准测试中实现了61-87%的成本降低,同时保持竞争性性能。