缓存感知的提示压缩:大语言模型API缓存的双层成本模型
摘要
提出了一种缓存感知的提示压缩(CAPC)方法,该方法将查询无关的压缩与缓存相结合,以降低大语言模型API的成本,在Anthropic的Sonnet API和生产工作负载上展现出显著优于现有方法的节省效果。
arXiv:2607.15516v1 公告类型:cross
摘要:生产环境中大语言模型的部署结合了两种成本降低的基本方法:提示缓存(对重复使用的token前缀给予折扣费率)和提示压缩(发送更少的token)。压缩领域的文献已经标准化了查询感知的方法,这些方法为每个查询生成不同的压缩前缀,从而机械地使每次调用时的严格前缀缓存失效。我们在Anthropic的Sonnet 4.6 API上通过经验表征了这种成本,发现缓存远非文献假设的rho=1.0理想情况:Sonnet的缓存具有双层架构,在约3,500个token处有一个尖锐的阈值,在该阈值以下,命中率在30次调用的会话中稳定在rho约0.83。我们的成本模型预测,并且实验证实,在现实的rho下,查询感知压缩在高压缩比(r>=6)时优于朴素缓存。我们提出了缓存感知的提示压缩(CAPC),将查询无关的压缩与显式的cache_control以及一个保持层级的比率边界相结合,防止过度压缩将缓存的前缀推入热层级。CAPC在LongBench-v2的所有16种配置中都是最便宜的策略,与仅缓存相比平均节省49%,与查询感知压缩相比节省64%,与原始版本相比节省90%,同时质量在未压缩基线的0.05以内。我们在三个生产工作负载上验证了CAPC:一个具有94k token的schema前缀的企业级工具使用助手(在r=3时成本降低51.7%);一个跨两个代码库的graphify知识图谱RAG流水线(在FastAPI上比全部缓存快9.3倍,在httpx上快2.4倍);以及公开的tau-bench零售基准(50个任务),其中CAPC是四种策略中最便宜的,奖励与原始版本完全相等(两者均为36/50,p=1.00),而查询感知压缩是最昂贵的,比原始版本高出40.1%——这是首次在公开基准上对交叉模型负投资回报率预测的生产验证。
查看缓存全文
缓存时间: 2026/07/20 09:26
# 面向LLM API缓存的两层成本模型
来源:https://arxiv.org/html/2607.15516
## 缓存感知型提示压缩:一种面向LLM API缓存的两层成本模型
###### 摘要
生产环境中的LLM部署通常结合两种降本原语——*提示缓存*(对复用的令牌前缀收取大幅折扣费率)和*提示压缩*(减少发送的令牌数量)。提示压缩研究的文献已标准化采用*查询感知*型方法,这类方法会为每次查询生成不同的压缩前缀——这一设计选择从机械层面破坏了每次调用中的前缀严格缓存机制。我们通过实验刻画了该选择在Anthropic Sonnet 4.6 API上的成本影响,发现缓存远非文献假设的ρ=1.0\\rho=1.0理想状态:Sonnet的缓存具有两层架构,在约3,500令牌处存在陡峭阈值,低于该阈值时,在30次调用会话中命中率稳定在ρ≈0.83\\rho\\approx 0.83。我们的成本模型预测——实验也证实——在现实ρ\\rho条件下,查询感知型压缩在高压缩比(r≥6r\\geq 6)时优于朴素缓存。我们随后提出**缓存感知型提示压缩(Cache-Aware Prompt Compression, CAPC)**,它将查询无关型压缩与显式`cache_control`相结合,并辅以*层级保持比率界限*,防止过度压缩将缓存前缀推入热层。CAPC在LongBench-v2上16/16个(文档大小×\\times压缩比)配置中均为成本最低策略,相比仅缓存策略平均节省49%(范围24–67%),相比查询感知型压缩平均节省64%(范围42–76%),相比原始版本平均节省90%(范围84–94%)——且在层级保持比率下,质量与未压缩基线相差不超过0.05。我们在三种生产规模工作负载上验证了CAPC:一个企业工具使用助手,带有94k令牌的`tools=schema`前缀(在r=3r\{=\}3时成本降低51.7%);一个跨两个代码库复现的图化知识图谱RAG流水线(在FastAPI上相比全缓存提升9.3×\\times,在httpx上提升2.4×\\times,前缀大小在5k–260k5\\text\{k\}\\text\{\-\-\}260\\text\{k\}范围内保持85%85\\%的缓存命中率);以及公开τ\\tau-bench零售基准(50个任务,具有确定性数据库状态奖励),其中CAPC是四种策略中成本最低的,且任务完成奖励*与原始版本完全一致*(均为36/50,z=0.00z=0.00,p=1.00p=1.00),而查询感知型压缩是*成本最高*的,比原始版本高出+40.1%\+40.1\\%——这是在公开基准上对交叉模型负ROI预测的首次生产验证。所有实验的Anthropic API总花费为98.96美元。
## 引言
现代LLM部署结合了两种降本原语,而文献迄今将它们分开处理。**提示缓存**(Anthropic的`cache_control`、OpenAI的自动缓存、Google的Vertex缓存)通过存储前缀的KV状态并对后续读取收取折扣费率来节省成本。**提示压缩**(LLMLingua、LongLLMLingua、Cmprsr)通过首先减少发送的令牌数量来节省成本。这两个思路通常*相互冲突*。查询感知型压缩方法——提示压缩文献中的主导家族——为每次查询生成*不同*的压缩前缀。这破坏了缓存所依赖的前缀约束:每次调用都是缓存未命中,每次调用需支付完整的未缓存输入费率,经过精细调校的压缩节省被重复的缓存写入所抵消。我们在Anthropic Sonnet 4.6 API上通过实验刻画了这一交互。我们证明,在现实测量的缓存命中率ρ(N,|P|)\\rho(N,|P|)下,文献隐含的假设ρ=1.0\\rho=1.0以三种具体方式错误陈述了成本-质量格局:(1) Anthropic的缓存具有*两层架构*,在约3,500令牌处存在陡峭大小阈值,低于该阈值时ρ<1\\rho<1;(2) 在高压缩比(r≥6r\\geq 6)时,查询感知型压缩实际上优于朴素仅缓存——这与传统认知相反;(3) 在LongBench-v2上测试的所有16个(文档大小×\\times压缩比)配置中,一种简单的**缓存感知型提示压缩(CAPC)**将查询*无关*压缩与缓存相结合,严格优于文献的基线。
#### 贡献。我们的贡献包括:
1. 1\. 对Anthropic Sonnet 4.6提示缓存的**经验刻画**,揭示其两层架构(热/受限层,低于约∼3\{\\sim\}3k令牌,ρ≤0.83\\rho\\leq 0.83;持久/复制层,以上ρ≈1.0\\rho\\approx 1.0),在n=3n=3次独立试验中可复现,平台期σ=0\\sigma=0。
2. 2\. 一个**现实成本模型**`cost(N,|P|,r)=N[(1−ρ(N,|P|/r))|P|/r c_w + ρ(N,|P|/r)|P|/r c_r] + output`,该模型将文献的理想模型(ρ=1.0\\rho=1.0)作为特例,并产生一个**交叉预测**——在r≥6r\\geq 6时,仅缓存几乎从不优于查询感知型压缩——我们在实际API花费中精确验证了这一点。
3. 3\. **缓存感知型提示压缩(CAPC)**,附带一个相关的**层级保持比率界限**`r_max(P)=⌊P/3500⌋`,防止过度压缩将缓存前缀推入热层。
4. 4\. 在LongBench-v2文档上(12k–25k令牌,压缩比2–6,每个单元N=10N=10次查询)的**16/16经验主导结果**:CAPC是每种配置中四种策略成本最低的,相比仅缓存平均节省49%,相比查询感知型压缩平均节省64%,相比原始版本平均节省90%。一个单独的18点成本-质量Pareto扫描(第6节)显示,在28k令牌文档上CAPC完全主导(0/6被任何基线主导),在匹配质量时相比仅缓存节省53–78%。
5. 5. **在规模上的生产验证**:企业工具使用助手(第6.3节):CAPC在94k令牌的`tools=schema`前缀上相比原始版本实现51.7%的成本降低,同时揭示了一种隐式工具缓存现象,该现象对我们第3.1节的特征描述进行了限定。
6. 6. 知识图谱RAG的**“最后一英里交付”框架**(第6.4节):我们将CAPC与图化工具集成,并展示索引器的原生查询输出是无内容的(仅NODE/EDGE元数据);CAPC的第2层`source_file`引用填补了这一空白。在两个代码库上复现,且模型先验强度相反(FastAPI:模型非常熟悉;httpx:不太熟悉),揭示了先验中介性质对CAPC质量贡献的影响。我们发布了`capc_graphify_profiler.py`,一个启发式自动配置器,将集成简化为两个命令。
7. 7. **具有确定性地面真值奖励的公开基准验证**(第6.5节):在τ\\tau-bench零售基准(50个任务,多轮工具使用智能体,无判断0/1数据库状态奖励)上,CAPC是四种策略中成本最低的,且奖励*与原始版本完全一致*(均为36/50,双比例z=0.00z=0.00,p=1.00p=1.00),而查询感知型压缩比原始版本昂贵+40.1%\+40.1\\%——这是对第4节负ROI预测的直接、可复现的生产确认。τ\\tau-bench零售(小wiki主导前缀,查询感知惩罚+40%\+40\\%)与企业助手(大工具主导前缀,查询感知惩罚−31%\-31\\%)之间的对比提供了一个精细的特征描述:查询感知型压缩的成本效果随缓存前缀被突变的分数单调变化,我们在第7.2节中发展了这一发现。
#### 范围与可推广内容。本文同时提出了*框架层面*和*经验快照*层面的主张,我们明确区分两者。成本模型(第4节)、交叉分析方法、CAPC算法(第5节)、层级保持比率界限以及自适应缓存边界算法(第5.3节)是框架贡献,仅依赖于存在前缀严格缓存API且具有`c_w > c_r`定价结构——这一属性目前所有主要商业LLM API(Anthropic、OpenAI、Google)都共享。具体的数值——约∼\\sim3,500令牌的两层阈值、ρ≈0.83\\rho\\approx 0.83热层平台期、16/16主导百分比、交叉阈值`ρ_cross(r)`——是*2026年5月Sonnet 4.6*的测量值。我们预期定性发现(两层架构、小前缀下ρ<1\\rho<1、CAPC主导)可迁移至其他提供商和未来模型版本,而具体数值需要重新测量。第7节详细说明了跨提供商复现计划;第4节以参数形式呈现交叉分析,以便实践者从自身测量的价格中重新推导设计规则。
#### 论文路线图。第2节回顾提示缓存评估、提示压缩以及两者交互的少量相关文献。第3节呈现我们对Sonnet 4.6缓存行为的经验刻画。第4节推导成本模型和交叉分析。第5节详细说明CAPC算法,包括层级保持比率界限和自适应分段分类子程序。第6节呈现跨四个独立提示结构的五个实验:(§6.1–6.2)合成的LongBench-v2文档;(§6.3)带有94k令牌`tools=`前缀的生产企业工具使用助手;(§6.4)FastAPI和httpx上的两个图化知识图谱RAG案例研究;(§6.5)公开τ\\tau-bench零售基准,具有确定性数据库状态奖励。第7节讨论局限性和未来工作。
## 相关研究
触及CAPC设计空间的先前工作可分为五条线索:提示缓存的实证刻画、提示压缩方法、成本感知型模型路由、智能体和推理预算控制,以及关于缓存感知提示构建的少量但不断增长的行业指导。每条线索都产生了有用的原语,但都止步于CAPC所需的*联合优化*。
### 提示缓存:从实现到经济建模
Anthropic、OpenAI和Google均在2024–2025年推出了`cache_control`风格的前缀缓存API,并附有详细的定价表。这些API的学术研究最近才起步且范围狭窄。*Don’t Break the Cache*(Lumer等人,2026年)评估了DeepResearch基准上长期智能体任务的三类缓存策略,但未提出成本模型。*Auditing Prompt Caching*(Gu等人,2025年)将缓存视为*侧信道*隐私风险。*vCache*(Schroeder等人,2025年)和*GenCache*(Chakraborty等人,2025年)研究语义缓存机制,这与前缀缓存正交。
#### 差距。我们首次在生产缓存API上提供了系统的ρ(N,|P|)\\rho(N,|P|)特征描述,揭示了约3,500令牌处的陡峭阈值两层缓存架构,并将经验曲线嵌入到本文其余部分所依赖的成本模型中。
### 提示压缩:查询感知 vs. 查询无关
提示压缩方法的主导家族是*查询感知*型。*LLMLingua*(Jiang等人,2023a)引入这一范式,实现了10–20×\\times令牌减少;*LongLLMLingua*(Jiang等人,2023b)将其扩展到长上下文场景;*Prompt Compression in the Wild*(Kummer等人,2026年)测量了LLMLingua在30k生产查询中的行为。*ProCut*(Xu等人,2025年)和*CompactPrompt*(Choi等人,2025年)提出了领域调优的压缩器。*500xCompressor*(Li等人,2024年)和*Fundamental Limits of Prompt Compression*(Nagle等人,2024年)推动了压缩比前沿并刻画了信息论界限。所有查询感知型方法的关键特性是,它们通过构造为每次查询生成*不同*的压缩前缀——这正是提示压缩所禁止的特性。存在少量关于*查询无关*压缩的文献。*Cmprsr*(Zakazov等人,2025年)训练了一个RL驱动的查询无关抽象压缩器,并指出其结果“适合预计算”;然而,它并未模拟使预计算有价值的缓存经济学。
#### 差距。我们将查询无关压缩定位为其隐含的*缓存保持*设计选择,针对三个典型基线进行评估,并识别出一个新的失败模式——过度压缩将缓存前缀推入热缓存层(第5节)。
### 成本感知型模型路由与级联
*FrugalGPT*(Chen等人,2023年)引入了LLM级联。*RouteLLM*(Ong等人,2024年)训练了一个二元路由器。*xRouter*(Qian等人,2025年)使用RL进行成本感知协调。*Cascade Routing*框架(Dekoninck等人,2025年)统一了这些工作。这些研究将每个模型的价格视为*静态常数*;没有考虑缓存粘性。
#### 差距。ρ(N,|P|)\\rho(N,|P|)成本模型可直接与这些路由器中的任何一个组合使用;我们在第7节中将其列为未来工作。
### 智能体与推理预算控制
*Budget-Aware Tool-Use*(Liu等人,2025年)限制了工具调用次数;*INTENT*(Liu等人,2026年)优化了预算受限的智能体LLM;*Re-FORC*(Zabounidis等人,2025年)每次查询自适应调整思维链推理预算。这一线索作用于不同的杠杆——调用次数而非令牌内容——并且可与CAPC干净地组合。
### 行业指导与学术-实践差距
大量*行业*文献——提供商文档(Anthropic,2024年;OpenAI,2024年)、工程博客——提供了正确但*非正式*的缓存感知提示构建指导(“静态在前,动态在后”;“先压缩,然后缓存压缩版本”)。
#### 差距。我们将这些非正式的生产指导转化为:(a) 具有测量参数的正式成本模型,(b) 带有推导设计规则的算法,以及(c) 针对既定学术基线的严格经验评估。
### 定位总结
表 1:CAPC相对于五条最相近文献线索的定位。
## Sonnet 4.6提示缓存的实证刻画
先前关于提示缓存的工作……相似文章
为什么感觉大型LLM提供商在故意隐藏提示缓存?
一篇文章讨论提示缓存如何大幅降低LLM API成本,指出提供商对此解释不足,并提供一个简单的规则来构建提示以获得最大缓存命中率。
解释提示缓存如何在大型语言模型(LLM)中工作,以Claude为案例,详细说明Transformer的KV缓存机制以及在代理工作流中缓存静态前缀的成本效益。
解释提示缓存如何在大型语言模型(LLM)中工作,以Claude为案例,详细说明Transformer的KV缓存机制以及在代理工作流中缓存静态前缀的成本效益。
面向长上下文服务的KV-Cache优化:任务质量与系统性能的基准测试
本文提出了一个负载感知的基准测试,在长上下文LLM服务任务上比较了KV-cache压缩技术(量化、剪枝、合并),发现仅压缩比不足以预测性能,并倡导负载感知的选择。
@Alacritic_Super: 如果你在构建生产级 LLM 应用,学习 LLM 缓存。缓存可降低延迟、GPU 利用率和 AP…
本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。