cache-management

标签

Cards List
#cache-management

代理服务中基于学习智能体执行的KV-Cache管理

arXiv cs.AI · 2026-08-18 缓存

CacheScout是一个用于多智能体LLM服务的智能体感知KV-Cache运行时层,它在线学习智能体执行语义,以指导缓存淘汰和预取,从而提高缓存命中率并降低延迟。

0 人收藏 0 人点赞
#cache-management

来自未来的回望:基于反因果惊奇度的键值缓存管理

arXiv cs.LG · 2026-07-31 缓存

本文提出了一种KV缓存逐出策略,通过反因果惊奇度对令牌进行评分,移除那些可以从未来上下文中很好预测的过去令牌。该方法无需训练、分布内,并通过快速的单层近似实现了具有竞争力的性能。

0 人收藏 0 人点赞
#cache-management

@akshay_pachaar:每个推理引擎都犯了同样的错误。像 vLLM 或 SGLang 这样的推理引擎,是位于你的请求与模型权重之间的软件……

X AI KOLs Following · 2026-07-27 缓存

LMCache 是一个开源的 KV 缓存管理层,它将缓存 I/O 与计算分离,可插入 vLLM、SGLang 和 TensorRT-LLM,通过并行化缓存查找和共享 GPU 内存,实现高达 14 倍的首 token 延迟降低和 4 倍的解码加速。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈