KGCache:面向大语言模型知识图谱推理的摊销式子图检索
摘要
KGCache是一种用于一跳知识图谱邻域的内存缓存,可减少使用大语言模型的KGQA系统中冗余的子图检索。在WebQSP和CWQ上的评估显示,它可将知识图谱检索速度提升最多1.91倍,并表明语义缓存能进一步提高命中率。
arXiv:2608.07954v1 公告类型:新
摘要:当大语言模型以知识图谱为基础时,它们能更可靠地回答知识密集型问题,但诸如Think-on-Graph和Reasoning-on-Graph之类的系统会在不同问题中反复查询相同的图邻域。在这项工作中,我们研究了知识图谱问答(KGQA)工作负载中的这种重复检索,并提出了KGCache——一种用于一跳知识图谱邻域的内存缓存。KGCache被设计为与迭代遍历(ToG)和一次性规划(RoG)这两种KGQA范式兼容。KGCache位于KGQA引擎与提供知识图谱服务的后端之间,因此重复的实体请求可以直接从缓存中获取,而无需发起新的知识图谱查询。我们在WebQSP和CWQ上使用LRU、LFU以及一种基于轨迹感知的Oracle策略对KGCache进行了评估。我们的分析表明,这两个数据集的起始实体与遍历过程中到达的实体之间存在大量的实体重用。我们还探索了针对相似查询的语义缓存,它在WebQSP上显示出额外的命中率提升,并且需要在CWQ上进行进一步的准确性测试。实体缓存可将知识图谱检索速度提升最多$1.91\times$,而语义上下文缓存在所评估的WebQSP配置中实现了最多$1.06\times$的整系统加速,且每次缓存命中的速度提升最多$3.73\times$。
查看缓存全文
缓存时间: 2026/08/11 08:04
# KGCache:面向LLM知识图谱推理的摊销子图检索 Source: https://arxiv.org/html/2608.07954 Ariful Azad Texas A&M University College Station, TX, USA stanic@tamu\.edu,ericycc@tamu\.edu,sabuj\.laskar@tamu\.edu,ariful@tamu\.edu
相似文章
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。
RKSC: 面向多步LLM推理的推理感知KV缓存共享与自信提前退出
介绍了RKSC,一个无需训练的推理框架,用于多分支LLM推理,通过基于相似度的共享和提前退出减少KV缓存冗余,实现最高3倍加速且错误率极低。
Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务
本文提出了Kara,一种滑动窗口KV缓存压缩方法,用于高效服务推理型大语言模型。该方法通过使用双向注意力和Token2Chunk模块,解决了现有压缩技术中的局限性。该方法被集成到基于vLLM构建的KvLLM推理框架中,在保持性能的同时提高了输出吞吐量。
LogosKG:面向硬件优化、可扩展且可解释的知识图谱检索
LogosKG 提出一种贴合硬件的框架,可在含十亿条边的知识图谱上实现可扩展、可解释的多跳检索;通过度感知分区与按需缓存提升效率,同时不损失保真度。
ReCache:面向工具增强LLM代理的高效KV缓存重用与压缩
ReCache是一个用于工具增强LLM代理中高效KV缓存重用与压缩的框架,在保持性能的同时实现显著的加速和内存减少。