KGCache:面向大语言模型知识图谱推理的摊销式子图检索

arXiv cs.AI 论文

摘要

KGCache是一种用于一跳知识图谱邻域的内存缓存,可减少使用大语言模型的KGQA系统中冗余的子图检索。在WebQSP和CWQ上的评估显示,它可将知识图谱检索速度提升最多1.91倍,并表明语义缓存能进一步提高命中率。

arXiv:2608.07954v1 公告类型:新 摘要:当大语言模型以知识图谱为基础时,它们能更可靠地回答知识密集型问题,但诸如Think-on-Graph和Reasoning-on-Graph之类的系统会在不同问题中反复查询相同的图邻域。在这项工作中,我们研究了知识图谱问答(KGQA)工作负载中的这种重复检索,并提出了KGCache——一种用于一跳知识图谱邻域的内存缓存。KGCache被设计为与迭代遍历(ToG)和一次性规划(RoG)这两种KGQA范式兼容。KGCache位于KGQA引擎与提供知识图谱服务的后端之间,因此重复的实体请求可以直接从缓存中获取,而无需发起新的知识图谱查询。我们在WebQSP和CWQ上使用LRU、LFU以及一种基于轨迹感知的Oracle策略对KGCache进行了评估。我们的分析表明,这两个数据集的起始实体与遍历过程中到达的实体之间存在大量的实体重用。我们还探索了针对相似查询的语义缓存,它在WebQSP上显示出额外的命中率提升,并且需要在CWQ上进行进一步的准确性测试。实体缓存可将知识图谱检索速度提升最多$1.91\times$,而语义上下文缓存在所评估的WebQSP配置中实现了最多$1.06\times$的整系统加速,且每次缓存命中的速度提升最多$3.73\times$。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:04

# KGCache:面向LLM知识图谱推理的摊销子图检索
Source: https://arxiv.org/html/2608.07954
Ariful Azad Texas A&M University College Station, TX, USA stanic@tamu\.edu,ericycc@tamu\.edu,sabuj\.laskar@tamu\.edu,ariful@tamu\.edu

相似文章

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

arXiv cs.CL

本文提出了Kara,一种滑动窗口KV缓存压缩方法,用于高效服务推理型大语言模型。该方法通过使用双向注意力和Token2Chunk模块,解决了现有压缩技术中的局限性。该方法被集成到基于vLLM构建的KvLLM推理框架中,在保持性能的同时提高了输出吞吐量。