VisKG-LM: 将知识图谱编译为视觉记忆用于多项选择题问答
摘要
本文提出VisKG-LM,一种将知识图谱编译为视觉记忆以进行高效多项选择题问答的方法,通过将图编码与语言推理解耦,在基线上实现性能提升。
arXiv:2609.19158v1 公告类型:新
摘要:知识图谱通常通过使用图神经网络编码检索到的子图,并在在线推理路径中与语言模型融合,从而集成到问答系统中。因此,每次对一对数据进行评分时,相同的子图都会从头开始重新编码,跨越训练轮次、种子和评估运行,即使知识图谱从未改变。我们提出疑问,是否可以改为离线编译一次检索到的知识图谱,然后将其作为只读内存访问。VisKG-LM表明这是可行的,通过将图编码与语言推理解耦。它将每个检索到的候选特定子图序列化为关系标签路径,并将结果渲染为图像,其二维布局保留了路径的分支结构。每张图像离线编码一次并缓存以供重用。在推理时,语言模型仅从文本中上下文化问题和候选答案,只有其最后一层查询缓存的视觉记忆,读取其全局布局和局部关系细节。因此,图信息仅在文本被理解后才进入。在CommonsenseQA、OpenBookQA和MedQA-USMLE的测试集上,VisKG-LM分别比GreaseLM提高了$1.2$、$0.8$和$4.3$分,同时匹配或超越了GraphVis,一个$7$B的视觉语言模型,而仅使用约$400$M在线参数。与接收相同关系标签路径的匹配纯文本控制相比,它在三个基准测试中分别获得了$4.2$、$6.5$和$5.1$分的增益。这些增益表明,完整的视觉记忆接口增加了超越路径文本化的价值,并支持编译视觉记忆作为在线图传播的替代方案。
查看缓存全文
缓存时间: 2026/09/18 08:51
# VisKG-LM:将知识图谱编译为视觉记忆以解决多选题问答
来源:https://arxiv.org/html/2609.19158
Yixin Peng1\\equalcontrib\\corresponding, Er Jin1\\equalcontrib, Shiwei Luo1\\equalcontrib, Diego Collarana2, Stefan Decker1,2
###### 摘要
知识图谱通常通过在在线推理路径中使用图神经网络对检索到的子图进行编码,并将其与语言模型融合,从而集成到问答系统中。因此,尽管知识图谱从未改变,但在训练轮次、随机种子和评估运行中,每次对问答对评分时,相同的子图都需要从头开始重新编码。我们探究是否可以将检索到的知识图谱一次性离线编译,然后作为只读内存进行访问。VisKG-LM通过将图编码与语言推理解耦,证明这是可行的。它将每个检索到的、特定于候选答案的子图序列化为关系标签路径,并将结果渲染为二维图像,其布局保留了路径的分支结构。每张图像仅离线编码一次,并缓存以供重用。在推理时,语言模型仅基于文本语境化问题和候选答案,仅在其最终层查询缓存的视觉内存,读取其全局布局和局部关系细节。因此,图信息仅在文本被理解后才被引入。在CommonsenseQA、OpenBookQA和MedQA-USMLE的测试集上,VisKG-LM分别比GreaseLM高出1.2、0.8和4.3分,同时仅使用约4亿在线参数就匹配或超越了77B的视觉语言模型GraphVis。与接收相同关系标签路径的匹配文本控制组相比,它在三个基准测试上分别获得了4.2、6.5和5.1分的绝对提升。这些提升表明,完整的视觉内存接口带来的价值超越了单纯的路径文本化,并支持编译视觉内存作为在线图传播的替代方案。
## 引言
预训练语言模型在其参数中编码了大量的事实知识,并在广泛的下游NLP任务中表现出强劲的性能(Robertset al.2020 (https://arxiv.org/html/2609.19158#bib.bib37); Petroniet al.2019 (https://arxiv.org/html/2609.19158#bib.bib38))。然而,知识密集型任务,如多选题问答,通常需要事实或领域特定知识,而这些知识无法仅通过参数记忆可靠地捕获。对于较小的语言模型,这种局限性尤为明显,因为它们在具有挑战性的多选题问答基准测试中通常表现出较低的准确性和不太一致的预测(Pinhanezet al.2026 (https://arxiv.org/html/2609.19158#bib.bib45))。例如,CommonsenseQA(Talmoret al.2019 (https://arxiv.org/html/2609.19158#bib.bib9))、OpenBookQA(Mihaylovet al.2018 (https://arxiv.org/html/2609.19158#bib.bib10))和MedQA-USMLE(Jinet al.2021 (https://arxiv.org/html/2609.19158#bib.bib11))分别需要常识关联、基础科学事实和临床知识。因此,最近的研究通过外部知识增强语言模型,从而显著提高了多选题问答的性能(Geet al.2026 (https://arxiv.org/html/2609.19158#bib.bib46); Liet al.2026 (https://arxiv.org/html/2609.19158#bib.bib47); Zou and Wang2026 (https://arxiv.org/html/2609.19158#bib.bib49))。其中大部分知识是关系型的,知识图谱提供了一种紧凑的表示方法,将实体建模为节点,关系建模为类型化的边,多跳事实建模为显式路径(Lewiset al.2020 (https://arxiv.org/html/2609.19158#bib.bib21); Jiet al.2021 (https://arxiv.org/html/2609.19158#bib.bib31); Hoganet al.2021 (https://arxiv.org/html/2609.19158#bib.bib32))。
表1:基线比较。✓\checkmark、△\triangle和×\times分别表示完全支持、部分支持和不支持。"拓扑结构":图拓扑保持;"无G/V":无在线图/视觉编码器;"缓存":可重复使用的已编码知识图谱;"后期融合":仅在文本语境化后融合图信息。
核心挑战在于如何向语言模型暴露知识图谱中的结构化信息,何时计算图表示,以及在哪个阶段将其与文本表示融合。现有的知识图谱增强多选题问答方法可以大致分为三种范式:纯文本语言模型方法、语言模型-图神经网络方法和大型视觉-语言模型方法。如表1(https://arxiv.org/html/2609.19158#Sx1.T1)所总结,这些范式在拓扑结构保持、在线图或视觉计算、表示重用性、融合阶段和模型规模方面做出了不同的权衡。纯文本语言模型方法将检索到的图序列化为文本序列,并使用纯文本语言模型进行处理(Jianget al.2023 (https://arxiv.org/html/2609.19158#bib.bib22); Sunet al.2023 (https://arxiv.org/html/2609.19158#bib.bib16); Edgeet al. (https://arxiv.org/html/2609.19158#bib.bib13))。然而,线性化模糊了原始图结构,使得路径顺序、共享前缀、分支模式和结构连接不再保持。语言模型-图神经网络方法(包括KagNet(Linet al.2019 (https://arxiv.org/html/2609.19158#bib.bib17))、MHGRN(Fenget al.2020 (https://arxiv.org/html/2609.19158#bib.bib3))、QA-GNN(Yasunagaet al.2021 (https://arxiv.org/html/2609.19158#bib.bib2))和GreaseLM(Zhanget al.2022 (https://arxiv.org/html/2609.19158#bib.bib1)))在保持适中模型参数规模的同时,保留了图拓扑结构。然而,图表示通常在文本-图交互的多个阶段中被涉及和融合,无法一次预计算并可靠地在不同训练轮次、随机种子或评估运行中重用。最后,大型视觉-语言模型方法(如GraphVis(Denget al.2024 (https://arxiv.org/html/2609.19158#bib.bib14)))将图渲染为图像以保留其拓扑结构,并将图信息扩展到视觉模态,允许语言模型通过多模态融合整合图信息。然而,这些方法需要训练一个70亿参数的视觉-语言模型,导致其训练和推理成本显著高于纯文本语言模型和语言模型-图神经网络方法。此外,由于视觉图表示是由可训练的视觉-语言编码器生成的,并在整个训练过程中不断演变,因此它们无法一次性离线编码并作为固定的视觉内存重用。
这些局限性促使我们提出一种同时保留显式图拓扑、维持适中参数规模并将图编码与语言推理解耦的方法。我们提出VisKG-LM,通过将检索到的知识图谱一次性离线编译为只读视觉内存来解决这些限制。VisKG-LM不是将子图线性化为文本序列,而是将每个特定于候选答案的子图转换为关系标签路径,并将其渲染为二维文档图像,其布局显式保留了实体名称、类型化关系、路径顺序和孤立节点。然后,该图像由文档编码器DeepEncoder V2(Weiet al.2026 (https://arxiv.org/html/2609.19158#bib.bib4))离线编码为缓存的视觉表示,因此视觉编码仅计算一次,并可在不同训练轮次、随机种子和评估运行中重用。在推理时,语言模型的下层仅处理文本形式的问题和答案候选,而图信息仅在顶层引入。具体而言,在顶层应用一个门控交叉注意力模块,允许模型从原始的纯文本表示开始,并逐渐学习融入多少图信息。最后,一个双视图读出模块在全局和局部层面总结缓存的视觉内存。我们的贡献如下:
- •我们提出了一种知识图谱增强的多选题问答架构,用离线编译的只读视觉内存取代在线的图神经网络消息传递,使得每个检索到的子图仅编码一次并可在后续阶段重用。
- •我们引入了严格的后期融合设计,其中语言模型下层在没有图访问权限的情况下语境化问题和候选答案,仅顶层通过单向门控交叉注意力查询缓存内存;然后一个双视图摘要器读取其全局布局和局部关系视图以进行评分。
- •在CSQA、OBQA和MedQA-USMLE上,VisKG-LM始终优于强大的语言模型-图神经网络基线,同时仅使用约4亿在线参数就匹配或超越了77B的视觉-语言模型GraphVis。与提供了完全相同路径的匹配文本控制组相比,VisKG-LM在三个基准测试上分别获得了4.2、6.5和5.1个百分点的绝对提升,证明其改进超越了单纯的路径文本化。
## 相关工作
### 知识图谱增强语言模型。
知识图谱增强的问答方法主要在结构化图信息进入语言模型的位置和方式上有所不同。以大语言模型为中心的方法将检索到的子图使用序列化的路径、三元组或文本摘要转换为文本,并使用纯文本语言模型进行处理(Jianget al.2023 (https://arxiv.org/html/2609.19158#bib.bib22); Sunet al.2023 (https://arxiv.org/html/2609.19158#bib.bib16); Edgeet al. (https://arxiv.org/html/2609.19158#bib.bib13); Luoet al.2024 (https://arxiv.org/html/2609.19158#bib.bib36); Heet al.2024 (https://arxiv.org/html/2609.19158#bib.bib15); Wanet al.2025 (https://arxiv.org/html/2609.19158#bib.bib27))。将图线性化会削弱其显式结构,路径顺序可能仍可从序列中恢复,但共享前缀、分支和跨路径连接不再被直接表示。此外,序列化的证据必须在每个查询时由语言模型重新处理。语言模型-图神经网络方法将文本和图编码器紧密耦合,通过联合处理其检索到的子图和文本上下文来为每个问题-候选对评分。MHGRN(Fenget al.2020 (https://arxiv.org/html/2609.19158#bib.bib3))在最多k跳的关系路径上执行多选题问答陈述条件消息传递。QA-GNN(Yasunagaet al.2021 (https://arxiv.org/html/2609.19158#bib.bib2))将语言模型编码的问题-答案上下文作为附加节点引入联合图中,并与检索到的子图节点一起更新。GreaseLM(Zhanget al.2022 (https://arxiv.org/html/2609.19158#bib.bib1))在语言模型块和图神经网络层之间进行交错,从而在多层之间实现双向信息交换。DRAGON(Yasunagaet al.2022 (https://arxiv.org/html/2609.19158#bib.bib34))进一步使用掩码语言建模和知识图谱链接预测对GreaseLM风格的双向文本-图模型进行预训练。JointLK(Sunet al.2022 (https://arxiv.org/html/2609.19158#bib.bib33))在语言标记和知识图谱节点之间应用密集的双向注意力,并递归地修剪图。QAT(Parket al.2023 (https://arxiv.org/html/2609.19158#bib.bib35))用以关系为中心的元路径标记取代了显式的图神经网络消息传递。这些方法保留了图结构并支持任务自适应推理,但在训练和推理中都将图编码器保留在循环中,因此其输出无法一次性编译并重用。
### 图信息的视觉方法。
将图扁平化为三元组的序列会使路径顺序、共享前缀、分支结构和局部分组难以恢复。GraphVis(Denget al.2024 (https://arxiv.org/html/2609.19158#bib.bib14))相反,将检索到的子图渲染为节点-链接图,并使用两阶段过程微调一个70亿参数的视觉-语言模型(LLaVA-v1.6-Mistral(Liet al.2024 (https://arxiv.org/html/2609.19158#bib.bib39)))。类似地,GITA(Weiet al.2024 (https://arxiv.org/html/2609.19158#bib.bib40))将视觉图渲染与文本图描述相结合用于通用图推理。VGCure(Zhuet al.2024 (https://arxiv.org/html/2609.19158#bib.bib41))也表明,图结构感知的自监督训练可以提高视觉-语言模型理解图图像中复杂关系和结构信息的能力。尽管这些方法展示了可视化图结构的价值,但它们通常需要计算成本高昂的视觉-语言模型训练或微调。BLIP-2(Liet al.2023 (https://arxiv.org/html/2609.19158#bib.bib24))提出了一种更节省参数的替代方案:它不联合更新大型视觉和语言骨干网络,而是保持两者冻结,并通过轻量级的查询转换器将它们连接起来。遵循这一原则,VisKG-LM使用RLP将每个特定于候选答案的子图渲染为路径有序的视觉文档,在保留图结构的同时避免了紧凑节点-链接图中常见的节点和边重叠。冻结的视觉编码器处理每个文档一次,生成的视觉标记被缓存以供重用。在顶层,在问题和候选答案被语境化之后,双视图内存摘要器提取全局布局和局部关系摘要以进行答案评分。
### 面向文档的视觉编码器。
Donut(Kimet al.2022 (https://arxiv.org/html/2609.19158#bib.bib29))和Nougat(Blecheret al.2023 (https://arxiv.org/html/2609.19158#bib.bib30))引入了一种无需OCR的文档理解范式,后续模型进一步强调两个特征:忠实保留文档结构和紧凑的视觉标记序列(Leeet al.2023 (https://arxiv.org/html/2609.19158#bib.bib42); Huet al.2024 (https://arxiv.org/html/2609.19158#bib.bib43), 2025 (https://arxiv.org/html/2609.19158#bib.bib44))。DeepSeek-OCR(Weiet al.2025 (https://arxiv.org/html/2609.19158#bib.bib5))将其更进一步,通过其DeepEncoder将高分辨率文档压缩成短标记序列。DeepSeek-OCR 2(Weiet al.2026 (https://arxiv.org/html/2609.19158#bib.bib4))保留了这种压缩的视觉分词器,但用语言模型风格的视觉编码器取代了基于CLIP的组件,让压缩的标记通过双向注意力交换信息,同时因果流查询重组文档信息。这两个特征——结构保真表示和紧凑的、可缓存的标记序列——非常适合我们的RLP渲染,其中关键信息由实体名称、类型化关系、路径顺序和分支符号承载。因此,我们使用DeepEncoder V2作为冻结的、离线的编码器,将每个渲染的子图转换为缓存的、只读的视觉内存。
## 方法
参见标题图1:VisKG-LM的架构。对于每个问题-候选对,检索到的子图被离线渲染和编码(橙色)。语言模型首先独立地对文本进行语境化,然后缓存的视觉标记被单向融合到顶层k层。在每个融合层中,视觉标记作为键和值用于门控交叉注意力,带有单独的零初始化的tanh\ tanh门控来控制注意力和前馈网络残差。最终的评分器将文本摘要与独立学习的全局和局部摘要连接起来以对答案选项进行排序。
### 问题设置与概述。
设D=\{\(ci,qi,Ai,yi\)\}\\mathcal\{D\}=\\\{\(c\_\{i\},q\_\{i\},\\mathcal\{A\}\_\{i\},y\_\{i\}\)\\\}为一个多选题问答数据集,其中cic\_\{i\}是可选上下文,qiq\_\{i\}是问题,Ai=\{ai,1,...,ai,Ci\}\\mathcal\{A\}\_\{i\}=\\\{a\_\{i,1\},\\ldots,a\_\{i,C\_\{i\}\}\\\}是候选集合,其中Ci=5C\_\{i\}=5(对于CSQA)和Ci=4C\_\{i\}=4(对于OBQA、MedQA),yi∈\{1,...,Ci\}y\_\{i\}\\in\\\{1,\\ldots,C\_\{i\}\\\}是真实答案索引。任务是选择正确的候选答案:模型为每个三元组\(ci,qi,ai,j\)\(c\_\{相似文章
VISPATH:面向多模态知识图谱问答的视觉意图引导路径推理
VisPath 引入了一种视觉意图引导的路径推理框架,用于多模态知识图谱问答,在新的基准 VisPath-Bench 和现有数据集上取得了显著改进,超越了基线方法。
KGCache:面向大语言模型知识图谱推理的摊销式子图检索
KGCache是一种用于一跳知识图谱邻域的内存缓存,可减少使用大语言模型的KGQA系统中冗余的子图检索。在WebQSP和CWQ上的评估显示,它可将知识图谱检索速度提升最多1.91倍,并表明语义缓存能进一步提高命中率。
RSF-GLLM: 通过递归软流与解耦LLM生成弥合多跳知识图谱问答中的语义鸿沟
本文介绍了RSF-GLLM,一个将可微图推理与LLM生成解耦的框架,以解决多跳知识图谱问答中的语义鸿沟问题,在实现竞争性性能的同时,具有卓越的推理效率。
超越视觉相似性:基于知识的视觉问答中的实体对齐检索
KBMR是一种基于MLLM的检索器,用于基于知识的视觉问答,它通过语义对齐来提高检索和VQA准确性,相比CLIP基线表现出显著提升。
KG-Guard: 基于图的幻觉检测方法用于知识库问答
KG-Guard是一个轻量级的基于图的框架,用于检测基于LLM的知识库问答中的幻觉。它将LLM视为黑盒,使用图编码器与MLP分类器来识别幻觉答案节点,在参数少得多的前提下优于基线方法。