先修复再增强:面向多跳问答的上下文增强知识图谱推理
摘要
本文提出了一种上下文增强的多跳问答训练框架,表明结合上下文图与知识图谱并使用强化学习可以提高生物医学领域的性能。
arXiv:2609.12230v1 公告类型:新
摘要:问答通常需要跨多个相连事实进行推理,而不是检索单个孤立关系。知识图谱(KGs)提供了一种结构化方式来表示此类事实,但仅在孤立的KG主-关系-三元组上训练大语言模型(LLMs)可能会限制它们学习多跳推理所需周围上下文的能力。在这项工作中,我们提出了一种上下文增强的多跳问答训练框架。虽然通常适用,但我们在疾病特定KG的背景下验证了该框架,这些KG使用可靠的KG提取框架GraphMERT提取,针对胃轻瘫和糖尿病。对于每个主要KG三元组,我们附加从同一源文本块中提取的支持三元组,以形成上下文图(CG)。这创建了两种监督设置:KG基础监督,仅使用目标KG三元组或路径;以及CG基础监督,使用目标KG三元组或路径以及支持上下文三元组。我们在两种设置下使用监督微调(SFT)训练Qwen3-14B模型,产生KGModel和CGModel变体。为了加强模型的低跳事实基础,我们引入了一个由LLM判断的、历史感知的自适应修复管道,该管道识别未解决的一跳失败,在目标修复样本上持续微调,并移除或隔离有问题的噪声三元组。这个修复阶段使模型在清理后的一跳验证集上达到100%准确率。最后,我们使用低跳问答项目进行强化学习(RL),并在更难的3跳、4跳和5跳任务上评估泛化能力。在两种疾病中,上下文增强的监督始终比仅KG监督提高了多跳性能。从修复的SFT检查点初始化的RL产生了更大且更稳定的收益。
查看缓存全文
缓存时间: 2026/09/14 08:29
# 上下文增强知识图谱推理用于多跳问答
来源:https://arxiv.org/html/2609.12230
Niraj K\. Jha
机构:普林斯顿大学电气与计算机工程系
###### 摘要
问答通常需要对多个相互关联的事实进行推理,而非检索单个孤立的关系。知识图谱(KG)提供了表示此类事实的结构化方式,但仅在孤立的KG三元组(头实体-关系-尾实体)上训练大语言模型(LLM),可能会限制其学习多跳推理所需周围上下文的能力。在这项工作中,我们提出了一种用于多跳问答的上下文增强训练框架。尽管该框架普遍适用,但我们使用一种称为GraphMERT的可靠KG提取框架提取的胃轻瘫和糖尿病的特异性疾病KG,在其背景下进行了验证。对于每个主要KG三元组,我们附加了从相同文本块提取的支持三元组,形成一个上下文图(CG)。这创造了两种监督设置:KG基础监督,仅使用目标KG三元组或路径;以及CG基础监督,使用目标KG三元组或路径及其支持的上下文三元组。我们在两种设置下使用监督微调(SFT)训练Qwen3-14B模型,产生了KGModel和CGModel变体。为了增强模型较低跳事实基础,我们引入了一个LLM评判、历史感知的自适应修复流程,该流程识别未解决的一跳失败,在目标修复样本上持续微调,并移除或隔离有问题的嘈杂三元组。这个修复阶段使模型在清理后保留的一跳验证集上达到了100%的准确性。最后,我们使用较低跳问答项目进行强化学习(RL)训练,并在更困难的3跳、4跳和5跳任务上评估泛化能力。在两种疾病中,上下文增强监督在多跳性能上始终优于仅KG监督。从修复后的SFT检查点初始化的RL,比从未修复检查点初始化的RL产生了更大且更稳定的收益。总体而言,最强结果来自经过上下文增强、修复和RL训练的模型,这表明可靠的多跳推理既受益于更丰富的上下文,也受益于修复后的较低跳知识基础。
## 1引言
大语言模型(LLM)在自然语言理解、指令遵循和问答方面取得了重大进展,但问答仍然是一个具有挑战性的场景,因为它需要有依据的和知识密集的推理[1 (https://arxiv.org/html/2609.12230#bib.bib1),2 (https://arxiv.org/html/2609.12230#bib.bib2),3 (https://arxiv.org/html/2609.12230#bib.bib3),4 (https://arxiv.org/html/2609.12230#bib.bib4),5 (https://arxiv.org/html/2609.12230#bib.bib5)]。在生物医学(以及许多其他)背景下,问题通常无法从单个孤立的事实中回答。相反,它们需要连接跨越多个证据片段的疾病、症状、机制、治疗、解剖部位和临床发现[6 (https://arxiv.org/html/2609.12230#bib.bib6),7 (https://arxiv.org/html/2609.12230#bib.bib7),8 (https://arxiv.org/html/2609.12230#bib.bib8)]。这使得多跳推理在正确答案可能依赖于将多个相关事实组合成连贯推理链的场景中尤为重要[6 (https://arxiv.org/html/2609.12230#bib.bib6),7 (https://arxiv.org/html/2609.12230#bib.bib7),9 (https://arxiv.org/html/2609.12230#bib.bib9),8 (https://arxiv.org/html/2609.12230#bib.bib8),10 (https://arxiv.org/html/2609.12230#bib.bib10)]。为了提高多跳推理的可靠性,知识图谱(KG)通过将知识组织成结构化和可解释的事实发挥了重要作用。KG将关系编码为形式为 (h, r, t) 的三元组,其中头实体 h 通过关系 r 连接到尾实体 t[11 (https://arxiv.org/html/2609.12230#bib.bib11)]。例如,糖尿病是胃轻瘫公认的潜在病因,而甲氧氯普胺被用作胃轻瘫的药物治疗;这些临床事实可以在生物医学KG中表示为 *diabetes mellitus*(糖尿病)、*cause\_of*(导致)和 *gastroparesis*(胃轻瘫)以及 *metoclopramide*(甲氧氯普胺)、*treats*(治疗)和 *gastroparesis*(胃轻瘫)[12 (https://arxiv.org/html/2609.12230#bib.bib12),13 (https://arxiv.org/html/2609.12230#bib.bib13)]。大型生物医学资源,如统一医学语言系统(UMLS)[14 (https://arxiv.org/html/2609.12230#bib.bib14)],跨多个词汇表组织生物医学概念和关系,使其成为结构化生物医学知识表示的广泛使用的基础。先前的基于KG的推理系统表明,结构化知识可以补充语言模型表示。例如,QA-GNN将问题和候选答案连接到相关的KG节点,并在联合语言-图表示上进行推理[15 (https://arxiv.org/html/2609.12230#bib.bib15)]。最近的工作也将KG用作监督的结构化来源,而不仅仅是检索资源。KG-SFT使用外部KG为监督微调(SFT)构建推理子图[16 (https://arxiv.org/html/2609.12230#bib.bib16)]。Dedhia等人从医学KG原语合成KG基础推理课程[17 (https://arxiv.org/html/2609.12230#bib.bib17)],Stephen等人从神经科学KG生成基于课程的问答(QA)项目[18 (https://arxiv.org/html/2609.12230#bib.bib18)]。BioKGQA通过从PrimeKG构建生物医学KG问答数据集进一步支持了这一研究方向,证明了结构化的生物医学KG可以作为生成QA基准和监督的基础[19 (https://arxiv.org/html/2609.12230#bib.bib19),20 (https://arxiv.org/html/2609.12230#bib.bib20)]。这些工作表明,可靠的KG可以作为特定领域语言模型训练的数据生成基质。尽管有上述优点,孤立的KG三元组可能不足以进行稳健的推理。单个三元组可能声明存在一个关系,但它通常省略了正确解释该关系所需的周围证据。例如,当与相关的机制、解剖部位、临床发现、风险因素或伴随疾病一起考虑时,疾病-症状关系可能更有意义。这在生物医学问答中尤其重要,因为回答问题通常不仅需要识别目标关系,还需要理解该关系如何适应局部临床背景。这一观察推动了上下文增强的KG监督。我们不是将每个三元组视为独立事实,而是询问当每个目标三元组与其源上下文中的支持证据一起呈现时,模型是否可以学习到更有用的表示。基于上下文图(CG)[21 (https://arxiv.org/html/2609.12230#bib.bib21)]的更广泛概念,我们通过附加从相同源文本块提取的支持三元组来增强每个主要三元组。生成的CG保留了传统KG的结构形式,同时在每个目标事实周围添加了局部证据。基于这一动机,我们使用GraphMERT(一个近期用于从非结构化生物医学文本中自动提炼可靠领域特定KG的框架)[22 (https://arxiv.org/html/2609.12230#bib.bib22)],为胃轻瘫和糖尿病构建了疾病特异性生物医学KG。然后,我们通过附加同块支持三元组到每个主要三元组来增强这些KG,为这两种疾病场景生成CG。从这些KG和CG中,我们生成了两种类型的QA项目。在KG基础设置中,每个项目仅从目标三元组或推理路径生成。在CG基础设置中,每个项目从目标三元组或路径及其支持的上下文三元组生成。这种设计使我们能够直接比较上下文增强的监督是否比标准KG基础监督提供更强的训练信号。然后,我们在三个训练阶段研究了这一比较。首先,我们使用KG基础或CG基础的QA项目对基础LLM进行微调,产生KGModel和CGModel变体。其次,我们引入了受技能目标自适应训练(STAT)[23 (https://arxiv.org/html/2609.12230#bib.bib23)]启发的LLM评判自适应修复阶段。该阶段检查初始SFT模型是否仍然包含未解决的一跳缺失知识,并在使用强化学习(RL)之前应用有针对性的自适应修复。最后,我们研究了从修复后的SFT检查点初始化RL是否比从未修复的SFT检查点初始化更有效。最后一个阶段受到近期关于SFT和RL互补作用研究的启发。先前的研究认为“SFT记忆,RL泛化”,这表明SFT学习任务格式和模仿模式,而RL更好地鼓励泛化行为[24 (https://arxiv.org/html/2609.12230#bib.bib24)]。在KG基础推理中,先前的工作也表明KG路径可以为组合推理提供有用的奖励信号[25 (https://arxiv.org/html/2609.12230#bib.bib25),18 (https://arxiv.org/html/2609.12230#bib.bib18)]。受这些发现的驱动,我们使用较低跳RL来优化答案正确性和KG路径对齐,然后评估这是否能提高对更难的3跳、4跳和5跳问答的泛化能力。本文的主要贡献如下:
- • 我们提出了一种上下文增强的KG监督框架,该框架将相同源文本块中的支持三元组附加到每个主要KG三元组,在标准KG基础监督之外产生CG基础监督。
- • 我们构建了胃轻瘫和糖尿病疾病特异性KG/CG数据集,并生成了跨越1跳到5跳推理的结构化多项选择QA项目,这些项目完全基于可验证的KG/CG路径。
- • 我们引入了一个LLM评判、历史感知的自适应修复流程,通过持续的有针对性的修复改善一跳SFT基础,同时移除或隔离有问题的嘈杂三元组,最终在采用RL之前在清理后的保留验证集上达到完美的准确率。
- • 我们比较了从未修复的SFT检查点初始化的RL与从修复后的SFT检查点初始化的RL,直接测试更清洁的一跳事实基础是否能改善高跳泛化。
- • 在两种疾病场景中,我们表明上下文增强的SFT改善了多跳性能,自适应修复加强了一跳基础,而从修复检查点进行的RL产生了最强的3跳、4跳和5跳结果。我们进一步评估了答案选项打乱下的鲁棒性,以测试增益是否对多项选择选项顺序敏感。本文其余部分的组织如下。第2节 (https://arxiv.org/html/2609.12230#S2)回顾了理解所提框架所需的背景和相关工作。第3节 (https://arxiv.org/html/2609.12230#S3)介绍了方法论,包括整体流程、数据集构建、训练过程、自适应修复、RL设置和评估方案。第4节 (https://arxiv.org/html/2609.12230#S4)报告了实验结果。第5节 (https://arxiv.org/html/2609.12230#S5)讨论了主要发现。第6节 (https://arxiv.org/html/2609.12230#S6)描述了所提方法的局限性并概述了未来工作。最后,第7节 (https://arxiv.org/html/2609.12230#S7)对文章进行了总结。
## 2背景和相关工作
本节回顾了理解所提框架所需的背景和相关工作。2.1节 (https://arxiv.org/html/2609.12230#S2.SS1)介绍了生物医学KG及其在问答中的作用。2.2节 (https://arxiv.org/html/2609.12230#S2.SS2)讨论了孤立三元组的局限性,并推动了上下文增强的KG监督。2.3节 (https://arxiv.org/html/2609.12230#S2.SS3)回顾了如何使用KG生成QA监督。2.4节 (https://arxiv.org/html/2609.12230#S2.SS4)讨论了用于知识基础QA项目的SFT。2.5节 (https://arxiv.org/html/2609.12230#S2.SS5)介绍了在采用SFT后修复缺失的生物医学知识。最后,2.6节 (https://arxiv.org/html/2609.12230#S2.SS6)回顾了用于多跳推理的RL。
### 2\.1用于问答的知识图谱
KG将知识表示为概念之间的结构化关系。KG可以表示为一组三元组:G={(hi,ri,ti)}i=1N,其中hi表示头实体,ri表示关系,ti表示尾实体,N是图中三元组的总数。这种表示法将跨各种文档表达的信息转换为可以被搜索、连接和计算分析的明确事实。图1 (https://arxiv.org/html/2609.12230#S2.F1)显示了一个胃轻瘫KG的小子图。
在需要可解释性和可追溯性的高风险领域,明确的KG基础的价值尤其明显。例如,在生物医学问答中,模型产生正确答案通常是不够的;答案还应该基于可靠的证据[26 (https://arxiv.org/html/2609.12230#bib.bib26),27 (https://arxiv.org/html/2609.12230#bib.bib27),15 (https://arxiv.org/html/2609.12230#bib.bib15),28 (https://arxiv.org/html/2609.12230#bib.bib28)]。结构化三元组通过暴露推理过程中使用的中间事实有助于满足这一要求。
请参阅说明文字 图1:胃轻瘫KG的一个子图。节点代表临床概念,有向边代表关系。
先前的工作已通过检索相关实体、路径或子图并将其与语言模型表示相结合来支持KG问答。图-语言推理方法将问题和候选答案连接到相关的KG节点,构建联合表示,并在语言上下文和KG结构上进行推理[15 (https://arxiv.org/html/2609.12230#bib.bib15),29 (https://arxiv.org/html/2609.12230#bib.bib29),30 (https://arxiv.org/html/2609.12230#bib.bib30)]。基于蒙特卡洛树搜索(MCTS)的方法使用KG作为预训练LLM代理的外部结构化支持,通过引导基于图的探索、在受限KG路径上搜索以及使用LLM评估或组合候选推理路径后再生成答案[31 (https://arxiv.org/html/2609.12230#bib.bib31),32 (https://arxiv.org/html/2609.12230#bib.bib32),33 (https://arxiv.org/html/2609.12230#bib.bib33)]。Think-on-Graph更进一步将LLM视为探索KG实体和关系、检索有前景的推理路径并使用这些路径支持答案生成的代理,无需额外的模型训练[34 (https://arxiv.org/html/2609.12230#bib.bib34)]。这些方法表明,结构化知识可以通过在推理期间提供明确的关系证据来补充预训练语言模型。除了推理时检索,KG也可以作为训练和评估数据的结构化来源。最近的工作使用可靠的KG来生成推理子图、解释、KG基础课程、思维……相似文章
SABET-QA:时序知识图谱问答
SABET-QA 提出了一个用于时序知识图谱问答的迭代框架,通过双向实体-时序评分和上下文化增强了多跳推理,并在 CronQuestions 和 TimeQuestions 等基准测试中显示出相对于基线的一致改进。
HyperProve: 用于多跳问答的答案引导超图扩展
HyperProve 提出了一种利用答案引导超图扩展的检索增强型问答框架,用于处理多跳问题,并在基准测试中取得了优于基线模型的性能。
多跳知识图谱问答的本体引导证据路径推理
提出 OPI,一种面向多跳知识图谱问答的本体引导框架,利用以关系为中心的本体图进行双向检索和迭代精炼,在多个基准上取得了最先进的结果。
用于免训练多跳问答的图与文本记忆协同进化
提出Co-E,一种免训练系统,同步图记忆与文本记忆用于多跳问答,在六个基准上优于可比的免训练基线。
RSF-GLLM: 通过递归软流与解耦LLM生成弥合多跳知识图谱问答中的语义鸿沟
本文介绍了RSF-GLLM,一个将可微图推理与LLM生成解耦的框架,以解决多跳知识图谱问答中的语义鸿沟问题,在实现竞争性性能的同时,具有卓越的推理效率。