AgentKGV:基于两阶段训练的知识图谱事实验证智能LLM-RAG框架
摘要
提出了AgentKGV,一种基于两阶段训练(蒸馏SFT和轨迹级GRPO)的智能LLM-RAG框架,用于验证知识图谱中的事实,在T-REx基准上取得了显著改进,同时减少了检索调用。
arXiv:2607.09092v1 公告类型:新
摘要:知识图谱(KGs)通常从大规模语料库中自动构建,但由于噪声来源和提取失败,它们不可避免地包含事实错误,在工业规模下可靠地验证它们仍然是一个关键挑战。为了解决这个问题,我们提出了AgentKGV,即用于知识图谱事实验证的智能LLM-RAG框架,它集成了动态路由和迭代查询重写,能够处理文档级检索中的表面形式不匹配。为了使该框架在工业部署中更准确且成本更低,我们进一步引入了一种两阶段训练策略:基于回合级蒸馏的SFT,将推理能力从大型教师模型迁移到小型模型,以实现稳定的查询重写和推理;以及轨迹级GRPO,优化搜索策略以减少大规模不必要的检索。在开放域T-REx基准的长尾谓词分割上,我们的框架相比单轮RAG将宏F1提高了5.5个百分点,两阶段训练进一步提高了9.4个百分点。GRPO还将平均搜索调用次数从3.24次减少到1.63次,且不降低准确性。
查看缓存全文
缓存时间: 2026/07/13 07:57
# AgentKGV: 面向知识图谱事实验证的双阶段训练智能体LLM-RAG框架 来源:https://arxiv.org/html/2607.09092 Yumin Heo¹, Hyeon-gu Lee², Sumin Seo², Youngjoong Ko¹ ¹成均馆大学, ²NAVER [email protected], [email protected] {hyeongu.lee, sumin.seo}@navercorp.com ###### 摘要 知识图谱(Knowledge Graphs, KGs)通常从大规模语料库中自动构建,但由于噪声源和抽取失败,它们不可避免地包含事实错误,而在工业规模下可靠地验证这些错误仍是一个关键挑战。为了解决这一问题,我们提出了AgentKGV,一种用于知识图谱事实验证的智能体LLM-RAG框架,它集成了动态路由和迭代查询重写,能够处理文档级检索中的表面形式不匹配问题。为了使该框架在工业部署中更准确且成本更低,我们进一步引入了一种双阶段训练策略:基于回合级蒸馏的SFT(Supervised Fine-Tuning),将大型教师模型的推理能力迁移到小型模型中,以实现稳定的查询重写和推理;以及轨迹级GRPO(Group Relative Policy Optimization),通过优化搜索策略来减少不必要的检索。在开放域T-REx基准的长尾谓词子集上,我们的框架相比单轮RAG将宏F1值提升了5.5个百分点,而双阶段训练进一步提升了9.4个百分点。GRPO还将平均搜索调用次数从3.24降至1.63,同时不降低准确率。 ## 1 引言 知识图谱将实体及其关系编码为三元组(subject, predicate, object),并作为搜索引擎、推荐系统、问答和决策支持等广泛的知识密集型应用的核心组件。在工业环境中,从大量文档中自动构建知识图谱的需求显著增长。然而,由于模糊的句子结构、低可靠性的来源以及NLP模型中的错误,自动构建的知识图谱不可避免地包含错误信息。因此,抽取三元组的事实有效性成为工业知识图谱下游可靠性的关键瓶颈。 研究者们传统上依赖孤立的方法来评估自动构建三元组的有效性。基于图的方法(Bordes et al., 2013)通过结构一致性评估有效性,但往往无法检测真实世界的事实错误,因为它们仅依赖内部图拓扑。基于LLM的方法(Pan et al., 2024)提供了更广泛的语义推理,但仍然易受领域特定幻觉的影响。基于RAG的方法(Lewis et al., 2020; Trivedi et al., 2023)利用外部文档检索进行判断,但当系统无法检索到相关信息时就会失败。另一个困难在于压缩三元组与自然语言文档之间的结构模态差距,因为文档中的事实信息很少以与知识图谱三元组相同的标准化形式出现,这使得单轮检索不可靠。 为了克服这些限制,最近的研究采用了智能体LLM框架(Yao et al., 2023; Schick et al., 2023),其中自主智能体动态地编排推理和检索。在这一范式下,我们提出了AgentKGV,其中智能体首先通过动态路由决定是通过内部参数化知识验证三元组,还是通过外部检索进行验证。当需要外部检索时,智能体随后将输入三元组迭代重写为与文档级检索兼容的自然语言查询。由于这种迭代重写将压缩的三元组转化为多样的自然语言表达,它将验证建立在检索到的证据之上。 然而,在工业知识图谱中可靠且高效地部署此框架需要解决两个实际挑战。首先,查询重写可能变得不稳定,因为模型可能缺乏针对领域特定谓词的稳定语义锚点,而工业知识图谱包含大量在通用预训练语料库中很少观察到的长尾谓词。其次,迭代搜索策略可能效率低下,因为模型可能不知道何时停止搜索,这种低效在工业规模下尤其代价高昂,因为即使每个三元组的搜索迭代次数小幅增加也会导致大量计算开销。 为了使该框架在工业部署中更准确且成本更低,我们引入了一种双阶段训练策略。第一阶段应用基于蒸馏的SFT,其中大型教师模型生成完整的验证轨迹。从每个成功轨迹中,我们提取最终判断及其紧邻的前一查询,并在此之上训练小型模型。查询重写部分教模型如何将三元组重写为有效查询,而判断部分教模型如何基于检索到的证据进行推理并得出结论。通过这种蒸馏,小型模型学习了教师模型的查询重写和推理能力,并获得了针对领域特定谓词的三元组基础查询重写和路由的稳定语义基础。第二阶段应用轨迹级GRPO,其中模型通过完整轨迹展开和轨迹级奖励进行训练。我们还施加了每轮搜索惩罚,以阻止模型发出不必要的搜索调用。通过这种设计,模型学会了何时停止搜索,以及如何在证据不足时得出结论。本工作的贡献总结如下: - 我们提出了**AgentKGV**,用于知识图谱事实验证的智能体LLM-RAG框架,它集成了动态路由和迭代查询重写,通过多轮检索基于文档级证据验证三元组。 - 我们引入了一种**双阶段训练策略**,结合了基于回合级蒸馏的SFT和轨迹级GRPO,使框架在工业部署中更准确且成本更低。 - 我们在开放域英文基准上验证了AgentKGV,确认了其在训练期间很少见到的**长尾谓词**上的有效性,并进一步在**真实世界的韩语企业知识图谱**上验证了其适用性。 参见图注 图1:提出的智能体LLM-RAG框架概览。智能体在内部验证和外部检索之间动态路由,并迭代地将三元组重写为检索兼容的查询,直到产生最终判断。 ## 2 相关工作 ### 2.1 知识图谱事实验证 验证知识图谱三元组有效性的方法分为三类。**基于图的方法**通过内部图结构评估有效性,要么通过学习嵌入对三元组打分(Bordes et al., 2013; Yang et al., 2015),要么通过基于路径和推理的图推理(Lao et al., 2011; Das et al., 2018)。它们捕捉结构规律,但仅依赖图拓扑,因此无法检测图中没有任何支持的构建时事实错误。**基于LLM的方法**(Pan et al., 2024)利用大型语言模型的参数化知识,提供更广泛的语义覆盖,但在预训练期间很少见到的领域特定谓词上仍易受幻觉影响。**基于RAG的方法**将判断建立在检索到的文档之上(Lewis et al., 2020; Popat et al., 2018; Chen et al., 2022; Pan et al., 2023),最近的工作将其扩展为迭代式(Trivedi et al., 2023; Asai et al., 2024)和自适应式(Mallen et al., 2023; Shi et al., 2024)检索。这些方法减少了幻觉,但专为自然语言问答设计,忽略了知识图谱验证特有的挑战:目标是压缩的(s,p,o)三元组而非问题,对其的单次检索通常不可靠,因为文档用不同的措辞表达相同的事实。 **智能体LLM框架**更进一步。模型作为一个自主智能体,将推理与工具或检索调用交错进行(Yao et al., 2023; Schick et al., 2023),最近的工作通过强化学习训练智能体,使其学会何时以及如何搜索(Jin et al., 2025; Song et al., 2025)。这些框架在多跳问答中有效,但并非为知识图谱三元组验证设计,也不解决(s,p,o)到文档的模态差距。我们的框架采用智能体范式进行知识图谱事实验证,并通过动态路由和基于(s,p,o)的迭代查询重写解决了这一差距。 ## 3 方法论 ### 3.1 问题定义 我们将知识图谱事实验证形式化为一个二元分类任务。给定三元组 τ = (s, p, o),目标是为其分配一个标签 y ∈ {true, false},指示该三元组是否事实正确。验证在文档语料库 D = {d₁, d₂, ..., dₙ} 上进行,其中每个文档可能包含与三元组相关的证据。 ### 3.2 智能体LLM-RAG框架 #### 3.2.1 整体架构 提出的框架作为一个多轮智能体运行,与检索系统交互。图1展示了框架的概览。给定三元组 τ,智能体首先执行动态路由,决定是直接通过其内部知识验证三元组,还是启动迭代检索。当启动检索时,智能体选择一个组件组合作为指导并编写初始查询,然后进入多轮循环。 在每一轮 t,智能体观察一个上下文 cₜ,包含三元组、先前轮次的运行摘要、最近的查询及其检索结果: cₜ = [τ, S_{<t}, qₜ₋₁, Rₜ₋₁] (1) 其中 S_{<t} 是早期轮次的运行摘要,qₜ₋₁ 和 Rₜ₋₁ 是最近的查询及其检索到的文档。基于此上下文,智能体决定累积的证据是否足以产生最终判断,还是应该重写查询并继续搜索。循环持续直到智能体产生最终判断,或达到最大轮次 T。在这些轮次中,一个独立的摘要模块压缩检索历史,使上下文保持紧凑。 #### 3.2.2 动态路由 路由决策通过对三元组进行显式的思维链推理来做出。当三元组可以通过内部参数化知识信验证时,智能体无需检索即可产生判断。否则,智能体启动迭代检索。这种自适应路由避免了不必要的检索并降低了成本。 #### 3.2.3 基于(s,p,o)的初始查询编写 当需要检索时,智能体将压缩的三元组转换为与文档级检索兼容的自然语言查询。与操作于自然语言查询的通用查询重写不同,智能体可以利用三元组的显式 (s,p,o) 结构。实际上,仅使用单一定查询的文档级检索可能不可靠;过于宽泛的查询会返回提及实体但不包含该事实的文档,而过于具体的查询可能在语料库以不同措辞表达相同事实时匹配不到任何文档。在我们的方法中,一组组件组合(附录A中的表3)作为可选选项呈现给智能体,每一轮选择一个组合以设置查询的特定性和表面形式。这使智能体能够调整检索粒度并覆盖谓词的词汇变体。 #### 3.2.4 迭代查询重写 智能体多次精炼查询直到找到证据。从第二轮开始,智能体不再独立编写每个查询。相反,系统根据先前的查询及其结果精炼后续查询,使其能够更准确地找到相关证据。当先前结果仅部分相关时,智能体将查询重写为更合适的组件组合或表面形式。另一方面,当先前查询检索不到有用文档时,智能体改变表述形式而不是重复相同的搜索。检索结果与后续查询之间的这种反馈使智能体能够更有效地搜索支持或反驳三元组的证据。迭代持续到智能体检索到用于最终判断的充分证据,或达到最大轮次。 #### 3.2.5 检索摘要模块 检索摘要模块维护跨轮次的运行摘要 S_{<t}。在每一轮,它将先前的摘要与最近的查询和检索结果结合起来: S_{<t+1} = Summarizer(S_{<t}, qₜ, Rₜ) (2) 这样,当前轮的完整结果被压缩到下一轮的摘要中,使得智能体始终看到早期轮次的压缩历史以及仅当前轮的完整结果。这种设计提供了两个好处。首先,它限制了上下文长度,因为除最近一轮外的所有轮次都以压缩形式存储,而非完整文档。其次,摘要使搜索历史显式化,因此智能体可以避免冗余查询,转而针对仍然缺失的证据。因此,该模块在保持上下文紧凑的同时,支持跨轮次更有效的查询重写。 参见图注 图2:双阶段训练策略概览。**阶段1(基于蒸馏的SFT)**从正确的教师轨迹中提取最后一轮,形成两个状态-动作对,分别监督查询重写和基于证据的推理。**阶段2(GRPO)**使用轨迹级奖励优化搜索策略,该奖励结合了最终正确性和每轮搜索惩罚,在减少冗余检索的同时保持准确性。 ### 3.3 双阶段
相似文章
DeLIVeR: 基于强化知识图谱探索的分解式信息真实性识别
DeLIVeR 是一个框架,它使用强化规划器大语言模型将主张分解为问题集,用于结构化知识图谱遍历,在基准数据集上比静态RAG基线提高了10-15%的事实核查准确率。
RAGA:用于自主知识图谱构建和检索增强生成的阅读与图谱构建智能体
RAGA 是一个由大语言模型驱动的自主智能体,通过“阅读-搜索-验证-构建”的认知循环构建知识图谱,并集成混合符号-向量检索以实现检索增强生成,在科学问答数据集上取得了实验性改进。
AgenticRAG:面向企业知识库的代理检索
本文介绍了 AgenticRAG,这是一个来自微软的框架,通过为大型语言模型(LLM)配备迭代搜索、文档导航和分析工具,增强了企业知识库的检索能力。它在多个基准测试中展示了相比标准 RAG 流水线在召回率和事实准确性方面的显著提升。
RSF-GLLM: 通过递归软流与解耦LLM生成弥合多跳知识图谱问答中的语义鸿沟
本文介绍了RSF-GLLM,一个将可微图推理与LLM生成解耦的框架,以解决多跳知识图谱问答中的语义鸿沟问题,在实现竞争性性能的同时,具有卓越的推理效率。
增强元认知AI:基于图论的大语言模型富集的知识图谱填充
MetaKGEnrich是一个全自动流水线,使用图指标检测大语言模型应用中的知识缺口,检索网络证据,并在三个基准数据集上将答案质量提升80%-87%。