DeLIVeR: 基于强化知识图谱探索的分解式信息真实性识别
摘要
DeLIVeR 是一个框架,它使用强化规划器大语言模型将主张分解为问题集,用于结构化知识图谱遍历,在基准数据集上比静态RAG基线提高了10-15%的事实核查准确率。
arXiv:2607.17935v1 Announce Type: new
摘要:由于传统检索系统中的“查询脆弱性”,自动化事实核查对大型语言模型 (LLMs) 仍然是一个挑战。我们提出 DeLIVeR(信息驱动真实性识别的分解式学习),这是一个将证据检索视为强化策略探索任务的框架。DeLIVeR 利用规划器大语言模型将复杂主张分解为目标问题集,用于遍历结构化知识图谱 (KGs) 以获取高精度证据。我们使用群体相对策略优化 (GRPO) 优化规划器的策略,奖励系统优先考虑结构多样性和判决准确性。我们在 LIAR、FEVER 和 PolitiFact 上的评估表明,DeLIVeR 显著优于最先进的基线。使用 Qwen2.5-7B,我们的框架分别达到了83.73、84.57和79.70的峰值F1分数,比 HippoRAG2 提高了10-15%。通过转向强化问题规划策略,DeLIVeR 有效弥合了多跳推理差距,并为可验证的虚假信息检测提供了可审计、透明的路径。
查看缓存全文
缓存时间: 2026/07/21 06:46
# DeLIVeR: 通过强化知识图谱探索的信息基础真实性识别的分解学习 来源: https://arxiv.org/html/2607.17935 11institutetext:路易斯维尔大学,美国肯塔基州路易斯维尔 40292\. 11email:\{conghoan\.nguyen,hieu\.duong,l\.nguyen\}@louisville\.edu 22institutetext:丹尼森大学,美国俄亥俄州格兰维尔 43023\. 22email:\{hoang\_t2\}@denison\.edu
###### 摘要
自动事实核查对于大型语言模型(LLM)来说仍然是一个挑战,原因在于传统检索系统中的“查询脆弱性”。我们提出了 DeLIVeR(Decomposed Learning for Information-grounded Veracity Recognition,即基于分解学习的信息基础真实性识别),这是一个将证据检索视为强化策略探索任务的框架。DeLIVeR 利用一个规划器 LLM 将复杂声明分解为有针对性的问题集合,进而遍历结构化的知识图谱(KG)以获取高精度证据。我们使用组相对策略优化(GRPO)来优化规划器的策略,其奖励系统优先考虑结构多样性和判决准确性。我们在 LIAR、FEVER 和 PolitiFact 上的评估表明,DeLIVeR 显著优于最先进的基线。使用 Qwen2.5-7B,我们的框架分别在三个数据集上达到了 83.73、84.57 和 79.70 的峰值 F1 分数,比 HippoRAG2 提升了 10–15%。通过转向强化的问题规划策略,DeLIVeR 有效地弥合了多跳推理差距,并为可验证的虚假信息检测提供了一条可审计、透明的路径。
## 1 引言
在线虚假信息的泛滥对公众信任和民主稳定构成了严重威胁。尽管大型语言模型(LLM)提供了复杂的推理能力,但它们经常因依赖于静态的内部知识而非可验证的基准而受到“幻觉”的削弱[1 (https://arxiv.org/html/2607.17935#bib.bib1),3 (https://arxiv.org/html/2607.17935#bib.bib3)]。虽然检索增强生成(RAG)旨在缓解这一问题,但现有框架在多跳间隙、静态查询限制以及固定检索策略方面存在困难,这些策略无法适应涉及多个实体的复杂声明[38 (https://arxiv.org/html/2607.17935#bib.bib38),4 (https://arxiv.org/html/2607.17935#bib.bib4),5 (https://arxiv.org/html/2607.17935#bib.bib5)]。
参见标题
图 1:针对蒙娜丽莎失窃声明的假新闻检测系统对比。
为了解决这些局限性,我们提出了 DeLIVeR,这是一个将事实核查从静态的检索步骤转变为强化、闭环优化过程的框架,如图1 (https://arxiv.org/html/2607.17935#S1.F1) 所示。与主要关注特征级转换的领域自适应方法不同,DeLIVeR 优化了模型的信息寻求策略。给定一个声明,规划器 LLM 会生成一组多样化的、有针对性的问题,这些共同查询知识图谱(KG)以检索互补的证据。该策略通过组相对策略优化(GRPO)进行优化,以奖励结构多样性和判决准确性。在开发该框架时,我们专门研究了:强化规划器 LLM 能否比静态 RAG 基线更有效地弥合多跳推理差距(RQ1);基于集合的问题规划在多大程度上减少了结构化 KG 中的查询模糊性(RQ2);以及 GRPO 驱动的优化是否为真实性分类提供了更稳定和可解释的信息寻求策略(RQ3)。
我们的贡献如下:
- •**结构化多跳基础**:我们引入了一个基于 KG 的证据检索流水线,通过检索结构化的多跳证据路径来进行声明验证,超越了扁平的文本检索。
- •**基于集合的问题规划**:我们设计了一个规划器 LLM,将每个声明分解为一组连贯的、多样化的、有针对性的问题,减少了查询模糊性,并提高了标准单查询 RAG 的证据覆盖率。
- •**GRPO 驱动的策略优化**:我们使用 GRPO 对问题生成模块进行微调,奖励机制鼓励有效格式、结构多样性和证据质量,从而产生更稳定的信息寻求策略。
- •**实证验证与可解释性**:在 FEVER、LIAR 和 PolitiFact 上的实验显示,与强大的 RAG 基线相比有持续改进,而问题驱动的检索过程提供了固有的证据链,便于审计模型决策。
## 2 相关工作
早期用于知识密集型任务的人工智能系统严重依赖于神经架构,例如人工神经网络(ANN)和基于能量的模型,特别是离散 Hopfield 神经网络(DHNN),它们展示了结构化推理和模式识别的基本原理。这些早期方法在逻辑挖掘和约束满足方面建立了关键见解,这些见解至今仍在影响现代 AI 系统。值得注意的贡献包括:将集成多属性选择与 DHNN 相结合的灵活逻辑挖掘框架[72 (https://arxiv.org/html/2607.17935#bib.bib72)];在离散 Hopfield 网络中对加权 C 型随机 2-可满足性公式的研究[73 (https://arxiv.org/html/2607.17935#bib.bib73)];以及利用高阶可满足性表示来优化逻辑挖掘的方法[74 (https://arxiv.org/html/2607.17935#bib.bib74)]。尽管这些早期的神经和基于逻辑的范式表明,结构化的、受规则支配的表示能显著提高分类的可靠性和可解释性,但它们通常操作于固定的命题表示,并未解决现代事实核查在大型动态知识语料库上进行开放域、多跳证据检索的需要。
假新闻检测已从基于特征的模型[33 (https://arxiv.org/html/2607.17935#bib.bib33),34 (https://arxiv.org/html/2607.17935#bib.bib34)]发展到预训练的深度编码器,如 BERT 和 RoBERTa[16 (https://arxiv.org/html/2607.17935#bib.bib16),17 (https://arxiv.org/html/2607.17935#bib.bib17)],这些模型在包括 LIAR[35 (https://arxiv.org/html/2607.17935#bib.bib35)] 和 FEVER[36 (https://arxiv.org/html/2607.17935#bib.bib36)] 在内的基准上表现良好。然而,由于幻觉和缺乏可验证的证据归因,LLM 在真实性预测方面如果没有明确的依据仍不可靠[18 (https://arxiv.org/html/2607.17935#bib.bib18)]。检索增强生成(RAG)通过将预测条件置于外部上下文来解决这个问题[38 (https://arxiv.org/html/2607.17935#bib.bib38)],但标准 RAG 通常使用基于相似性的查询检索非结构化文本,并且常常无法捕捉到涉及多个实体和关联事件的声明所需的关系结构[15 (https://arxiv.org/html/2607.17935#bib.bib15),7 (https://arxiv.org/html/2607.17935#bib.bib7)]。最近的基于图的检索方法改进了索引和排序,但它们通常将用户查询视为固定的。相比之下,DeLIVeR 强调结构化的 KG 证据,同时通过学得的问题集合来优化信息寻求策略。
第二个挑战是查询模糊性。许多 RAG 系统依赖于直接从声明中推导出的单个查询,这使得当声明定义不明确或隐含表述时,检索变得脆弱。先前关于声明分解的研究表明,生成中间问题可以改善推理[8 (https://arxiv.org/html/2607.17935#bib.bib8),9 (https://arxiv.org/html/2607.17935#bib.bib9)],并且诸如 T5/BART 之类的问题生成模型已被用于生成子问题[10 (https://arxiv.org/html/2607.17935#bib.bib10)]。然而,这些方法通常不是为了优化验证所需的检索结果而训练的,特别是当证据必须从互补的语义方面(例如,时间上下文、关系、矛盾)收集时。我们的方法引入了一个规划器 LLM,它可以生成一个小的、多样化的问题集合,从多个角度探查 KG,提高了证据覆盖率,并减少了下游验证的模糊性[11 (https://arxiv.org/html/2607.17935#bib.bib11)]。
最后,为黑盒 LLM 流水线优化检索行为是困难的,因为梯度无法通过验证器传播。现有方法使用诸如基于 KLD 的技术[12 (https://arxiv.org/html/2607.17935#bib.bib12)]或策略梯度式优化[49 (https://arxiv.org/html/2607.17935#bib.bib49)]等目标来使检索与 LLM 反馈对齐,但 PPO 式方法在高维生成空间中可能不稳定[50 (https://arxiv.org/html/2607.17935#bib.bib50)]。我们通过应用组相对策略优化(GRPO)[66 (https://arxiv.org/html/2607.17935#bib.bib66)]来优化问题集合生成,从而解决这个问题。GRPO 通过比较同一声明的多个输出来估计优势,无需集中式的评判器即可实现稳定更新。这提供了一种实用的机制来学习一个稳健的问题生成策略,通过奖励高信号证据同时阻止嘈杂检索,从而提高检索精度并支持准确的真实性决策。
## 3 方法
### 3.1 概述
所提出的 DeLIVeR 框架如图2 (https://arxiv.org/html/2607.17935#S3.F2) 所示,由知识图谱 (KG)、双足迹 LLM 架构和强化学习组成,以应对与假新闻检测相关的挑战,通过精确的证据检索和基于知识的判决生成。系统从基于可靠数据集的 KG 开始,节点代表实体或事实,边指示关系(例如,“支持”、“反驳”等),从而允许结构化和上下文相关的证据查询[43 (https://arxiv.org/html/2607.17935#bib.bib43)]。经过问题生成微调的辅助 LLM 处理输入声明,生成一组连贯的、有针对性的问题,这些共同查询 KG 以检索全面的证据[47 (https://arxiv.org/html/2607.17935#bib.bib47)]。来自问题集合的聚合证据连同声明一起被输入到一个冻结的主 LLM 中,以生成判决(真、假、信息不足)并带有可解释的解释,确保稳定性和可解释性[38 (https://arxiv.org/html/2607.17935#bib.bib38)]。组相对策略优化(GRPO)通过评估检索证据的质量(例如格式、结构、准确性)来迭代地改进问题生成 LLM,通过强化反馈优化检索有效性[49 (https://arxiv.org/html/2607.17935#bib.bib49)]。
参见标题
图 2:整体 DeLIVeR 架构通过四个关键阶段运行:生成问题序列、查询知识图谱、提取支持信息集以及使用 GRPO 更新生成模型。
该框架整合了先前提出的其他想法,形成了一种综合结构化知识、自适应查询和强化反馈的方法,为检测假新闻提供了稳健且可解释的手段。
### 3.2 问题形式化
DeLIVeR 中的真实性检测任务由以下条件概率分布控制,该分布将判决 \( y \) 分解为规划和检索步骤序列:
\[ P(y|c) \approx \max_{\mathcal{Q}} \left[ P(y|c, \text{Retrieve}(\mathcal{Q}, \mathcal{G})) \cdot P(\mathcal{Q}|c; \theta_{Q}) \right] \quad (1) \]
其中 \( c \) 是输入声明,\( \mathcal{Q} = \{q_1, \dots, q_n\} \) 是生成的问题集合,\( \mathcal{G} \) 表示结构化的知识图谱。我们的目标是优化参数 \( \theta_{Q} \),使得生成的 \( \mathcal{Q} \) 通过高质量的证据检索最大化正确判决 \( y \) 的可能性。
### 3.3 知识图谱构建
为确保框架基于可验证的事实,同时严格避免标签泄露和循环推理,我们仅使用与每个数据集相关联的真实证据语料库来构建知识图谱(KG)。我们明确地将声明文本和真实性标签排除在图构建流程之外,利用 GPT-4 执行开放信息抽取(OpenIE),将非结构化证据转换为结构化三元组 \((s, p, o)\)(主语–谓语–宾语)。为了保证高保真检索,我们实现了一个溯源追踪机制,将每个节点和边映射回其源文档 URI,从而使验证器 LLM 能够对照原始文本审计检索到的路径。
表 1:提取 KG 三元组的质量评估
如表1 (https://arxiv.org/html/2607.17935#S3.T1) 所示,对 500 个随机抽取的三元组进行的手动质量评估证实了该过程的可靠性,实体精度达到 94.2%,三元组保真度达到 91.8%。此外,我们通过处理时间敏感性,在源文本中可用时将时间元数据(时间戳)附加到边上。在检索过程中,模型优先选择时间戳最接近声明发布日期的边。为了控制噪声,我们应用基于频率的过滤器,移除那些未与至少两个其他节点连接的“孤立”实体,确保图聚焦于复杂推理所需的密集多跳关系簇。
### 3.4 问题生成模块
问题生成模块是 DeLIVeR 框架的核心部分,它利用一个预训练的亿级参数辅助大型语言模型,根据输入声明创建相关问题,以便为从 KG 中针对性检索相关证据来验证假新闻设定语言框架。形式化地,给定输入声明 \( c \),辅助 LLM \( Q \) 生成一个问题集合 \( Q = \{q_1, q_2, \ldots, q_n\} \),每个问题 \( q_i \) 探索声明的特定角度,例如来源、支持声明 \( c \) 的证据、可能影响声明的上下文因素,或者反驳或矛盾,例如:“\( c \) 声明的原始来源是什么?”“KG 中的证据 \( x \) 是否与声明 \( c \) 中的断言 \( y \) 相矛盾?”“哪些时间因素影响事件 \( z \) 的有效性?”该过程定义为 \( \mathcal{Q}(c; \theta_{Q}) \to Q \subseteq \mathcal{P}(\text{KG}) \),其中 \( \theta_{Q} \) 是 LLM 的预训练参数,问题集合 \( Q \) 被共同用于查询 KG,检索出一个统一的证据集。生成的每个问题旨在覆盖声明的多个角度,如事实、时间和因果,以促进从 KG 中获得更丰富支持的证据集合,并支持多跳推理,这对于评估复杂的虚假信息是必要的。
问题集合通过向量相似性搜索映射到 KG 节点和边,问题和 KG 元素的嵌入确保了上下文相关的证据检索:
\[ \text{Score}(q_i, e_j) = \cos(\phi(q_i), \phi(e_j)), \quad (2) \]
其中 \( \phi(q_i) \) 和 \( \phi(e_j) \) 分别是问题 \( q_i \) 和 KG 元素(节点或边)\( e_j \) 的嵌入,\( \cos \) 表示余弦相似度[52 (https://arxiv.org/html/2607.17935#bib.bib52)]。这种评分方式使得能够选择最相关的 KG 元素,与标准 RAG 系统中的静态查询方法相比,显著提高了检索证据的粒度和相关性。为了解决冗余问题并确保对 KG 关系结构的全面覆盖,相似文章
AgentKGV:基于两阶段训练的知识图谱事实验证智能LLM-RAG框架
提出了AgentKGV,一种基于两阶段训练(蒸馏SFT和轨迹级GRPO)的智能LLM-RAG框架,用于验证知识图谱中的事实,在T-REx基准上取得了显著改进,同时减少了检索调用。
RSF-GLLM: 通过递归软流与解耦LLM生成弥合多跳知识图谱问答中的语义鸿沟
本文介绍了RSF-GLLM,一个将可微图推理与LLM生成解耦的框架,以解决多跳知识图谱问答中的语义鸿沟问题,在实现竞争性性能的同时,具有卓越的推理效率。
Debate-on-Graph: 基于不确定知识图谱的大型语言模型可靠自适应推理
Debate-on-Graph (DoG) 是一个框架,通过利用带有置信度的不确定知识图谱 (UKG) 增强 LLM 推理,采用启发式搜索和多智能体辩论机制生成可靠答案。在四个 QA 基准测试中达到最先进性能。
增强元认知AI:基于图论的大语言模型富集的知识图谱填充
MetaKGEnrich是一个全自动流水线,使用图指标检测大语言模型应用中的知识缺口,检索网络证据,并在三个基准数据集上将答案质量提升80%-87%。
面向多讲座教育推理的基于证据的多模态知识图谱构建
提出了一种基于证据的多模态流水线,从讲座视频中构建富含溯源信息的知识图谱,结合ASR、OCR和视觉-语言模型,在神经网络讲座上实现了高检索准确率。