SPARK:基于知识图谱的不对称奖励自博弈

arXiv cs.AI 论文

摘要

本文介绍了 SPARK,这是一种自博弈强化学习框架,利用从科学文献中衍生出的知识图谱来提升视觉-语言模型的关系推理能力。

arXiv:2605.05546v1 公告类型:新论文 摘要:自博弈强化学习在具有形式化可验证结构的领域(如数学和编程)中展现出强劲性能,在这些领域中,问题生成和奖励计算均可以明确的规则为基础。将此范式扩展至科学文献更具挑战性:文档内部及跨文档的多模态元素之间的关系很少在文本中明确表述,这使得自动生成交互式关系推理问题变得困难,并削弱了奖励信号的可靠性。我们提出了 SPARK(基于知识图谱的不对称奖励自博弈),这是一个框架,能够自动从多文档科学文献中构建统一的知识图谱(KG),并将其作为自博弈的结构基础。跨越多模态节点的 KG 路径作为生成交互式关系推理问题的来源,存储在 KG 中的结构化事实为可验证的奖励计算提供了依据。单个小型视觉-语言模型(sVLM)在面对固定 KG 时的信息不对称条件下,交替扮演提议者(Proposer)和求解者(Solver)角色,我们认为这一设计可以自然地扩展至未来工作中的在线适应。我们在公开基准和一个自建的跨文档多跳问答数据集上评估了 SPARK。结果表明,SPARK 始终优于基于扁平语料库的自博弈基线,且随着跳跃次数的增加,性能差距进一步扩大,这表明 KG 结构接地在关系多跳推理方面提供了超出非结构化语料库接地的贡献。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:22

# SPARK:基于知识图谱的非对称奖励自博弈

来源:https://arxiv.org/html/2605.05546
###### 摘要

自博弈强化学习在具有形式化可验证结构的领域(如数学和编程)中表现强劲,在这些领域中,问题生成和奖励计算都可以基于显式规则。将这一范式扩展到科学文献更具挑战性:文档内部及跨文档的多模态元素之间的关系在文本中很少被明确表达,这使得自动生成交叉推理问题变得困难,并削弱了奖励信号的可靠性。我们提出了 **SPARK**(**S**elf-**P**lay with **A**symmetric **R**eward from **K**nowledge Graphs,基于知识图谱的非对称奖励自博弈),这是一个从多文档科学文献中自动构建统一知识图谱(KG)并利用其作为自博弈结构基础的框架。跨越多模态节点的 KG 路径用作生成交叉推理问题的来源,而存储在 KG 中的结构化事实为可验证的奖励计算提供了基础。在针对固定 KG 的信息不对称条件下,单个小型视觉-语言模型(sVLM)在“提议者”(Proposer)和“求解者”(Solver)角色之间交替,我们认为这种设计可以自然地扩展到未来的在线适应工作中。我们在公共基准和一个自建的跨文档多跳问答数据集上对 SPARK 进行了评估。结果表明,SPARK 始终优于基于平坦语料库的自博弈基线,且随着跳转次数(hop count)的增加,性能差距扩大,这表明 KG 结构 grounding(依托/基于)对关系多跳推理的贡献超越了非结构化语料库 grounding 所能提供的能力。

机器学习,ICML,知识图谱,自博弈,视觉-语言模型

Hyobin Park<sup>1</sup> Taeseop Kim<sup>2</sup> Dong-Geol Choi<sup>2</sup><sup>†</sup>

<sup>1</sup>ANTLAB, 韩国 <sup>2</sup>韩国韩白国立大学

[email protected] [email protected] [email protected]

<sup>†</sup>通讯作者

## 1 引言

科学进步依赖于文献中知识的积累与互联。研究人员不仅通过阅读单篇论文,而且通过综合多个文档中概念的演变、方法论的分歧以及实验结果的比较来获得新的见解。因此,理解科学文献从根本上来说是一个关系推理的问题。在单个文档中,图表支持具体声明,表格为实验测量提供依据,方程则形式化了方法论。在多文档之间,一篇论文的方法论与另一篇的实验设计相连,不同工作的结果被比较和综合。如何训练模型自动理解这种复杂的关系结构,是激励本研究的核心问题。

##### 自博弈 RL 与非结构化领域之间的差距。

自博弈强化学习是一种无需外部标注即可改善模型的有前景的范式。DeepSeek-R1 (Guo et al., 2025) 和 OpenAI o1 (Jaech et al., 2024) 等系统通过基于自博弈的强化学习,在数学和编码任务上达到了专家级性能。这一范式成功的基石在于两个条件。首先,形式化结构(符号方程系统、编译器)使得自动生成高质量问题成为可能。其次,同样的结构保证了可靠的奖励计算,无需人工干预即可确定正确性。SPICE (Liu et al., 2025) 试图将这一范式扩展到文档语料库,但将文档视为平坦文本无法表示多模态元素之间的关系或文档间的语义连接,从而在结构上限制了上述两个条件的满足。

科学文献的关系结构在序列化线性文本序列的那一刻就很大程度上被破坏了。图表支持哪些声明,或两篇论文的方法论如何关联,在文本中没有任何显式陈述。因此,基于平坦语料库的自博弈遇到了两个根本性瓶颈。从问题生成的角度来看,可生成问题的空间局限于表面事实提取,使得生成交叉推理问题在结构上不可行。从奖励计算的角度来看,当地面真实答案分散在非结构化文本中时,支撑这些答案的关系结构仍然隐含,使得任何奖励机制都难以可靠地区分结构合理的推理与听起来合理但不正确的答案。

##### 通过知识图谱实现的结构化解决方案。

我们认为,知识图谱(KGs)同时为这两个瓶颈提供了原则性的结构化解决方案。KG 将文档的多模态组件及其之间的关系编码为显式的节点-边结构。在此结构上,KG 路径作为自动生成关系推理问题的来源(解决瓶颈 1),而存储在 KG 中的事实为可验证的奖励计算提供了基础(解决瓶颈 2)。此外,连接多个文档之间的概念节点创建了跨文档推理路径,超出了单文档的范围,直接将科学文献理解所根本要求的复杂跨文档知识综合纳入自博弈训练目标中。

##### SPARK。

基于这些见解,我们提出了 SPARK。SPARK 通过结构、引用和语义关系图从科学论文中自动构建三阶段 KG,并通过自博弈循环内化关系推理能力,在该循环中,单个 sVLM 在提议者角色(基于 KG 路径生成问题)和求解者角色(在无 KG 访问权限的信息不对称条件下回答问题)之间交替。奖励信号分解为三个 KG 验证组件:$R_{\text{answer}}$、$R_{\text{path}}$ 和 $R_{\text{consistency}}$,直接监督推理路径的结构忠实度,而不仅仅是简单匹配答案。

##### 贡献。

本文做出了三个主要贡献。

1.  **基于 KG 的自博弈框架。** 我们提出了 SPARK,它利用固定的 KG 作为离线知识结构,在科学文献领域同时满足成功自博弈的两个条件:自动生成高质量问题和计算可验证奖励。通过路径忠实度奖励 $R_{\text{path}}$,SPARK 直接针对平坦语料库自博弈无法监督的多跳关系推理。
2.  **多模态三阶段 KG 构建流水线。** 为了让 KG 作为结构化解决方案发挥作用,从原始文档中自动提取关系结构本身就是一个先决条件。我们展示了一个三阶段流水线(结构-引用-语义),无需人工标注即可构建跨越文本、图表、表格和方程的多模态 KG。跨文档 KG 联盟连接了论文间的概念节点,实现了跨文档推理路径。
3.  **跨文档多跳问答基准。** SPARK 所针对的关系多跳推理能力无法通过现有的基准(如 ScienceQA (Luo et al., 2022) 或 DocVQA (Mathew et al., 2021))直接衡量。我们引入了一个源自 50 篇 arXiv 论文的 450 个问题的跨文档 QA 数据集。

> *参见图注*
>
> 图 1: SPARK 概述。三阶段流水线自动从科学文档构建 KG,跨文档联盟连接论文间的概念节点。单个 sVLM 在提议者和求解者角色之间交替:提议者从 KG 中采样推理路径以生成带有黄金答案的关系问题,而求解者在信息不对称条件下无 KG 访问权限回答问题。奖励信号分解为三个 KG 验证组件:$R_{\text{answer}}$、$R_{\text{path}}$ 和 $R_{\text{consistency}}$,其中 $R_{\text{path}}$ 和 $R_{\text{consistency}}$ 是 SPARK 独有的术语,若无 KG 则无法定义。

## 2 相关工作

### 2.1 自博弈强化学习与语言模型

基于人类和 AI 反馈的对齐方法 (Ouyang et al., 2022; Bai et al., 2022) 已确立了语言模型后训练的标准范式。随后,提出了基于自博弈的方法 (Chen et al., 2024b; Yuan et al., 2024),其中单个模型同时充当生成器和判别器。然而,这些方法受到信息对称瓶颈的影响,由于两个组件共享相同的先验知识,难以生成独立的学习信号。虽然一些研究 (Wu et al., 2025) 从博弈论角度阐述了这一点,但它们主要集中在对齐而非事实推理上。另一方面,基于可验证奖励的强化学习 (RL) (Guo et al., 2025) 已被证明在诱导长链推理方面有效。将这种方法扩展到无需外部数据的零数据自博弈的工作也在进行中 (Zhao et al., 2025; Huang et al., 2025)。最近,提出了基于语料库的自博弈 (Liu et al., 2025),通过使用非结构化语料库作为 grounding 来挖掘任务,以缓解信息对称问题。然而,非结构化文本在关系验证方面存在挑战,并限制了学习信号的精确度。我们的工作继承了这一范式,但将 grounding 环境替换为知识图谱(KG)。通过利用 KG 路径作为自动关系推理任务生成的来源,并利用存储在 KG 中的事实进行可验证的奖励计算,我们同时实现了平坦语料库自博弈在结构上无法满足的两个成功条件。

### 2.2 基于知识图谱的问答

知识图谱(KGs)通过实体-关系三元组提供了显式的多步推理框架和可验证的事实基础,促成了将其应用于问答(KGQA)的广泛研究。早期的基于嵌入的多步 KGQA 方法 (Saxena et al., 2020; Jiang et al., 2023) 奠定了基础,随后演变为 LLM 直接将 KG 路径用作推理计划的方法 (Sun et al., 2024; Luo et al., 2024),以及图结构检索实用性的工业规模演示 (Edge et al., 2024)。在理论方面,研究将 LM 推理概念化为 KG 上随机游走路径的加权聚合 (Wang et al., 2024),或通过查询原型注意力提高 KG 推理性能 (Liu et al., 2024)。最近的工作提出将 KG 结构直接整合到 LLM 解码过程中以从根本上防止幻觉 (Luo et al., 2025),或将 RL 调优的 LLM 推理应用于以关系为中心的 KGQA (Tan et al., 2025)。然而,后者缺乏基于自博弈的自动化任务生成机制。我们的研究在自博弈循环中利用 KG 进行任务生成和奖励计算。通过一种信息不对称结构——提议者访问 KG 路径而求解者无 KG 回答——我们将跨文档多跳推理作为主要学习目标。

### 2.3 科学文档理解

科学文档包含复杂的多种模态成分,如方程、表格和图表,以及特定领域的符号,使得应用通用文档理解方法变得困难。在解析和结构提取方面,该领域已从基于规则和 CRF 的方法 (Lopez, 2009) 发展到多模态预训练 (Huang et al., 2022)、无 OCR 端到端转换 (Kim et al., 2022; Blecher et al., 2023) 以及使用基于视觉-语言模型的页面嵌入的视觉文档检索 (Faysse et al., 2025)。在语言模型方面,由于证明了科学特定预训练的有效性 (Beltagy et al., 2019),将其扩展到大规模解码器模型 (Taylor et al., 2022; Lewkowycz et al., 2022) 极大地推动了科学领域的语言理解和生成。基于这些文档理解技术,我们的工作无需人工标注即可从多模态文档(包括文本、图表、表格和方程 (Seo et al., 2025))中自动构建三层 KG(结构、引用和语义)。通过将其用作自博弈的 grounding 环境,我们将科学文献固有的关系推理转化为可学习的结构信号。

## 3 方法:SPARK

SPARK 包含两个阶段。第一阶段自动构建固定的 KG,第二阶段利用该 KG 作为自博弈循环的唯一结构基础,将关系推理能力内化到单个 sVLM 中。

### 3.1 自动 KG 构建

#### 3.1.1 三阶段 KG 构建流水线

利用科学文档的关系结构进行自博弈,需要将文本序列化过程中丢失的隐含关系恢复为显式的图结构。这些关系存在于多个不同的层次:文档的物理布局、作者意图的跨模态连接,以及内容单元之间的语义或因果关系。我们通过三阶段流水线来解决这个问题,其中每个阶段独立恢复一个层次的结构。

KG 遵循模式 $\mathcal{G}=(\mathcal{V},\mathcal{E})$。节点类型集 $\mathcal{V}=\{\text{TextBlock, Figure, Table, Equation, Concept, Claim}\}$ 旨在涵盖科学文献中多模态组件的全部范围。边类型集 $\mathcal{E}$ 旨在跨越三个层次:层次包含(Contains, HasCaption)、跨模态引用(References, Illustrates, Quantifies, Defines)以及语义关系(Supports, Contradicts, DerivesFrom, Compares)。这种分类法精确对应于以下阶段恢复的三个层次结构。每条边 $e \in \mathcal{E}$

相似文章

利用知识图谱路径作为自进化搜索代理的中间监督

arXiv cs.AI

本文介绍了一种利用知识图谱路径作为中间监督来提升自进化搜索代理性能的方法。该方法通过将问题构建建立在关系上下文之上,并引入航点覆盖奖励(Waypoint Coverage Reward)以实现分级部分奖励,从而解决了搜索自博弈(Search Self-Play)中的瓶颈问题。

Search-on-Graph-R1:使用强化学习训练大型语言模型搜索知识图谱

arXiv cs.CL

本文提出了Search-on-Graph-R1(SoG-R1),该模型通过首先使用黄金SPARQL查询搭建前沿教师模型以生成有依据的轨迹,然后应用监督微调和强化学习,训练一个8B参数的大型语言模型在知识图谱中导航。这个紧凑的模型在WebQSP、CWQ和GrailQA上超越了冻结的前沿系统,尤其是在CWQ上取得了所有对比方法中的最佳结果。

面向知识图谱问答的研究者智能体

arXiv cs.AI

本文提出了一种自我改进的“研究者智能体”,用于知识图谱上的Text-to-SPARQL问答,该智能体能迭代优化自身的提示和工具。在DBpedia上进行评估,达到了0.22的准确率,并识别出谓词选择是主要瓶颈。