KARMA: 基于知识图谱的自动化推理实现与对齐

arXiv cs.CL 论文

摘要

KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。

arXiv:2607.03166v1 公告类型:新 摘要:基于模板的对比合成是可扩展的,但其候选项通常仅在少数实体槽位上有所不同,而序列级优化将监督分散到大部分共享模板上。我们将此形式化为粒度不匹配问题,并提出了KARMA,它枚举领域知识图谱上的模式约束路径,并将其转化为槽位对齐的对比候选项。随后,槽位并行对齐(SPA)应用解耦的槽位级目标,将偏好监督引导到具有区分性的实体槽位,其中槽位感知的掩码注意力作为可选的打包评估实现。在生物医学、计算机科学和化学基准测试中,KARMA 优于基础LLM和同数据SFT基线,并与序列级和词元级偏好方法相比表现出色。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:37

# KARMA: 基于知识图谱的自动化推理实例化与对齐
来源:https://arxiv.org/html/2607.03166
Jinkyeong Choi, Chaebin Jeong, Donghyeon Park
世宗大学 首尔,韩国
{jjinchoi, chaibin2000}@sju\.ac\.kr, parkdh@sejong\.ac\.kr

###### 摘要

基于模板的对比合成具有可扩展性,但其候选样本通常仅在少数实体槽上存在差异,而序列级优化将监督信号分散到大部分共享模板上。我们将此形式化为分辨率不匹配问题,并提出KARMA,该方法枚举领域知识图谱上受模式约束的路径,并将其口头化为槽对齐的对比候选样本。槽并行对齐(SPA)随后使用解耦的槽级目标,将偏好监督路由到具有判别性的实体槽,同时槽感知掩码注意力作为可选的打包评估实现。在生物医学、计算机科学和化学基准测试中,KARMA优于基础LLM和同数据SFT基线,并与序列级和词元级偏好方法相比表现更佳。

*关键词*:大型语言模型(LLMs)、推理、领域自适应、偏好优化、知识图谱(KG)

## 1 引言

近年来,LLM推理的进展增加了对推理监督的需求[35,4,9]。然而,扩展此类监督仍受到可靠性、多样性和成本之间权衡的限制[30,14]。先前的方法以三种方式处理这种权衡。(1)人类专家标注可提供可靠的推理链,但在过程层面代价高昂[30,14,32]。(2)来自教师模型的合成数据提高了可扩展性[33,37],但继承了并传播了潜在的推理错误[7,24]。(3)基于规则或模板的生成通过程序化构建降低了成本,但狭窄的模板限制了事实覆盖范围[23]。

尽管生成推理数据的方式存在这些差异,但一旦将其用于对比监督,就会出现结构性的限制:候选差异通常集中在少数实体槽上,而监督却应用于整个序列级别。

<参考图注>
图1:偏好优化中的分辨率不匹配问题。(a)DPO在序列级比较单个选定-拒绝对。(b)Multi-DPO将其扩展到多个拒绝候选,但仍停留在序列级。(c)我们的槽并行对齐(SPA)比较共享相同模板的候选,并在具有判别性的实体槽的分辨率上对齐偏好。

我们形式化这一差距为**分辨率不匹配问题**(图1):偏好通常由少数具有判别性的实体槽决定,而优化应用于整个序列。瓶颈不在于我们比较了多少个候选,而在于我们在什么分辨率上进行比较。标准的DPO[21](图1-a)及其多候选扩展(图1-b)扩大了比较集,但保留了序列级粒度,这稀释了信息性实体槽上的信号[20,40,41]。知识图谱为解决这种不匹配提供了一种自然的方式:在固定模式下,替代路径产生的候选共享相同的模板,差异局限在实体槽上[28,27,18]。我们将这一思想实例化为**KARMA**(基于知识图谱的自动化推理实例化与对齐),一个统一的框架,其合成流水线产生此类候选,其学习组件**槽并行对齐(SPA)**直接对这些候选进行操作(图1-c)。合成流水线将知识图谱路径在共享模板[31,6,1]下口头化,并使用基于循环的支撑度作为偏好分配的结构性先验。这暴露了明确的判别性实体槽,同时将事实覆盖范围扩展到手写模板之外。在学习方面,SPA应用解耦的槽级目标,对构建暴露的实体槽进行监督,同时保留共享模板作为语言建模信号。为了高效的打包评估,SPA可以选择性地使用槽感知掩码注意力,在单次前向传播中近似每个候选的对数似然,而不会改变槽级监督信号。与先前的词元级方法[38,3,39,15]不同,后者学习或估计哪些词元重要,SPA针对的是KARMA合成数据中通过构建明确暴露的实体槽。当数据和优化共享相同的槽级分辨率时,偏好学习可以专注于判别性证据,同时保留共享模板。

我们在生物医学、化学和计算机科学基准测试上评估KARMA,它在基础LLM和SFT基线上取得了一致的提升。我们的贡献是:
- • **来自知识图谱的对齐对比合成**:我们提出了一种基于知识图谱的合成流水线,该流水线通过设计构建共享口头化模板的选定-拒绝候选,将偏好差异定位到实体槽,并使用知识图谱路径的循环性作为偏好分配的结构性先验。
- • **槽并行对齐(SPA)**:我们引入了一种偏好优化方法,其分辨率与数据相匹配:一个解耦的槽级目标对构建暴露的实体槽应用偏好和锚损失,同时保留共享模板作为语言建模信号。我们进一步提供了一个可选的槽感知掩码注意力实现,该实现减少了冗余候选评估,而无需估计词元重要性。

## 2 相关工作

##### 推理监督中的权衡

推理监督面临成本-覆盖的权衡:人类过程监督提供可靠的步骤级信号,但代价高昂[30,14,32];教师蒸馏的数据可扩展性更好,但在递归使用下会退化[33,17,7,24];基于模板的生成降低了成本,但限制了事实覆盖,并将对比差异压缩到少数实体槽上[29,23]。KARMA将这种压缩转化为资源:通过将候选构建锚定在知识图谱路径中,它在扩展事实覆盖的同时,通过构建将判别性变化局限在实体槽上。

##### 细粒度偏好对齐

序列级偏好优化[21,2,25,16]在候选共享大部分词元时,稀释了对少数判别性位置的监督[40,15]。词元级方法通过重要性评分、学习掩码或 oracle 选择来估计哪些词元重要,从而解决这一问题[38,3,39,42,36],但需要额外的学习或外部信号来识别它们。SPA则利用来自KARMA合成数据的结构性先验:判别性实体槽通过构建已知,因此监督直接路由到它们,无需估计。

##### 知识图谱口头化

知识图谱通过将结构化事实口头化为自然语言来为语言模型提供基础[6,1,31,5],而图上的推理方法进一步利用知识图谱路径作为忠实的中间轨迹[18,27,28]。这两条线都将每条口头化路径视为一个正实例,而未利用替代路径共享端点和模式这一结构性特性。KARMA恰恰利用这一特性来暴露用于SPA的槽级判别性结构。

## 3 方法

### 3.1 概述

我们提出**KARMA**,一个基于知识图谱的对比合成流水线,以及**SPA**,一种为KARMA合成数据协同设计的槽级偏好优化方法。KARMA在固定关系模式下枚举固定源-目标实体之间的替代知识图谱路径,并将其口头化为结构对齐的对比候选,这些候选共享模板支架,仅在判别性实体槽上有所不同。SPA随后通过两个核心学习机制将偏好优化与此实体槽级结构对齐:(i)在共享上下文下候选变体的槽并行组织,以及(ii)一个解耦的混合目标,将偏好监督应用于实体槽,同时保留共享模板。槽感知掩码注意力是一种可选的打包评估机制,通过单次前向传播近似每个候选的对数似然,从而减少冗余前向传播。KARMA和SPA共同实现了一个单一原则:**将监督的粒度与数据的结构粒度对齐**。

<参考图注>
图2:KARMA和SPA概述。KARMA通过路径枚举、基于支撑度的Top-K选择以及模板口头化,从知识图谱路径合成结构对齐的对比候选。由于候选差异定位在稀疏的实体槽上,序列级偏好优化会遭受信号稀释。SPA通过一个解耦的槽级目标来解决这种不匹配,将学习与实体槽级监督对齐。槽感知掩码注意力(启用时)作为可选的打包评估实现,减少冗余候选评估,同时保持槽级监督信号不变。

### 3.2 KARMA数据合成:基于知识图谱的对比候选构建

KARMA通过三个步骤从领域知识图谱构建槽对齐的对比候选:它枚举源-目标实体对之间受模式约束的路径,通过平衡支撑度和结构多样性在每个候选池中选择Top-K个替代路径,并用池内共享的模式特定模板口头化选定的路径。得到的候选共享相同的源和目标实体以及关系模式,仅在其中间实体槽上有所不同。这种槽局部变化是SPA的接口:它将对比信息限制在实体槽上,在与数据变化相同的粒度上暴露偏好信号。

#### 3.2.1 路径枚举

KARMA首先从领域知识图谱G=(N,E)枚举受模式约束的多跳路径来构建候选池,其中N是实体集合,E⊆N×R×N是关系类型R上的有类型边集合。关系模式指定了候选路径必须实例化的有类型边的有序模式。KARMA使用此类模式收集共享相同模式以及源和目标实体,但仅在其中间实体上有所不同的替代路径(图2A)。对于给定的源实体e_s、目标实体e_t和关系模式,KARMA枚举一个受模式约束的候选池P,这是G的一个源到目标子图,其元素的形式为:
pm = (e_s, e_1^(m), e_2^(m), ..., e_{n-1}^(m), e_t),   (1)
其中m=1,...,M索引池内的路径,n表示关系模式中的跳数,e_j^(m)表示路径p^m中第j个中间位置的实体(j=1,...,n-1),e_s, e_t表示源和目标实体。每个这样的池对应一个源-目标对,并作为一个训练实例的候选集。同一池中的路径共享相同的关系模式以及源和目标实体,但可能在其中间实体上有所不同。等价地,每个中间槽j引发一组不同的槽实体S_j={e_{j,1},...,e_{j,d_j}},每个路径从其中选择一个实体,因此e_j^(m)∈S_j。这一特性使得KARMA能够构建对比替代样本,其差异局限在中间实体槽上。

#### 3.2.2 Top-K候选选择

给定一个大小为M的候选池P={p^1,...,p^M},KARMA通过平衡路径支撑度和结构多样性来选择K个路径。我们通过每个路径的中间实体在池中的累计循环性来衡量其支撑度:每个中间实体贡献其在P上的出现次数,路径的支撑度是这些贡献的总和。中间实体频繁出现的路径因此获得更高的支撑度,反映了在相同源-目标对下通常共享的结构连接。KARMA随后按支撑度降序贪心地接纳路径,受限于重叠预算δ,该预算限制了与先前已接纳路径共享的中间实体数量(图2B)。此预算通过防止近乎重复的候选来强制结构多样性。当K个路径已被接纳时停止;少于K个可接纳路径的池被丢弃。我们将接纳的路径记为p_k^⋆(k=1,...,K),按接纳顺序索引,中间实体写为e_j^(k)表示第k个选定路径的槽j。有序的选定路径序列P^⋆=(p_1^⋆,...,p_K^⋆)

相似文章

KARMA:基于Karma对齐的奖励模型适配

arXiv cs.CL

介绍KARMA,一个在Reddit对话上训练奖励模型的框架,通过强化学习提升大语言模型的上下文敏感对话行为。研究发现,预测Karma的最佳奖励模型并不能带来最佳的下游对齐效果。

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。

KARLA: 基于知识库增强检索的语言模型

arXiv cs.AI

KARLA 提出了一种方法,让大型语言模型在生成过程中查询知识库,从而无需重新训练即可更新事实知识,并提高透明度。实验表明,该方法在短文本和长文本生成中均提升了事实依据性。

CoRA: 面向可靠思维链推理的置信度-理由对齐

arXiv cs.CL

本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。