REAP:面向LLM的闭卷知识库构建的关系感知启发与解析

arXiv cs.CL 论文

摘要

本文介绍了REAP,一个用于从LLMs构建闭卷知识库的两阶段流程,它结合了针对特定关系的启发策略与确定性JSON解析,在使用Mistral-Small-24B-Instruct-2501的AKBC Shared Task 2026测试集上实现了0.62的宏F1分数。

arXiv:2608.10963v1 公告类型:新 摘要:我们提出了REAP系统,用于AKBC Shared Task 2026,该任务在闭卷设置下从语言模型构建知识库,预算限制为最多32B参数且不进行模型微调。我们的系统结合了结构化思维链推理、针对特定关系的查询策略以及基于推理的空集门来获取参数化知识,然后直接提取为有效的JSON数组。在测试集上,基于Mistral-Small-24B-Instruct-2501构建的系统取得了0.62的宏F1分数,在countryLandBordersCountry(F1 = 0.95)、companyTradesAtStockExchange(F1 = 0.73)和hasArea(F1 = 0.77)上表现尤为突出。我们的代码公开在https://github.com/yammdd/AKBC-Shared-Task-2026。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:38

# 面向大语言模型封闭式知识库构建的关系感知抽取与解析
Source: https://arxiv.org/html/2608.10963
Thanh-Trung Do、Tuan-Phong Nguyen
所属机构:越南国立大学工程技术学院,河内,越南
所属机构:\{23020342, 24022472, tuanphong\}@vnu\.edu\.vn

###### 摘要

我们提出了Reap系统,用于AKBC 2026共享任务:在封闭式环境下从语言模型构建知识库,预算限制为最多32B参数且不允许模型微调。我们的系统结合了结构化思维链推理、关系特定查询策略以及基于推理的空集门控来抽取参数化知识,然后直接提取为有效的JSON数组。在官方测试集上,基于Mistral-Small-24B-Instruct-2501构建的系统取得了宏平均F1分数为0.620.62,尤其在countryLandBordersCountry(F1=0.95F\_\{1\}=0.95)、companyTradesAtStockExchange(F1=0.73F\_\{1\}=0.73)和hasArea(F1=0.77F\_\{1\}=0.77)上表现突出。我们的代码已公开。111https://github.com/yammdd/AKBC-Shared-Task-2026

## 1 引言

大型语言模型(LLMs)在其参数中编码了大量事实性知识17 (https://arxiv.org/html/2608.10963#bib.bib1)。然而,为知识库构建(KBC)而抽取这些知识远比回答孤立的事实性问题更具挑战性:一个主语–关系对(s,r)(s,r)可能对应空对象集(∅\\emptyset)、单值对象集(11)或多值对象集(NN)。AKBC 2026共享任务8 (https://arxiv.org/html/2608.10963#bib.bib5)在约束条件下形式化了这一问题:系统必须在封闭式环境下运行,不得使用检索增强生成或外部知识;最多使用32B参数;并且不进行模型微调。

在本任务中,每条输入记录指定一个主语实体以及六个给定关系之一(见表1 (https://arxiv.org/html/2608.10963#S1.T1)),系统必须返回对应的完整对象集,格式为有效的JSON数组。这些关系涵盖地理邻接与面积、人物的死亡城市、场馆容量、奖项获得者以及公司上市交易的证券交易所。因此,所需输出可能为空、包含单个对象或包含一长串对象,同时定量答案还必须足够精确。表1 (https://arxiv.org/html/2608.10963#S1.T1)总结了六个目标关系及其真实标签的范围。

表1:六个目标关系的定义和真实标签范围。早期的事实探测方法使用完形填空式提示或提示集成来对候选对象进行排序17 (https://arxiv.org/html/2608.10963#bib.bib1);5 (https://arxiv.org/html/2608.10963#bib.bib11),而LM-KBC挑战系列则进一步要求系统实现可变基数的答案集20 (https://arxiv.org/html/2608.10963#bib.bib13);10 (https://arxiv.org/html/2608.10963#bib.bib20);7 (https://arxiv.org/html/2608.10963#bib.bib21);9 (https://arxiv.org/html/2608.10963#bib.bib10)。因此,一种直接生成式的解决方案——要求模型一次回忆所有对象并生成格式正确的JSON——可能会产生幻觉对象、遗漏有效答案或违反输出模式。

为解决这一问题,我们提出了Reap(Relation-aware Elicitation And Parsing,关系感知抽取与解析),一个两阶段流水线,将事实抽取与答案序列化解耦。阶段1使用针对每个关系定制的策略提示LLM,而阶段2在可能的情况下使用确定性JSON解析,仅将LLM-based提取作为回退方案。这种分离使得模型在系统强制采用所需JSON格式之前,能够专注于回忆答案集。

我们的主要贡献如下:

1. 1. 关系感知抽取:我们针对不同关系类型设计了专门策略,包括带空集门控的CoT推理、用于陆地边界的四方向地理扫描,以及用于奖项的按时间顺序多轮查询。
2. 2. 高效混合解析:确定性解析处理约80%80\\%的记录,而LLM-based提取仅用于复杂输出,大幅降低了整体计算成本。
3. 3. 可扩展推理与评估:在TPU硬件上使用vLLM进行批量推理,实现了快速的端到端处理。完整系统在测试集上达到宏平均F10.620.62,并突显了参数化知识在稀有实体上的局限性。

## 2 相关工作

#### 探测语言模型中的知识。

LAMA17 (https://arxiv.org/html/2608.10963#bib.bib1)确立了完形填空式探测方法,但假设每个关系只有一个对象,且可提取内容高度依赖于提示5 (https://arxiv.org/html/2608.10963#bib.bib11);相关综述参见2 (https://arxiv.org/html/2608.10963#bib.bib12)。LM-KBC挑战系列20 (https://arxiv.org/html/2608.10963#bib.bib13);10 (https://arxiv.org/html/2608.10963#bib.bib20);7 (https://arxiv.org/html/2608.10963#bib.bib21);9 (https://arxiv.org/html/2608.10963#bib.bib10)将其重新定义为任意基数对象集(00、11或NN)的知识库构建,AKBC 2026共享任务8 (https://arxiv.org/html/2608.10963#bib.bib5)延续了这一设定。先前的系统将LLM探测与实体映射相结合22 (https://arxiv.org/html/2608.10963#bib.bib14);最近,在LM-KBC 2025中表现最佳的系统之一ReWiSe1 (https://arxiv.org/html/2608.10963#bib.bib6)将思维链(CoT)推理与关系层面的自洽性相结合。在Reap中,我们采纳了关系特定CoT和显式空集处理的思想,但放弃了自洽性投票,因为它代价高昂且可能被自信但错误的推理链所主导。

#### 参数化知识及其局限。

封闭式问答表明,语言模型可以在没有检索的情况下回答事实性问题19 (https://arxiv.org/html/2608.10963#bib.bib3),这启发了我们所采用的封闭式设置。然而,这种参数化知识是不均衡的:模型能很好地回忆流行事实,但在长尾实体上表现不佳12 (https://arxiv.org/html/2608.10963#bib.bib15);15 (https://arxiv.org/html/2608.10963#bib.bib16),这限制了任何封闭式系统的上限,并与我们针对稀有主语的错误分析相一致。

#### 逐步推理与空集门控。

思维链提示21 (https://arxiv.org/html/2608.10963#bib.bib2);13 (https://arxiv.org/html/2608.10963#bib.bib17)改善了一步一步的多步推理,并建立在指令微调LLM的上下文学习能力之上3 (https://arxiv.org/html/2608.10963#bib.bib18)。由于正确答案本身可能为空集,我们在Reap中添加了一个受选择性预测启发的*基于推理的空集门控*11 (https://arxiv.org/html/2608.10963#bib.bib4)。与估计模型是否知道答案的校准方法不同6 (https://arxiv.org/html/2608.10963#bib.bib19),我们的门控是一个由提示驱动的决策,当属性不存在或证据不足时,返回空集作为最终答案。

## 3 方法

### 3.1 架构概述

Reap系统由两个顺序阶段组成(图1 (https://arxiv.org/html/2608.10963#S3.F1))。在阶段1中,我们使用LLM为多值关系*生成证据*(自由形式的文本),或对单值关系使用CoT推理。如果生成阶段产生无法解析的输出,系统会自动重试或切换到回退提示。阶段2使用正则表达式将证据*提取*为JSON数组;对于无法由简单规则可靠处理的多值关系,LLM自行执行提取。

图1:Reap的架构。
### 3.2 关系特定提示设计

阶段1的提示针对每个关系专门化,遵循三个原则:(i) *查询分解*以最大化多值关系的召回率(例如,awardWonBy的六个十年范围查询,以及countryLandBordersCountry的四方向地理扫描);(ii) *输出格式约束*,通过BORDERS:或FINAL\_ANSWER: \[...\]标记实现;(iii) *带空集门控的逐步推理*,对于无法回答的实体(例如,在世人物或私营公司)输出FINAL\_ANSWER: \[\]。这些关系定制、多步骤的CoT过程共同构成了阶段1在提取之前执行的*结构化推理*。

少样本演示是静态示例对(一个正例,一个空集案例),按关系固定,用于说明推理链和空集触发条件。关键的是,所有示例均仅来自train\.jsonl或手写三元组,确保针对评估划分零数据泄漏。

#### awardWonBy:按时间顺序多轮查询。

对于有数十或数百名获奖者的重要奖项,单次查询通常召回率较低。因此,我们采用多轮策略,包括一个通用提示和五个按时间顺序分解的辅助提示:从奖项设立至1970年代、1980年代–1990年代、2000年代–2010年代、2020年至今,以及最后一轮针对不太知名或非西方获奖者。所有六次生成均使用温度T=0.7T=0.7,以在合并证据前增加召回多样性。

#### countryLandBordersCountry:四方向地理扫描。

提示指示模型充当地理专家,检查主语的东部、西部、南部和北部边界。这种扫描减少了对小邻国和相邻飞地的遗漏。提示仅包含陆地边界,明确排除海洋边界,对于岛国返回BORDERS: NONE。如果响应缺少BORDERS:标记,系统会自动使用更短的回退提示重试。

#### companyTradesAtStockExchange:四步上市检查。

模型遵循四步CoT过程:(1) 识别公司;(2) 应用*严格公开检查(空集门控)*,判断实体是否为私营公司、非营利组织或未单独上市的子公司,若满足任一条件则返回FINAL\_ANSWER: \[\];(3) 使用完整官方名称检索所有上市交易所,如New York Stock Exchange或SIX Swiss Exchange;(4) 以FINAL\_ANSWER: \["Exchange Name"\]结束。

#### hasArea:四步实体消歧与单位归一化。

模型遵循四个CoT步骤:(1) 区分目标实体(例如岛屿、湖泊或地区)与其所在国家;(2) 从参数化知识中检索其面积,同时保留小数精度;(3) 将数值转换为km2\\text\{km\}^\{2\};(4) 以整数或小数值输出为FINAL\_ANSWER: \["Value"\]。

#### hasCapacity:带容量范围验证的四步推理。

模型遵循四个CoT步骤:(1) 确定场馆类型和位置;(2) 区分大学或小型地方体育场与名称相似或位于同城的规模更大的国家体育场;(3) 对照合理的容量范围检查估算值(小型场馆1,0001\{,\}000–35,00035\{,\}000座,大型国家体育场35,00035\{,\}000–100,000100\{,\}000座);(4) 以整数容量返回FINAL\_ANSWER: \["Value"\]。

#### personHasCityOfDeath:带空集门控的五步推理。

模型执行五个步骤:(1) 检查主体的传记状态,适当时记录“ALIVE TODAY”;(2) 解决姓名歧义;(3) 检索死亡城市或城镇;(4) 分离地点名称;(5) 如果人物在世或信息不可用,则返回FINAL\_ANSWER: \[\],如果死亡地点已确认,则返回FINAL\_ANSWER: \["CityName"\]。

### 3.3 后处理

为确保提取输出符合真实标签格式,我们在生成阶段后应用以下自动化后处理流程:

1. 1. 直接解析与稳健数组提取:系统直接解析FINAL\_ANSWER:行的内容,或通过平衡括号扫描恢复截断的JSON数组。
2. 2. 数值提取与归一化:对于定量关系(hasArea和hasCapacity),正则表达式提取整数或浮点数值,同时移除千位分隔符和测量单位。
3. 3. 标题与噪声过滤:对于awardWonBy,系统移除年份前缀(例如“1938: Albert Einstein”)、HTML标签、作品标题后缀以及博士、教授、爵士、女士、勋爵、圣徒、圣、先生等敬称,以获得归一化的实体名称。
4. 4. 括号过滤与去重:系统移除尾部括号限定词(例如“Guinea (West Africa)”→\\to“Guinea”),并执行不区分大小写的去重,同时保留首次出现的首字母大写形式。

## 4 实验

### 4.1 实验设置

#### 数据。

组织者提供了六个关系的训练、验证和测试划分。验证集和测试集各包含475条记录:countryLandBordersCountry在验证集和测试集中分别有68条和67条,hasCapacity分别有97条和98条,awardWonBy有10条,其余三个关系各100条。每条记录包含一个主语、一个关系和一个对象集,每个对象附有别名列表。数据覆盖了所有三种基数情况:空集(例如,用于陆地边界的New Zealand)、单值关系和多值关系(例如,train\.jsonl中Nobel Prize in Physics有229229位获奖者,val\.jsonl中AAAI Fellow有350人)。

#### 模型。

我们评估了三个指令微调模型——Gemma-2-9B-it4 (https://arxiv.org/html/2608.10963#bib.bib7)、Llama-3.1-8B-Instruct14 (https://arxiv.org/html/2608.10963#bib.bib8)和Mistral-Small-24B-Instruct-250116 (https://arxiv.org/html/2608.10963#bib.bib9)——并与组织方的Qwen3.5-9B基线18 (https://arxiv.org/html/2608.10963#bib.bib22)进行比较。Gemma-2-9B-it和Llama-3.1-8B-Instruct作为对比系统,而Mistral-Small-24B-Instruct-2501(以下简称Mistral-24B)是我们的最终系统中的主要模型。

#### 硬件与运行时间。

实验在Kaggle上进行,使用TPU v5e-8,具有八个TPU v5e核心。我们使用vLLM TPU Server提供服务,并采用bfloat16精度。采用直接解析和批量推理后,在验证集(475条记录)上对所有六个关系完整运行一次大约需要*2–5分钟*,batch\_size=32。

#### 指标。

我们使用组织方提供的evaluate\.py脚本报告宏/微平均精确率、召回率和F1。对于字符串值关系,评估器对预测进行归一化,并通过最大二分匹配匹配别名。对于定量关系,它应用5%5\\%的相对容差。总体宏平均F1是所有*逐记录*F1分数的平均值。

### 4.2 验证结果

我们首先在*零样本*设置下评估所有模型,使用直接查询,不进行证据生成或CoT推理。如图2 (https://arxiv.org/html/2608.10963#S4.F2)所示,Llama-3.1-8B、Gemma-2-9B和Mistral-24B分别取得了0.380\.38、0.420\.42和0.430\.43的宏平均F1分数。这些相对较低且相似的分数表明,当要求同时回忆事实并满足输出格式时,所有三个模型都表现不佳。这一局限性在需要长对象列表的多值关系(如awardWonBy)和需要精确值的定量关系上尤为明显。

Llama-3.1-8B、Gemma-2-9B、Mistral-24B:0、0.1、0.2、0.3、0.4、0.5、0.6、0.7;宏平均F1分别为0.380\.38、0.420\.42、0.430\.43、0.480\.48、0.510\.51、0.650\.65。

相似文章

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。

ReLTEx:基于LLM的可靠分类法扩展

arXiv cs.CL

ReLTEx是一个基于LLM的可靠分类法扩展框架,它将LLM驱动的候选生成与结构感知验证及递归扩展控制相结合,以减少幻觉并提高一致性。在基准分类法上的实验表明,它能够产生更可靠且语义连贯的扩展。