EGT-KG:用于小型语言模型的实际科学问答的基于证据的类型化知识图谱检索

arXiv cs.AI 论文

摘要

本文提出了EGT-KG,一个检索框架,该框架使用基于证据的类型化知识图谱来增强使用小型语言模型的科学问答,并在实验中显示优于标准RAG方法的性能提升。

arXiv:2609.00479v1 公告类型:新 摘要:对于新兴科学研究领域,本地小型语言模型(SLMs)正变得更具吸引力,因为它们比大型语言模型提供更强的隐私控制和更稳定的部署管道。然而,在实践中,使用SLMs的科学问答往往受到不可避免的约束:小文献集、碎片化的证据、有限的上下文窗口和推理能力。我们提出了基于证据的类型化知识图谱(EGT-KG),一个检索框架,用于改进使用本地SLMs的信息检索。我们评估了三种问答设置:一个标准检索增强生成(RAG)工作流和两个EGT-KG工作流:自动生成的关系模式(AS)和专家定义的关系模式(ES)。我们的实验使用六维评估框架(S3CRF:Soundness, Correctness, Completeness, Conciseness, Relevance, Fluency)在Biopolymer-bound Soil Composite文献基准上进行评估,结果显示EGT-KG在大多数设置中优于标准RAG方法,其中llama3:8b的最佳改进为:最终分数70.37(+14.67%)和68.82(+12.14%),分别来自AS/ES EGT-KG变体。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:04

# EGT-KG:基于证据的类型化知识图谱检索,用于支持小型语言模型的实用科学问答  
来源:https://arxiv.org/html/2609.00479  

**作者**:Muran Yu, Jiechao Gao, Yuandong Pan, Barney H. Miao  
**单位**:斯坦福大学土木与环境工程系  

**作者**:Andrew C. Lesh, Kincho H. Law, Jie Wang, Michael D. Lepech  
**邮箱**:[\{yumuran, jiechao, ydpan, barneym, aclesh, law, jiewang, mlepech\}@stanford.edu](mailto:)  
**单位**:斯坦福大学土木与环境工程系  

---

### 摘要  
对于新兴科学研究领域,本地小型语言模型(SLMs)正变得更具吸引力,因为它们比大语言模型(LLMs)提供更强的隐私控制和更稳定的部署流程。然而,在实践中,在SLMs上进行科学问答往往面临不可避免的约束:文献集合较小、证据碎片化、上下文窗口和推理能力有限。我们提出了**基于证据的类型化知识图谱(EGT-KG)**,一个利用本地SLMs改进信息检索的检索框架。我们评估了三种问答设置:一种标准的检索增强生成(RAG)工作流,以及两种EGT-KG工作流:自动生成的关系模式(AS)和专家定义的关系模式(ES)。我们的实验采用六维评估框架(S3CRF:稳健性、正确性、完整性、简洁性、相关性、流畅性),在生物聚合物结合土壤复合材料(Biopolymer-bound Soil Composite)文献基准上进行评估,结果表明EGT-KG在大多数设置中优于标准RAG方法,其中llama3:8b的改进最为显著:最终得分达70.37(+14.67%)和68.82(+12.14%),分别由AS/ES变体实现。

## 1 引言  
大语言模型(LLMs)的快速发展改变了科学知识发现与人机协作的范式,包括科学问答(Zheng等人,2025)。然而,部署前沿LLMs用于专业研究工作流可能会引发数据隐私、运营成本和推理延迟等方面的担忧(Pan等人,2025;Cai等人,2024)。因此,小型语言模型(SLMs)在受限环境下的特定领域应用中变得越来越有吸引力(Wang等人,2025;Lu等人,2024)。但是,由于内部知识有限、推理能力较弱,且对噪声上下文的容忍度低于前沿LLMs,SLMs在专业科学问答中往往不可靠(Allen-Zhu与Li,2024;Lee等人,2026;Mallen等人,2023)。这一挑战在新兴研究领域尤为关键,因为这些领域的知识碎片化分布于少数知识源中,且在预训练语料库中未被充分代表。检索增强生成(RAG)(Lewis等人,2021)能够将本地模型基于外部文档进行锚定,但传统的密集检索通常不足以应对科学问答。科学问题可能依赖于材料、程序、条件、观察结果和结论之间的关系,而密集RAG主要通过语义相似性检索文本块。因此,检索到的段落可能广泛相关,但仍可能缺少忠实回答所需的具体证据。基于图的RAG方法通过将信息组织为实体和关系来解决部分问题(Edge等人,2024)。然而,通用知识图谱可能缺乏时效性和细粒度的领域知识(Ding等人,2024),而自动构建的图谱可能引入噪声或模糊关系(Schäfer等人,2024;Zhuang等人,2025)。此外,将科学叙述转换为三元组可能会丢弃推理所需的实验背景、条件限定和定量细节(Pujara等人,2017)。  

我们提出**基于证据的类型化知识图谱(EGT-KG)**框架,旨在改进使用本地SLMs进行科学问答设置中的RAG。我们的方法扩展了基于图的检索,遵循两个原则:第一,图结构应指导检索,而不是替代原始证据;第二,关系结构应具备足够的信息量以辅助检索。因此,我们构建了一个包含证据节点和分类关系的具体化知识图谱,允许系统将关系标签用作检索信号。我们在一个基于30篇论文语料库构建的、以生物聚合物结合土壤复合材料(BSC)为中心的材料问答基准上评估了我们的框架。关于BSC的知识分布在一个紧凑但专业的文献集中,这使其成为小语料库科学问答的一个现实测试案例。我们比较了标准RAG工作流与两个EGT-KG变体:自动生成模式(AS)和专家设计模式(ES)。结果表明,EGT-KG增强的检索在大多数情况下提高了答案质量,尤其是在事实检索问题中。  

本文的核心贡献总结如下:  
第一,为增强受限资源下的RAG,我们提出了一个基于证据的类型化知识图谱框架,将关系分类与具有出处意识的证据节点相结合,用于本地SLMs的科学问答。  
第二,我们在以BSC为中心的基准上对不同工作流进行了受控比较,系统研究了模式粒度与答案质量之间的权衡。  
第三,我们引入了一种S3CRF评估设置,结合多维评分(稳健性、正确性、完整性、简洁性、相关性和流畅性)与检索性能分析,说明了答案质量如何受六个标准、查询扩展、回退率和证据窗口使用情况的影响。

## 2 相关工作  

**检索**。检索增强生成(RAG)是一种广泛采用的方法,通过提供模型参数中未存储的外部知识来改进问答(Lewis等人,2020)。它可以提高事实基础性并减少幻觉,展示了其在医学、教育和法律等专业领域问答中的潜力(Fan等人,2024)。然而,密集向量表示可能导致检索到不相关的文档,可能忽略显式的结构化依赖关系、属性、条件或程序。此外,RAG系统的实施中,计算开销、内存使用和RAG投毒也是关注点(Gupta等人,2024;Greshake等人,2023;Liu等人,2025;Liu等人,2024)。因此,对于需要高精度的敏感任务,需要一个成本高效、稳定且安全的RAG系统。  

**图增强检索**。知识图谱增强的检索方法通过提供语料库的全局描述和分层社区结构来缓解RAG的局限性(Fu等人,2025)。Graph-RAG已证明图结构有助于多跳证据发现,避免在单个语义相似的文本块中丢失目标信息(Procko与Ochoa,2024)。然而,当前的基于图的方法会压缩原始文本,这可能导致信息丢失并进一步降低响应生成的质量。此外,它倾向于使用知识图谱中的大部分三元组。在没有约束的情况下,用户可能面临上下文爆炸和高推理成本(Xiang等人,2025)。Guo等人(2024)提出了LightRAG,集成了一种基于图的索引方法,以提高RAG在信息检索中的效率和理解能力。然而,传递给答案模型的最终段落仍然是由语言模型预处理的,可能引入未经验证的噪声。  

**关系分类**。关系分类是自然语言处理(NLP)中过去十年中一个研究充分的领域。特征模型、核模型、神经网络模型和Transformer编码器等方法被用于为两个命名短语分配语义关系(Kambhatla,2004;Bunescu与Mooney,2005;Socher等人,2012;Huang等人,2020)。然而,这些在关系分类中的应用专注于处理原始文本信息,而非从知识图谱中提取的三元组中的关系节点。Yu等人(2020)提出了一种利用维基百科现有参考材料构建领域知识图谱的关系抽取方法。与其他半监督关系分类方法(Agichtein与Gravano,2000;Ravichandran与Hovy,2002;Pantel与Pennacchiotti,2006)一样,这些分类过程需要从互联网收集额外的语料库。将这些方法应用于我们的框架将引入额外的计算成本,这对本地SLMs来说压力很大。

## 3 方法  
(参考图注)**图1:EGT-KG框架概览**。该框架包括四个主要部分:实体提取、类型化关系分类和具体化知识图谱构建、带重排序的两阶段检索以及最终问答。  
我们提出一个基于证据的类型化知识图谱检索框架,用于在SLMs上进行特定领域问答。该框架旨在提高检索质量,其中最终答案将基于原始证据节点而非预处理信息。我们框架的完整工作流程组织如下:  
在第一阶段,对文档块进行处理,提取带有简短支持证据段的原始三元组。然后,将提取的自由形式关系标签相应地映射到两个预定义的类型化模式(AS和ES)中。这些类型化三元组将用于构建一个具体化知识图谱,其中证据节点由原始证据段转换而来,将三元组与未处理的证据文本和源块链接起来。  
在第二阶段,具体化知识图谱指导查询扩展和候选块检索。然后,重排序后的候选块和证据窗口被传递给答案模型。图1提供了框架结构的概览。  

### 3.1 图三元组提取  
语料库建立在以生物聚合物结合土壤复合材料(BSC)及相关新兴生物聚合物基材料为中心的30篇论文上。它包括9篇直接与评估问题相关的论文、9篇与问题不直接相关的BSC论文、9篇与BSC相似的材料科学论文和3篇通用参考论文。该语料库具有三个独特属性,使其成为一个合适的测试案例。首先,生物聚合物结合土壤复合材料是一种新兴材料。因此,语言模型不太可能通过参数拥有太多关于它们的知识,这可以通过表2中的基线性能得到确认。因此,框架的改进可归因于来自语料库的检索质量。其次,从事这些材料研究的研究人员设计了评估问题,因此这些问题具有实际意义,并涵盖了材料行为、材料性能和最终处理等方面。第三,同样的专业知识制定了一个专家定义的模式,可以在知识图谱中更好地捕获有用信息。附录A.6介绍了该材料,表A.13列出了30篇论文。  

我们按文档结构划分了收集的语料库,保留了章节标题等元数据,得到884个平均长度为1,387个字符的文本块。因此,检索到的证据段可以追溯到其原始文档和本地位置。为确保下游比较不受不同三元组提取过程的影响,我们仅在固定的文本块语料库上执行一次三元组提取,并在两个EGT-KG变体中重用原始输出。  

形式上,令 \( C \) 表示整个文本块集,每个 \( c \in C \) 携带元数据 \( M(c) \),包括块ID、论文ID、来源ID、标题、块长度和原始文本。我们使用 AutoSchemaKG(Chen与Bertozzi,2023)作为三元组提取引擎。具体来说,我们使用AutoSchemaKG的提取工具处理 \( C \) 中的每个块并记录结构信息。作为一个关键特性,提取输出保留了头实体、尾实体、关系以及一个带有定位信息的简短支持证据段,而不是三元组的处理后摘要或描述。因此,对于每个块 \( c \in C \),提取器返回一组原始三元组 \( T \),可表示为:  
\[ T(c) = \{ h, \rho \mid e, t \} \]  
其中 \( h \) 和 \( t \) 分别表示头实体和尾实体,\( \rho \) 是自由形式的关系标签,\( e \) 是一个可追溯到源块的简短证据段。证据段 \( e \) 与关系 \( \rho \) 一起被附加,以转换为用于图构建的证据节点,这使得**证据窗口切片**成为可能,该技术可以在不损失性能的情况下减少22%的上下文。三元组集 \( T \) 将在后续实验中被AS/ES变体共同使用。  

**表1:用于知识图谱构建的类型化关系模式**  
| 模式类型 | 关系组成 |
| :--- | :--- |
| **AS模式(自动生成)** | 涉及或包含;导致或影响;时间关系;逻辑或介词;研究或观察;方法;定义;生产;空间关系 |
| **ES模式(专家设计)** | 导致或影响;定义;制造程序;时间关系;实验方法;逻辑推理;研究观察;实验程序;材料组成;设计程序;生物聚合物特性 |

### 3.2 类型化关系分类  
三元组提取后,我们将关系标签转换为一组语义上有意义的关系类型。我们将每个不同的标签分类为一种模式类型或丢弃它,然后将所得的标签到类型的映射应用于所有具有该标签的三元组,因此相同的标签总是被相同地分类。在此过程中,我们通过修剪噪声、不一致和无关的三元组来限制知识图谱的大小以用于检索。设计这两种类型模式是为了研究关系粒度本身如何改变查询扩展过程以及响应的质量。如表1所示,AS模式包含9种类型,ES模式包含11种类型,后者更细粒度,旨在捕获与BSC研究相关的更多具体关系。  

(此处原文内容截断)

相似文章