一种面向异构文档知识图谱构建的本体引导、去重感知抽取层
摘要
本文介绍了一个生产级抽取层,利用本地托管的经过调优的Qwen大语言模型,将异构文档转换为与本体对齐的知识图谱,并采用本体引导的提示、多阶段去重和基于嵌入的解析。在情报语料上的评估表明,搜索召回率从约70%提升到95%,且没有错误合并。
arXiv:2607.28662v1 公告类型:新
摘要:大型语言模型能够流畅地从非结构化文档中抽取实体和关系,但结果不一致:类型词汇在不同文档间断裂,同一个人以多种姓名变体出现,关系重复,而同名的不同个体则有被静默混淆的风险。本文介绍了一个生产级抽取层的设计、实现和实证改进,该层将实时文档流转换为与正式本体对齐的经过验证的知识图谱。系统消费来自Kafka的文档元数据,将通过PDF、电子表格、Office和图像内容的路由到为每种格式构建的处理程序,并使用本地托管的、基于本体调优的Qwen3.5-9B模型分两遍抽取实体和关系。其显著组件是本体引导的抽取:通过嵌入相似度从图数据库中实时检索经过策划的本体相关切片,并将其注入抽取提示中,与静态领域切片相比,目录开销减少了约94%。抽取结果随后通过五个阶段的精炼流水线:确定性清洗、跨块合并、第二遍关系抽取、六种无需模型推理的去重算法,以及一个嵌入解析子系统,其冲突防护机制不允许任何相似度分数覆盖。在情报语料上的评估将搜索召回率从约70%提升到95%,且没有错误合并,并纠正了七类静默质量缺陷,从将源文本截断单个字符的bug到系统性地重复带有标题前缀的实体。
查看缓存全文
缓存时间: 2026/08/03 07:29
# 1 引言 来源:https://arxiv.org/html/2607.28662 一种面向异构文档知识图谱构建的本体引导、去重感知抽取层 Vaibhav Dangaich Kevin Lewis Kundeshwar Pundalik [email protected] [email protected] [email protected] 摘要 > 大型语言模型从非结构化文档中提取实体和关系时流畅但缺乏一致性:类型词汇在不同文档间割裂、同一人物以多种姓名变体出现、关系重复,而共享姓名的不同个体则有被静默合并的风险。本文介绍了一个生产级抽取层的设计、实现和经验性改进,该层将实时文档流转换为对齐正式本体的、经过验证的知识图谱。系统从 Kafka 消费文档元数据,将 PDF、电子表格、Office 和图像内容路由到为每种格式构建的处理程序中,并使用本地托管的、基于本体微调的 Qwen3.5-9B 模型,分两遍提取实体和关系。其显著组件是本体引导抽取:通过嵌入相似度从图数据库实时检索精选本体的相关切片,并将其注入抽取提示,相对于静态领域切片,目录开销减少了约 94%。抽取结果随后通过五阶段精炼流水线:确定性清洗、跨分块合并、第二遍关系提取、六个无需模型推理的去重算法,以及一个任何相似度分数都无法覆盖其冲突防护的嵌入消解子系统。在情报语料上的评估将搜索召回率从约 70% 提升到 95%,且没有错误合并,并纠正了七类静默质量缺陷,从截断源文本一个字符的 bug,到携带标题前缀实体的系统性重复。 关键词:本体引导抽取、知识图谱构建、实体消解、检索增强生成、大型语言模型 本文介绍了一个抽取系统,它将实时异构文档流转换为经过验证、对齐本体的知识图谱。该系统作为实时 Kafka 消费者[1 (https://arxiv.org/html/2607.28662#bib.bib1)]运行,从上游摄取服务接收文档元数据,从磁盘检索对应的原始文件,并采用本地托管的大型语言模型(LLM)——通过 vLLM[2 (https://arxiv.org/html/2607.28662#bib.bib2)]部署在 GCP 虚拟机上,并提供 OpenAI 兼容 API——从非结构化文本、PDF 和图像内容中提取结构化实体和关系。抽取模型是 Konect-U/Qwen3.5-9B-AWQ-4bit-Ontology,一个 4 位 AWQ 量化、经本体微调的 Qwen3.5-9B 模型;本体检索(第 4 节 (https://arxiv.org/html/2607.28662#S4))和基于嵌入的消解(第 6.5 节 (https://arxiv.org/html/2607.28662#S6.SS5))使用配套的嵌入模型 Konect-U/Qwen3-Embedding-0.6B-Ontology。该方法建立在越来越多证明 LLM 在知识图谱构建中有效性的工作之上[3 (https://arxiv.org/html/2607.28662#bib.bib3),4 (https://arxiv.org/html/2607.28662#bib.bib4)]。系统通过环境配置支持在这些本地自托管模型和云托管模型之间切换提供商,无需更改代码即可实现无缝回退。输出是符合严格 Pydantic 强制模式[5 (https://arxiv.org/html/2607.28662#bib.bib5)]的经过验证的 JSON 知识图谱,并附带实体去重元数据。该输出既持久化到终端以供操作人员查看,也以独立 JSON 文件形式持久化到指定输出目录,供下游图数据库摄取。系统使用 Python 实现。早期迭代由三个单体文件组成(consumer.py、一个约 1,860 行的 model.py 和 str\_op\_schema.py);随着新文档格式和本体接地阶段的加入,该设计变得难以扩展,且单一的 model.py 将提示构造、分块、多阶段抽取、重试逻辑和去重纠缠在同一命名空间中。因此,当前系统被重构为模块化包(src/extraction/),包含约五十个按职责分组的专注模块: - • consumer/(kafka.py、record\_processor.py、output.py):Kafka 消费、消息标准化、基于 MIME/扩展名的路由、有界并发工作池和顺序化输出缓冲。 - • core/(entity\_extractor.py、relationship\_extractor.py、media\_extractor.py、plain\_text.py、prompts.py):两阶段 LLM 抽取流水线、提示构造和关系第二遍质量防护。 - • ontology/(catalog\_injection.py、graph\_retriever.py、context\_composer.py):*本体引导抽取*:从 Neo4j 本体图实时检索相关本体切片,并将其注入抽取提示(第 4 节 (https://arxiv.org/html/2607.28662#S4))。 - • pdf/、xlsx/、docx/、pptx/、vision/:针对原生数字和扫描 PDF、电子表格、Word、PowerPoint 和图像的逐格式抽取处理程序(第 5 节 (https://arxiv.org/html/2607.28662#S5))。 - • dedup/(alias\_resolver.py、name\_similarity.py、phonetic.py、candidates.py、merger.py):基于规则的去重算法,现已增强音标匹配(Double Metaphone、Soundex、Jaro–Winkler)。 - • resolution/(engine.py、blocking.py、scorer.py、embedder.py、decision.py、store.py):基于嵌入的*实体消解*子系统,包含 FAISS 阻塞、多信号评分和阈值决策引擎(第 6.5 节 (https://arxiv.org/html/2607.28662#S6.SS5))。 - • parsing/(retry.py、json\_parser.py、result\_finalizer.py、entity\_type.py、relationship\_normalizer.py)和 schemas/(extraction.py、disambiguation.py):严格重试解析、结果终结化,以及对每个抽取结果强制结构保证的 Pydantic 数据模型。 - • providers/(local.py、gemini.py、base.py):可插拔 LLM 后端,支持环境驱动的提供商切换、每请求超时和重试预算。 Kafka 流 → 摄取对象 → 格式路由器 → S1 抽取 → S2 清洗 → S3 合并 → S4 第二遍 → S5 丰富 → 五阶段抽取流水线 → 经过验证的 JSON 知识图谱 ↑ Neo4j 本体图 → 实时向量检索 → Qwen3.5-9B(vLLM)/ Gemini → 提供商可切换 图 1:抽取层的高级架构。Kafka 消费者按 MIME 类型将每个文档路由到五阶段抽取流水线(详见 图 15 (https://arxiv.org/html/2607.28662#S7.F15));本体图在阶段 1 引导类型词汇;LLM 提供商可在本地 vLLM 端点和 Gemini 之间切换;最终输出是经过验证的 JSON 知识图谱。 ### 1.1 贡献 本文有四个贡献。第一,*本体引导抽取*(第 4 节 (https://arxiv.org/html/2607.28662#S4))通过类定义的向量搜索,从图数据库实时检索精选本体的相关切片,并将其注入抽取提示,使模型生成严格来自正式模式的类型而非自由形式标签,这与检索增强生成的精神一致[6 (https://arxiv.org/html/2607.28662#bib.bib6)]。第二,*多格式处理*(第 5 节 (https://arxiv.org/html/2607.28662#S5))将抽取从 PDF 和纯文本扩展到电子表格、Word、PowerPoint 和图像,对表格数据采用确定性的“规划后执行”策略,并使用六信号逐页分类器将各个 PDF 页面路由到文本、OCR 或跳过路径。第三,*分层去重子系统*(第 6 节 (https://arxiv.org/html/2607.28662#S6))将六个零推理基于规则的算法与基于嵌入的消解阶段配对,后者的硬冲突防护任何相似度分数都无法覆盖。第四,*实证评估*(第 8.1 节 (https://arxiv.org/html/2607.28662#S8.SS1)–8.2 节 (https://arxiv.org/html/2607.28662#S8.SS2))在情报领域语料上量化了这些机制的影响,并记录了它们暴露和纠正的上游质量缺陷。 实体去重系统解决了知识图谱构建中的一个关键缺口:处理姓名变体并防止错误实体合并。这一挑战已在实体消解文献中广泛研究[7 (https://arxiv.org/html/2607.28662#bib.bib7),8 (https://arxiv.org/html/2607.28662#bib.bib8)],但现有方法通常需要专门的训练数据或预链接的知识库。我们的贡献是一个零开销、基于规则的去重流水线,作为 LLM 抽取实体的后处理层运行。 ##### 初始挑战。在本次增强之前,系统表现出若干局限性: - • 抽取实体仅有一个别名(文本中出现的基名)。 - • 拼写变体(如“John Doe”与“Jon Doe”)被实例化为完全不同的实体。 - • 系统缺乏检测可能代表重复的相似名称实体的能力。 - • 因此,由于这些名称变体,图搜索遗漏了约四分之一的合法实体匹配。 - • 反过来,在不同上下文中出现的相同名称有可能被错误合并为单个实体(例如,Khamsin 研究所的燃烧科学家“Elena Petrov”和 Vektor Signal 的恶意软件分析师“Elena Petrova”可能被错误合并,尽管她们是不同个体)。 ##### 应用解决方案。一个六阶段抽取后增强流水线(详见第 6.2 节 (https://arxiv.org/html/2607.28662#S6.SS2))解决了这些局限性:算法别名扩展至每个实体五个以上变体、模糊源文本挖掘拼写变体[9 (https://arxiv.org/html/2607.28662#bib.bib9)]、语言感知相似度评分[10 (https://arxiv.org/html/2607.28662#bib.bib10)]、在任何合并前匹配角色、组织和地点的上下文验证重复检测、保留限定词的关系去重,以及顺序化并行输出缓冲。 ##### 结果。该方法将搜索召回率从约 70% 提升到 95%,同时保持零误报率。 ## 2 相关工作 ##### 用于知识图谱构建的 LLM。自 Transformer 架构[11 (https://arxiv.org/html/2607.28662#bib.bib11)]引入以及大型模型少样本提示[12 (https://arxiv.org/html/2607.28662#bib.bib12)]出现以来,越来越多的工作表明大型语言模型可以直接从文本填充知识图谱[3 (https://arxiv.org/html/2607.28662#bib.bib3),4 (https://arxiv.org/html/2607.28662#bib.bib4)],无论是通过零样本提示[13 (https://arxiv.org/html/2607.28662#bib.bib13)]、NER 风格提示[14 (https://arxiv.org/html/2607.28662#bib.bib14)]、生成式端到端关系抽取[15 (https://arxiv.org/html/2607.28662#bib.bib15)],还是重新审视的关系抽取[16 (https://arxiv.org/html/2607.28662#bib.bib16)]。这些研究一致报告了我们的系统在生产中遇到的失败模式:碎片化的类型词汇、幻觉关系,以及偏向实体描述而非关系抽取的倾向。我们的贡献不是新的抽取模型,而是一个在每一阶段约束和修复现成模型输出的架构。 ##### 本体接地与检索增强。本体是共享概念化的形式化规范[17 (https://arxiv.org/html/2607.28662#bib.bib17)];在这种模式中接地抽取是保持输出类型词汇一致性的关键。检索增强生成[6 (https://arxiv.org/html/2607.28662#bib.bib6)]将生成条件建立在检索到的自由文本上;我们将同样的原则应用于正式类层次结构,通过嵌入相似性检索相关本体切片并将其注入抽取提示。我们对通用类施加的中心性惩罚将 PageRank[18 (https://arxiv.org/html/2607.28662#bib.bib18)]适应到模式检索。据我们所知,将实时图检索、子类扩展和谓词全文搜索用于抽取时接地,这种组合此前未见描述。 ##### 实体消解与姓名匹配。实体消解可以追溯到 Fellegi 和 Sunter 的概率记录链接理论[19 (https://arxiv.org/html/2607.28662#bib.bib19)],此后已成熟为一个广泛领域[20 (https://arxiv.org/html/2607.28662#bib.bib20),7 (https://arxiv.org/html/2607.28662#bib.bib7)],从阻塞综述[8 (https://arxiv.org/html/2607.28662#bib.bib8)]到 Magellan 的学习匹配器[21 (https://arxiv.org/html/2607.28662#bib.bib21)],再到基于 Transformer 的匹配器[22 (https://arxiv.org/html/2607.28662#bib.bib22)]。经典姓名匹配工作涵盖人名缩写[23 (https://arxiv.org/html/2607.28662#bib.bib23)]、字符串度量比较[24 (https://arxiv.org/html/2607.28662#bib.bib24),25 (https://arxiv.org/html/2607.28662#bib.bib25)]、我们的评分器所依赖的 Jaro–Winkler 度量[26 (https://arxiv.org/html/2607.28662#bib.bib26)]、语音编码[27 (https://arxiv.org/html/2607.28662#bib.bib27)]和跨语言匹配[10 (https://arxiv.org/html/2607.28662#bib.bib10),28 (https://arxiv.org/html/2607.28662#bib.bib28)];实体链接和消歧提供了上下文证据原则[29 (https://arxiv.org/html/2607.28662#bib.bib29),30 (https://arxiv.org/html/2607.28662#bib.bib30)]。基于嵌入的层遵循现代密集句子表示用于语义相似性的实践[31 (https://arxiv.org/html/2607.28662#bib.bib31)]。与学习型匹配器不同,我们的六个基于规则的算法不需要训练数据且以零推理成本运行,而基于嵌入的层采用标准的阻塞—匹配流水线,并带有任何相似度分数都无法覆盖的硬冲突防护。 ## 3 系统概述 抽取层作为实时 Kafka 消费者运行,从上游摄取阶段接收文档元数据,解析基于文件的记录(指向磁盘上文件的元数据)或数据库内嵌记录(内联全文),并在抽取前将两者标准化为单一内部表示。消费者配置、会话超时调优和并行性设置是运维问题而非科学问题,收集在附录 B (https://arxiv.org/html/2607.28662#A2) 中。以下小节描述抽取策略本身:两阶段提示设计、保护关系遍次的质量门控、分块方案和错误恢复行为。 ### 3.1 两阶段抽取流水线 LLM 倾向于优先处理实体描述而非关系[16 (https://arxiv.org/html/2607.28662#bib.bib16)],因此抽取被拆分为两次调用:阶段 1 在零样本范式[13 (https://arxiv.org/html/2607.28662#bib.bib13),14 (https://arxiv.org/html/2607.28662#bib.bib14)]下提取实体和初步关系;阶段 2 重新阅读文本以及抽取的实体目录,并仅关注关系,包括时间和上下文限定词。输出通过保留限定词的去重(图 11 (https://arxiv.org/html/2607.28662#S6.F11))进行整合,之后阶段 3(抽取后增强,图 7 (https://arxiv.org/html/2607.28662#S6.F7)–10 (https://arxiv.org/html/2607.28662#S6.F10))精炼实体数据。 ### 3.2 质量门控的关系第二遍 基于比率的跳过
相似文章
我构建了一个开源知识图谱管道,结合混合检索以改进LLM多跳推理 [P]
一个开源的全栈管道,从原始文本构建知识图谱,使用混合搜索(密集向量+稀疏+图遍历)解决LLM中的多跳推理问题,并通过倒数排名融合和交叉编码器对结果进行重排序。
@pauliusztin_: 两个月前,我开始使用知识图谱构建统一记忆层。以下是我最常被问到的问题……
本帖子讨论了使用知识图谱构建统一记忆层的最佳实践,强调将实体解析(命名)与去重(身份)分离,以避免图污染。还重点介绍了使用像 PrefectIO 这样的编排工具,通过检查点和缓存来管理昂贵的 LLM 提取管道。
@hxiao: 我不是知识图谱的粉丝,但最近出于一个令人惊讶的原因开始更频繁地使用它们:构建非平凡的…
作者描述使用基于Qwen模型构建的知识图谱提取器来生成具有挑战性的多跳问答对,用于评估智能体搜索系统。
宁迟勿早:基于本体后提取校正的神经符号知识图谱构建
本文提出了一种神经符号框架,通过将一致性校正推迟到后提取阶段,从文本中构建基于本体的知识图谱,从而减少令牌使用,同时提高知识图谱的一致性并保持问答性能。
yifanfeng97/Hyper-Extract
Hyper-Extract 是一个开源命令行工具,利用大语言模型(LLMs)从非结构化文档中提取结构化知识,支持多种输出格式,如知识图谱和超图。