生成式本体归纳:使用大型语言模型从文档语料库中进行领域无关的模式发现

arXiv cs.AI 论文

摘要

提出生成式本体归纳(GOI),一种领域无关的框架,利用大型语言模型从文档语料库中归纳结构化本体,在多个领域实现高覆盖率。

arXiv:2607.16201v1 公告类型:新 摘要:本体工程仍然是知识密集型AI系统的关键瓶颈。现有的自动化方法要么依赖预定义模式,要么在狭窄领域内运行,要么产生不适合下游流程的非结构化输出。 我们提出生成式本体归纳(GOI),一种领域无关的框架,它从示例语料库中归纳出生成式蓝图——实体、维度、属性、关系和约束——并将其导出为YAML/JSON中的类型化图(六种节点类型,七种边类型)。我们引入了节点覆盖率评分(Node Coverage Score),这是一种新颖的评估指标,用于衡量生成输出中出现的结构本体节点(类、属性和维度)的比例。 对四种对比本体进行的受控生成验证——一个熟悉的软件服务发票模式、一个自定义职位描述本体、一个保密的疼痛管理临床就诊记录本体,以及一个专业服务合同与工作说明书本体——表明GOI提示的生成在每个案例中覆盖了95-100%的结构主干;一个通用的三字段模板在发票模式上达到了97.8%,但在职位描述本体上下降到52.2%,在疼痛管理本体上为62.2%,在专业服务合同本体上为78.3%。无论文档类型对模型有多熟悉,结构覆盖率都保持不变。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:36

# 基于大语言模型的领域无关文档语料库模式发现 来源:https://arxiv.org/html/2607.16201 11institutetext:Pivots Global 11email:ssergienko@ontology\.live

## 生成式本体归纳:基于大语言模型从文档语料库中发现领域无关的模式

###### 摘要

本体工程仍然是知识密集型AI系统的关键瓶颈。现有的自动化方法要么依赖预定义模式,要么在狭窄领域内运行,要么产生不适合下游流水线的非结构化输出。我们提出了**生成式本体归纳(GOI)**,这是一个领域无关的框架,能从示例语料库中归纳出**生成式蓝图**——实体、维度、属性、关系和约束——并将其作为带类型的图(六种节点类型、七种边类型)导出为YAML/JSON格式。我们引入了**节点覆盖率分数**这一新的评估指标,用于衡量生成输出中出现结构本体节点(类、属性和维度)的比例。在四个对比性本体上的受控生成验证——熟悉的软件服务发票模式、自定义职位描述本体、保密的疼痛管理临床访视记录本体,以及专业服务合同与工作说明书本体——表明,GOI提示生成在每个案例中均覆盖了结构主干的95-100%;一个通用的三字段模板在发票模式上达到97.8%,但在职位描述本体上降至52.2%,在疼痛管理本体上为62.2%,在专业服务合同本体上为78.3%。无论文档类型对模型来说熟悉程度如何,结构覆盖率均保持稳定。

## 1 引言

现代AI系统越来越依赖结构化知识来支撑推理、引导生成,并确保复杂工作流中的一致性。本体——领域内实体、关系和约束的形式化表示——是知识图谱、语义搜索、检索增强生成(RAG)和多智能体编排的骨干。然而,本体工程仍然是一个劳动密集型、专家驱动的过程,造成了根本性的瓶颈:每个新领域、文档类型或应用都需要手动模式设计、迭代优化和领域特定规则。这种**结构差距**在AI领域普遍存在。企业知识管理系统在文档类型演变时难以保持一致的模式。构建领域特定知识图谱的研究团队在抽取开始前要花费数月进行本体设计。承诺自主运行的智能体框架仍需要手工制作的模式来构建其记忆和推理。通用AI的承诺与结构化知识仍然顽固地依赖于特定领域且需要手动管理的现实相冲突。这种差距中一个特别未被充分探索的维度发生在混合专业团队中:研究人员、后端工程师和前端开发人员拥有根本不同的思维模型,并且缺乏共享的、人类可读的产品知识层结构表示。

大语言模型(LLMs)的最新进展已开始解决结构差距。零样本和少样本本体构建流水线表明,LLMs可以在没有大量训练数据的情况下提取实体、归纳分类法并生成模式元素[1 (https://arxiv.org/html/2607.16201#bib.bib1)、2 (https://arxiv.org/html/2607.16201#bib.bib2)、3 (https://arxiv.org/html/2607.16201#bib.bib3)]。基于语料库的方法可以从开放域文本集合中发现层次事件本体[4 (https://arxiv.org/html/2607.16201#bib.bib4)]。交互式系统支持从研究语料库中进行人工引导的模式发现[5 (https://arxiv.org/html/2607.16201#bib.bib5)]。然而,这些方法都有共同的局限性:它们通常需要预定义的本体种子,在受限领域内运行,产生无类型或结构不一致的输出,缺乏稳健的跨文档规范化,并为非专家用户提供有限的路径来可视化、验证和导出发现的模式。

本文介绍了**生成式本体归纳(GOI)**,这是一个旨在通过四项核心贡献来填补这些差距的框架:首先,我们形式化了**生成式本体**的概念——定义文档类并能够生成新实例的结构模式——并将其与描述性实体提取区分开来。GOI通过分析同一文档类型的多个示例,识别出支配该类别的重复出现的维度、属性、关系和约束,从而逆向工程出这个生成式蓝图。其次,我们提出了一个完整的技术架构,包括通用的带类型图表示(六种节点类型、七种边类型)、一个引出生成式模式而非逐文档实体的多文档提示、一个基于类型的自动布局算法、多格式导入(OWL、RDF、YAML、JSON、Markdown),以及双视图YAML/JSON导出,其**提示就绪**的markdown渲染实现了“本体驱动AI流水线”的论点,允许直接注入RAG和智能体提示,无需图遍历。第三,我们引入了**节点覆盖率分数**这一新的评估指标,用于衡量在归纳出的本体中,出现在由该本体生成的输出中的结构节点(类、属性和维度)的比例——这是一个令牌级指标无法捕捉的直接结构完整性信号。第四,我们识别并解决了实际中的**跨职能团队沟通差距**:混合专业AI产品团队缺乏共享的、可读的结构化工件,而GOI的可视化、交互式、可导出模式正是这一共同的工件,定位GOI既是技术贡献也是**组织原语**。在四个对比性本体(涵盖B2B开票、人才招聘、医疗临床文档和专业服务合同)上的受控生成验证展示了GOI的结构强制覆盖率;我们也讨论了局限性,包括LLM一致性、令牌窗口约束、缺乏正式的OWL公理以及幻觉风险。本文其余部分的结构如下:第2节 (https://arxiv.org/html/2607.16201#S2)回顾相关工作;第3节 (https://arxiv.org/html/2607.16201#S3)详细介绍GOI框架;第4节 (https://arxiv.org/html/2607.16201#S4)介绍节点覆盖率分数;第5节 (https://arxiv.org/html/2607.16201#S5)展示实验结果;第6节 (https://arxiv.org/html/2607.16201#S6)讨论启示和局限性;第7节 (https://arxiv.org/html/2607.16201#S7)总结。

## 2 相关工作

### 2.1 零样本和少样本模式归纳

基于LLM的方法现在能够在无需大量监督的情况下生成跨域模式和语料级本体。基于语料库的开放归纳使用远距离监督和语料级信号来归纳层次事件本体,无需直接监督[4 (https://arxiv.org/html/2607.16201#bib.bib4)]。源的零样本生成合成或检索伪文档以揭示潜在模式结构,然后以零样本方式归纳模式元素[2 (https://arxiv.org/html/2607.16201#bib.bib2)]。不假设预定义模式的从文本到模式流水线先进行提取,然后事后定义并规范化模式元素,实现领域无关的操作[6 (https://arxiv.org/html/2607.16201#bib.bib6)]。纯提示竞争的

相似文章

说科学的语言:迈向面向自然科学的通用生成基础模型

Hugging Face Daily Papers

LOGOS是一个科学生成语言模型,它将多种科学对象及其空间交互编码为令牌序列,从而在自然科学的各类任务中实现统一的自主回归框架。1B、3B和8B参数的模型展现出性能随规模一致提升,并已发布以促进研究。

用于模式约束临床信息抽取的检索增强型大语言模型

arXiv cs.CL

本文提出了一种模块化的检索增强生成(RAG)流水线,用于从护理人员与患者的对话转录中提取结构化临床观察结果,采用模式约束提示和第二遍审核,基于Llama和GPT骨干模型,取得了80.36%的F1分数。

从孤立任务到结构化能力:大型语言模型的多层分类法

arXiv cs.CL

本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。

大型语言模型的高效引导生成

Papers with Code Trending

本文介绍了一种高效的方法,利用正则表达式和上下文无关文法引导LLM文本生成,开销极小,并在开源Python库Outlines中实现。