通过LLM提取的语义实体三元组图监测变革性技术融合

arXiv cs.CL 论文

摘要

本文提出了一种新颖的数据驱动流程,利用大语言模型(LLMs)从非结构化文本中提取语义三元组,并构建知识图谱以监测技术融合。该方法在arXiv预印本和美国专利商标局(USPTO)专利申请上得到验证,展示了其在技术预测中的可扩展性。

arXiv:2510.25370v2 公告类型:替换 摘要:预测变革性技术仍然是一项关键但具有挑战性的任务,尤其是在信息和通信技术(ICT)等快速发展的领域。传统的基于专家的方法难以跟上短创新周期和模糊的早期术语。在这项工作中,我们提出了一种新颖的数据驱动流程,通过识别技术融合模式来监测变革性技术的出现。 我们的方法利用大语言模型(LLMs)的进展,从非结构化文本中提取语义三元组,并构建大规模的技术相关实体和关系图。我们引入了一种新方法,用于对语义相似的技术术语进行分组(名词钉扎),并开发基于图的指标来检测融合信号。该流程包括多阶段过滤、领域特定关键词聚类以及主题共现的时间趋势分析。 我们在两个互补数据集上验证了我们的方法:278,625篇arXiv预印本(2017-2024),用于捕捉早期科学信号;以及9,793件USPTO专利申请(2018-2024),用于跟踪下游商业发展。我们的结果表明,所提出的流程能够识别既有的和新出现的融合模式,为基于全文分析的技术预测提供了一个可扩展且通用的框架。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:54

# 通过LLM提取的语义实体三元组图监测变革性技术融合
**来源:** https://arxiv.org/html/2510.25370

\[ orcid=0009-0008-6801-6160\]\\cormark\[1\] 1\]organization=创业与管理研究所, HES-SO, city=锡永, country=瑞士 \[orcid=0000-0003-0429-8644\] \[orcid=0000-0003-0429-8644\] \[orcid=0000-0001-6471-772X\] \[orcid=0000-0002-1002-057X\] \[\] 2\]organization=网络防务校区, armasuisse, 科学与技术, city=图恩, country=瑞士 \\cortext \[cor1\]通讯作者:Andrei Kucharavy \\ Dimitri Percia David \\ Alain Mermoud \\ Julian Jang-Jaccard \\ Nathan Monnet

###### 摘要

预测变革性技术仍然是一项关键但充满挑战的任务,尤其是在信息与通信技术(ICTs)等快速发展的领域。传统的专家驱动方法难以跟上短创新周期和早期模糊术语的节奏。在本文中,我们提出了一种新颖的数据驱动管道,通过识别技术融合模式来监测变革性技术的出现。我们的方法利用大语言模型(LLMs)的进展,从非结构化文本中提取语义三元组,并构建一个大规模的技术相关实体与关系图。我们引入了一种新方法来分组语义相似的技术术语(*名词装订*),并开发了基于图的指标来检测融合信号。该管道包括多阶段过滤、领域特定关键词聚类以及主题共现的时间趋势分析。我们在两个互补数据集上验证了我们的方法:278,625篇arXiv预印本(2017–2024)用于捕捉早期科学信号,以及9,793份USPTO专利申请(2018–2024)用于追踪下游商业发展。结果表明,所提出的管道能够识别既定的和新兴的融合模式,为基于全文分析的技术预测提供了一个可扩展且通用的框架。

###### 关键词:文献计量学、实体提取、机器学习、技术预测、大语言模型

## 1 引言

准确预测技术颠覆对于寻求保持竞争力和韧性的组织至关重要。虽然增量式创新通常可以在现有规划框架内预测和管理,但**变革性技术**会引入范式转变,重塑整个领域,并常常溢出到相邻行业\[Schumpeter1949, Ettlie1984OrganizationSA\]。由于这类技术挑战既有的概念框架,它们本质上是难以预测的\[Christensen1997InnovatorsDilemma\]。尽管存在这些挑战,预测变革的战略重要性长期以来一直推动着预测方法的发展,尤其是自冷战时期以来\[TF1967Jantsch\]。诸如德尔菲法\[dalkey1969experimental\]和S曲线替代分析\[fisher1971simple\]等开创性方法激发了数十年的方法改进\[national2010persistent, calleja\_sanz2020, technology2004technology\]。然而,这些经典方法难以跟上信息与通信技术(ICTs)快速创新周期的步伐。例如,“大语言模型”(LLMs)一词于2019年出现,而在短短三年内,ChatGPT已成为全球公认的应用\[kucharavy2024deep\]。在这种背景下,经典方法对专家小组和历史数据的依赖使其不适用\[daim\_digital\_2022\]。因此,ICT预测越来越多地转向数据驱动方法\[daim\_anticipating\_2016\],其中科学计量学成为一种有前景的方法\[perciadavid2023\]。然而,即使是数据驱动的方法在早期识别变革性技术方面也面临困难,部分原因是初始阶段缺乏稳定的术语和定义明确的应用领域。继续以LLMs为例,即使在ChatGPT发布一年后,像OpenAlex这样的主要文献计量平台仍然缺乏许多基础子技术的本体术语\[VelezEstevez2023NewTI, SinghChawla2022MassiveOI, würsch2023llms\]。虽然würsch2023llms表明从科学文本中提取与技术相关的名词是可行的,但该过程仍然嘈杂,难以有效用于大规模监测和预测。

在本文中,我们提出了一种替代方法,利用大语言模型(LLMs)的最新进展,实现以技术概念为中心的语义三元组的可扩展提取和分析\[sternfeld\_eeke\]。我们关注**技术融合**,将其作为变革潜力的早期指标。该概念最初由rosenberg1963在其对机床行业的研究中提出,融合描述了以前独立的科学和技术领域如何开始依赖共享的技术和知识基础,从而模糊了它们之间的边界。变革性技术常常出现在这些重叠点,因此追踪不同领域开始交汇的位置提供了颠覆潜力的早期信号\[Dosi1982TechnologicalPA, Li2024ANI\]。

我们的主要贡献如下:

1.  \(i\) 我们引入了一个无偏的管道,用于提取涉及技术指定名词的语义三元组。
2.  \(ii\) 我们提出了一种新颖的句法相似性识别技术——称为**名词装订**——用于对相关技术术语进行分组。
3.  \(iii\) 我们实现了技术组件的粗粒度分解,以提高可解释性。
4.  \(iv\) 我们开发了一种基于图的方法来检测和追踪随时间变化的技术融合。

这些元素被集成到一个统一的管道中,用于通过融合模式识别变革性技术的出现。我们通过一个关于LLMs的案例研究来展示该管道的实用性,将其应用于一个包含278,625篇arXiv预印本(2017–2024)和9,793份USPTO专利申请(2018–2024)的大型语料库。

本文的其余部分结构如下:第2节(https://arxiv.org/html/2510.25370#S2)回顾相关文献。第3节(https://arxiv.org/html/2510.25370#S3)描述数据来源。第4节(https://arxiv.org/html/2510.25370#S4)概述方法论。第5节(https://arxiv.org/html/2510.25370#S5)展示结果。最后,第6节(https://arxiv.org/html/2510.25370#S6)总结本文并讨论未来研究方向。

## 2 相关工作

在本节中,我们将讨论三个方面的先前研究。首先,讨论文献计量学的主要主题和趋势。然后,讨论关于声明和三元组提取的相关工作,重点介绍那些利用机器学习技术的方法。最后,讨论拓扑分析在技术预测中的使用。

### 2.1 文献计量学

作为技术预测的一种方法,文献计量学利用记录信息(主要是科学书籍、文章和专利)的定性和定量分析。对书面作品的系统研究由来已久,*文献计量学*一词在20世纪初被创造出来。最广泛认可的经典文献计量技术之一是引文分析,它研究学术出版物之间的引用模式\[smith1981citation\]。早期的引文分析主要关注引用次数和共引网络。然而,随着先进网络分析方法的发展和计算能力的提高,对引文网络进行更复杂的分析成为可能。此类方法现在被应用于一系列领域进行技术预测。例如,qiu2022对机器人专利进行了引文网络分析,以识别创新的关键路径。类似地,LI2020分析了纳米发电机技术领域的专利和学术论文,提供了科学技术进步更综合的视角。

传统上,文献计量研究受到结构化元数据的限制。然而,自然语言处理(NLP)的最新进展为更深入地分析全文文档开辟了新途径。诸如n-gram分析\[michel2011quantitative\]、隐含狄利克雷分配(LDA)\[LDA2003\]、语义嵌入\[Mikolov2013DistributedRO\]、深度神经语言模型编码\[Context2Vec2016\]以及最近的大语言模型(LLMs)\[Beltagy2019SciBERT\]等技术,极大地扩展了文献计量学的研究范围。开放获取和预印本平台(如arXiv¹、medXiv²、bioRxiv³和PubMed Central⁴)提供的全文文档日益增多,进一步支持了这些发展。例如,perciadavid2023使用LLM生成的句子嵌入分析了arXiv上的计算机科学预印本,以提取作者情感并将其与随时间变化的技术安全性联系起来。类似地,Sandu等人(2024)在社会媒体文本挖掘领域构建了一个合作网络,并使用n-gram分析识别了重复出现的研究主题。

在与基于文献的文献计量学发展的同时,人们对专利分析的关注也日益增加,因为专利提供了丰富的技术细节和与商业应用的紧密联系。虽然学术论文通常代表早期的科学探索,但专利往往反映了将这些发现转化为可部署技术的努力。重要的是,欧洲和美国专利都遵循合作专利分类(CPC)系统,使得跨司法管辖区的系统分析成为可能。例如,KIM2017228基于CPC代码对专利进行聚类,并应用引文和权利要求分析来预测新兴技术。类似地,you2017使用Bass和ARIMA模型分析光发生器技术专利,以识别有前景的创新轨迹。通过整合来自学术出版物和专利的文献计量学见解,研究人员能够更全面地了解技术发展——从基础研究到商业实现\[LI2020, ADAMUTHE2019181\]。

### 2.2 声明和三元组提取

语义三元组,也称为RDF(资源描述框架)三元组,是语义网技术中知识提取和组织的基本表示形式。一个语义三元组由三个组件组成:主语、谓语和宾语,用于以机器可读的格式表示事实陈述\[berners2001rdf\]。这种结构是知识图的基础,使系统能够以可查询和扩展的方式存储和推理事实\[Hogan\_2021\]。在从科学文献中提取声明的背景下,我们的目标是提取可以表示为语义三元组的声明,重点关注技术断言和关系。通过遵循语义三元组标准,这些声明被组织成无根、无偏的知识图,有助于下游任务,如模式挖掘和知识发现。

先前的声明提取方法大致可分为启发式方法和机器学习方法。启发式方法,例如jansen2017提出的方法,不需要训练数据且计算成本低。然而,它们在捕捉复杂声明方面能力有限。jansen2017通过基于模式匹配、词频和句子长度对句子进行评分来提取核心声明。然而,他们仅能在29%的情况下成功地将声明重写为所需的AIDA(原子的、独立的、陈述性的和绝对的)标准。相比之下,机器学习方法,如li2021提出的使用BiLSTM进行句子分类的方法,提供了更好的性能,以超过0.8的F1分数对句子进行分类。然而,这些模型需要领域特定的监督训练数据,并且需要定期更新。

大多数三元组提取模型依赖于监督训练,例如RECON和sPERT,它们需要标记的训练数据\[bastos2021, eberts2020\]。这些方法受限于可用训练数据和预定义关系的依赖性。一个长期存在的研究方向是开放信息提取(OIE),由openie首次提出,作为无模式、独立于领域的从文本中提取关系元组的方法。早期的OIE系统依赖于浅层句法模式(TextRunner\[textrunner\]、ReVerb\[reverb\]),后来融入了更深层的语言特征(OLLIE\[ollie\]、ClausIE\[clausie\])和基于从句的推理,其中Stanford OpenIE\[stanfordie\]是广泛使用的代表。这几代OIE的共同局限性在于,无模式提取倾向于覆盖而非精确度,导致系统过度生成表面级或无用的元组\[liu2022\],这促使了约束提取而不退回到完全监督的方法。ottersen2024通过使用语言模型在预定义的关系集内提取三元组来解决这个问题,提高了精确度,但要求用户指定所有可能的关系。

最近,提取转向了*生成式*公式,在这种公式中,语言模型直接以文本形式输出三元组。REBEL\[rebel\]将关系提取视为端到端的序列生成,而UIE\[uie\]通过单一文本到结构的模式统一了多个提取任务。通过指令微调的LLMs,这一方向进一步转向了由提示驱动而非任务特定训练的小样本和零样本提取。ChatIE\[chatie\]将零样本提取分解为多轮问答对话,而GPT-RE\[gptre\]使用上下文内示范来改进关系提取。一个并行的问题是强制有效输出结构:约束或结构化解码限制生成,使输出符合目标格式\[uie, li2024\]。对于知识图构建,EDC\[edc\]将开放提取与模式定义和规范化相结合,表明LLMs可以在不进行参数调整的情况下生成高质量的三元组。LLM提取的适用性取决于领域;würsch2023llms报告称,LLMs从网络安全文献中提取的知识实体匹配不佳,这强调了生成式提取必须与验证和过滤结合。关于这种生成式IE范式的全面综述,包括提示设计、零样本学习和约束解码,由xu2023提供。

我们的工作使用LLMs的小样本提示,从全文科学文章和专利中进行无模式三元组提取,从而保留了OIE的领域独立性,同时利用LLMs的上下文能力来抑制其典型的过度生成。与在句子级别基准上评估的生成式IE方法\[rebel, uie, chatie, gptre, xu2023\]不同,我们在数十万个文档的规模上应用开放提取,以构建大规模、无偏的技术图。

### 2.3 用于技术预测的拓扑分析

传统的共词分析技术主要依赖共现频率来检测术语之间的关联\[callon1983coword\]。然而,较新的方法强调复杂图中实体的连通性和中心性,以识别技术融合区域和新兴创新集群。这些方法的核心是**知识图**,通过从技术资料中提取关键实体来构建。

相似文章