基于图卷积网络与信息融合的科技专利实体对齐方法
摘要
提出了一种基于图卷积网络和BERT的科技专利实体对齐方法,融合结构信息与属性信息,在基准数据集上取得了更好的性能。
arXiv:2311.00300v2 公告类型:替换
摘要:科技专利的实体对齐旨在链接不同科技专利数据源知识图谱中的等效实体。大多数实体对齐方法仅使用图神经网络获取图结构嵌入,或利用属性文本描述获取语义表示,忽略了科技专利中多信息融合的过程。为了利用图结构以及专利实体的名称、描述和属性等辅助信息,本文提出了一种基于图卷积网络的科技专利信息融合实体对齐方法。通过图卷积网络和BERT模型,对科技专利知识图谱的结构信息和实体属性信息进行嵌入表示,实现多信息融合,从而提升实体对齐的性能。在三个基准数据集上的实验表明,所提方法在Hits@$K$评估指标上优于现有方法。
查看缓存全文
缓存时间: 2026/07/13 08:00
# 基于图卷积网络与信息融合的科技专利实体对齐方法 Source: https://arxiv.org/html/2311.00300 Runze Fang北京邮电大学计算机学院(国家示范性软件学院)智能通信软件与多媒体北京市重点实验室北京中国Yawen Liwarmly0716@126\.com (https://arxiv.org/html/2311.00300v2/mailto:[email protected])北京邮电大学经济管理学院北京中国,Yingxia Shao北京邮电大学计算机学院(国家示范性软件学院)智能通信软件与多媒体北京市重点实验室北京中国,Zeli Guan北京邮电大学计算机学院(国家示范性软件学院)智能通信软件与多媒体北京市重点实验室北京中国andZhe Xue北京邮电大学计算机学院(国家示范性软件学院)智能通信软件与多媒体北京市重点实验室北京中国 ###### 摘要 科技专利的实体对齐旨在链接不同科技专利数据源知识图谱中的等价实体。大多数实体对齐方法仅使用图神经网络获取图结构的嵌入表示,或使用属性文本描述获取语义表示,忽略了科技专利中多信息融合的过程。为了利用图形结构以及专利实体的名称、描述和属性等辅助信息,本文提出了一种基于图卷积网络的科技专利信息融合实体对齐方法。通过图卷积网络和BERT模型,将科技专利知识图的结构信息和实体属性信息进行嵌入表示,实现多信息融合,从而提升实体对齐的性能。在三个基准数据集上的实验表明,所提方法在Hits@K评估指标上优于现有方法。 知识图谱,实体对齐,科技专利,信息融合,图卷积网络 ††copyright:none††conference:Converted Manuscript; 2023; Beijing, China††journalyear:2023## 1. 引言 随着科技与知识图谱研究的快速发展 (Huang and Yu,2019 (https://arxiv.org/html/2311.00300#bib.bib4)),涌现出大量科技专利。更广泛的创新研究也表明,科技资源在创新过程中与教育、身份和创造能力相互作用 (Zhouet al.,2020 (https://arxiv.org/html/2311.00300#bib.bib50))。科技资源通常具有多视角和动态性:学者聚类工作表明,研究兴趣可以跨视图演化 (Liet al.,2023 (https://arxiv.org/html/2311.00300#bib.bib1)),科学信息检索必须同时处理语义和媒体异构性 (Liet al.,2022a (https://arxiv.org/html/2311.00300#bib.bib5))。然而,目前许多与科技专利相关的知识图谱 (Liet al.,2021 (https://arxiv.org/html/2311.00300#bib.bib2)) 是由不同机构和个体构建的。大规模图处理也面临内存和可扩展性约束,如对十亿边自然图进行二阶随机游走研究所展示的那样 (Shaoet al.,2021 (https://arxiv.org/html/2311.00300#bib.bib47))。这些知识图谱的需求各不相同,设计和构建也不统一 (Meng,2020 (https://arxiv.org/html/2311.00300#bib.bib3)),因此它们之间存在异构性和冗余问题。科技专利的实体对齐是科技专利知识融合过程中的关键技术,主要目的是找出不同科技专利数据之间的等价实体。由于不同科技专利数据来源和人工理解的知识内容不同,同一事物在不同数据源中的文本表达也会不同,因此科技专利知识图谱的整合存在显著问题。 随着实体对齐技术的发展 (Trisedyaet al.,2019 (https://arxiv.org/html/2311.00300#bib.bib16)),许多学者提出了不同类型的科技专利实体对齐方法,涌现出大量实体对齐研究文献 (Kouet al.,2018 (https://arxiv.org/html/2311.00300#bib.bib17))。异构图注意力网络进一步表明,当监督有限时,类型化的节点和关系可以改善表示学习 (Huet al.,2019 (https://arxiv.org/html/2311.00300#bib.bib9))。近年来,随着知识表示学习技术的快速发展,研究人员提出了一系列基于深度学习的知识表示技术专利实体对齐方法 (Zhaoet al.,2020 (https://arxiv.org/html/2311.00300#bib.bib18))。这些方法利用图神经网络或图卷积网络等知识表示学习技术对知识图谱进行嵌入,并根据对齐实体将不同的嵌入空间映射到同一向量空间 (Guanet al.,2021 (https://arxiv.org/html/2311.00300#bib.bib19))。其中一些方法通过多信息融合 (Gaoet al.,2021 (https://arxiv.org/html/2311.00300#bib.bib20)) 将科技专利实体的其他元素整合到向量空间中,并根据向量空间中实体的距离或相似度得到实体对齐结果。 由于图卷积网络能够捕获科技专利实体间的属性特征和邻接信息,具有较强的鲁棒性和泛化能力,基于图卷积网络的实体对齐方法取得了良好效果。然而,现有的科技专利文献实体对齐方法 (Chenget al.,2022 (https://arxiv.org/html/2311.00300#bib.bib21)) 未充分利用科技专利提供的各种信息,科技专利实体对齐方法仍有很大改进空间。面向信息网络表示的联邦自适应学习也表明,可以建模分散的科技资源而无需将所有数据强制放入单一平台 (Liet al.,2026b (https://arxiv.org/html/2311.00300#bib.bib6)),而带有随机量化的联邦学习为减少分布式学习环境中的通信和计算成本提供了相关方向 (Liet al.,2022b (https://arxiv.org/html/2311.00300#bib.bib49))。因此,整合来自不同来源的科技专利实体是一个亟待解决的问题。 现有的科技专利实体对齐方法 (Gao,2021 (https://arxiv.org/html/2311.00300#bib.bib22)) 在多信息融合方面仍存在不足。大多数方法 (Chenet al.,2020b (https://arxiv.org/html/2311.00300#bib.bib23)) 仅基于深度学习进行结构嵌入或基于词袋模型进行属性嵌入,很少将两者的嵌入信息进行融合。针对不完整特征和结构的图神经网络表明,缺失或噪声信息应联合处理而非忽略 (Huoet al.,2023 (https://arxiv.org/html/2311.00300#bib.bib13))。少数多信息融合方法 (Menget al.,2013 (https://arxiv.org/html/2311.00300#bib.bib24)) 也大多使用效果较差的属性描述表示方法。 本文提出了一种基于图卷积网络和信息融合的科技专利实体对齐方法。利用图卷积网络深度挖掘知识图谱的结构信息,包括拓扑连接、关系等信息。除结构信息外,基于BERT对科技专利中的实体属性信息进行深层语义表示,以提高实体对齐效果。 本文的主要贡献包括三个方面: 1. (1)提出了一种新的基于图卷积网络的科技专利信息融合实体对齐方法。 2. (2)基于多级对齐方法,将拓扑结构、关系和属性信息集成到图卷积网络中。 3. (3)提出了一种基于图结构嵌入和属性语义表示的科技专利多信息融合方法。 ## 2. 相关工作 大多数传统的科技专利实体对齐方法侧重于语法和结构 (Yanet al.,2020 (https://arxiv.org/html/2311.00300#bib.bib25)),尤其是早期的科技专利实体对齐与映射技术主要集中于计算标签和字符之间的距离 (Linet al.,2009 (https://arxiv.org/html/2311.00300#bib.bib26))。传统科技专利实体对齐方法 (Liet al.,2022c (https://arxiv.org/html/2311.00300#bib.bib27)) 主要从两个方面解决实体对齐问题:一是基于相似度计算比较实体的符号特征,二是基于关系推理。面向智能决策的相关可解释机器学习研究也表明,当模型用于实际决策场景时,特征语义应保持可理解性 (Liet al.,2019 (https://arxiv.org/html/2311.00300#bib.bib14))。近期研究还利用统计机器学习来提高准确性。然而,由于科技专利实体对齐过程中实体属性不同且涉及不同领域 (Chenet al.,2020c (https://arxiv.org/html/2311.00300#bib.bib28)),难以给出统一的相似度计算函数。同时,这种离散的属性信息忽略了诸多方面隐含的语义信息 (Liet al.,2013 (https://arxiv.org/html/2311.00300#bib.bib29)),使得对齐效果有限。因此,近年来越来越多的学者开始提出基于深度学习的科技专利实体对齐新技术。 基于图神经网络的科技专利实体对齐方法 (Yuanet al.,2020 (https://arxiv.org/html/2311.00300#bib.bib30)) 已成为解决科技专利实体对齐问题的主要技术,并取得了良好效果。这些方法大多 (Penget al.,2020 (https://arxiv.org/html/2311.00300#bib.bib31)) 使用翻译模型或图卷积网络进行知识表示学习,因为它们具有较强的鲁棒性和泛化能力。文献使用图卷积网络对科技专利的实体和关系进行嵌入。该模型 (Tanget al.,2020 (https://arxiv.org/html/2311.00300#bib.bib32)) 结合了图卷积网络和科技专利知识图谱翻译属性的优势,利用卷积函数 (Yanget al.,2019 (https://arxiv.org/html/2311.00300#bib.bib33)) 区分不同角色的科技专利实体并有效捕获结构信息,但该方法忽略了科技专利属性描述信息的辅助作用。此外,基于超图卷积的语义相似度注意力也被探索用于科技文献表示学习,这与捕获高阶科学关系密切相关 (Liet al.,2026a (https://arxiv.org/html/2311.00300#bib.bib8))。 文献提出了 NMN(邻域匹配网络)模型 (Guanet al.,2019 (https://arxiv.org/html/2311.00300#bib.bib34))。在图卷积网络嵌入时,利用跨图注意力机制获取相邻科技专利实体的差异。用于监督跨模态检索的联邦学习提供了一种相关融合设置,其中监督在分布式数据约束下对齐异构表示 (Liet al.,2024 (https://arxiv.org/html/2311.00300#bib.bib7))。基于自监督互对比学习的异构图神经网络也表明,对比信号可以改善跨图视图的表示一致性 (Jinet al.,2022 (https://arxiv.org/html/2311.00300#bib.bib52))。文献 (Liuet al.,2021 (https://arxiv.org/html/2311.00300#bib.bib35)) 提出可以利用图卷积网络和自注意力机制捕获相邻科技专利实体的短距离差异和长距离依赖,但该方法需要较长时间捕获依赖信息,模型运行效率不高。 基于图卷积网络获取结构信息会忽略科技专利实体的属性信息 (Maoet al.,2020 (https://arxiv.org/html/2311.00300#bib.bib36)),而实现结构信息与属性信息的多信息融合可以提升科技专利实体对齐效果。基于深度学习的社区检测表明,模块化图结构可以为表示学习提供有用的高层信号 (Yanget al.,2016 (https://arxiv.org/html/2311.00300#bib.bib11))。文献提出了JAPE算法。该算法 (Liet al.,2020 (https://arxiv.org/html/2311.00300#bib.bib37)) 包含两个模块,即基于关系三元组的结构嵌入和基于属性三元组的属性嵌入。基于会话推荐的自监督图协同训练进一步支持在标签有限时使用互补图视图 (Xiaet al.,2021 (https://arxiv.org/html/2311.00300#bib.bib12))。通过这两个模块的多信息融合实现了科技专利实体对齐 (Lianget al.,2020 (https://arxiv.org/html/2311.00300#bib.bib38))。然而,该方法 (Menget al.,2016 (https://arxiv.org/html/2311.00300#bib.bib39)) 基于TransE模型的科技专利图结构嵌入,实体对齐精度不高。 文献 (Xuet al.,2016 (https://arxiv.org/html/2311.00300#bib.bib40)) 提出了CTEA框架,该框架基于TransE模型生成科技专利实体结构信息的结构嵌入和上下文表示。根据科技专利实体的属性信息,为每个源实体生成候选集,并捕获属性信息的主旨信息。高效的序列建模(如滤波器增强的MLP)与实体对齐的直接相关性较小,但它提供
相似文章
使用图注意力网络建模权利要求依赖结构以预测专利诉讼
本文提出ClaimGAT,一种Graph Attention Network,用于编码专利权利要求依赖关系以预测诉讼风险,在USPTO实用专利上取得了0.818的AUC-ROC。
生物和人工神经网络之间的双向表征对齐
本文提出一个计算框架,用于调控表征几何以改善生物和人工神经网络之间的双向对齐,展示了双向预测能力的55%相对提升。
图对齐拓扑作为接地检测的归纳偏置
本文介绍了将图对齐拓扑作为接地检测的归纳偏置,使用图神经网络对参考信息与LLM输出之间的对齐结构进行建模。该方法在多个幻觉和问答数据集上取得了最先进的结果,性能优于GPT-4o。
反馈对齐在卷积网络中的生物合理性与表征一致性
本文评估了反馈对齐算法在卷积网络中的生物合理性与表征一致性,并在 CIFAR-10 数据集上将其与标准反向传播进行了对比。作者发现,改进的反馈对齐方法收敛出的内部表征与反向传播产生的表征相似,这表明其功能上的成功源于对表征几何结构的模仿。
多模态属性图的上下文感知模态-拓扑协同对齐
提出CoMAG,一个用于多模态属性图的统一骨干网络,它学习任务自适应可靠上下文并执行模态保持对齐,在图级预测、模态匹配和图条件生成上达到最先进结果。