用于科学关系预测的时间对齐演化概念图
摘要
本文提出一种时间对齐的演化概念图框架,联合建模语义与结构演化,以预测科学关系,在预测准确性上较现有方法取得显著提升。
arXiv:2609.18163v1 Announce Type: new
Abstract: 预测科学关系可通过在有前景的连接出现前识别它们来指导发现。现有方法常分别建模概念语义与图结构,或对粗糙的历史快照进行语义总结,导致语义表示可能与快速演化的图证据不匹配。我们提出一种时间对齐的演化概念图框架,联合建模语义与结构演化。其核心思想是将带日期的论文视为共享更新事件,从相同的出版历史中重建每个预测时间的语义与结构状态。配对级融合结合这些状态以预测首次共现、关系形成和条件关系类型。在保持架构与训练不变的情况下,随图更新刷新上下文比冻结上下文平均关系AUPRC提升16.6%。在一个由187,848篇论文、270,687个概念和745万条共现链接构建的图上,完整框架将平均关系AUROC从最强评估基线的0.9290提升至0.9722,平均人口加权AUPRC为0.005778。
查看缓存全文
缓存时间: 2026/09/17 09:34
# 时间对齐的演化概念图用于科学关系预测
来源:https://arxiv.org/html/2609.18163
Jingze Wang Minkun Xu Shangqi Guo††感谢:\*共同贡献\。\†通讯作者\。
###### 摘要
预测科学关系可以通过识别有前景的潜在联系来指导发现。现有方法常常分别建模概念语义和图结构,或对粗粒度的历史快照进行语义汇总,导致语义表示可能与快速演化的图证据错位。我们提出一个时间对齐的演化概念图框架,联合建模语义和结构的演化。其核心思想是将有日期的论文视为共享的更新事件,在每个预测时间点通过相同的出版历史重构语义和结构状态。成对级融合将这些状态结合起来,以预测首次共现、关系形成和条件关系类型。在固定架构和训练的前提下,随着图更新同时刷新上下文,比冻结上下文提高了16.6%的平均关系AUPRC。在一个由187,848篇论文构建、包含270,687个概念和745万条共现链接的图上,完整框架将平均关系AUROC从最强评估基线的0.9290提升至0.9722,平均人口加权AUPRC为0.005778。
###### 索引词:
科学关系预测,时间对齐概念图,演化语义,时序图
††地址:1清华大学精密仪器系类脑计算研究中心,中国北京
2广东省智能科学与技术研究院,中国珠海
## 1 引言
科学进展通常连接不同的工作方向:一种方法进入新的应用领域,技术相互结合,或新证据挑战已建立的方法。在研究成果出现之前预测这些联系可以揭示有前景的方向。概念图方法从历史文献中预测未来的共现关系\[9 (https://arxiv.org/html/2609.18163#bib.bib2), 8 (https://arxiv.org/html/2609.18163#bib.bib3), 10 (https://arxiv.org/html/2609.18163#bib.bib1)\]\。科学关系赋予连接特定含义,例如一种方法*使用*、*结合*或*替代*另一种方法。仅仅共同讨论并不能确立这些角色。因此,我们预测科学关系是否会形成及其类型。这些预测基于概念使用情况和观察到的连接。当一种方法进入新应用时,其最近的上下文和新兴的图邻域描述的是同一发展过程。将较早的概念使用与较新的图事件相结合,混合了该发展过程的不同阶段。因此,这两个信息源应在相同的预测时间点进行重构。
图1:时间对齐的演化概念图。带日期的论文通过查询时间t提供上下文出现和图事件。在概念对级别融合重构的语义和结构状态,以预测首次共现、关系形成和条件关系类型。基于文献的发现和科学嵌入为未观察到的连接提供证据\[13 (https://arxiv.org/html/2609.18163#bib.bib9), 15 (https://arxiv.org/html/2609.18163#bib.bib10)\]\。Marwitz等人\[10 (https://arxiv.org/html/2609.18163#bib.bib1)\]在截止年份之前对摘要中的上下文嵌入取平均值,并将其与图信息结合进行链接预测。时序图模型\[11 (https://arxiv.org/html/2609.18163#bib.bib6), 16 (https://arxiv.org/html/2609.18163#bib.bib7), 2 (https://arxiv.org/html/2609.18163#bib.bib12), 17 (https://arxiv.org/html/2609.18163#bib.bib13)\]和文本属性动态图\[18 (https://arxiv.org/html/2609.18163#bib.bib17)\]启发了演化交互的表示方法。历时嵌入\[4 (https://arxiv.org/html/2609.18163#bib.bib15)\]研究语义变化,而时序知识图模型则预测未来关系\[7 (https://arxiv.org/html/2609.18163#bib.bib11)\]。
我们提出了一个时间对齐的演化概念图框架(图1 (https://arxiv.org/html/2609.18163#S1.F1))。带日期的论文作为概念使用和图连接的共享更新事件。在每个查询时,通过相同的出版日期重构语义和结构状态,将当前概念使用与其对应的图证据配对。上下文敏感的更新跟踪使用情况;图编码器和近期事件通路捕获已建立的连接和当前活动。成对级融合预测首次共现、关系形成和条件关系类型。固定架构和训练后,随着图更新同时刷新语义上下文,比冻结上下文提高了16.6%的平均关系AUPRC。完整框架比最强评估基线提高了70.7%的关系人口AUPRC。
## 2 提出的框架
### 2.1 带日期的论文作为共享更新事件
我们从摘要中提取概念提及,并通过检索和验证合并别名。概念列表按时间顺序扩展:新观察到的名称获得现有或新的节点ID,而先前的分配保持固定。全语料库范围的歧义缩写检查过滤候选合并项。每篇论文提供用于类型化、有向关系(*使用*、*结合*、*替代*和*矛盾*)的上下文出现、共现和全文证据。生成器-判别器教师管道提炼局部关系提取器。学生置信度在提取器开发集上进行校准。可信实例包括:有教师证据、至少两个学生提取器一致或置信度≥0.95≥0.95。关系记录保留论文、日期、类型、方向、置信度和支持文本。专家对10,000个已接受的关系实例的审计显示,关系有效性为93.4%,类型正确性为90.7%,方向正确性为89.9%。
对于每个查询日期t,语义状态和图统计的重构不使用该日期之后的出版物。仅激活在t之前观察到的名称,并包含在t出版的论文。共现图聚合支持论文计数;关系图保留类型、方向和证据强度。我们在累积边权重和关系统计之前,按查询日期过滤论文事件。
我们预测在接下来的时间窗口(t, t+H](t, t+H]内(测试窗口H=365天)是否会出现首次可信的科学关系。合格的配对在t之前没有科学关系,并且仅涉及在t之前观察到的概念;允许先前的共现。负标签表示在窗口内未观察到关系。排除未来观察不完整的查询。*首次共现预测*考虑从未先前一起观察到的配对。*关系类型预测*分类关系阳性配对的第一个关系。我们合并*替代*和*矛盾*类别,并排除冲突的首日类别。图保留方向;形成和类型目标与端点顺序无关。在窗口内,关系蕴含共现;类型以关系形成为条件。
### 2.2 重构概念语义
对于论文中的每个概念表层形式,SciDeBERTa\[6 (https://arxiv.org/html/2609.18163#bib.bib16)\]提供上下文token表示。对概念的token和重复提及进行平均,得到一个768维的出现向量。保留的记录包含表层形式、论文标识符、发布日期和向量。
为了结合累积使用情况和近期适应,我们使用早期出现的平均值初始化状态,并在最新的K=20个可见出现上进行顺序更新。对于最多有K个出现的记录,第一个初始化状态,其余进行重放。令x_kx\_\{k\}表示第k个可见出现,其中k计数完整历史。每个重放步骤为:
m_k\\displaystyle m\_\{k\}=m\_{k-1}+g_k(x_k-m\_{k-1}),\\displaystyle=m\_\{k-1\}+g\_\{k\}(x\_\{k\}-m\_\{k-1\}),\(1\)g_k\\displaystyle g\_\{k\}=\\max\\{1/k,\\ \\sigma(\\alpha[1-\\cos(m\_\{k-1\}, x\_\{k\})]+\\beta)\\}。\displaystyle=\\max\\{1/k,\\ \\sigma(\\alpha[1-\\cos(m\_\{k-1\}, x\_\{k\})]+\\beta)\\}。1/k1/k平均速率提供了一个下限,强调早期观察,随着历史增长而减小。Sigmoid项对新上下文保持持续响应,β\\beta设定基线,α\\alpha控制对上下文差异的敏感性。我们固定α=4\\alpha=4和β=-2.5\\beta=-2.5:在零余弦差异时,sigmoid速率为0.076,在相似度为0.9时为0.109。乘以x_k-m\_{k-1}x\_\{k\}-m\_\{k-1\}使得当观察结果已类似于状态时更新较小,而偏离累积使用的情况获得更大权重。
历史均值保留较早的证据,而近期重放则适应当前用法,每个表层形式最多进行K次顺序更新。在测试截止点,96.7%96.7\%具有上下文观察的表层形式最多有20个出现,因此其历史被完整重放。在每个查询时重构状态将语义适应与图的出版截止点联系起来。
我们使用直到t时的提及次数合并t之前观察到的别名,然后归一化以获得上下文语义c_v(t)c\_\{v\}(t)。单独的256维身份表示i_v(t)i\_\{v\}(t)平均t之前观察到的名称的嵌入。新的上下文更新使用情况,而新的别名可以更新身份。
### 2.3 基于时间对齐状态的预测
*上下文使用和概念身份。*令a_v=f_c(c_v(t))a\_\{v\}=f\_\{c\}(c\_\{v\}(t))和b_v=f_i(i_v(t))b\_\{v\}=f\_\{i\}(i\_\{v\}(t))为学习的投影。一个门将其维度组合成语义状态:
γ_v\\displaystyle\\gamma\_\{v\}=\\sigma(f_g([a_v, b_v])),\\displaystyle=\\sigma(f\_\{g\}([a\_\{v}, b\_\{v\}])),h_v(t)\\displaystyle h\_\{v\}(t)=\\operatorname{Norm}(\\gamma_v\\odot a_v+(1-\\gamma_v)\\odot b_v)。\displaystyle=\\operatorname{Norm}(\\gamma\_\{v\}\\odot a\_\{v\}+(1-\\gamma\_\{v\})\\odot b\_\{v\})。\(2\)该门在每个特征维度上平衡概念身份和当前使用情况。此语义状态与来自相同查询日期的图证据一起进入成对级融合。
*累积结构和近期交互。*两层加权的GraphSAGE\[5 (https://arxiv.org/html/2609.18163#bib.bib5)\]编码共现邻域。两层基于基分解的关系图卷积\[12 (https://arxiv.org/html/2609.18163#bib.bib8)\]编码类型化关系邻域,保留方向和关系特定证据。
每个端点也贡献其最近20个共现和关系事件。Token包含事件类型、年龄、强度和有效性,并具有固定的时间编码。两个时序MLP-Mixer层\[14 (https://arxiv.org/html/2609.18163#bib.bib18), 2 (https://arxiv.org/html/2609.18163#bib.bib12)\]总结序列。该通路描述近期活动,与累积邻域并存。
*融合和层次化输出。*对于端点嵌入a, ba,b,我们使用\[a+b, |a-b|, a\\odot b\]\[a+b, |a-b|, a\\odot b\]形成顺序不变的配对表示。任务特定的门将语义、图和事件表示与配对历史统计信息结合。关系分数包含基础预测和门控的排序及交互残差。这些贡献在进入三输出softmax之前进入关系logit:
\(p_{\\text{none}}, p_{\\text{co only}}, p_{\\text{rel}}\)\\displaystyle(p\_\{\\text{none}\}, p\_\{\\text{co only}\}, p\_\{\\text{rel}\})=\\operatorname{softmax}(0, z\_\{\\text{co}\}, z\_\{\\text{rel}\}),\\displaystyle=\\operatorname{softmax}(0, z\_\{\\text{co}\}, z\_\{\\text{rel}\}),\(3\)P(\\text{co-occurrence})\\displaystyle P(\\text{co-occurrence})=p\_\{\\text{co only}\}+p\_\{\\text{rel}\},\\displaystyle=p\_\{\\text{co only}\}+p\_\{\\text{rel}\},P(\\text{relation})\\displaystyle P(\\text{relation})=p\_\{\\text{rel}\\} \\leq P(\\text{co-occurrence})。\\displaystyle=p\_\{\\text{rel}\} \\leq P(\\text{co-occurrence})。\(4\)这些结果描述了无共现、有共现但无关系以及在目标窗口内形成关系的情况。这里的共现包括先前观察到的配对的再次共现;该不等式是构造性成立的。
首次共现使用直接的二元输出和门控事件校正。关系类型使用条件分类器,混合两个冻结的语义和关系预测器(基于ROC和精确率-召回率选择),并带有有界的语义和图残差。这些特定于任务的输出尊重其不同的候选集。
### 2.4 针对罕见关系形成的训练
对于关系形成,训练结合人口样本、与广泛采样的负样本配对的正样本以及高分困难负样本。逆概率权重校正采样标签分布。目标函数结合加权的三输出负对数似然、共现排序、关系排序和条件关系二元交叉熵,权重分别为11、0.20.2、0.80.8和0.10.1。排序损失使用softplus(s^- - s^+)\\operatorname{softplus}(s^{-}-s^{+})进行正-负分数对计算;跨设备收集候选样本扩大了排序池。
我们从随机初始化开始训练,并在验证集上选择检查点。在AUROC和AUPRC的帕累托前沿内,我们保留关系AUROC≥0.9700≥0.9700条件下AUPRC最高的模型。所选检查点在测试前冻结。
## 3 实验
图2:ROC曲线:(a, b) 人口加权;(c) 三条一对多曲线的平均值。我们的关系曲线是表1 (https://arxiv.org/html/2609.18163#S3.T1)和表2 (https://arxiv.org/html/2609.18163#S3.T2)中三个刷新检查点的平均ROC;其他曲线显示代表性运行。插图放大低假阳性率区域。
表1:人口加权测试集上的关系形成(均值±±样本标准差,三个种子)。
### 3.1 数据、协议与对比方法
计算机视觉语料库包含从2017年1月到2026年6月的187,848篇论文、270,687个概念、7,452,716个共现对以及580,615个具有科学关系的不同配对。我们在2022-2023和2023-2024窗口上进行训练,在2024-2025窗口上验证,在2025-2026窗口上测试,截止日期为6月25日。测试查询日期为2025年6月25日;所有方法共享概念列表,并使用截至该日期观察到的名称和论文证据。
在测试截止点,总人口包含249亿个合格的概念对,关系流行度为1.9×10⁻⁶1.9\\times 10^{-6}。我们从所有目标窗口共现对和均匀采样的合格对中形成测试视图。从此视图中,我们保留所有47,433个关系正样本,并均匀采样202,567个负样本。所有模型使用此固定的250,000对样本,并考虑两个采样阶段的逆概率权重。我们报告加权AUROC和平均精度(AUPRC)。首次共现使用其对应的加权视图;关系类型使用所有46,466个明确的关系正样本和宏平均指标。
Marwitz的组合预测器\[10 (https://arxiv.org/html/2609.18163#bib.bib1)\]提供了科学链接对比;DyGFormer和GraphMixer提供了时序图对比。图2 (https://arxiv.org/html/2609.18163#S3.F2)还包括语义和关系预测器,例如RecB\[3 (https://arxiv.org/html/2609.18163#bib.bib14)\]和SciBERT对嵌入\[1 (https://arxiv.org/html/2609.18163#bib.bib4)\]。
我们的关系模型使用隐藏维度96,语义和任务宽度192,dropout为0.2。AdamW运行1,600步,全局批量大小为24,576,学习率2×10⁻⁴2\\times 10^{-4},120步预热,余弦衰减,权重相似文章
SCoR:一种用于预测科学概念之间关系的层次框架
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
ConceptTS: LLM引导的概念瓶颈用于可解释的多元时间序列预测
ConceptTS 引入了一个可解释的预测框架,该框架使用大语言模型为多元时间序列预测提出人类可读的概念,通过概念瓶颈在保持透明度的同时实现了具有竞争力的准确性。
图原生强化学习通过概念重组实现可追溯的科学假设生成
本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。
分布漂移下的时序知识图谱预测:一项合成评估
本文研究了在受控分布漂移下的时序知识图谱预测,使用了一个编码重复性、同质性和周期性的合成生成器。在七种架构上的实验揭示了信号依赖的鲁棒性以及模型对结构断裂适应性方面的局限性。
基于时间增强符号图神经网络的动态链接预测
本文提出了一种面向符号图神经网络的模块化时间增强框架,通过历史上下文集成模块(HCIM)结合LSTM和多头时间注意力机制整合历史上下文,在真实世界的时间符号网络上进行动态链接预测时取得了持续改进。