科学贡献图(Scientific Contribution Graph):基于文献的规模化自动化技术路线图绘制

arXiv cs.CL 论文

摘要

本文介绍了科学贡献图(Scientific Contribution Graph),这是一个大规模资源,包含从23万篇开放获取论文中提取的200万条科学贡献,并通过1250万条前提边连接,同时提出了自动化技术路线图绘制和前提预测的任务。

arXiv:2605.15011v1 Announce Type: new 摘要:科学贡献很少孤立发展,而是建立在先前的发现之上。我们将自动化技术路线图绘制任务定义为从学术文章中提取科学贡献并将其与前提条件连接起来。我们提出了科学贡献图(Scientific Contribution Graph),这是一个大规模的AI/NLP领域资源,包含从23万篇开放获取论文中提取的200万条详细科学贡献,并通过1250万条前提边连接。我们进一步引入了科学前提预测,这是一项科学发现任务,模型预测哪些现有技术能够促成未来的发现,并展示了当前模型在该任务上正在快速改进,在使用时间过滤回测评估时达到了0.48 MAP。我们预期这样的技术路线图资源将支持科学影响评估和自动化科学发现。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:24

# 规模化自动文献驱动技术路线图

## 科学贡献图:规模化自动文献驱动技术路线图
Peter A. Jansen1,2  
1亚利桑那大学,2艾伦人工智能研究所  
[email protected]  

###### 摘要  
科学贡献很少孤立发展,而是建立在先前发现的基础之上。本文将自动技术路线图任务形式化为从学术文章中提取科学贡献并将其与先决条件链接起来。我们提出**科学贡献图**,这是一个大规模的AI/NLP领域资源,包含从23万篇开放获取论文中提取的200万条详细科学贡献,这些贡献由1250万条先决条件边连接。我们进一步引入**科学先决条件预测**这一科学发现任务,其中模型需预测哪些现有技术能够促成未来发现,并通过时间过滤回测显示,当代模型在该任务上正快速改进,平均精度均值(MAP)达到0.48。我们预期,此类技术路线图资源将支持科学影响评估和自动科学发现。  
[GitHub仓库](https://github.com/cognitiveailab/scientific-contribution-graph)

---

## 1 引言  
艾萨克·牛顿爵士有句名言:“如果我比别人看得更远,那是因为我站在巨人的肩膀上。”科学贡献很少孤立发展,而是建立在先前的贡献之上,例如问题框架、实验方法和经验发现。理解这些先决关系对于研究科学进步至关重要,也对于必须推理哪些现有能力可用于开发新能力的自动科学发现系统(如Lu等人,2024;Jansen等人,2025b;Baek等人,2025)具有重要价值。  
目前,科学贡献之间的继承关系通常通过论文级引用或从论文中提取的句子级三元组来表示。引用分析捕捉论文级链接(Wang等人,2022;Zhang和Wu,2021;Ammar等人,2018),但引用往往提供背景上下文(如Li和Ouyang,2024;Li等人,2022),而非表明一项工作直接建立在另一项工作之上。有影响力引用检测方法(如Valenzuela等人,2015;Nazir等人,2020)部分控制了这一点,但仍停留在粗糙的全论文层面:它们无法解析例如“论文A中开发的数据集具体依赖于论文B中提出的问题公式化”这样的细节。相反,科学信息提取系统通常提取句子级实体或三元组,例如<方法, 使用, 数据集>(来自CS-KG的三元组;Dessí等人,2025)。这些三元组往往脱离上下文:不清楚正在讨论的具体技术是什么,也不清楚一项贡献是否以及如何建立在另一项贡献之上。这导致了论文级引用图与句子级三元组之间的表征效用缺口。  

**表1:** 现有科学知识图谱工作的比较,包括输入来源、提取任务框架、边构建的依赖模型以及规模。先前系统主要从短实体跨度中提取带类型的三元组,而本工作通过seq2seq建模生成详细的科学贡献节点,并通过跨论文贡献对齐构建边。  

本工作通过**科学贡献图**填补这一空白,该大规模资源以中等粒度表示科学进步:比论文更细,但比三元组更丰富。节点代表单个科学贡献,边则代表一项贡献如何建立在先导贡献之上。该图包含从23万篇开放获取论文(种子来自ACL Anthology)中提取的200万条贡献,并由1250万条先决条件边连接,平均每篇论文提取9条贡献。节点和边并非表示为短实体提及或三元组,而是包含生成的名称和详细的摘要描述,边则解释源文本如何描述一项贡献建立在另一项贡献之上。现有图谱如CS-KG的平均节点长度约为3个词元,而科学贡献图中的节点和边平均分别包含130个和71个词元。  
构建此图需要将知识图谱构建建模为对论文全文的开放式序列到序列(seq2seq)提取,而非对句子或段落的跨度标注或三元组提取(Dagdelen等人,2024;Shamsabadi等人,2024)。这在计算上颇具挑战:该流水线平均每篇论文需要43次LLM调用,以提取贡献、识别先决条件并将其对齐到图中的贡献节点。  
为展示自动科学发现的实用性,本工作引入科学先决条件预测任务,其中模型必须识别开发新型目标技术所需的现有技术。通过时间过滤回测(如Luo等人,2018;Jansen等人,2025a),我们实证表明当代语言模型最近已从接近随机水平进步到中等水平,预示着近期在科学发现中的实用性。  
本工作的贡献如下:  
1. **科学贡献图**:一个技术路线图资源,包含来自23万篇开放获取论文的200万条详细科学贡献,由1250万条描述技术如何建立在先导技术之上的先决条件边连接。  
2. **科学先决条件预测**的形式化:将其作为自动科学发现的技术需求预测任务,并配以实证演示,表明当代语言模型在过去两年内从随机水平快速进步至0.48 MAP。  

**图1:** 图构建流水线示意图,包括(1)从论文中提取贡献,(2)为每项贡献提取先决条件,以及(3)通过将先决条件与引用论文中的贡献对齐来创建贡献依赖边。由于篇幅限制,仅显示一小部分贡献、先决条件、边和内容。每篇论文平均提取9条贡献,每条贡献平均包含6条先决条件边。

---

## 2 相关工作  
**提取科学贡献:** 先前工作已从文献中提取科学贡献,最常见的是作为跨度标注的命名实体识别或结构化信息提取。NER系统通常预定义3至10个实体类别,例如数据集、模型、方法、任务和指标(Das等人,2025;Pramanick等人,2025;Otto等人,2023;D’Souza等人,2021;Luan等人,2018),然后通过分类或跨度标注在摘要或全文中识别贡献。近期工作将科学信息提取建模为序列到序列(seq2seq)提取:Shamsabadi等人(2024)为病毒学论文提取结构化模式,包括研究的病毒、地点、时间和繁殖率;Dagdelen等人(2024)使用结构化模式提取材料数据。本文在此大规模使用这种seq2seq信息提取框架来构建知识图谱。  

**科学知识图谱:** 现有规模化科学知识图谱主要以三元组或N元关系表示,如表1所示。最大资源CS-KG V2(Dessí等人,2025)使用SCICERO模型(Dessí等人,2022)提取,该模型将实体映射到标准本体。Mondal等人(2021)从3万篇NLP领域论文中提取两种以评估为中心的关系:EvaluatedOn/By;SciClaim(Magnusson和Friedman,2021)提取句子级主张图;D’Souza等人(2021)从442篇论文中提取开放式三元组,并用12种广泛贡献类型进行标记。相比之下,本工作将提取建模为开放式序列到序列生成,从全文提取贡献名称和详细描述,而非从句子中按照预定义模式提取实体标签或三元组。这些贡献随后通过对齐过程链接到源文本中提到的先决贡献,从而生成一个包含200万条贡献和1200万条边的详细大规模图,提取自23万篇论文。  

**自动科学发现:** 基于文献的发现通常被形式化为识别“未发现的公共知识”,即文献中未明确陈述但可通过组合已发表关系推断出的合理关系(Swanson,1986,1988)。现代工作通常将发现形式化为对科学概念图中的链接预测(Cesario等人,2024;Pu等人,2023;Crichton等人,2020),或使用文献通过迭代细化生成研究方向(Si等人,2025)、文献生成的创意方面(Radensky等人,2024),或从文献链中进行外推(Vasu等人,2025;Li等人,2025)。最相关的工作:Giants(He-Yueya等人,2026)测试LLM是否能从两种组件技术中构思未来见解;CodeScientist(Jansen等人,2025b)通过基于代码的实验构思并测试文献衍生的技术。而本工作侧重于技术路线图——表示科学贡献如何建立在先决贡献之上——并评估反向预测问题,即预测开发新型目标技术需要哪些现有科学贡献。

---

## 3 问题形式化  
我们将技术路线图形式化为一个自动知识图谱构建问题。设 *D* 表示输入文档语料库,此处具体为科学论文。合成过程将 *D* 映射到贡献图 *G*:*D* → *G*。图 *G* 由一组节点 *cᵢ* ∈ *C* 组成,每个节点代表一个单独的科学贡献,以及一组边 *eⱼ* ∈ *E*,将科学贡献链接到其先决技术。每个贡献 *cᵢ* 表示为一个元组 ⟨*nᵢ*, *dᵢ*, *mᵢ*⟩,其中 *nᵢ* 是科学贡献的名称,*dᵢ* 是贡献的自然语言描述,*mᵢ* 是可选的关联元数据集合,例如源论文的标题以及提及该贡献的源论文章节。每条边 *eⱼ* 表示为一个元组 ⟨*c_pre*, *c_dep*, *aⱼ*⟩,其中 *c_pre* 和 *c_dep* 分别是先导贡献和依赖贡献节点,*aⱼ* 是在提取过程中生成的可选边属性集合,例如为何 *c_pre* 被描述为 *c_dep* 的先决技术的自然语言解释。

### 3.1 边对齐  
论文通常通过引用和散文的组合来描述新科学贡献如何建立于现有贡献之上。例如,示例句子“我们的Contrastive-RLHF模型使用对比目标修改了Smith等人(2025)的偏好加权RL训练损失...”描述了一个依赖贡献(“Contrastive-RLHF模型”)、一个候选先决技术(“偏好加权RL训练损失”)及其来源(“Smith等人,2025”)。我们将边构建建模为两步过程。首先,对于每个依赖贡献 *c_dep*,我们提取候选先决技术列表 *P(c_dep)*。每个候选先决技术 *pₖ* ∈ *P(c_dep)* 表示为一个元组 ⟨*pnₖ*, *pdₖ*, *peₖ*, *prₖ*⟩,其中 *pnₖ*、*pdₖ* 和 *peₖ* 分别描述先决技术的名称、描述以及为何它是先决条件的简短自然语言解释。引用 *prₖ* 通常标识一个源论文,包括其标题、年份和第一作者,但也可能是一个内部引用(当同篇论文中较晚的贡献依赖于较早的贡献时),或一个外部工件引用(例如通过URL引用的工具或软件包)。  
其次,我们将每个候选先决技术 *pₖ* 与一个具体的先导贡献节点 *c_pre* 对齐。为了生成连接依赖贡献 *c_dep* 与先导贡献的边 *eⱼ*,对齐器 *A* 将依赖贡献 *c_dep*、候选先决技术 *pₖ* 以及引入该先决技术的论文 *d_pre* 作为输入,并输出边 *eⱼ*:*eⱼ* = *A*(*c_dep*, *pₖ*, *d_pre*)。本文使用的对齐算法将在下文描述。

---

## 4 知识图谱构建  
图1总结了构建流水线。从一个初始论文语料库开始,流水线通过提取贡献节点、识别先决技术以及将这些先决条件对齐到源贡献,迭代扩展贡献图。在每批次之后,从图中尚未包含的引用论文中选择下一篇论文,优先考虑在图中的引用频率以最小化边稀疏性。

### 4.1 开放获取论文语料库  
科学贡献图目前包含从23万篇开放获取论文中提取的贡献,这些论文来自两个许可宽松的来源。种子语料库是一次爬取...

相似文章

SciPaths:预测科学发现的路径

arXiv cs.CL

介绍了SciPaths,这是一个用于预测实现目标科学发现所需的关键贡献的基准,并评估了前沿和开放权重语言模型,发现从贡献反向推理到关键构建块的能力仍有显著提升空间。

Project2Task:面向自主研究的图引导项目级规划

arXiv cs.AI

介绍了Project2Task,一种用于自主研究系统的图引导项目级规划层,可将宏观项目简报分解为有界、依赖感知的研究任务,并明确贡献归属。评估显示其提高了项目组合质量和下游任务准确性。