迈向基于引用图的自动进化树生成
摘要
本文提出了EvoTree,一个从引用图自动生成科学进化树的框架,在跨AI子领域的新的标注基准上达到了最先进的性能。
arXiv:2609.09561v1 公告类型:新
摘要:综述仍然是研究人员把握AI子领域方法谱系的主要方式,但它们难以应对当前的发表速度。现有的分类法归纳方法大多局限于叶节点且不考虑时间因素;它们往往将过渡性论文强行归入成熟叶节点,并可能在祖先与后代之间产生拓扑倒置。我们提出EvoTree,一个分阶段框架,将概念骨架学习与时间精炼解耦:一个图感知编码器结合基于分布的层次聚类生成稳定的分类法骨架;然后时间微调在单调路径约束下将边缘论文重新连接到内部节点;最后通过LLM标注概念而不改变拓扑结构。我们发布了首个跨11个AI子领域的此任务标注基准。EvoTree在所有基线中获得了最高的NMI和引用方向准确率,并在标注基准上具有最佳的概念纯度,且是唯一在标注集上具有非平凡边缘论文检测的方法。
查看缓存全文
缓存时间: 2026/09/10 08:11
# 面向引用图的自动演化树生成 来源:https://arxiv.org/html/2609.09561 作者:Zexing Zhao所属机构:佐治亚理工学院机械工程学院 邮箱:[[email protected]](mailto:[email protected]) 合作者:Yuntong Hu, Liang Zhao 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 综述论文仍是研究者把握人工智能子领域方法谱系的主要方式,但其扩展性难以适应当前的论文发表速率。现有的分类法归纳方法大多局限于叶子节点且不涉及时序:它们倾向于将过渡性论文强行归入成熟类别,并可能导致祖先与后代之间的拓扑倒置。我们提出EvoTree——一个分阶段解耦概念骨架学习与时序精炼的框架:图感知编码器结合基于分布的层次聚类生成稳定的分类法骨架;时序微调阶段在单调路径约束下将边缘论文重新挂载至内部节点;最终通过大语言模型为概念添加标签而不改变拓扑结构。我们发布了首个跨11个AI子领域的标注基准数据集。EvoTree在所有基线方法中实现了最高的归一化互信息和引用方向准确率,在标注基准上达到最佳概念纯度,并且是唯一在标注集上实现有效边缘论文检测的方法。 †††通讯作者。 ## 1 引言 科学文献的快速增长对以人类为中心的知识组织和领域理解提出了根本性挑战。OpenAlex等开放学术基础设施已索引超过4.7亿篇科学作品及持续扩展的引用网络。随着研究领域以前所未有的速度演进,研究者越来越难以高效理解快速发展的领域的历史演进、概念谱系和范式转换,这催生了对组织、综合和理解科学进展的AI辅助方法的迫切需求。在各种科学组织形式中,演化树和层次谱系图尤为有效,因为它们能明确揭示跨代工作的概念继承、分支与渐进式优化。此类结构被现代综述论文广泛采用,用于总结研究范式、模型家族和新兴子领域的演化过程。然而,构建这些演化树主要依赖人工,需要深厚的领域专业知识和密集的文献分析,且随着新论文的不断涌现会迅速过时。这引出了一个基础研究问题:我们能否从引用图自动生成科学演化树? 解决该问题极具挑战性,原因在于若干未充分探索的难题。首先,科学演化树是具有层次、时序和语义结构的对象,而引用图是大规模稀疏关系网络。弥合这两种根本不同的结构需要学习演化感知表示,同时保留引用依赖性和时序科学进展——这并非现有分类法归纳方法或时序主题建模方法所能直接解决。其次,科学演化本质上是动态的:研究范式持续分支、融合和优化,这使得从演化的引用图中构建稳定且可解释的谱系结构变得困难。科学学研究中现有的引用和共引分析主要刻画全局科学趋势,而非归纳显式层次演化结构。第三,现有综述论文仅提供有限的监督信号,要求模型从稀缺的高质量演化标注中进行泛化。此外,边缘或过渡性论文通常位于主要范式之间,在不引入时间顺序矛盾的情况下,难以将其定位到传统分类法归纳框架中。 为应对这些挑战,我们提出一个结构分阶段且时序约束的框架,将分类法归纳、时序许可性和边缘论文重挂载整合为连贯的流水线。具体而言,我们的框架首先通过图感知节点嵌入上的基于分布的层次聚类,构建稳定且时序无关的核心分类法。随后,进行时序精炼以建模演化动态并处理边缘论文:将它们挂载至更宽泛的内部概念,同时施加时序一致性和结构合法性约束(如路径单调性)。这种分阶段方法确保概念骨架保持稳健,同时时序动态得以准确且合乎逻辑地映射。 我们的贡献总结如下: - • 新问题建模。我们提出从引用图构建演化树,为科学文献挖掘引入动态视角。 - • 分阶段约束框架。我们将分类法初始化与时序精炼分离,在保留引用感知结构的同时过滤偏离核心轨迹的外围论文。 - • 演化动态建模。我们引入时序与结构约束,结合边缘论文检测与内部节点重挂载,缓解传统分类法生成中的时间顺序失真。 - • 综合基准。我们构建了首个跨11个AI子领域的该任务基准,大量实验表明在演化结构质量和标注概念纯度方面,本方法持续优于分类法、基于引用及大语言模型基线,并且是唯一在标注集上实现有效边缘论文检测的方法。 ## 2 相关工作 ### 2.1 自动分类法归纳 自动分类法归纳研究如何将术语、实体或主题组织成树或有向无环图等层次结构。先前工作表明,分类法质量需要超越孤立的成对上位词预测。现有方法大多关注给定现有层次结构时的分类法扩展或补全,或扩展层次形式本身。另一系列工作直接从语料库构建主题或概念层次。TaxoGen通过自适应球形聚类和局部嵌入递归构建主题分类法,而HiExpan利用弱监督关系抽取扩展用户引导的种子层次。近期工作将语言模型应用于学术分类法构建:TaxoAlign通过将大语言模型诱导的层次与参考结构对齐,为科学领域生成分类法;另有研究通过大语言模型引导的多方面聚类,为科学论文归纳层次分类法。然而,这些方法主要针对文本语料库设计,无法有效建模结构依赖关系,且通常假设静态分类法,因此无法捕捉时序约束的科学演化(包括跨代工作的范式转换和谱系进展)。 ### 2.2 知识演化建模 知识演化建模研究科学概念、研究主题和范式如何随时间涌现、演化和转变。早期工作主要关注时序主题建模(包括动态主题模型和主题随时间),捕捉文档集合中的主题漂移和时序词分布。另一系列研究通过科学学社区的引用和共引分析探讨科学演化。近期,基于大语言模型的综述系统(如AutoSurvey和SurveyX)检索论文、构建大纲并生成综述风格文本,但主要优化文本综合而非显式结构演化建模。尽管近期有若干工作将论文总结为类分类法结构,但均未直接解决科学演化树生成问题。现有方法缺乏对演化路径的时序约束,也缺乏处理边缘论文或构建综述风格演化结构的机制。 ## 3 问题定义 ##### 引用图。给定一篇综述论文,令 $\mathcal{G}=(\mathcal{V},\mathcal{E}_{\mathcal{G}})$ 表示由其参考文献集构建的引用图,其中每个节点 $v_i\in\mathcal{V}$ 是一篇参考文献(包含文本内容 $s_i$(标题与摘要)和发表年份 $\tau(v_i)$)。有向边 $(v_i,v_j)\in\mathcal{E}_{\mathcal{G}}$ 表示论文 $v_i$ 引用了论文 $v_j$。在主要评估中,目标综述本身不包含在 $\mathcal{G}$ 中。 ##### 分类法树。分类法树按概念包含关系组织论文,记为 $\mathcal{T}^{\mathrm{tax}}=(\mathcal{C}^{\mathrm{tax}},\mathcal{V},\mathcal{E}^{\mathrm{tax}},\phi^{\mathrm{tax}})$,其中 $\mathcal{C}^{\mathrm{tax}}$ 是主题节点集,$\mathcal{V}$ 是论文节点集,$\mathcal{E}^{\mathrm{tax}}\subseteq\mathcal{C}^{\mathrm{tax}}\times(\mathcal{C}^{\mathrm{tax}}\cup\mathcal{V})$ 构成一棵根树。每个主题节点 $c\in\mathcal{C}^{\mathrm{tax}}$ 代表一个带标签 $\phi^{\mathrm{tax}}(c)$ 的语义概念,每个论文节点 $v_i\in\mathcal{V}$ 仅作为叶子节点出现(即,每个论文节点的父节点必须是概念节点而非另一篇论文,且该父节点对应直接包含该论文的最低层概念簇)。因此,$\mathcal{T}^{\mathrm{tax}}$ 中的边仅编码概念细化,不涉及时序语义。 ##### 演化树。演化树 $\mathcal{T}=(\mathcal{C},\mathcal{V},\mathcal{E}_C,\mathcal{E}_P,\phi)$ 在此基础上扩展了时序许可的演化关系。$\mathcal{E}_C$ 在带标签 $\phi$ 的概念 $\mathcal{C}$ 上构成根树,$\mathcal{E}_P=\{(a(v_i),v_i)\}$ 通过挂载映射 $a:\mathcal{V}\rightarrow\mathcal{C}$ 将每篇论文附着于一个概念。与分类法树不同,当论文在更粗抽象层级上得到更好解释时,可附着于内部概念节点。对于每个概念 $c$,令 $\mathcal{V}_{\text{att}}(c)=\{v_i:a(v_i)=c\}$ 表示直接附着于 $c$ 的论文,$\mathcal{V}(c)$ 表示其完整子树中的论文。我们定义基于发表年份 $\tau(\cdot)$ 的两个时序统计量: $$\tau^{\text{att}}(c)=\frac{1}{|\mathcal{V}_{\text{att}}(c)|}\sum_{v\in\mathcal{V}_{\text{att}}(c)}\tau(v),\quad\bar{\tau}(c)=\frac{1}{|\mathcal{V}(c)|}\sum_{v\in\mathcal{V}(c)}\tau(v).$$ $\tau^{\text{att}}$ 支持结构约束:由于父节点与其子节点的附着集互不相交,其诱导的约束非平凡。$\bar{\tau}$ 总结概念整体,用于路径级评估。 该树必须满足:(i) 根树;(ii) 时序一致性:对每个从父节点 $c_p$ 到子节点 $c_c$ 的概念边 $(c_p,c_c)\in\mathcal{E}_C$,有 $\tau^{\text{att}}(c_p)\leq\tau^{\text{att}}(c_c)+\epsilon$;(iii) 兄弟排序:按 $\tau^{\text{att}}$ 非递减排列。公式 (2) 要求每条从根到叶的路径从早期、较宽泛概念发展至后期、更专用概念,松弛项 $\epsilon$ 吸收发表日期噪声,使单篇误标年份的论文不会使原本有效的边失效。 ##### 边缘论文。边缘论文与所有叶子级概念的兼容性均较弱。给定连续兼容性评分 $m(v_i,c)\in[0,1]$(在 §4.4.3 实例化),边缘集为 $$\mathcal{M}=\{v_i\in\mathcal{V}:\max_{\ell\in\mathrm{Leaves}(\mathcal{T})}m(v_i,\ell)<\eta\},$$ 其中 $\eta$ 为阈值。边缘论文不被丢弃;它们可附着于内部节点以代表孤立、过渡性或弱延续的贡献。 ##### 挑战与设计概览。该形式化提出四个挑战,塑造了我们的方法:(C1) 离散结构 $(\mathcal{C},\mathcal{E}_C,a)$ 与连续嵌入 $\{\mathbf{e}_i\}$ 无法端到端联合优化,这促使在结构与表示之间进行交替优化(§4.4.1)。
相似文章
EvoSci:一种受生物启发的多智能体框架,用于科学发现的演化
EvoSci提出了一种受生物启发的多智能体框架,将进化算法与知识图谱建模相结合,以迭代生成、评估和完善研究想法,在同行评审评估中取得了最佳性能。
研究图谱:引文演化图作为研究想法生成的监督信号
提出研究图谱(GoR),一种监督微调方法,利用引文演化图作为监督信号,用于基于大语言模型的研究想法生成,在基于gpt-4o的基线上取得了最先进的结果。
EvoOptiGraph:基于图结构生成的弱点驱动共同进化方法用于优化建模
EvoOptiGraph是一个框架,用于从自然语言自动进行优化建模,使用基于图的进化生成来创建多样化的训练数据,并通过弱点驱动的强化学习共同进化模型,在多个基准测试上取得了最先进的结果。
EvoSQL:面向Text-to-SQL的记忆增强评论器-生成器协同进化
EvoSQL是一个面向Text-to-SQL的协同进化框架,通过带有情景记忆的生成器-评论器对迭代改进SQL生成,在Spider和BIRD基准测试上取得了性能提升。
CurateEvo:面向智能体后训练的数据策展进化
CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。