语言编码的网络拓扑使大型语言模型能够推理复杂网络

arXiv cs.LG 论文

摘要

BioGlyph是一种方法,将网络拓扑转换为可解释的语言角色,以增强大型语言模型推理复杂网络的能力,在各个领域展示了显著的性能提升。

arXiv:2609.03229v1 Announce Type: new 摘要: 网络描述了生物学及其他领域的系统,从蛋白质相互作用、社会关系到电网和引文记录。推理此类系统需要理解其结构:哪些元素是核心的,哪些连接桥接了不同的社区,以及当元素被移除时结构如何变化。尽管大型语言模型(LLMs)擅长自然语言,但当网络以边列表、句子或测量表的形式给出时,它们在处理此类问题时感到困难,因为必须推断其结构意义。在此,我们介绍了BioGlyph,它将网络拓扑编译成一种可解释且可转移的结构角色语言。BioGlyph结合图划分和结构测量来识别诸如枢纽、社区核心和跨社区连接器等角色,并使用固定规则将它们翻译成通用词汇。该表示通过每个元素的结构角色、支持证据和语义结果来描述,保持网络和LLM不变。在跨越五个领域的二十个网络中,BioGlyph显著提高了开源LLMs回答结构推理问题的能力,系统准确率最高提升了26个百分点。消融研究表明,增益来自于以语义可解释术语明确编码结构角色。增益在密集的、社区结构的网络中更为明显,而在拓扑更易于从文本推断的稀疏网络中减弱。在一个酿酒酵母蛋白质相互作用网络中,BioGlyph揭示了生物组织:跨社区连接器富含必需基因,而外围蛋白则缺乏。因此,BioGlyph为语言模型和科学家提供了一种可解释的表示,用于推理网络结构。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:22

# 语言编码的网络拓扑使大型语言模型能够推理复杂网络  
来源:https://arxiv.org/html/2609.03229  

Ucchwas Talukder UtshaSakib Mostafa  
隶属机构:斯坦福大学放射肿瘤学系,加利福尼亚州斯坦福市,美国  

James Zou  
隶属机构:斯坦福大学电气工程系,加利福尼亚州斯坦福市,美国  
隶属机构:斯坦福大学医学院生物医学数据科学系,加利福尼亚州斯坦福市,美国  
隶属机构:斯坦福大学计算机科学系,加利福尼亚州斯坦福市,美国  

Md Tauhidul Islam  
隶属机构:斯坦福大学放射肿瘤学系,加利福尼亚州斯坦福市,美国  
隶属机构:通讯作者: tauhid@stanford\.edu  

###### 摘要  
网络描述了生物学及其他领域的多样系统,从蛋白质相互作用、社会关系到电网和引文记录。对这些系统进行推理需要理解其结构:哪些元素是核心,哪些连接在原本分离的社群之间架起桥梁,网络如何组织,以及当元素被移除时其结构如何变化。尽管大型语言模型(LLMs)擅长自然语言推理,但当网络以边列表、句子或数值测量表的形式呈现时,它们通常难以应对此类结构问题,因为这些表示的结构含义必须被推断出来。  

本文介绍了 **BioGlyph**,一种将网络拓扑编译为可解释、可迁移的结构角色语言的方法。BioGlyph 结合图分区算法和结构测量来识别诸如枢纽、社群核心和跨社群连接器等角色,并使用固定规则将其算法特征转化为通用词汇。所得表示通过每个网络元素的结构角色、支持证据和语义后果来描述它们,同时保持原始网络和 LLM 不变。在涵盖生物、社会和信息系统等五个不同领域的二十个网络中,BioGlyph 显著提高了开源 LLM 回答结构推理问题的能力,系统准确率比基于边的、数值的和学习的表示方法高出多达 26 个百分点。消融实验表明,性能提升来自 BioGlyph 通过语义可解释术语显式编码结构角色。在稠密、具有社群结构的网络中,性能提升尤为显著,而在拓扑更容易从直接文本表示推断的稀疏网络中,提升则较小。应用于酿酒酵母蛋白质相互作用网络时,BioGlyph 还揭示了具有生物学意义的组织结构:跨社群连接器富集了必需基因,而外围蛋白则较少。因此,BioGlyph 提供了一种通用、可解释的表示,使语言模型和科学家都能对复杂网络结构进行推理。  

## 引言  

参考图注 图1:BioGlyph 将网络结构转化为可解释的角色。  
a,一个由 31 个节点组成、分为五个社群的示例网络。BioGlyph 识别了互补的结构角色,包括枢纽、割点、桥、社群核心、跨社群连接器和瓶颈链接。例如,节点 A 是一个高度连接的枢纽,而移除节点 B 会将网络分成三个部分。虚线轮廓表示一个脆弱的社群,它通过单一链接连接到网络的其余部分。  
b,BioGlyph 应用经典的网络分析算法和固定规则来识别十一个结构角色。规则使用精确扰动测试或从网络结构导出的阈值。该过程对于给定的随机种子是确定性的,并且仅使用网络拓扑,无需节点标签或生物学注释。  
c,BioGlyph 将所得结构信息转换为人类和语言模型可读的描述。每个条目指定了结构角色、支持该角色的证据,以及(在相关情况下)移除节点或链接的后果。最终描述提供了网络组织的可解释摘要,可被冻结的语言模型用于回答有关连通性、重要性和扰动的问题。然后,答案可以与精确的图算法进行核对。  

网络提供了一种描述系统各部分如何连接的自然方式。细胞内的蛋白质相互作用、基因调控电路以及大脑中的连接都可以用图来表示。电网、运输系统、引文记录、万维网和社交网络也使用相同的表示。在图中,节点代表系统的部分,边代表它们之间的关系。数十年的网络科学表明,系统的行为不仅取决于单个节点,还取决于它们之间的连接模式\[45 (https://arxiv.org/html/2609.03229#bib.bib1), 4 (https://arxiv.org/html/2609.03229#bib.bib2)\]。  

几种结构模式出现在非常不同的网络中。枢纽拥有异常多的连接。割点(或关节点)在移除时会将连通的网络分开。桥提供了原本不连通区域之间的唯一链接。许多网络还形成了由少量节点连接的稠密社群,这些节点将一个社群与另一个社群联系起来\[16 (https://arxiv.org/html/2609.03229#bib.bib3), 15 (https://arxiv.org/html/2609.03229#bib.bib4)\]。这些结构特征可以具有直接的科学意义。网络位置与基因必需性\[25 (https://arxiv.org/html/2609.03229#bib.bib5), 51 (https://arxiv.org/html/2609.03229#bib.bib6)\]、基础设施脆弱性\[2 (https://arxiv.org/html/2609.03229#bib.bib7)\]以及信息在社交系统中的流动有关。因此,理解网络需要的不仅仅是知道哪些节点是相连的。重要的问题通常是这些连接对系统意味着什么,尤其是当节点或边被移除时。  

大型语言模型是基于文本进行推理的强大通用系统。在大规模文本集合上训练的模型可以从提示中的示例学习新任务\[7 (https://arxiv.org/html/2609.03229#bib.bib8)\],并且可以通过显式推理解决多步骤问题\[46 (https://arxiv.org/html/2609.03229#bib.bib9)\]。网络推理提出了不同的挑战。当图被写成边列表或描述节点如何连接的句子时,语言模型在回答问题之前必须从文本中恢复相关结构。例如,模型必须确定一个节点是否连接两个区域,移除一条边是否会使图分离,或者哪个候选节点对连通性最重要。即使标准图算法可以精确计算答案,语言模型在此类问题上也经常出错\[44 (https://arxiv.org/html/2609.03229#bib.bib10), 13 (https://arxiv.org/html/2609.03229#bib.bib11)\]。  

基于扰动的问题使这一局限性尤为明显。移除第三个节点后,两个节点还能相互到达吗?删除一条边会使网络分裂吗?移除哪个节点会造成最大的破坏?当通信系统中的路由器故障或大脑中的连接中断时,会出现类似的问题。它们在生物医学中尤为重要,因为许多问题可以被表述为网络扰动。当一个基因被上调或下调时会发生什么?哪个蛋白质对维持通路最重要?哪个组分连接两个生物过程?哪些蛋白质最容易受到破坏?回答这些问题需要理解每个组分在整个生物系统中的位置。仅靠相互作用列表无法解释为什么某个蛋白质重要,也无法预测扰动它时会发生什么。在每种情况下,扰动的效果都取决于网络的结构。  

当前方法通常通过连接或学习的数值表示向 LLM 提供网络信息。连接可以写成边列表、结构化数据或自然语言描述\[19 (https://arxiv.org/html/2609.03229#bib.bib12), 44 (https://arxiv.org/html/2609.03229#bib.bib10), 13 (https://arxiv.org/html/2609.03229#bib.bib11)\]。这些格式保留了底层网络,但模型仍然必须从连接中推断出重要的结构属性。其他方法学习节点或网络区域的数值表示,并将这些表示提供给语言模型\[32 (https://arxiv.org/html/2609.03229#bib.bib13), 37 (https://arxiv.org/html/2609.03229#bib.bib14), 8 (https://arxiv.org/html/2609.03229#bib.bib15)\]。尽管这些表示可以捕获复杂的模式,但研究人员很难解释它们。数值表示不容易解释为什么一个蛋白质重要,它连接了哪些其他蛋白质,或者当它被移除时可能会发生什么。  

这些局限性提出了一个简单的问题:能否用语言模型和研究人员都能理解的术语直接表达网络结构?  

本文介绍了 **BioGlyph**,一种将网络结构转化为简单的结构角色语言的方法(图1 (https://arxiv.org/html/2609.03229#Sx1.F1))。BioGlyph 首先使用成熟的网络分析算法来识别枢纽、社群核心、割点、桥和连接不同社群的蛋白质等属性。然后,它使用固定规则用文字描述这些属性。因此,每个蛋白质或相互作用不仅可以根据其结构角色来描述,还可以根据支持该角色的测量以及其位置对周围网络的意义来描述。例如,BioGlyph 不仅提供一个蛋白质的相互作用数量,还可以将其描述为枢纽或两个社群之间的连接器,并解释如果该蛋白质被移除,网络将如何变化。该方法仅使用网络本身,不需要生物学标签或特定任务的训练。LLM 也保持不变。因此,BioGlyph 改变了网络信息的呈现方式,而不是改变底层模型。  

通过用文字表达网络属性,BioGlyph 使网络分析的结果更容易解释,并能纳入更广泛的推理过程中。  

我们在代表生物、社会和信息系统的八个网络上评估了 BioGlyph。我们向 LLM 询问有关网络连通性、重要性以及移除节点或相互作用后果的问题,同时保持底层网络和模型不变,仅改变网络的表示方式。我们将 BioGlyph 与边列表、自然语言描述、数值网络测量和学习的网络表示进行了比较。BioGlyph 在需要理解网络结构的问题上始终提高了性能,并且接近于专门为该任务训练的图神经网络的性能。在具有许多相互连接社群的稠密网络中,改进尤为明显,因为直接读取单个连接很困难。在连接已经相对容易读取的稀疏网络中,优势较小。这些结果表明,显式描述有意义的结构属性可以使复杂的网络信息更容易被 LLM 使用。  

接下来我们问,相同的结构描述是否可以在独立于语言模型推理用途的情况下揭示具有生物学意义的模式。在酿酒酵母蛋白质相互作用网络中,BioGlyph 仅使用网络连接(不使用基因必需性注释)识别结构角色。连接不同社群的蛋白质更可能是必需的,而外围蛋白质则不太可能是必需的。跨社群连接器对必需基因的富集程度也比仅通过度数在相同大小集合中选择的蛋白质更强。这些发现表明,结构词汇表捕捉的是具有生物学意义的组织,而不仅仅是为 LLM 提示提供一种便利的格式。  

这些结果共同表明,网络结构可以被转换为一种通用语言,既能被计算模型访问,也能被研究人员访问。BioGlyph 保留了从成熟的网络分析方法获得的信息,同时使重要的结构关系更容易解释、交流并在生物医学推理中使用。这为使用 LLM 处理生物网络,以及更广泛地将定量网络分析与人类可读的科学解释联系起来提供了一个通用框架。  

## 结果  

### BioGlyph 改进了对酵母相互作用组的推理并识别了具有生物学意义的角色  

我们首先在 **STRING-Yeast** 上评估了 BioGlyph,这是一个包含 3,384 个蛋白质和 43,030 个物理关联的酿酒酵母蛋白质相互作用网络\[36 (https://arxiv.org/html/2609.03229#bib.bib22)\]。独立的基因必需性注释使我们能够测试仅从网络拓扑推断的角色是否与生物学功能相对应。基准包含 156 个问题,其中 10.3% 指的是网络中不存在的蛋白质,因此需要模型声明无法回答该问题。对于每个问题,我们检索了指定蛋白质周围的网络区域,并用六种形式表示它:BioGlyph;无网络信息(R0);边列表(R1);相同边表示为句子(R2);原始图测量值表(R3);以及使用 GraphSAGE 学习的结构角色(R4)。GraphSAGE 是评估的四个图编码器中最强的;所有四个的结果在 S1 节 (https://arxiv.org/html/2609.03229#S1) 中报告。  

每种表示都提供给了相同的两个冻结的 80 亿参数语言模型:**Qwen3-8B** 和 **Llama-3.1-8B**。答案根据精确的图算法输出进行评分,而不是由另一个语言模型评分。  

图2 (https://arxiv.org/html/2609.03229#Sx2.F2) 展示了单个 BioGlyph 描述如何支持对某个网络区域的持续推理。我们编译了一个包含 120 个蛋白质的区域,并在第一个问题时提供了一次描述。**Qwen3-8B** 将 **ACT1** 识别为移除后会造成最大破坏的蛋白质,并引用了所陈述的后果,即移除它会留下八个连通分量。该模型随后使用相同的描述回答了另外四个评分问题,将 **ACT1** 识别为跨社群连接器,并在被质疑 **CBF5** 可能更具破坏性的替代建议时保留了其原始答案。所有评分响应都与相应的精确图算法输出一致。**ACT1** 被 SGD 独立注释为必需的,尽管该注释对模型不可用。  

参考图注 图2:单个 BioGlyph 描述支持对酵母相互作用组的多轮推理。  
a,一个包含 120 个蛋白质和 781 个链接的 STRING-Yeast 区域被编译一次并提供给冻结的 **Qwen3-8B**。节点根据移除 **ACT1** 后剩余的八个连通分量着色。显示了八个对话轮次中的三个。轮次 1 询问六个蛋白质中哪一个在移除时会造成最大的破坏;轮次 5 询问 **ACT1** 是否也连接不同的社群;轮次 8 通过建议 **CBF5** 替代来质疑初始答案。为便于阅读,显示了基因名称:节点 1

相似文章

通过可微图划分对蛋白质语言模型表示的结构解释

arXiv cs.LG

本文提出了 SoftBlobGIN 框架,通过将蛋白质语言模型的表示投影到接触图上进行结构感知的消息传递,增强了其可解释性。该框架在酶分类和结合位点检测任务上展现出性能提升,同时提供了可审计的结构化解释。

大型语言模型是否适用于图计算?进展与展望

arXiv cs.CL

本综述回顾了大型语言模型在图计算中的应用,将其分为两种范式:LLM作为执行器和LLM作为规划器。研究发现,LLM在简单任务上表现良好,但在大规模精确计算方面不可靠,并提出了未来方向。

说科学的语言:迈向面向自然科学的通用生成基础模型

Hugging Face Daily Papers

LOGOS是一个科学生成语言模型,它将多种科学对象及其空间交互编码为令牌序列,从而在自然科学的各类任务中实现统一的自主回归框架。1B、3B和8B参数的模型展现出性能随规模一致提升,并已发布以促进研究。

基于超网络的大语言模型知识注入的缩放定律

Hugging Face Daily Papers

本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。

图原生强化学习通过概念重组实现可追溯的科学假设生成

arXiv cs.AI

本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。