智能体图令牌推理

arXiv cs.LG 论文

摘要

提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。

arXiv:2608.00542v1 公告类型:新 摘要:图在科学和工业领域对关系数据进行建模,从引文网络到产品共购图。由于许多此类图的节点带有丰富的文本,越来越多的研究工作将大语言模型(LLMs)应用于图分析。这些方法中最具图原生性的方法使用图令牌:图编码器将一个图视图(如节点、其k跳邻域或簇)压缩为一段连续的令牌,该令牌同时编码节点属性和拓扑,并由模型直接读取。然而,现有方法以静态单次的方式使用图令牌:在模型看到目标之前就编码一个预定义的图视图,并且从不修改它,使得模型的逐步推理能力未得到利用。我们提出了智能体图令牌推理,将图令牌化重新构建为推理过程本身的一部分。在每一步中,模型选择编码哪个图视图以及何种粒度;按需调用图编码器来生成相应的图令牌;并将生成的令牌块拼接到当前上下文中。因此,模型在图令牌空间中逐步推理,它读取的令牌依赖于轨迹。我们通过三阶段训练流程实现这一点:(i) 自监督任务,教模型读取异构图令牌;(ii) 带有图令牌一致性正则化器的令牌鲁棒轨迹阶段;(iii) 偏好优化,奖励图令牌证据与节点文本证据一致的轨迹。在涵盖七个图领域的评估中,我们的模型大幅优于一组广泛的基线,并零样本迁移到未见领域,无需针对目标任务进行微调。更广泛地说,这项工作将基于LLM的图分析从静态图令牌编码器推向图原生智能体范式。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:41

# 智能体图令牌推理

来源:https://arxiv.org/html/2608.00542 与 Yi Yang  
香港科技大学  
[email protected] (https://arxiv.org/html/2608.00542v1/mailto:[email protected])

###### 摘要。图模型在科学和工业中普遍用于建模关系数据,从引文网络、蛋白质相互作用到商品共购图。由于许多这类图中的节点携带丰富的文本,越来越多的研究将大型语言模型(LLM)应用于图分析。其中最具图原生性的方法使用*图令牌*:图编码器将一个图视图——一个子图,例如某个节点、其k跳邻域或一个簇——压缩为一段连续的短令牌块,该令牌块联合编码节点属性和拓扑结构,并被模型直接读取。然而,现有方法以静态单次方式使用图令牌:它们在模型看到目标之前就已编码一个预定义的图视图,并从不修订,这使得模型的逐步推理能力未能在任务中得到利用。我们引入*智能体图令牌推理*,将图令牌化重新构想为推理过程本身的一部分。在每一步,模型选择要编码的图视图及其粒度;一个图编码器被按需调用以物化相应的图令牌;生成的令牌块被拼接进运行中的上下文。模型因此能在图令牌空间中进行逐步推理,而它读取的令牌是随轨迹变化的。我们通过一个三阶段训练流程实现这一目标:(i)教授模型读取异构图令牌的自监督任务;(ii)带有图令牌一致性正则化器的令牌稳健轨迹阶段;(iii)偏好优化,奖励图令牌证据与节点文本证据一致的轨迹,激励模型将其预测建立在两者一致性之上。在跨越七个图领域的广泛评估中,我们的模型大幅超越多种基线,并零样本迁移到未见过的领域,无需任何针对目标的微调。进一步分析表明,我们的智能体方法在最具挑战性的样本上大幅减少了错误。更广泛地说,这项工作将基于LLM的图分析从静态图令牌编码器推向图原生智能体范式。图神经网络、大型语言模型、智能体推理、图令牌 ††版权:无

## 1. 引言

图是关系数据的通用表示,在许多领域中,其节点携带丰富的文本——一篇论文及其摘要、一个商品及其描述、一个蛋白质及其功能注释。最近一个有前景的研究方向使用大型语言模型来分析这类图:人们提出关于图的问题(这篇论文属于什么领域?这两个蛋白质会相互作用吗?),模型返回答案。挑战在于语言模型纯粹是在语言上训练的:将图数据与其语言空间对齐,使模型能够理解图,这一点很困难。为此涌现的技术是*图令牌*。诸如LLaGA(Chen et al., 2024c (https://arxiv.org/html/2608.00542#bib.bib4))、TEA-GLM(Wang et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib37))、GraphGPT(Tang et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib33))、GraphTranslator(Zhang et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib41))和GOFA(Kong et al., 2025 (https://arxiv.org/html/2608.00542#bib.bib21))等方法对目标周围的图视图[^1]运行图编码器,并将其压缩为一段短的、固定长度的连续令牌块,模型在阅读问题的同时读取该令牌块。它们的成功恰恰来自这种压缩:图被转化为语言模型能理解的令牌,并且无论编码的图视图有多大,令牌块的长度保持不变。然而,这些方法使用预定义的静态图令牌模式来读取图。给定一个目标,要编码的图视图——通常是锚点的k跳邻域或单个全局令牌——是预先选择的,在模型看到问题之前就已编码,并且从不修订;模型随后必须在单次前向传播中产生答案(图1 (https://arxiv.org/html/2608.00542#S1.F1)a)。因此,一切都取决于所选的那个图视图的质量:它既不能太窄以至于不包含证据,也不能太宽以至于信号被稀释,而且它在问题已知之前就被确定了。这引发了一个基本问题:如何能假设一个预定义的静态图令牌足以让语言模型一次性读出并推导出最终答案?与此同时,语言模型发展出了一种直接针对这个问题的能力:*智能体推理*。模型不再仅仅依赖于提示中已有的内容来回答,而是能够决定它还需要什么,采取行动获取它,并重复这一过程——这种行为通常通过大规模强化学习(Shao et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib27);Jaech et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib17);Guo et al., 2025 (https://arxiv.org/html/2608.00542#bib.bib10))来培养。这种迭代的好处在于,上下文会一轮接一轮地丰富,每一步都根据前几步揭示的信息来添加证据,直到足以推导出答案,因此收集多少证据会根据实例的难度自适应调整,而不是事先固定。图分析天然适合这种方式,因为目标需要的证据(它自身的属性、它的邻居、它周围的社区、其他地方相似节点)很少在开始搜索之前就显而易见。然而,当前的图令牌方法远远落后于这种范式:它们预先承诺一个图视图,并单次回答,因此模型永远不会得到它最终发现需要的证据。结果,语言模型在图分析上的能力远未得到充分释放。弥合这一差距需要一种多步骤的公式化,其中推理跨越若干轮进行,每一轮由图令牌表示,并引向我们的研究问题:*语言模型如何通过图令牌进行逐步智能体推理?*

(a) 单次图令牌(先前的工作)  
图G\mathcal{G},问题Q,预定义视图GVG^V,Z\mathbf{Z},答案A,固定的fGNNf^{\mathrm{GNN}},fLLMf^{\mathrm{LLM}}  
(b) 智能体图令牌推理(我们的,AGT)  
图G\mathcal{G},问题Q,fLLMf^{\mathrm{LLM}},动作ata_t,选择视图GVtG^{V_t},ZtAGT\mathbf{Z}^{\mathrm{AGT}}_t,答案A,fGNNf^{\mathrm{GNN}},下一步(如果回答)

图1. 单次 vs. AGT,来自相同的输入:图G\mathcal{G}和问题Q。(a)先前的图令牌方法将预定义的视图编码为图令牌Z\mathbf{Z}并单次回答。(b)我们的方法让模型在每一步发出一个动作,调用要编码的图视图;编码器返回一个拼接回上下文的智能体图令牌块,循环重复直到终止的回答动作。例如,欺诈检查可能先读取账户自身的文本,然后读取其交易伙伴、周围社区以及相似账户,最后才回答。

我们以*智能体图令牌*(AGT)推理(图1 (https://arxiv.org/html/2608.00542#S1.F1)b)来回答这个问题,它将图令牌化从预处理步骤转变为推理过程的一部分。给定一个图和任务问题,模型一次一步地进行推理:它发出一个离散的动作,指明范围和粒度,从锚点节点本身到k跳子图、一组检索到的语义相似节点或整个簇;一个图编码器被按需调用,将该图视图编码为固定长度的图令牌块;该令牌块在下一步之前被拼接进运行中的上下文。模型因此自适应地增长一条推理轨迹[^2],每一步都根据到目前为止的推理来选择,并自适应地终止以输出任务答案。因此,推理在图令牌空间而非语言中展开,这与在连续潜在空间中推理的精神一致(Hao et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib13))。引发这种行为并非易事,主要是因为同时被给予提示文本和图令牌的模型倾向于依赖文本而忽略令牌。因此,我们在三个训练阶段训练模型,每个阶段都贡献了一个组件,据我们所知,这些组件对于图令牌学习都是新的:(1)*学习读取图令牌*——自监督预训练,将编码器与语言模型对齐,使其能够读取不同动作产生的各种令牌块;(2)*激励推理轨迹*——带有图令牌一致性项的轨迹SFT,使推理由令牌内容驱动,而非脆弱的线索;(3)*图-文本一致性偏好*——IPO偏好于那些与图保持一致的rollout,而不是被损坏的锚点文本所误导的rollout,推动策略将其答案建立在图上。

图2. 智能体图令牌(AGT)推理概述。阶段1通过两个自监督阅读任务为令牌块建立基础;阶段2通过扰动图令牌上的一致性项拟合智能体轨迹;阶段3优化偏好对,其中文本一致的rollout正确,而文本损坏、图不一致的rollout错误,教会模型偏好图令牌与节点文本一致的推理路径。LLM和GNN在所有阶段都联合优化。

#### 贡献

我们的贡献有三方面。

- •一个智能体图令牌推理框架。我们将图令牌化重新定义为推理的一部分:模型在单一序列中将其推理与按需图令牌物化交错进行,将图学习从静态、单次范式转变为智能体范式,其中间证据是图原生的而非文本化的。
- •一个三阶段训练方案。我们在每个阶段贡献一个有针对性的设计:教模型读取图令牌、保持其阅读基于令牌内容、并奖励图与文本证据一致的轨迹。
- •强大的实证结果。在七个图领域上,我们的模型在节点分类和链接预测方面优于相当规模的图令牌和智能体基线,并零样本迁移到检查点从未训练过的目标。这项工作将基于LLM的图分析从静态图令牌编码器推向图原生智能体范式。

## 2. 相关工作

### 2.1 用大型语言模型进行图学习

大量工作将大型语言模型适配到文本属性图,方法的主要区别在于图如何呈现给模型。*文本化*方法将局部结构渲染为自然语言文本,让模型在提示中阅读:它们将节点的邻域序列化为描述(Ye et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib40);Zhao et al., 2023 (https://arxiv.org/html/2608.00542#bib.bib43);Guo et al., 2023 (https://arxiv.org/html/2608.00542#bib.bib11)),使用LLM为下游模型生成解释或增强特征(He et al., 2023 (https://arxiv.org/html/2608.00542#bib.bib14);Fang et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib8)),或者选择最有信息量的邻居来描述(Li et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib22));广泛的实证研究比较了这类文本编码(Chen et al., 2024a (https://arxiv.org/html/2608.00542#bib.bib5))。这类文本对拓扑的编码效果较差,并且会膨胀上下文。*图令牌*方法则学习一个图编码器,将图视图压缩为结构感知的软令牌注入提示:LLaGA(Chen et al., 2024c (https://arxiv.org/html/2608.00542#bib.bib4))、GOFA(Kong et al., 2025 (https://arxiv.org/html/2608.00542#bib.bib21))、TEA-GLM(Wang et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib37))、GraphGPT(Tang et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib33))、GraphTranslator(Zhang et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib41))和GraphPrompter(Liu et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib24))都遵循这一路线,通常将GNN编码器附加到开源LLM主干上,如LLaMA或Mistral(Touvron et al., 2023 (https://arxiv.org/html/2608.00542#bib.bib35);Jiang et al., 2023 (https://arxiv.org/html/2608.00542#bib.bib18))。一种免训练变体在没有任何调优的情况下执行图上下文学习(Sun et al., 2025 (https://arxiv.org/html/2608.00542#bib.bib31)),互补的分析则询问结构提示何时以及为何有帮助(Huang et al., 2023 (https://arxiv.org/html/2608.00542#bib.bib16))。这些表示是图原生的,但所编码的图视图是在架构时选择的固定模板,在模型读取目标之前编码一次,并且从不修订,因此模型无法在推理过程中请求不同的图视图。第三条最近的*智能体*路线让模型在若干步骤中收集证据:AgentGL(Sun et al., 2026 (https://arxiv.org/html/2608.00542#bib.bib30))训练一个发出文本查询并读回文本片段的RL策略;GraphCoT(Jin et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib19))和GraphSearch(Liu et al., 2026 (https://arxiv.org/html/2608.00542#bib.bib23))同样在图的文本渲染上进行操作;相关地,Graph-of-Thoughts(Besta et al., 2024 (https://arxiv.org/html/2608.00542#bib.bib3))将模型自身的文本思想组织为图,而不是分析输入图数据。这些方法都没有重新编码图令牌。简而言之,现有工作要么是智能体的但基于文本,要么是基于图令牌的但静态的。据我们所知,我们的是第一个智能体图令牌推理框架,其中每个推理步骤本身就是一个按需图令牌物化,将图令牌方法的图原生表示与智能体方法的自适应性统一起来。这也使其从根本上不同于任何基于文本的推理方法,如思维链提示(Wei et al., 2022 (https://arxiv.org/html/2608.00542#bib.bib38))或AgentGL(Sun et al., 2026 (https://arxiv.org/html/2608.00542#bib.bib30)):每个推理步骤都在令牌块本身中携带图拓扑和节点属性信息,

相似文章

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。

GraphReAct:面向多步图推理的推理与行动

arXiv cs.AI

本文介绍了 GraphReAct,这是一个将推理与行动范式扩展到图结构数据以进行多步推理的框架。它结合了拓扑检索、语义检索以及上下文精炼,以提升在图学习基准测试上的性能。

ATLAS:智能体还是隐式视觉推理?一个词足矣

Hugging Face Daily Papers

ATLAS提出了一种视觉推理框架,该框架通过功能标记将智能体操作和隐式表示相结合,实现了通过下一个标记预测和强化学习进行高效训练,同时避免了中间图像的生成。

面向高效可控LLM推理的代理式思维链引导

Hugging Face Daily Papers

ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。

通过纠正少数决策令牌即可恢复推理能力

arXiv cs.AI

本文表明,基础LLM与大型推理模型之间的推理差距集中在少量早期规划令牌上。本文提出一种基于分歧的令牌干预方法,仅用推理模型的输出替换这些关键令牌,即可使基础模型的表现几乎与推理模型持平。