CoG(图上认知):通过认知循环与双向图-文本协同导航海量知识空间
摘要
CoG 是一种认知启发的免训练框架,适用于检索增强生成中的自适应知识探索,通过计划-探索-反思循环与双向图-文本协同,在多跳问答基准测试上实现了最先进的性能。
arXiv:2609.12791v1 公告类型:新
摘要:检索增强生成(RAG)为大型语言模型(LLM)处理知识密集型任务提供了支持。然而,导航全球异构知识库(大规模知识图谱与文本语料库)以进行复杂推理仍是一个挑战。现有方法通常采用反应式、图驱动的探索策略,盲目遵循图拓扑结构而不适应问题上下文或探索进度的演变,且缺乏图与文本之间的深度双向协同。为解决这些局限性,我们提出了 CoG(Cognition on Graph),一种认知启发的免训练自适应知识探索框架。受人类问题解决的启发,CoG 执行持续的计划-探索-反思循环,主动制定调查计划,进行双源检索,并动态反思进展以调整策略。关键的是,它在结构化图与非结构化文本之间建立了深度双向协同,其中从文本中提取的实体动态引导图探索以弥合知识鸿沟。在七个多跳问答基准测试上的大量实验表明,CoG 显著优于现有最先进的方法,同时实现了卓越的探索效率。我们的代码和数据集可在 https://github.com/zhougengxian/CoG 获取。
查看缓存全文
缓存时间: 2026/09/14 08:39
# 图上的认知:通过认知循环与双向图-文本协同探索海量知识空间 来源:https://arxiv.org/html/2609.12791 **耿先贤** 单位:北京邮电大学 单位:中关村学院,北京 邮箱:[[email protected]](mailto:) **徐健** 单位:中国科学院自动化研究所MAIS 单位:中国科学院大学人工智能学院 通讯作者:[email protected] **项铭** 单位:中国科学院自动化研究所MAIS 单位:中国科学院大学人工智能学院 通讯作者:[email protected] **鄂海红†**††注:通讯作者\.单位:北京邮电大学 **刘成林†**††注:通讯作者\.单位:中关村学院,北京 单位:中国科学院自动化研究所MAIS 单位:中国科学院大学人工智能学院 通讯作者:[email protected] ###### 摘要 检索增强生成(RAG)使大语言模型(LLMs)能够处理知识密集型任务。然而,在海量、异构的知识库(大规模知识图谱与文本语料)中为复杂推理进行导航仍然是一项挑战。现有方法通常采用被动的、图驱动的探索策略,它们盲目遵循图拓扑结构,既不能适应问题上下文或动态演变的探索进程,也缺乏图与文本之间的深度双向协同。为解决这些局限,我们提出CoG(图上认知),一个受认知启发、无需训练的自适应知识探索框架。CoG借鉴人类解决问题的思路,执行持续的“规划-探索-反思”循环:它主动制定探究计划、执行双源检索,并动态反思进展以调整策略。关键的是,它在结构化图谱与非结构化文本之间建立了深度双向协同——从文本中提取的实体能够动态引导图谱探索,从而弥合知识缺口。在七个多跳问答基准上的大量实验表明,CoG在显著超越现有最先进方法的同时,实现了更优的探索效率。我们的代码和数据集可在https://github.com/zhougengxian/CoG获取。 ## 1 引言 虽然大语言模型在各种任务上表现出色,但其对静态参数知识的依赖导致了知识密集型场景下的事实幻觉与推理不透明问题(Huang et al. (2025b); Li et al. (2025b); Wang et al. (2026))。检索增强生成(RAG)通过将响应建立在外部知识源的基础上来缓解这一问题,从而提高准确性和可追溯性(Zhang et al. (2025b); Song et al. (2025))。 (见图注)图1:探索策略对比。CoG在认知循环中整合了所有先前能力,独特地建立了双向协同,其中文本主动弥合图谱缺口,实现在全球知识库中的稳健导航。 有效的检索是RAG的核心。VectorRAG(Lewis et al. (2020))通过向量相似性检索文本块,而GraphRAG(Gutiérrez et al. (2025); Luo et al. (2025a); Gutiérrez et al. (2024); Yang et al. (2025); Wu et al. (2026); Dong et al. (2026))则构建知识图谱进行结构化引导。然而,现有方法主要在简化的局部环境中运行。它们将知识范围限制在预选的、已知包含答案的“标准答案”段落,而非原始的、完整的实体文档。这掩盖了真实世界检索中固有的噪声,未能评估真正的鲁棒性(Luo et al. (2025b))。 当过渡到全局环境时,核心挑战从简单信息检索升级为复杂的知识探索。它要求系统通过综合来自KG的结构关联和来自文本语料的语义信息,逐步构建证据链。在整个过程中,系统必须有效应对大规模知识库中固有的噪声、歧义和干扰。试图解决这一挑战的现有工作,却在两个关键方面存在不足(如图1所示)。 首先,探索仍然严重依赖图谱,文本利用不足。大多数方法仅依赖KG遍历进行探索(Sun et al. (2024); Chen et al. (2024b); Ma et al. (2025a); Wang et al. (2025))。即使是混合方法(Ma et al. (2025b))也仅将文本作为辅助上下文,未能利用文本内的实体主动引导探索,KG固有的稀疏性和不完整性问题依然未被解决。其次,探索策略脆弱且僵化。这些系统依赖预标注实体作为刚性起点(Xu et al. (2026)),缺乏回溯机制(Chen et al. (2024b))或主动调整能力(Ma et al. (2025a)),容易在无关子图中迷失方向,或因链接失败或知识空白而搁浅。 为弥合这些差距,我们从人类解决问题的认知过程中汲取灵感。面对开放领域的复杂问题,人类并非盲目遍历信息;相反,他们参与规划、探索和反思的动态循环。他们主动制定探究计划,灵活综合来自不同来源的信息,并持续反思已积累的证据以调整策略。受此机制启发,我们提出CoG(图上认知),一个将类似人类推理过程实例化为包含规划、探索、综合和反思的连续认知循环的框架。 在规划阶段,CoG不依赖预标注实体,而是主动分析问题以制定探究策略,并由此导出探索性子查询和识别相关实体来锚定搜索。在探索阶段,CoG执行双源知识收集:它从KG中检索一跳相关子图,同时对文本语料中与实体相关的文档进行分层阅读,捕获结构关系和丰富的上下文细节。综合模块随后将来自两个来源的证据聚合成统一的检索摘要,提炼出推进推理过程的关键见解,并实现结构化与非结构化知识之间的深度双向协同。最后,反思模块评估检索信息的有效性:对于有效的探索,它更新策略并基于已取得的进展生成下一个查询;对于无效的探索,它利用全局交互历史诊断失败并调整方向,确保在广阔的知识空间中稳健导航。 我们的主要贡献有三点: - • 我们提出CoG,一个受认知启发、闭环、无需训练的GraphRAG框架。它利用持续的“规划-探索-反思”认知循环,在嘈杂的全局知识库中进行自适应知识探索。 - • 我们建立了结构化知识与非结构化知识之间的深度双向协同,其中从文本动态提取的实体能主动引导图谱探索,以有效解决KG的不完整性问题。 - • 在七个知识密集型、多跳问答基准上的大量实验表明,CoG显著优于现有最先进方法,展示了在导航大规模知识库方面卓越的推理能力和鲁棒性。 ## 2 相关工作 | 方法 | 范围 | 文本语料 | 知识图谱 | 关键能力 | 探索策略 | |------|------|----------|----------|----------|----------| | | | #词数 | #实体文档 | #实体 | #三元组 | 文本引导 | 反思与回溯 | 主动规划 | 自适应实体链接 | | VectorRAG | 局部 | 1.5M | 21K | – | – | – | – | – | – | 稠密检索 | | GraphRAG系列† | 局部 | 0.9M | 12K | 构建‡ | 97K | 1.4M | – | – | – | – | 图引导检索 | | StructGPT, KG-Agent | 全局 | – | – | Freebase | 39M | 1.9B | ✗ | ✗ | ✗ | ✗ | 交互历史 | | ToG, ReKnoS | 全局 | – | – | Wikidata | 115M | 1.7B | ✗ | ✗ | ✗ | ✗ | 束搜索 | | PoG | 全局 | – | – | Freebase | 39M | 1.9B | ✗ | ✓ | ✗ | ✗ | 带回溯的束搜索 | | DoG | 全局 | – | – | Freebase | 39M | 1.9B | ✗ | ✗ | ✓ | ✗ | 多智能体辩论 | | AnchorRAG | 全局 | – | – | Freebase | 39M | 1.9B | ✗ | ✗ | ✗ | ✓ | 并行锚点探索 | | KERAG | 全局 | – | – | Wikidata | 115M | 1.7B | ✗ | ✗ | ✗ | ✓ | 模式引导扩展 | | ToG-2 | 全局 | 5B | 7.1M | Wikidata | 115M | 1.7B | ✗ | ✗ | ✗ | ✗ | 束搜索 | | **CoG (本文)** | 全局 | 5B | 7.1M | Wikidata | 115M | 1.7B | ✓ | ✓ | ✓ | ✓ | **认知循环** | 表1:检索与探索方法对比。我们报告知识库规模:文本为总词数与实体文档数,KG为实体与三元组数(单位:K=千,M=百万,B=十亿)。 †\dagger:包括HippoRAG、HippoRAG2、GFM-RAG等。 ‡\ddagger:从局部文本语料构建的图谱。 ✓:具备,✗:缺失,“–”:不适用。 CoG独特地运行在海量规模,并整合了所有关键探索能力:文本引导、反思与回溯、主动规划、自适应实体链接。 RAG通过检索外部知识来增强LLMs。除了VectorRAG(Lewis et al. (2020)),GraphRAG方法构建了诸如知识图谱(Gutiérrez et al. (2024); Guo et al. (2024); Gutiérrez et al. (2025); Zhu et al. (2025))、分层社区(Edge et al. (2024); Huang et al. (2025a))或文档图(Wang et al. (2024); Chen et al. (2025); Li et al. (2024a))等结构化索引来引导检索。最近的进展在图谱上应用了强化学习(Luo et al. (2026); Yu et al. (2026))或混合稠密检索(Lei et al. (2025))。然而,这些工作主要在局部环境中运行,将知识库限制在高度相关的标准文档或特定领域的KG中。这简化了探索挑战,未能评估在嘈杂全局环境中的鲁棒性。相比之下,CoG针对全球知识库的现实与海量规模(Wikidata和Wikipedia),在指数级更大、更嘈杂的搜索空间中进行导航。 对于全局知识探索,先前的工作侧重于迭代KG推理。基于路径的方法如ToG(Sun et al. (2024))、StructGPT(Jiang et al. (2023))和KG-Agent(Jiang et al. (2025))执行基于提示的探索,而ReKnoS(Wang et al. (2025))和KERAG(Sun et al. (2025))通过超关系或模式提高覆盖率。基于策略的方法引入特定启发式,如PoG中的回溯(Chen et al. (2024b))或多智能体辩论与并行性在DoG(Ma et al. (2025a))和AnchorRAG(Xu et al. (2026))中。然而,这些方法将高级推理行为视为固定流程的碎片化附加组件。同时,基于学习的方法(Chang et al. (2026); Lin et al. (2026); Cui et al. (2025))训练专门的导航模块,引入了高训练成本和不稳定性,同时缺乏明确的可解释性。 有别于这些僵化的流程和高昂的训练成本,CoG引入了无需训练、闭环的认知循环。它原生统一了“规划-探索-反思”,使得主动规划和自适应纠错能够自主涌现。尽管具有高级推理能力,以KG为中心的方法仍然容易受到KG稀疏性和不完整性的影响。为此,混合方法将KG与文本语料相结合(Lee et al. (2025); Sarmah et al. (2024); Tan et al. (2025))。CoK(Li et al. (2024b))在多源库上验证推理,而ToG-2(Ma et al. (2025b))使用图实体锚定文档检索。其他方法仅将文本用于相关性评分(Lei et al. (2025))或依赖预构建的超边(Luo et al. (2026))。然而,这些方法将文本视为被动上下文或需要僵化的离线构建,缺乏动态的结构引导。相比之下,CoG引入了深度双向协同,其中非结构化文本主动引导图谱遍历。通过从文本中提取实体以动态弥合KG结构缺口,它在嘈杂的全局空间中实现了稳健的探索。表1系统比较了这些方法在关键能力上的差异。 ## 3 方法 ### 3.1 任务定义 (见图注)图2:CoG框架概览。它采用持续的“规划-探索-反思”认知循环,自适应地导航结构化与非结构化知识以应对复杂问答。 我们关注在全球、混合知识库上进行多跳问答(QA)的任务。给定一个复杂问题\(q\),系统必须通过迭代地从异构知识源检索和推理,构建证据链以生成最终答案\(a\)。知识库\(\mathcal{K}=\{\mathcal{G},\mathcal{D}\}\)包含两个互补组件:结构化知识图谱\(\mathcal{G}=(\mathcal{E},\mathcal{R},\mathcal{T})\),其中\(\mathcal{E}\)和\(\mathcal{R}\)分别表示实体和关系的集合。KG以两种形式提供结构化信息:1)连接实体对的关系事实三元组\(\mathcal{T}=\{(h,r,t) \mid h,t \in \mathcal{E}, r \in \mathcal{R}\}\),以及2)描述单个实体属性(如出生日期、性别)的实体属性。非结构化文本语料\(\mathcal{D}\),一个大规模...
相似文章
用于免训练多跳问答的图与文本记忆协同进化
提出Co-E,一种免训练系统,同步图记忆与文本记忆用于多跳问答,在六个基准上优于可比的免训练基线。
colbymchenry/codegraph
CodeGraph 是一个开源工具,为代码库创建预索引的知识图谱,使 Claude Code 的探索代理能够即时查询符号关系和调用图,将工具调用次数减少高达 96%,探索时间减少 77%。
@hxiao: 我不是知识图谱的粉丝,但最近出于一个令人惊讶的原因开始更频繁地使用它们:构建非平凡的…
作者描述使用基于Qwen模型构建的知识图谱提取器来生成具有挑战性的多跳问答对,用于评估智能体搜索系统。
动态概念图:迈向人工智能的持久多模态世界模型
本提案引入了动态概念图(Dynamic Concept Graph, DCG),这是一种混合认知架构,结合了神经表示学习、符号知识结构、多模态感知和类比推理,为人工智能提供持久且不断进化的世界模型,以解决大型语言模型中推理不一致和缺乏因果理解等局限性。
从暴力图遍历到认知注意力:一次架构重设计
作者将IONS协议从暴力图遍历重新设计为认知注意力架构,该架构逐步将查询路由到网络的相关切片中,分离了路径置信度、相关性和实用性。