HypoAgent:一种面向知识图谱的交互式溯因假设生成的智能体框架

arXiv cs.AI 论文

摘要

HypoAgent是一种面向知识图谱的交互式溯因假设生成的智能体框架,集成了三个智能体以处理不断变化的用户意图和细粒度诊断,实现了最先进的性能。

arXiv:2605.31370v1 公告类型:新 摘要:知识图谱上的溯因推理旨在生成能够解释观察到的实体或事实的逻辑假设。现有的可控假设生成方法允许用户通过显式条件引导这一过程,但在交互式场景中仍存在局限:它们难以在多轮对话中捕捉不断变化的自然语言意图,并且在生成的假设失败时缺乏细粒度的诊断。为解决这些问题,我们提出了HypoAgent——一种用于知识图谱上交互式溯因假设生成的智能体框架。HypoAgent集成了三个智能体:意图识别智能体(将用户话语和对话历史转化为可执行的知识图谱条件)、假设生成智能体(根据提取的用户意图执行可控假设生成)以及根因分析智能体(诊断不可靠的假设片段,并利用知识图谱邻域探测识别支持的改进方案)。在常识和生物医学领域特定知识图谱上的实验表明,HypoAgent在单轮、多轮和无条件设置下均实现了最先进的语义相似度。我们的代码可在 https://github.com/HKUST-KnowComp/HypoAgent 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:27

# HypoAgent: 一种面向知识图谱的交互式溯因假设生成代理框架

来源:https://arxiv.org/html/2605.31370

Yisen Gao¹, Yixi Cai², Tianshi Zheng¹, Jiaxin Bai³, Yangqiu Song¹  
¹香港科技大学 ²北京航空航天大学 ³香港浸会大学  
[email protected]

###### 摘要

知识图谱上的溯因推理旨在生成能够解释观察到的实体或事实的逻辑假设。现有的可控假设生成方法允许用户通过显式条件引导这一过程,但这些方法在交互式场景中仍存在局限:它们难以在多轮对话中理解不断演变的自然语言意图,并且在生成的假设失败时缺乏细粒度的诊断。为了解决这些局限性,我们提出 HypoAgent,一种用于知识图谱上交互式溯因假设生成的代理框架。HypoAgent 集成了三个代理:意图识别代理,它将用户话语和对话历史转化为可执行的知识图谱条件;假设生成代理,它根据提取的用户意图执行可控的假设生成;以及根因分析代理,它诊断不可靠的假设片段,并利用知识图谱邻域探测来识别支持的修正方案。在常识性和生物医学领域特定知识图谱上的实验表明,HypoAgent 在单轮、多轮和无条件设置下均达到了最先进的语义相似度。我们的代码可在 https://github.com/HKUST-KnowComp/HypoAgent 获取。

# HypoAgent: 一种面向知识图谱的交互式溯因假设生成代理框架

Yisen Gao¹, Yixi Cai², Tianshi Zheng¹, Jiaxin Bai³, Yangqiu Song¹  
¹香港科技大学 ²北京航空航天大学 ³香港浸会大学  
[email protected]

## 1 引言

参见标题 (a) 不断演变的用户意图。  
参见标题 (b) 细粒度的故障诊断。

图 1:知识图谱上交互式溯因推理面临的两个挑战。

溯因推理 (Paul, 1993) 是三种经典推理模式之一,与演绎推理 (Johnson-Laird, 1999) 和归纳推理 (Hayes 等, 2010) 并列。它通过从证据到解释性假设的推理,为观察到的现象寻找最合理的解释。溯因推理广泛应用于临床诊断 (Pukancová 和 Homola, 2015; Martini, 2023),医生根据症状和患者档案推断潜在疾病或机制;也应用于科学发现 (Engelschalt 等, 2023; Wackerly, 2021; Duede 和 Evans, 2021; Upmeier zu Belzen 等, 2021),研究人员提出并修正假设以解释经验观察。

知识图谱作为以互连实体和关系表示的领域知识,为溯因推理提供了天然基础。在知识图谱上,溯因推理 (Bai 等, 2024) 旨在恢复一个一阶逻辑假设,其答案集能解释给定的观察实体集。例如,给定几种疾病,系统可能生成关于它们共享机制、治疗或易感人群的假设。这类逻辑假设是可解释的,因为其答案集和支持路径可以在知识图谱上进行检查。

然而,知识图谱上的溯因推理具有挑战性,因为单次观察集可能包含多个合理假设,特别是在大规模、密集连接的知识图谱中。近期工作 (Gao 等, 2025) 通过可控假设生成解决了这一问题,用户通过目标实体、关系或逻辑模式等显式条件引导生成,从而获得符合其兴趣和意图的假设。

然而,现有的溯因推理方法 (Bai 等, 2024; Gao 等, 2025, 2026b) 在用于交互式假设生成时面临两个关键挑战。

首先,它们缺乏在多轮交互中理解不断演变且可能模糊的自然语言意图的有效机制。在实践中,用户通常从对观察的广泛探索开始,然后通过后续反馈逐步细化需求。如图 1(a) 所示,给定生物医学观察 {类风湿关节炎、银屑病关节炎、强直性脊柱炎},用户可能首先询问这些疾病与什么有关,然后要求机制解释,随后转向治疗策略或药物。尽管这些轮次可以映射到可执行的知识图谱条件,但意图的控制条件并非静态:它们随对话上下文动态变化,先前的交互历史能为理解当前话语提供关键线索。因此,理解用户意图需要同时考虑当前话语和累积的对话历史。然而,现有的单轮可控生成器通常要求用户明确指定控制信号。虽然它们能处理固定条件(如目标关系、实体或逻辑模式),但无法理解动态且依赖上下文的自然语言意图(例如,要求“进一步探索”之前讨论过的机制)。

其次,它们缺乏对溯因推理失败的细粒度诊断。在科学应用中,失败的假设可能仍然包含有用片段 (Okes, 2019)。如图 1(b) 所示,给定观察到的药物 {英夫利西单抗、阿达木单抗、戈利木单抗},溯因系统可能生成一个假设,声称这些实体是治疗类风湿关节炎并靶向 IL-17 的药物。执行此假设可能会检索到 {司库奇尤单抗、依奇珠单抗},表明完整假设未能恢复原始观察。然而,这种不匹配本身并未揭示失败的根本原因。片段级分析可以显示:对类风湿关节炎的治疗关系是支持的,而观察药物对 IL-17 的靶向片段则不成立。进一步的邻域证据可能表明,观察到的药物反而共享对炎症性肠病的治疗关系。因此,有用的修正不是丢弃整个假设,而是用知识图谱支持的关系替换错误片段,产生一个涉及治疗类风湿关节炎和炎症性肠病的改进假设。现有方法 (Bai 等, 2024; Gao 等, 2026b) 通常仅通过最终答案集相似度评估假设,因此无法识别哪些逻辑片段正确、哪个片段导致错误,或如何有针对性地修复假设。

#### 我们的方法。

为了解决这些挑战,我们提出 HypoAgent,一种用于知识图谱上交互式且可解释的溯因假设生成的代理框架。HypoAgent 由三个协作代理组成。意图识别代理将每条用户话语与对话历史一起转化为可执行的知识图谱条件,使系统能从模糊的自然语言反馈中捕捉不断演变的意图。假设生成代理基于已理解的条件调用可控假设生成器,并维护轮次级记忆,包括假设、逻辑形式、解释和评估结果。根因分析代理通过将失败假设分解为可执行片段、检查其知识图谱支持度,以及探测观察实体的邻域以寻找缺失的关系-实体锚点,来诊断失败假设。它还进一步提出针对性的条件修正,使系统能修复不可靠的片段,而非从头生成假设。

我们的主要贡献总结如下:

- • 我们识别了现有知识图谱溯因推理方法在交互式多轮设置中面临的两个关键挑战:在多轮对话中理解不断演变的自然语言用户意图,以及对失败或部分正确的假设执行细粒度的根因分析。
- • 我们提出了 HypoAgent,一个集成意图识别、历史感知的可控假设生成以及基于知识图谱的根因分析的代理框架。该设计使用户能通过自然语言反馈交互式地改进溯因假设。
- • 我们在 DBpedia50、PharmKG 和 BioKG 上进行了实验,覆盖常识性和生物医学领域特定知识图谱。结果表明,HypoAgent 在无条件、单轮和多轮设置下均达到了最先进的语义相似度性能。

## 2 相关工作

**溯因推理。** 溯因推理旨在从观察中推断合理的解释,已在各种一般推理设置中得到了研究。在自然语言推理中,α-NLI (Bhagavatula 等, 2020) 将溯因推理引入常识推理任务,系统需为观察事件序列选择最合理的解释。后续研究通过解码、提示、自一致性、反常识推理等技术改进了溯因推理 (Qin 等, 2021; kadiķis 等, 2022; Chan 等, 2023; Zhao 等, 2024)。除常识场景外,溯因推理还在 ProofWriter (Tafjord 等, 2021)、基于 LLM 的开放世界推理 (Zhong 等, 2023; Del 和 Fishel, 2023; Thagard, 2024)、抽象逻辑推理 (Liu 等, 2024; Zheng 等, 2025) 和神经符号溯因学习 (Zhou, 2019; Camposampiero 等, 2024; Hu 等, 2025) 等正式文本推理基准中得到了探索。

#### 知识图谱上的溯因推理。

知识图谱上的溯因推理旨在生成能够解释一组观察实体或事实的逻辑假设。AbductiveKGR (Bai 等, 2024) 首次引入了该问题,将知识图谱溯因建模为基于 Transformer 的假设生成,模型为观察生成候选逻辑解释。最近,CtrlHGen (Gao 等, 2025) 引入了可控溯因假设生成,通过将生成器条件化为用户指定的控制信号,使生成的假设能更好地满足期望的语义或结构约束。DARK (Gao 等, 2026b) 进一步统一了知识图谱中的演绎和溯因推理,通过捕获它们的双向关系:它将假设和结论视为序列的两面,并使用掩蔽扩散建模双向推理。这些工作共同显著推进了神经图数据库推理 (Bai 等, 2025; Li 等, 2026; Xie 等, 2026; Gao 等, 2026a),改进了生成、控制以及更好地理解用户查询意图。

## 3 预备知识

#### 符号表示。

我们将知识图谱定义为 G = (E, R, T),其中 E 是实体集,R 是关系集,T ⊆ E × R × E 是观察到的三元组集。三元组 (vi, r, vj) ∈ T 表示关系 r 在实体 vi 和 vj 之间成立。遵循开放世界假设 (Drummond 和 Shearer, 2006),未观察到的三元组被视为未知而非假。在本文中,假设 H 表示为一个一阶逻辑公式,涉及 G 中的实体、变量和关系,包含存在量词和逻辑连接词如 ∧、∨ 和 ¬。为简单起见,合取假设可以写为:

H(X) = ∃Z1, ..., Zk : a1 ∧ a2 ∧ ... ∧ am,

其中 X 是目标变量,Z1, ..., Zk 是存在量化的中间变量,每个 ai 是一个关系文字,即要么是关系谓词 r(u, v) 要么是其否定 ¬r(u, v)。这里,r 是 G 中的一个关系,u, v 可以是实体、目标变量 X,或来自 {Z1, ..., Zk} 的存在变量。给定假设 H,我们记 AG(H) 为在 G 上执行 H 后得到的答案集。即,AG(H) ⊆ E 包含那些使 H(X) 在 G 上为真的目标变量 X 所分配到的实体。

#### 任务定义。

给定知识图谱 G 和一组观察实体 O = {o1, o2, ..., on} ⊆ E,知识图谱上的溯因假设生成旨在推断一个合理的假设 H,使一阶逻辑解释该观察。假设 H 的质量通过其答案集 AG(H) 与观察实体集 O 的相似度来衡量。即,目标是找到最优假设 H*,最大化其答案集与观察实体的相似度:

H* = argmax_H sim(AG(H), O),   (1)

其中相似度函数 sim(·,·) 可以通过集合度量(如 Jaccard 相似度、Dice 系数和重叠系数)来实现。在可控溯因假设生成 (Gao 等, 2025) 中,模型还额外获得用户指定的控制条件 c。目标是生成一个假设 H,不仅解释观察实体 O,还满足控制条件 c。在本文中,我们将此设置从单轮控制扩展到多轮交互式假设生成。在第 t 轮时,

相似文章