GraphDx:一种成本感知、知识增强的序贯诊断多智能体框架

arXiv cs.AI 论文

摘要

GraphDx是一种成本感知、知识增强的序贯诊断多智能体框架,利用LLM构建的医学知识图谱和三个协作智能体,提高诊断成功率并降低测试成本。

arXiv:2607.15280v1 公告类型:新 摘要:序贯诊断需要通过迭代信息收集来平衡诊断准确性与资源成本。现有大型语言模型(LLM)方法存在关键的知识推理鸿沟:尽管编码了广泛的医学知识,但在成本约束下难以系统推理,往往导致过度测试。我们提出GraphDx,一个知识增强框架,具有两项核心创新。首先,我们设计了一个自动化流水线,利用LLM构建医学诊断知识图谱(MDKG),具有量化典型性、以行为为中心的拓扑结构以及诊断相关性和成本敏感性的双目标属性。其次,我们引入三个协作智能体(感知、推理和决策),其中感知和决策智能体处理语言理解和生成,而推理智能体在MDKG上执行确定性证据评分和成本感知规划。在MedQA和MIMIC-IV上,基于三个LLM骨干(DeepSeek-V3、Kimi-k2、Llama-3.3)的实验表明,GraphDx将诊断成功率从50%-68%提高到79%-93%,同时将测试成本降低20%-54%,为自动临床诊断提供了稳健、经济且可解释的解决方案。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:21

# GraphDx:一种面向顺序诊断的成本感知知识增强多智能体框架 来源:https://arxiv.org/html/2607.15280 Shaoting Tan¹, Ning Liu¹, Yuntao Du¹, Shuyue Wei¹, Wu Shuai², Qian Li¹, Yanyu Xu¹, Wei Zhang³, Lizhen Cui¹, Haitao Yuan⁴, ¹山东大学, ²南开大学, ³华东师范大学, ⁴南洋理工大学, 通讯作者:liun21cs@sdu\.edu\.cn (https://arxiv.org/html/2607.15280v1/mailto:email@domain) ###### 摘要 顺序诊断要求通过迭代信息收集来平衡诊断准确性与资源成本。现有的大语言模型(LLM)方法存在一个关键的*知识-推理鸿沟*:尽管编码了广泛的医学知识,但它们难以在成本约束下进行系统性推理,常常导致过度检查。我们提出**GraphDx**,一个知识增强框架,包含两项核心创新。首先,我们设计了一个自动化流水线,利用LLM构建带有量化典型性、以动作为中心的拓扑结构以及兼顾诊断相关性和成本敏感性的双目标属性的医学诊断知识图谱(MDKG)。其次,我们引入了三个协作的智能体(感知、推理和决策),其中感知和决策智能体处理语言理解和生成,而推理智能体在MDKG上执行确定性证据评分和成本感知规划。在MedQA和MIMIC-IV数据集上,使用三个LLM骨干模型(DeepSeek-V3、Kimi-k2、Llama-3.3)的实验表明,**GraphDx**将诊断成功率从50–68%提高到79–93%,同时将测试成本降低20–54%,为自动化临床诊断提供了一个稳健、经济且可解释的解决方案。 GraphDx:一种面向顺序诊断的成本感知知识增强多智能体框架 Shaoting Tan¹, Ning Liu¹, Yuntao Du¹, Shuyue Wei¹, Wu Shuai², Qian Li¹, Yanyu Xu¹, Wei Zhang³, Lizhen Cui¹, Haitao Yuan⁴, ¹山东大学, ²南开大学, ³华东师范大学, ⁴南洋理工大学, 通讯作者:liun21cs@sdu\.edu\.cn (https://arxiv.org/html/2607.15280v1/mailto:email@domain) ## 1 引言 大语言模型(LLM)在医学考试中取得了显著成功,GPT-4等模型在USMLE上超越了人类表现(Nori等人,2023 (https://arxiv.org/html/2607.15280#bib.bib11);Singhal等人,2023 (https://arxiv.org/html/2607.15280#bib.bib12)),这表明LLM在其参数中编码了广泛的医学知识。然而,将这种成功转化为实际的临床实践,特别是**顺序诊断**,仍然是一个重大挑战。与静态问答不同,顺序诊断模拟了真实的临床工作流程:医生通过询问症状和进行诊断测试来迭代收集信息,在不确定性下做出决策,同时平衡诊断准确性与资源成本(包括金钱支出、患者不适和时间)。这个多轮过程不仅仅是知识回忆,而是需要系统性的推理来协调信息获取与假设精炼。 当前基于LLM的方法表现出一个关键局限性,我们称之为*知识-推理鸿沟*:尽管拥有大量医学知识,LLM难以在成本约束下进行系统性推理。最近的研究(Nori等人,2025 (https://arxiv.org/html/2607.15280#bib.bib7);Jia等人,2025 (https://arxiv.org/html/2607.15280#bib.bib6))揭示,LLM智能体倾向于“防御性医疗”,为了弥补推理不确定性而进行过多检查,同时未能利用区分性特征进行高效的鉴别诊断。这种行为源于LLM推理的隐式、非结构化特性,缺乏支持系统性假设检验的显式领域模型。我们确定了造成这一鸿沟的两个关键挑战: ##### 挑战1:诊断就绪的知识图谱构建。顺序诊断需要超越语义关系的*定量*属性,包括症状典型性和测试效用。现有的知识图谱(如UMLS)缺乏这些属性,而当前的自动化方法(Chen和Bertozzi,2023 (https://arxiv.org/html/2607.15280#bib.bib3);Anuya等人,2025 (https://arxiv.org/html/2607.15280#bib.bib2))仅提取语义三元组。此外,医学概念具有上下文相关的语义(例如,“心力衰竭”作为诊断 vs. 并发症),这需要静态本体无法提供的动态角色建模。 ##### 挑战2:有效的多智能体协作。将神经语言理解与符号图推理桥接起来需要协调观察提取、图关联、证据评分和响应生成。最近的方法如MAI-DxO(Nori等人,2025 (https://arxiv.org/html/2607.15280#bib.bib7))依赖于基于提示的协调,但其复杂性要求基础模型具备较强的指令跟随能力,导致在能力较弱的LLM上性能下降。 为了应对这些挑战,我们提出**GraphDx**,一个包含两个集成组件的知识增强框架(图1 (https://arxiv.org/html/2607.15280#S2.F1)): (1) 自动化MDKG构建(§3.2 (https://arxiv.org/html/2607.15280#S3.SS2))应对**挑战1**。我们设计了一个自动化流水线,其中专用智能体协作构建MDKG,丰富了现有知识图谱所缺乏的*定量诊断属性*,包括典型性权重和测试成本效益指标。该流水线采用三个阶段:带有量化典型性的并行知识提取、处理语义角色转换的混合实体对齐与动态节点升级、以及成本敏感规划的属性丰富化。这使得复杂的因果链能够自动出现,无需手动标注。 (2) 协作诊断智能体(§3.3 (https://arxiv.org/html/2607.15280#S3.SS3))应对**挑战2**。我们引入三个专用智能体:一个*感知智能体*,从患者响应中提取观察并关联到图节点;一个*推理智能体*,在MDKG上执行确定性证据评分和成本敏感规划;一个*决策智能体*,生成临床适当的响应。这种架构将复杂推理卸载到图上,减少了对基础模型能力的依赖。 我们在MedQA-Extended和MIMIC-IV数据集上,使用三个LLM骨干模型评估了**GraphDx**。结果表明,**GraphDx**将诊断成功率从50%提高到超过88%,同时将测试成本降低20%到50%,在所有测试模型上均获得一致的增益,包括在复杂的多智能体基线失败的情景下。为了支持可重复性和进一步研究,我们开源了实现,包括自动化图构建流水线和**ClinicSim**环境,地址为https://anonymous.4open.science/r/GraphDx-BB8B。 ## 2 相关工作 表1:近期工作与我们的方法比较。✓=是,✗=否,△\\triangle=弱/部分,—=不适用。方法 | 显式KG | 自动构建 | 顺序诊断 | 成本敏感 | 端到端LLM
Singhal等人 (2023) (https://arxiv.org/html/2607.15280#bib.bib12) | ✗ | – | △\\triangle | ✗
多智能体LLM (Nori等人, 2025) (https://arxiv.org/html/2607.15280#bib.bib7) | ✗ | – | ✓ | △\\triangle
KG增强LLM (Gao等人, 2025) (https://arxiv.org/html/2607.15280#bib.bib5) | ✓ | ✗ | △\\triangle | ✗
AutoKG (Chen和Bertozzi, 2023) (https://arxiv.org/html/2607.15280#bib.bib3) | ✓ | ✓ | ✗ | ✗
**GraphDx (我们的方法)** | ✓ | ✓ | ✓ | ✓ 参照图注图1:**GraphDx**框架概览。左图:自动化MDKG构建流水线(算法1),利用并行提取和混合对齐构建图。右图:图增强诊断智能体(算法2),采用观察提取、图关联、证据评分和基于效用的动作规划的知识增强循环。

如表1 (https://arxiv.org/html/2607.15280#S2.T1) 所示,我们将相关工作分为三类,并在表1 (https://arxiv.org/html/2607.15280#S2.T1) 中进行比较。 **顺序诊断智能体。** 顺序诊断要求智能体在多次交互中平衡信息获取与诊断成本。近期,Nori等人 (2025) (https://arxiv.org/html/2607.15280#bib.bib7) 提出了SDBench和MAI-DxO,通过多智能体编排实现了优于人类医生的诊断准确率和成本控制。Jia等人 (2025) (https://arxiv.org/html/2607.15280#bib.bib6) 提出了DDO框架,使用强化学习(RL)优化症状询问策略。Schmidgall等人 (2025) (https://arxiv.org/html/2607.15280#bib.bib10) 和Qiu等人 (2025) (https://arxiv.org/html/2607.15280#bib.bib8) 分别构建了AgentClinic和DiagGym仿真环境,用于训练和评估多模态诊断智能体。此外,Estévez等人(2025)提出的ACTMED将贝叶斯实验设计与LLM结合,主动选择测试。然而,这些方法大多依赖于LLM的隐式推理或样本效率较低的RL,缺乏显式、可解释的结构化领域模型来指导决策。 **自动化医学知识图谱构建。** 传统的MKG构建依赖于专家标注,成本高昂。近期研究开始探索利用LLM进行自动化图构建。Chen和Bertozzi (2023) (https://arxiv.org/html/2607.15280#bib.bib3) 提出了AutoKG,使用LLM提取关键词并计算图拉普拉斯权重。Anuya等人 (2025) (https://arxiv.org/html/2607.15280#bib.bib2) 的CoDe-KG使用句子复杂度建模来提取三元组。Sarabadani等人 (2025) (https://arxiv.org/html/2607.15280#bib.bib9) 提出了DKG-LLM,将动态知识图谱与Grok 3模型结合。尽管这些工作实现了自动化,但构建的图大多用于语义检索,缺乏诊断推理所需的细粒度典型性参数(例如症状权重)和决策效用属性(例如测试成本、侵入性)。 **知识增强临床决策。** 知识增强AI旨在结合神经网络的感知能力与符号系统的逻辑能力。Gao等人 (2025) (https://arxiv.org/html/2607.15280#bib.bib5) 探索了将MKG集成到LLM中进行诊断预测。我们的方法更进一步,不仅实现了自动化图构建,还基于图设计了显式的证据评分引擎,实现了真正的“知识引导推理”。总之,我们的方法**GraphDx**是唯一同时具备自动化图构建能力、支持顺序诊断并显式建模测试成本的框架。 ## 3 方法 ### 3.1 问题形式化 我们将顺序诊断建模为一个部分可观测的决策过程。令D\\mathcal\{D\}为可能的疾病集合。在第tt轮,智能体观察到对话历史HtH\_\{t\},并维护关于D\\mathcal\{D\}的信念状态。智能体选择一个动作at∈Aactiona\_\{t\}\\in\\mathcal\{A\}\_\{action\}: - •询问(ff):询问症状或特征ff。 - •测试(τ\\tau):安排诊断测试τ\\tau。 - •诊断(dd):提供最终诊断dd。 目标是使期望总成本最小化: minπ⁡E\[∑t=1Tc\(at\)\+λmis⋅I\[d^≠d∗\]\]\\min\_\{\\pi\}\\mathbb\{E\}\\left\[\\sum\_\{t=1\}^\{T\}c\(a\_\{t\}\)\+\\lambda\_\{mis\}\\cdot\\mathbb\{I\}\[\\hat\{d\}\\neq d^\{\*\}\]\\right\] (1) 其中c\(at\)c\(a\_\{t\}\)是动作ata\_\{t\}的成本(包括金钱成本、侵入性和时间),λmis\\lambda\_\{mis\}是误诊惩罚,d^\\hat\{d\}是预测诊断,d∗d^\{\*\}是真实诊断。 ### 3.2 医学诊断知识图谱的自动构建 **GraphDx**的核心是医学诊断知识图谱(MDKG),形式化定义为有向图G=\(V,E,W,A\)\\mathcal\{G\}=\(\\mathcal\{V\},\\mathcal\{E\},\\mathcal\{W\},\\mathcal\{A\}\),其中: - •V=Vd∪Vf∪Vt\\mathcal\{V\}=\\mathcal\{V\}\_\{d\}\\cup\\mathcal\{V\}\_\{f\}\\cup\\mathcal\{V\}\_\{t\}:疾病、特征(症状/体征)和测试的节点。 - •E⊆\(Vd×Vf\)∪\(Vf×Vt\)\\mathcal\{E\}\\subseteq\(\\mathcal\{V\}\_\{d\}\\times\\mathcal\{V\}\_\{f\}\)\\cup\(\\mathcal\{V\}\_\{f\}\\times\\mathcal\{V\}\_\{t\}\):连接疾病到特征以及特征到测试的边。 - •W:E→R\\mathcal\{W\}:\\mathcal\{E\}\\to\\mathbb\{R\}:编码关联强度的边权重。 - •A:Vt→R2\\mathcal\{A\}:\\mathcal\{V\}\_\{t\}\\to\\mathbb\{R\}^\{2\}:测试属性(成本、侵入性)。 我们实现了一个完全自动化的流水线,从疾病列表Dlist\\mathcal\{D\}\_\{list\}构建G\\mathcal\{G\},无需手动标注。该过程分为三个阶段,旨在确保图成为基于证据推理的稳健计算基础。 **阶段1:并行知识提取。** 系统并行处理每个疾病d∈Dlistd\\in\\mathcal\{D\}\_\{list\}。对于每个疾病,它提示LLM提取一组元组\{\(f,wdf,Tf\)\}\\\{\(f,w\_\{df\},T\_\{f\}\)\\\},其中ff是特征,wdfw\_\{df\}是其典型性,TfT\_\{f\}是验证测试列表。为了减轻LLM中校准不良的连续概率估计带来的噪声,我们采用了**量化典型性**策略。我们将语言典型性描述映射到离散权重桶W:Edf→R\\mathcal\{W\}:\\mathcal\{E\}\_\{df\}\\to\\mathbb\{R\}: w\(d,f\)=\{w\+\+iff是标志性\(\+\+\)w\+iff是常见\(\+\)w−iff是罕见\(\-\)w−−iff是不可能\(\-\-\)w\(d,f\)=\\begin\{cases\}w\_\{\+\+\}&\\text\{if \}f\\text\{ 是标志性 \(\+\+\)\}\\\\ w\_\{\+\}&\\text\{if \}f\\text\{ 是常见 \(\+\)\}\\\\ w\_\{\-\}&\\text\{if \}f\\text\{ 是罕见 \(\-\)\}\\\\ w\_\{\-\-\}&\\text\{if \}f\\text\{ 是不可能 \(\-\-\)\}\\end\{cases\} (2) 这种量化充当低通滤波器,稳定了推理过程,使其免受LLM生成中轻微概率波动的影响。此外,为了确保图直接支持诊断规划,我们强制采用**以动作为中心的拓扑结构**。不仅仅是陈述性知识(“肺炎引起咳嗽”),提取过程显式建模了*验证边*(f,τ)∈Efτ\(f,\\tau\)\\in\\mathcal\{E\}\_\{f\\tau\},将特征连接到可以确认或排除它们的测试。这将图转化为一个导航结构:给定一个不确定的特征,智能体可以直接遍历到相关的诊断动作。 **阶段2:混合实体对齐与动态升级。** 医学概念常常面临语义模糊和角色转换(例如,一个语境下的疾病在另一个语境中成为症状)。为了解决同义词问题,我们采用**混合对齐机制**将新术语uu对齐到现有节点集V\\mathcal\{V\}。我们使用结合词汇和语义匹配的混合检索策略检索候选集Cu\\mathcal\{C\}\_\{u\}: Cu=TopKoverlap\(u,V\)∪TopKembed\(u,V\)\\mathcal\{C\}\_\{u\}=\\text\{TopK\}\_\{\\text\{overlap\}\}\(u,\\mathcal\{V\}\)\\cup\\text\{TopK\}\_\{\\text\{embed\}\}\(u,\\mathcal\{V\}\) (3) 其中TopKoverlap\\text\{TopK\}\_\{\\text\{overlap\}\}基于重叠系数(交集除以最小集大小)选择候选,以捕获部分匹配(例如,“糖尿病”⊆\\subseteq“2型糖尿病”);TopKembed\\text\{TopK\}\_\{\\text\{embed\}\}基于密集嵌入φ\(⋅\)\\phi\(\\cdot\)的余弦相似度选择候选,以捕获语义同义词。然后,LLM作为判别器D\(u,Cu\)D\(u,\\mathcal\{C\}\_\{u\}\)来确定uu是否应与v∗∈Cuv^\{\*\}\\in\\mathcal\{C\}\_\{u\}合并,还是形成新节点。此外,为了处理角色转换而无需手动干预,我们引入了**动态节点升级**策略。当一个最初作为特征添加的节点

相似文章

DeepLens诊断代理:智能体工作流设计让小推理模型能与前沿大语言模型竞争

arXiv cs.AI

DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。