MHGraphBench:基于知识图谱的大语言模型心理健康知识基准测试
摘要
本文介绍了MHGraphBench,这是一个基于知识图谱的基准测试,用于评估大语言模型在心理健康知识方面的能力,包括实体识别、关系判断和多跳推理。对15个LLM的实验揭示了识别能力与判断能力之间存在差距。
arXiv:2605.15589v1 公告类型:新
摘要:大语言模型(LLM)越来越多地应用于心理健康领域,但尚不清楚它们如何很好地捕捉相关的生物医学知识,以及如何可靠地将这些知识应用于临床上的重要结构化判断。本文提出了一个基于知识图谱(KG)的基准测试,用于评估LLM在心理健康实体识别、关系判断和两跳推理方面的能力。该基准测试源自PrimeKG,包含九个任务族,并提供了KG支持的答案和受控的负面选项。对15个闭源和开源LLM的实验揭示了一个持续存在的识别-判断差距:领先模型在实体类型识别和小型关系类型识别子集上达到了接近最优的表现,但在关系预测和两跳推理方面仍存在困难。此外,简短的KG派生片段对某些模型有帮助,但对其他模型则降低了性能。此外,在受约束的多项选择设置下,输出格式的可靠性可能显著影响实测性能,这凸显了响应有效性在基于基准测试的评估中的关键作用。因此,MHGraphBench应被解释为在受约束的多项选择接口下评估与PrimeKG中精心策划的心理健康子集的一致性,而不是作为对现实世界临床安全性的直接评估。
查看缓存全文
缓存时间: 2026/05/18 06:33
# MHGraphBench: 基于知识图谱的大语言模型心理健康知识基准测试
来源:https://arxiv.org/html/2605.15589
Weixin Liu¹ Congning Ni² Shelagh A. Mulvaney¹ Susannah L. Rose² Murat Kantarcioglu³ Bradley A. Malin¹,² Zhijun Yin¹,²
¹范德堡大学,美国田纳西州纳什维尔
²范德堡大学医学中心,美国田纳西州纳什维尔
³弗吉尼亚理工大学,美国弗吉尼亚州布莱克斯堡
{weixin.liu, shelagh.mulvaney}@vanderbilt.edu
{congning.ni.1, susannah.rose, b.malin, zhijun.yin}@vumc.org
[email protected]
###### 摘要
大语言模型(LLMs)在心理健康领域的应用日益广泛,但目前尚不清楚它们对相关生物医学知识的掌握程度,以及能否可靠地将其应用于具有临床意义的结构化判断。本文提出一个基于知识图谱(KG)的基准测试,用于评估LLMs在心理健康实体识别、关系判断和两步推理方面的能力。该基准源自PrimeKG,包含九个任务族,并配备KG支持的正确答案和受控的负选项。针对15个闭源和开源LLMs的实验揭示了一个持续的“识别-判断”差距:领先模型在实体类型识别和小规模的关系类型识别子集上接近满分,但在关系预测和两步推理上仍表现挣扎。此外,短的KG派生片段对一些模型有益,但会降低其他模型的性能。更关键的是,在受限的多项选择设置下,输出格式的可靠性会显著影响测量性能,凸显了响应有效性在基准评估中的关键作用。因此,MHGraphBench应理解为在受限的多项选择接口下,评估与PrimeKG中经过整理的心理健康子图的一致性,而非对现实世界临床安全性的直接评估。
MHGraphBench:基于知识图谱的大语言模型心理健康知识基准测试
Weixin Liu¹ Congning Ni² Shelagh A. Mulvaney¹ Susannah L. Rose² Murat Kantarcioglu³ Bradley A. Malin¹,² Zhijun Yin¹,²
¹范德堡大学,美国田纳西州纳什维尔
²范德堡大学医学中心,美国田纳西州纳什维尔
³弗吉尼亚理工大学,美国弗吉尼亚州布莱克斯堡
{weixin.liu, shelagh.mulvaney}@vanderbilt.edu
{congning.ni.1, susannah.rose, b.malin, zhijun.yin}@vumc.org
[email protected]
## 1 引言
心理健康障碍给全球带来了巨大且日益沉重的负担(GBD 2019 Mental Disorders Collaborators (2022 (https://arxiv.org/html/2605.15589#bib.bib1)))。心理健康领域的临床护理和转化研究通常需要整合异质的生物医学证据,包括疾病关系、表型和暴露、药物使用边界(例如,适应症vs.禁忌症vs.超说明书使用)以及疾病相关的生物信号(Freidel and Schwarz (2025 (https://arxiv.org/html/2605.15589#bib.bib9)); Gao et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib10)); Kyrios et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib11)); Rosland et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib12)))。这些特性使得心理健康应用不仅对模型能否识别相关生物医学实体高度敏感,也对其能否正确应用知识进行具有临床意义的结构化判断高度敏感。
大语言模型(LLMs)在生物医学和临床任务中表现出色,并吸引了越来越多在医疗应用方面的兴趣(Singhal et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib2)); Saab et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib13)); Iqbal et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib6)); Li et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib14))),包括心理健康环境(Volkmer et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib15)); Obradovich et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib21)))。大多数现有评估仍报告在广泛生物医学或临床基准上的总体准确率,对心理健康领域尤其重要的两个问题提供的见解有限:(i)LLM对心理健康生物医学知识的覆盖范围有多广,以及(ii)它能否可靠地区分具有临床意义和安全敏感性的关系边界(Arora et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib7)); Cai et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib8)))。
与此同时,专门针对心理健康的评估正在迅速发展。最近的基准测试已开始评估精神科诊断决策、现实咨询与求助互动以及心理健康环境中的可信度(Song et al. (2026 (https://arxiv.org/html/2605.15589#bib.bib40)); Xiong et al. (2026 (https://arxiv.org/html/2605.15589#bib.bib41)); Li et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib42)))。这些工作拓宽了心理健康LLM评估的范围,但主要侧重于诊断、咨询质量或可信度,而非可验证的结构化生物医学知识和基于知识图谱(KG)的关系推理。这一挑战因越来越多的证据而进一步复杂化,这些证据表明,多项选择LLM评估本身可能对选项顺序、提示格式、受限答案格式和输出解析规则敏感(Wang et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib18)); Pezeshkpour and Hruschka (2024 (https://arxiv.org/html/2605.15589#bib.bib19)); Zheng et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib22)))。因此,我们的目标不是直接评估现实世界的临床决策或临床安全性,而是在受限的多项选择接口下,依据经过整理的心理健康图,评估基于KG的结构化辨别和短路径推理能力。
KG以结构化且机器可验证的形式提供经过整理的生物医学事实。它们非常适合构建基准测试,因为支持从事实三元组自动生成问答、系统性的负采样以及针对实体、关系和路径的可解释任务设计(Chandak et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib3)); Sun et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib16)); Salnikov et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib17)); Markowitz et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib20)))。像PrimeKG这样的生物医学KG也展示了图结构资源对于下游生物医学推理和分析的价值(Chandak et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib3)))。对于心理健康,基于KG的评估尤其有用,因为它允许对具有临床意义的关系族进行受控基准测试,而不是仅依赖开放式提示。此外,直接源自KG事实的基准项可根据底层图进行验证,从而不仅能够分析任务准确性,还能分析图范围内的知识覆盖情况。
本文提出**MHGraphBench**,一个基于KG的基准测试,用于评估LLMs中的心理健康生物医学知识,该基准使用PrimeKG中经过整理的心理健康子图。我们使用42个精神科种子疾病节点定义基准领域,提取一个临床关注的子图,并将其转化为九个标准化的多项选择任务族,涵盖实体识别、关系判断和短疾病介导推理。所有基准项都源自带有受控负选项的KG支持事实,使得MHGraphBench成为一个结构化且可重复的基准,用于评估相对于经过整理的图的心理健康生物医学知识,而不是更广泛临床推理或现实世界临床安全性的直接衡量。除了基准准确率,我们还量化了实体、关系和三元组层面的图范围覆盖,并提供细粒度的实体与关系中心分析,以定位模型成功或失败之处。图1 (https://arxiv.org/html/2605.15589#S1.F1) 总结了整体流程,包括精神科种子选择、心理健康子图提取、KG到QA生成、任务构建和评估。
#### 设计原则:可验证的KG基础评估。
我们的核心设计原则是,基准项应自动从KG事实派生,配以明确的负采样,并且能针对底层的心理健康子图进行验证。这使得评估可扩展且可重复,同时允许我们分析模型在哪些实体、关系和图区域处理得好或差,而不仅仅是用单一的整体准确数字来总结性能。
利用MHGraphBench,我们提出四个主要问题:1) 在实体类型识别和小规模的关系类型识别子集上表现良好的模型,是否也能在具有临床意义的关系判断上表现良好?2) 与较简单的识别任务相比,短疾病介导推理的难度如何?3) 图范围覆盖和细粒度分析除了平均任务准确率之外,还能提供哪些额外的见解?4) 当添加短的KG派生证据时,它是否始终有助于模型性能?
我们对15个模型的实验得出了三个主要结论。首先,即使是最强的模型,在实体类型识别和小规模的关系类型识别子集上接近上限,但在关系预测和两步推理上仍然明显较弱,揭示了持续的“识别-判断”差距。其次,临床上敏感的关系族,尤其是禁忌症(contraindication),在所有模型中都仍然困难,并且开源模型在整体基准上远落后于最强的GPT系列系统。第三,图范围覆盖和证据增强提供了互补的见解:覆盖排名并不完全匹配平均任务排名,而且短的KG派生证据有助于某些模型,但降低了其他模型的性能。
#### 贡献
- • 我们根据由42个精神科种子疾病节点定义的PrimeKG子图,构建了一个心理健康基准。它包括九个标准化的多项选择任务族,涵盖实体识别、关系判断和短两步推理,全部带有KG支持的真实标签和受控负选项。
- • 我们引入了图范围覆盖指标和细粒度的实体与关系中心分析,以补充原始任务准确率,并在心理健康图中定位模型的优势和弱点。
- • 我们展示了在15个LLM上的实证结果,揭示了持续的“识别-判断”差距,证据增强的混合效应,以及在受限基准评估中响应格式可靠性的重要性。
图1:基于KG的心理健康基准框架概览。从PrimeKG中的42个最终精神科种子疾病节点开始,我们提取一个临床关注的子图,将所得知识图谱转化为包含九个任务族的多项选择问答(QA)基准,并使用准确率、覆盖率和细粒度分析来评估模型。
## 2 相关工作
多项研究评估LLMs在生物医学问答、临床推理、事实性、专家式考试任务以及更广泛的医疗用例中的表现(Singhal et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib2)); Saab et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib13)); Iqbal et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib6)); Li et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib14)))。这些基准提供了有用的广泛能力信号,但通常报告异质任务上的汇总分数,因此对特定于心理健康的知识或失败模式提供的见解有限(Singhal et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib2)); Saab et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib13)); Arora et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib7)))。此外,先前工作已表明,多项选择LLM评估本身可能对选项顺序、提示格式、受限答案格式和输出解析规则等因素敏感(Pezeshkpour and Hruschka (2024 (https://arxiv.org/html/2605.15589#bib.bib19)); Zheng et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib22)); Wang et al. (2024 (https://arxiv.org/html/2605.15589#bib.bib18)))。
知识图谱已被用于探测事实知识、生成可验证的基准测试,以及在受控扰动下研究模型推理行为(Chandak et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib3)); Sun et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib16)); Salnikov et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib17)); Markowitz et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib20)))。像药物重定位知识图谱(DRKG)和PrimeKG这样的生物医学KG资源进一步展示了结构化图表示在整合异质生物医学证据方面的价值(Ioannidis et al. (2020 (https://arxiv.org/html/2605.15589#bib.bib4)); Chandak et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib3)))。基于KG的基准测试尤其有吸引力,因为它们支持可扩展的问题生成、受控负采样、明确的黄金标签以及针对实体、关系和路径的可解释评估。然而,先前很少有工作专注于以心理健康为中心的KG基准测试,并涉及具有临床意义的关系边界、短路径推理任务和图级别覆盖分析。
心理健康生物医学知识涵盖疾病关系、药物使用边界、表型、暴露和生物关联(Freidel and Schwarz (2025 (https://arxiv.org/html/2605.15589#bib.bib9)); Gao et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib10)))。最近专门针对心理健康的基准测试通过针对精神科诊断决策、咨询和求助质量以及安全敏感环境下的可信度,将评估扩展到广泛的生物医学或临床QA之外(Song et al. (2026 (https://arxiv.org/html/2605.15589#bib.bib40)); Xiong et al. (2026 (https://arxiv.org/html/2605.15589#bib.bib41)); Li et al. (2025 (https://arxiv.org/html/2605.15589#bib.bib42)))。这些基准测试拓宽了心理健康LLM评估的范围,但主要侧重于诊断、咨询质量或可信度,而非可验证的结构化生物医学知识和基于KG的关系推理。我们的基准测试通过专注于PrimeKG中经过整理的心理健康切片,并在一个统一的KG基础框架中评估实体识别、关系判断、短推理行为和图范围覆盖,来补充这些工作。
## 3 基准测试构建与KG到QA生成
图1 (https://arxiv.org/html/2605.15589#S1.F1) 总结了所提出框架的端到端流程。精神科种子疾病定义了目标领域,子图提取产生PrimeKG中经过整理的心理健康切片,KG到QA生成将图事实转化为基准项,评估报告总体准确率、图范围覆盖和细粒度分析。
### 3.1 心理健康子图
PrimeKG是一个大型、公开可用的生物医学知识图谱,它整合了跨药物、疾病、基因/蛋白质、通路和其他生物医学实体的经过整理的关联,其中类型化节点通过语义定义的关系边连接(Chandak et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib3)))。在PrimeKG中,疾病节点使用Mondo疾病本体论(MONDO)的术语进行编码,并在图构建过程中分组为具有临床意义的疾病节点(Chandak et al. (2023 (https://arxiv.org/html/2605.15589#bib.bib3)))。为了聚焦于相似文章
HyperGVL:大型视觉-语言模型在超图理解和推理中的基准测试与改进
HyperGVL 推出首个评估大型视觉-语言模型超图理解和推理能力的基准,包含 84,000 个问答样本和 12 项任务及实际应用。论文还提出了 WiseHyGR,一个可泛化的路由器,通过自适应超图表示改进 LVLM 性能。
BLINKG:大语言模型集成知识图谱生成的基准测试
BLINKG 是一个基准测试,旨在评估大语言模型(LLM)从异构数据源构建知识图谱时的映射能力。它提供了一个标准化框架,用于评估 LLM 在数据模式与本体概念之间建立对应关系的有效性。
用于评估知识图谱构建方法和图神经网络的统一基准
本文介绍了一个统一的基准测试,旨在评估图神经网络在基于文本构建的噪声知识图谱上的鲁棒性,以及生物医学领域图构建方法的有效性。
MedicalBench:评估大型语言模型以改进医学概念提取
MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。
K12-KGraph:一个课程对齐的知识图谱,用于基准测试和训练教育大语言模型
介绍了K12-KGraph,一个从中国教科书提取的课程对齐知识图谱,以及用于评估和提升LLM在K-12教育中课程认知能力的基准测试(K12-Bench)和训练数据(K12-Train)。