基于知识图谱注入的表格医疗数据跨域特征扩展

arXiv cs.AI 论文

摘要

本文提出MedKGTab,一种知识注入框架,利用生物医学知识图谱扩展表格医疗数据中的跨域特征,通过生成高保真生物医学档案解决数据稀缺问题。

arXiv:2606.31171v1 公告类型: 新 摘要:获取全面的跨域生物医学档案通常成本高昂且耗时,导致医学研究中严重的数据稀缺问题。为应对这一挑战,我们提出MedKGTab,一种专为表格医疗数据跨域特征扩展而设计的知识注入框架。MedKGTab旨在通过利用现有特征之间的固有统计依赖性和已建立的医学相关性,推断未收集的生物医学特征。通过采用行列双注意力机制,MedKGTab直接操作于原始结构化表格数据,无需分词即可捕捉精确的数值分布,避免了分词带来的结构损失。关键的是,MedKGTab将数据驱动的统计先验与SPOKE生物医学知识图谱相结合,实现了数据通道与知识通道之间的最佳协同。在这种协同作用下,数据通道生成的表示受到注入的生物医学知识的调制,确保最终生成的数据基于经验性医学研究。实验结果表明,MedKGTab在跨域特征扩展中实现了高数据保真度和真实的数据表示。其性能优于当前最先进的医学大模型(如百川M3-plus)以及专为医学数据生成设计的表格模型。此外,无论是在同一数据集内推断缺失特征,还是在不同医学队列间进行泛化,MedKGTab在各种数据生成场景中均始终表现出色。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:37

# 基于知识图谱注入的表格医疗数据跨领域特征扩展
来源:https://arxiv.org/html/2606.31171
孟颖舟¹ 尹永杰² 辛浩然³ 刘国平⁴ 杨晨²
¹上海财经大学计算机与人工智能学院
²复旦大学计算机科学与技术学院
³独立研究者
⁴上海中医药大学基础医学院

###### 摘要

获取全面的跨领域生物医学特征通常成本高昂且耗时,导致医学研究中出现严重的数据稀缺问题。为应对这一挑战,我们提出 MedKGTab,一个专为表格医疗数据跨领域特征扩展设计的知体注入框架。MedKGTab 旨在利用已有特征之间固有的统计依赖性和已建立的医学相关性,推断未收集的生物医学特征。通过采用行-列双注意力机制,MedKGTab 直接对原始结构化表格数据进行操作,固有地捕捉精确的数值分布,避免了分词化导致的结构损失。至关重要的是,MedKGTab 将数据驱动的统计先验与 SPOKE 生物医学知识图谱相结合,实现了数据通道与知识通道之间的最佳协同。在这种协同中,数据通道得到的表示通过注入的生物医学知识进行调制,确保最终生成的数据基于经验医学研究。实验结果表明,MedKGTab 在跨领域特征扩展中实现了高数据保真度和逼真的数据表示。其性能优于最先进的医学大模型(例如,Baichuan M3-plus)以及专为医学数据生成设计的表格模型。此外,无论在同一个数据集中推断缺失特征,还是在不同医学队列间进行泛化,MedKGTab 在各种数据生成场景中均持续提供优越性能。

## 1 引言

生物医学特征对于医学研究至关重要,因为它们为疾病表征、诊断和治疗反应分析提供了重要信息。然而,获取全面的跨领域特征成本过高且耗时过长,导致严重的数据稀缺,如图 1 (https://arxiv.org/html/2606.31171#S1.F1)(a) 所示。表格医疗数据中的跨领域特征扩展提供了一种有前景的生成式解决方案,通过利用已有特征之间的固有依赖关系(Sun et al., 2025 (https://arxiv.org/html/2606.31171#bib.bib31);Wang et al., 2026 (https://arxiv.org/html/2606.31171#bib.bib32))推断未收集的特征。这种生成式工作流(图 1 (https://arxiv.org/html/2606.31171#S1.F1)(b))可以快速且低成本地合成大量高保真度的生物医学特征,从而支持更广泛的下游应用,从基础的疾病预测建模到复杂的任务(如疾病-药物相互作用推理)。然而,由于样本量小、数据稀疏性严重以及潜在的生物机制复杂(Athieniti and Spyrou, 2023 (https://arxiv.org/html/2606.31171#bib.bib29);Mani et al., 2025 (https://arxiv.org/html/2606.31171#bib.bib28);Tarazona et al., 2021 (https://arxiv.org/html/2606.31171#bib.bib30)),在不同生物领域间实现可靠的特征扩展仍然异常困难。

现有的表格数据生成方法难以应对这些挑战,因为它们主要针对领域内合成而设计(Chen et al., 2022 (https://arxiv.org/html/2606.31171#bib.bib21);Gorishniy et al., 2021 (https://arxiv.org/html/2606.31171#bib.bib9);Ye et al., 2025 (https://arxiv.org/html/2606.31171#bib.bib19))。为建模复杂的跨领域依赖关系,近期研究尝试注入外部知识图谱 (KG) 或开发专门的医学大语言模型 (LLM),但这两种范式均存在固有局限性。在表格数据生成模型中注入 KG 通常仅作为浅层结构约束,这种注入的知识容易受到稀释,其强度在不同任务中缺乏灵活性(Choi et al., 2017 (https://arxiv.org/html/2606.31171#bib.bib37))。与此同时,尽管 LLM 天然拥有庞大的内部知识,但其从根本上不适用于数值型表格数据。由于依赖分词化,LLM 无法保留生物实体之间的结构关系(Grinsztajn et al., 2022 (https://arxiv.org/html/2606.31171#bib.bib1)),导致结构信息的严重丢失以及无法捕捉真实的数值分布。此外,基于 LLM 的方法中更新模型参数所涉及的计算成本仍然过高(Li and Liang, 2021 (https://arxiv.org/html/2606.31171#bib.bib35);Wang et al., 2025 (https://arxiv.org/html/2606.31171#bib.bib36))。

![图 1](https://arxiv.org/html/2606.31171#S1.F1)
参考图注:图 1:传统数据收集工作流与我们的知识注入跨领域特征扩展工作流的比较。

为了克服知识注入稀释和结构不可知的 LLM 这两方面的局限性,我们提出 MedKGTab,这是一个专为跨领域医学特征扩展设计的知识注入框架。通过采用行-列双注意力机制,MedKGTab 直接对原始结构化表格数据进行操作,固有地捕捉精确的数值分布,无需分词化。更重要的是,MedKGTab 将数据驱动的统计先验与 SPOKE 生物医学知识图谱相结合。与先前容易稀释知识的方法不同,MedKGTab 实现了数据通道与知识通道之间的最佳协同。通过将特征级图先验作为特定目标偏置注入注意力模块,它显式地建模了跨领域的生物医学关联。该机制确保模型在获得关键的生物医学指导的同时,不会覆盖其内在的数据表示,成功保留了表格和图结构信息。总的来说,我们的主要贡献如下:

- • 我们设计了一种轻量级、可控的知识注入机制,克服了表格与图之间的对齐问题。该机制有效注入生物医学先验,且无需高昂的预训练参数更新计算成本。
- • 我们提出 MedKGTab 框架,该框架最优地协同数据通道与知识通道,提供必要的生物医学指导,而不会覆盖内在的数据表示。
- • 大量实验证明 MedKGTab 在数据保真度和逼真数据表示方面具有优越性。通过捕捉数值分布并保留生物医学关系,在领域内和跨队列两种设置下,它均优于经典模型和专门的医学大语言模型(例如,Baichuan M3-plus)。

## 2 相关工作

### 2.1 表格数据生成

合成表格数据生成在数据增强、隐私保护和有限监督学习领域得到了广泛研究。早期的深度生成模型,如 CTGAN、TVAE (Xu et al., 2019 (https://arxiv.org/html/2606.31171#bib.bib2)) 和 TabDDPM (Kotelnikov et al., 2023 (https://arxiv.org/html/2606.31171#bib.bib4)),有效在统一框架内建模了混合数值和类别特征。然而,它们主要关注领域内生成,难以应对跨领域医学特征。为提升表格模型的泛化能力,近期研究探索了预训练和可迁移的建模方法。TabPFN (Hollmann et al., 2025 (https://arxiv.org/html/2606.31171#bib.bib5)) 通过在超过 1 亿个合成表格任务上进行预训练,学习了可迁移的先验,在低数据条件下表现出强性能。FT-Transformer (Gorishniy et al., 2021 (https://arxiv.org/html/2606.31171#bib.bib9)) 和 TabR (Gorishniy et al., 2024 (https://arxiv.org/html/2606.31171#bib.bib6)) 通过更强的架构或基于检索的机制进一步提升了可迁移性。MediTab (Wang et al., 2024 (https://arxiv.org/html/2606.31171#bib.bib7)) 通过数据整合和跨异质医学表格的任务对齐提升可迁移性,而 MedTransTab (Chen et al., 2025 (https://arxiv.org/html/2606.31171#bib.bib8)) 则利用了医学大语言模型。

尽管取得这些进展,现有方法仍主要强调预测性能或统计保真度。它们并未显式地纳入专家生物医学知识来可靠地控制跨领域特征依赖,因此对于严格的医学特征扩展来说并非最优。

### 2.2 医学大语言模型

得益于在多样化临床数据集上的预训练,医学大语言模型在生物医学推理方面展现出强劲性能。代表性模型如 Med-PaLM 2 (Singhal et al., 2023 (https://arxiv.org/html/2606.31171#bib.bib10)) 和 Med-PaLM M (Tu et al., 2023 (https://arxiv.org/html/2606.31171#bib.bib11)) 在医学问答、长文本回复生成以及多模态生物医学理解方面表现出有效性。开源的医学 LLM,包括 ChatDoctor (Li et al., 2023 (https://arxiv.org/html/2606.31171#bib.bib12))、BioMistral (Labrak et al., 2024 (https://arxiv.org/html/2606.31171#bib.bib13))、MEDITRON (Chen et al., 2023 (https://arxiv.org/html/2606.31171#bib.bib14)) 和 Baichuan-M3 (Dou et al., 2026 (https://arxiv.org/html/2606.31171#bib.bib15)),通过指令微调和领域特定知识注入,进一步提升了医学推理和复杂临床推断能力。

尽管医学大语言模型知识丰富,但它们是为非结构化或半结构化序列而设计的。将其直接应用于表格特征扩展,会受到有限的上下文窗口以及根本无法建模复杂统计分布和定量特征间相关性的严重制约。

## 3 方法论

在现实世界中,获取全面的生物医学数据往往耗时且成本高昂。因此,跨领域特征扩展的目标是从易获取的源域特征推断出未收集的目标域特征。尽管近期的表格基础模型为小样本表格学习提供了强大的可迁移先验,但它们容易从有限的配对数据中学习不稳定的源-目标相关性,往往产生医学上不合理的结果。为解决此问题,我们提出 MedKGTab,一个用于跨领域医学特征扩展的知识注入表格框架,如图 2 (https://arxiv.org/html/2606.31171#S3.F2) 所示。具体来说,我们从外部生物医学知识图谱中导出特征级生物医学先验,并将其显式注入到预训练表格基础模型的特征注意力机制中。通过这种协同整合,目标域特征扩展不仅受经验数据统计的支配,还受到已建立生物医学知识的调制。

![图 2](https://arxiv.org/html/2606.31171#S3.F2)
参考图注:图 2:MedKGTab 的整体框架

### 3.1 问题形式化

对于多中心跨领域生物医学特征扩展,设完整的全局特征空间由 \(D\) 个不同的临床变量组成。在现实临床实践中,不同机构往往记录不相交的特征域。例如,如图 2 所示,医院 1 的数据可能包含域 A 但缺少域 B,而医院 2 则呈现相反的模式。

假设我们拥有来自多个不同队列的数据集。对于第 \(k\) 个队列,共有 \(N^{(k)}\) 名患者,仅收集了特定子集 \(d_k\) 个特征,得到相应的数据矩阵:

\[\mathcal{D}^{(k)} = \mathbf{X}_{\mathrm{obs}}^{(k)} \in \mathbb{R}^{N^{(k)} \times d_k}.\]

这些患者未收集的互补特征域记为缺失数据 \(\mathbf{X}_{\mathrm{mis}}^{(k)}\)。

总体任务是利用所有中心聚合的可用数据,准确推断所有队列 \(k\) 的未收集特征块 \(\hat{\mathbf{X}}_{\mathrm{mis}}^{(k)}\),从而系统地重建一个完整的跨领域数据集。

### 3.2 数据通道

如图 2 左上方面板所示,数据通道旨在将多中心数据集结构化为统一的先验上下文和迭代生成目标。

首先,我们聚合所有队列中收集的多域数据以构建统一上下文。然后,为了将多目标特征扩展转化为一系列可处理的推理问题,整个生成任务被划分为特征级子任务(例如,医院 1 的特征 B1 到 \(B_n\))。对于第 \(t\) 个缺失特征,我们构建其推理的对应输入:

\[
\mathcal{D}_t^{\mathrm{sub}} = (\mathbf{X}^{\mathrm{context}}, \mathbf{Y}^{\mathrm{obs}}_{:, t}),
\]

其中 \(\mathbf{X}^{\mathrm{context}}\) 是聚合的上下文,\(\mathbf{Y}^{\mathrm{obs}}_{:, t}\) 表示该特征在其他队列中的可用数据。MedKGTab 随后遍历未收集的特征列表,依次推断每个缺失特征的数据。

### 3.3 知识通道

如图 2 左下方面板所示,知识通道从外部知识图谱中导出样本无关的生物医学先验。在本研究中,我们使用 SPOKE (Morris et al., 2023 (https://arxiv.org/html/2606.31171#bib.bib17)),这是一个大规模知识图谱,整合了来自经过筛选的生物医学资源中的多样化实体和关系,为约束医学表格数据中的特征交互提供了结构化的可靠基础。

为了在无语义歧义的情况下将表格域与该图谱对齐,我们严格将源特征和目标特征映射到与任务相关的节点类型(例如,将代谢物映射到 “Compound” 节点,将微生物属映射到 “Organism” 节点)。每个表格特征唯一映射到最多一个对应的 SPOKE 节点。

鉴于生物医学网络固有的稀疏性,仅依赖直接边是不够的。因此,我们执行一种拓扑到矩阵的投影,该投影融合了闭包的一阶邻域信息,记为 \( \mathcal{N}(\cdot) \)。我们将这种增强的拓扑投影成特征级知识矩阵 \( A \in \mathbb{R}^{(d_x + d_y) \times (d_x + d_y)} \):

\[
A_{ij} = \begin{cases}
1, & \text{if } i \neq j \text{ and } \mathcal{N}(v_i) \cap \mathcal{N}(v_j) \neq \varnothing, \\
0, & \text{otherwise},
\end{cases}
\]

其中 \( v_i \) 和 \( v_j \) 分别表示成功映射的特征 \( i \) 和 \( j \) 对应的 SPOKE 节点。因此,若两个特征在其直接邻域中共享至少一个概念节点,则 \( A_{ij} = 1 \)。对于未映射(词汇表外)的特征,其在 \( A \) 中的对应行和列保持为零。此投影确保 \( A \) 能够鲁棒地捕捉基于共享生物医学拓扑的特征依赖关系。

为了最终确定用于模型注入的先验,我们添加自环以保留自我信息,并应用对称归一化:

\[
\tilde{A} = D^{-\frac{1}{2}} (A + I) \, D^{-\frac{1}{2}},
\]

其中 \( I \) 是单位矩阵,\( D \) 是 \( A + I \) 的度矩阵。得到的归一化矩阵 \( \tilde{A} \) 作为

相似文章

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG对比

arXiv cs.CL

# 将结构化生物医学知识注入语言模型:持续预训练与GraphRAG 来源:[https://arxiv.org/html/2604.16422](https://arxiv.org/html/2604.16422) ###### 摘要 将领域特定知识注入模型对于使语言模型(LMs)适应生物医学等专业领域至关重要。尽管目前大多数方法依赖于非结构化文本语料库,但本研究探讨了两种利用UMLS元术语表(Metathesaurus)中结构化知识的互补策略: