xMICD:多重ICD代码的可解释表示

arXiv cs.LG 论文

摘要

本文介绍了xMICD,一种将ICD代码分组与预训练嵌入相似性相结合的方法,以创建低维、临床可解释的患者表示,其预测性能可与基于嵌入的方法相媲美。

arXiv:2608.00935v1 公告类型:新 摘要:电子健康记录(EHRs)广泛用于使用机器学习的临床风险预测。国际疾病分类(ICD)代码提供关于患者诊断的结构化信息,但有效表示它们仍然具有挑战性。现有方法通常在预测性能和可解释性之间面临权衡:基于分组的表示是可解释的,但可能会丢失信息,而基于嵌入的表示实现了强大的预测性能,但难以解释。我们提出了多重ICD代码的可解释表示(xMICD),一种从ICD代码集构建低维患者表示的方法。xMICD将临床有意义的诊断分组与预训练ICD嵌入空间中的相似性相结合。该方法不使用二元组成员资格,而是通过基于相似性的相对分配将代码分配到组中,产生的特征反映了患者诊断与每个临床组的对齐程度。在大规模EHR数据集上的实验表明,xMICD在多个临床预测任务中实现了与ICD2Vec等基于嵌入的表示相当的预测性能。同时,所得特征在临床上仍然可解释,因为每个维度对应一个可识别的诊断组。因此,xMICD提供了一种将基于嵌入的语义关系整合到可解释的临床特征空间中的实用方法,适用于机器学习模型。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:44

# 多个 ICD 编码的可解释表示

Source: https://arxiv.org/html/2608.00935
Kumkup Keeratisiwakul, Albert Phuoc Kien Van Truong, Nutcha Yodrabum, Wasin Pansiritanachot, Marvin N. Wright, Thanapon Noraset ([email protected])

###### 摘要

背景:电子健康记录(EHRs)被广泛用于基于机器学习的临床风险预测和决策支持。在 EHR 记录的众多要素中,国际疾病分类(ICD)编码扮演着关键角色,因为它们以标准化格式概括了患者诊断[25](https://arxiv.org/html/2608.00935#

相似文章

EHR基础模型中ICD代码的分层建模

arXiv cs.AI

本文研究了在EHR基础模型中显式编码ICD-10-CM层级结构的方法,采用层级令牌增强和基于图结构的代码表示。在MIMIC-IV和eICU上的实验表明,与扁平代码表示相比,该方法在域内和跨数据集预测任务中均有改进。

基于LLM探针的主要ICD类别预测

arXiv cs.AI

本文提出了一种方法,利用冻结的医学大型语言模型(LLM)表示作为共享嵌入空间,从结构化和非结构化电子健康记录数据中预测主要ICD诊断类别,在MIMIC-IV上取得了优于基线方法的准确率,并展示了向MIMIC-III的迁移能力。

机器学习合并症指数

arXiv cs.AI

本文提出了一种机器学习合并症指数(MLCI),该方法利用诊断代码和非线性学习来改善多种临床结果的风险调整,优于传统的以死亡率为中心的指数。

理解代理式ICD编码的局限性

arXiv cs.CL

本文评估了用于ICD-10-CM编码的神经网络、工作流和代理系统,识别了罕见和复杂编码上的失败模式,并表明工具增强的代理配置可以在特定子集上恢复性能。