TreeText-CTS:用于不规则临床时间序列预测的紧凑、可溯源树路径证据
摘要
介绍TreeText-CTS,一种将不规则EHR轨迹转换为紧凑、可溯源树路径证据单元的方法,无需患者级摘要。在三个临床基准测试中,它在基于文本的EHR时间序列接口中实现了最先进的AUROC和AUPRC。
arXiv:2605.20292v1 公告类型:新
摘要:数值时间序列模型能够有效处理不规则电子健康记录(EHR)轨迹,但它们不能自然地将以可读证据形式支持每个风险估计的测量和时间模式暴露出来。现有的基于文本的接口提高了可读性,但通常依赖于原始的序列化(冗长且冗余)或患者级的自由形式摘要(难以追溯到源测量和时间窗口)。为了弥合这一差距,我们引入了TreeText-CTS(临床时间序列),它将不规则EHR轨迹转换为人类可读、紧凑、可溯源的树路径证据单元,无需患者级摘要或推理时的自回归解码。TreeText-CTS通过冻结的XGBoost模型路由多尺度窗口摘要,并将激活的树路径表述为由阈值条件组成的确定性、可溯源的证据单元。证据选择器组装这些单元的信息子集,然后语言模型编码器将其整合用于预测。在PhysioNet 2012死亡率、MIMIC-III死亡率和PhysioNet 2019脓毒症发病预测中,TreeText-CTS在评估的基于文本的EHR时间序列接口中实现了最佳AUROC和AUPRC,相比之前最强的基于文本的接口,AUPRC提高了6.0到9.7个绝对百分点,同时与数值时间序列模型保持竞争力。消融实验表明,树路径证据构建、证据选择和语言模型组成各自对性能有贡献。由于传递给语言模型编码器的每个片段都由激活的树路径阈值条件构建,TreeText-CTS使提供给最终预测器的证据可检查和可溯源。
查看缓存全文
缓存时间: 2026/05/21 06:21
# TreeText-CTS: 面向不规律临床时间序列预测的紧凑、可溯源树路径证据
来源:https://arxiv.org/html/2605.20292
Kwanhyung Lee¹², Juhwan Choi², Jongheon Kim¹, Joohyung Lee², Hyeongwon Jang¹, Eunho Yang¹
¹ Kim Jaechul Graduate School of AI, KAIST
² AITRICS
kwanlee9209@kaist\.ac\.kr
###### 摘要
数值型时间序列模型能够高效处理不规律电子健康记录轨迹,但无法自然地将支撑各风险估计的测量值与时间模式呈现为可读证据。现有基于文本的接口虽然提升了可读性,但通常依赖原始序列化(冗长且冗余)或患者级自由形式摘要(难以溯源至源测量值与时间窗口)。为弥补这一缺口,我们提出TreeText-CTS(临床时间序列),它将不规律电子健康记录轨迹转换为人类可读、紧凑且可溯源的树路径证据单元,无需患者级摘要或推理时的自回归解码。TreeText-CTS 通过冻结的 XGBoost 模型路由多尺度窗口摘要,并将激活的树路径表达为由阈值条件组成的确定性、可溯源证据单元。一个证据选择器会组装出这些单元的一个信息子集,随后由语言模型编码器整合以进行预测。在 PhysioNet 2012 死亡率、MIMIC-III 死亡率和 PhysioNet 2019 脓毒症发作预测任务中,TreeText-CTS 在所有评估的基于文本的电子健康记录时间序列接口中取得了最佳 AUROC 和 AUPRC,AUPRC 相比此前最强的基于文本接口提升了 6.0 到 9.7 个绝对百分点,同时与数值型时间序列模型保持竞争力。消融实验表明,树路径证据构建、证据选择以及语言模型组合均对性能有贡献。由于传递给语言模型编码器的每个片段均由激活的树路径阈值条件构成,TreeText-CTS 使得提供给最终预测器的证据可检查、可溯源。
## 1 引言
大语言模型已成为跨领域广泛有用的基础模型。它们在大规模语料上训练,编码了广泛的先验知识,这在医疗健康领域尤为宝贵——因为标记数据稀缺、昂贵且难以共享。此外,它们的语言输出也为推理、证据展示和人工检查提供了自然媒介。这些特性促使大语言模型应用于医疗健康预测,在此场景中模型应同时支持准确性与可解释的决策制定。
近期电子健康记录建模工作体现了这一趋势,包括指令微调的电子健康记录接口[26],长上下文临床建模[25],知识增强的预测与推理[8,9],以及由大语言模型导出的不规律重症监护时间序列表示[7]。然而,不规律电子健康记录时间序列预测仍由数值模型主导,这类模型直接处理数值、时间戳、掩码和缺失模式[2,19,6,22,28,14,12]。现有基于大语言模型的电子健康记录接口往往表现不如这些预测器,表明基于语言的方法必须保留数值模型所利用的结构化信号。
一个核心挑战是表示问题:原始电子健康记录时间序列在本质上是非语言的,它们由不规律的数值、时间戳、实验室检查、生命体征、干预措施、缺失模式和静态协变量组成。因此,将大语言模型应用于电子健康记录时间序列,需要一个能将结构化观测转化为语言、同时保留信息以实现准确且可检查预测的接口。
现有电子健康记录到语言的接口分为两大类。基于规则的方法使用固定模板序列化观测,保留源值并避免患者级生成[4,3]。它们是确定性的,但往往基于启发和穷举:它们将观测表述出来是因为观测存在,而非因为它们是紧凑的证据。这导致冗长、冗余的输入,难以验证。基于模型的方法则使用大语言模型对患者轨迹进行摘要、情境化或嵌入[7,13]。它们能提升可读性,但可能需要进行代价高昂的患者级生成,引发部署和隐私担忧,并且由于生成的文本可能省略或歪曲源测量值,需要进行忠实性检查[11,1,24]。
这些局限性表明缺少一种接口:像摘要一样紧凑,像基于规则的表示一样确定,并且可追溯到源电子健康记录窗口。我们提出 TreeText-CTS,一种用于不规律电子健康记录时间序列预测的树基语言接口。TreeText-CTS 利用树来发现与预测相关的阈值,并利用语言将激活的树路径呈现为可读证据。它在多个回溯窗口上对轨迹进行摘要,将摘要通过固定的窗口特定 XGBoost 模型路由,并将激活的根到叶路径渲染为确定性阈值谓词,例如 “MAP 最小值不超过 65” 或 “最近一次心率高于 110”。每个谓词都关联到其源窗口、树和叶节点。一个紧凑证据选择器组装出一个紧凑的树路径证据单元子集,然后一个临床语言模型分类器对这些单元进行组合以进行最终预测。
这一设计结合了先前接口的优势。与基于规则的序列化相似,分类器输入是确定性的、可复现且可溯源的。与基于模型的摘要相似,它具有选择性且可读,而非原始观测列表。与患者级自由形式摘要不同,TreeText-CTS 不需要推理时的自回归解码,并将确定性谓词文本作为可审计的证据锚点;可选的临床注释在离线状态下缓存以提供有临床意义的上下文,但绝不取代树派生的谓词。与近期使用大语言模型生成特征或细化树规则的大语言模型-树方法不同[15,27],TreeText-CTS 保持树库存固定,并且仅在确定性树路径证据构建之后使用语言编码器。
##### 贡献。
我们的贡献包括三个方面:
- • **针对不规律电子健康记录时间序列的树路径证据构建**。我们将多尺度电子健康记录窗口摘要转换为固定 XGBoost 模型中的激活路径,并将每条路径渲染为确定性谓词文本,生成可读的证据单元,并且关联到源窗口、临床变量、树和叶节点。
- • **紧凑分类器输入构建**。我们引入一个选择器,组装出树路径证据单元的一个紧凑子集,使语言模型分类器能够组合信息丰富的条件,而非冗余的原始序列化或自由形式的患者摘要。
- • **面向重症监护基准的准确性-可溯源性评估**。在三个重症监护预测基准上,TreeText-CTS 在基于文本的电子健康记录时间序列接口中取得了最强结果,并与数值型不规律时间序列模型保持竞争力,同时为每个选中的分类器输入片段保留了源可溯源性。
## 2 相关工作
##### 面向不规律临床时间序列的数值模型。
电子健康记录时间序列数据的传统模型通过各种策略处理缺失和不均匀的观测时间,例如循环衰减、集合函数、时域注意力、稀疏事件变换器或变量图[2,19,6,22,28,14,12]。这些数值时间序列模型直接从临床数值、时间戳、掩码和缺失模式中优化预测,是临床预测的强基线,但每个预测背后的证据不会自然地以人类可读形式呈现。
##### 面向电子健康记录时间序列预测的基于文本的接口。
近期基于文本的电子健康记录时间序列接口使用大语言模型嵌入、语言化观测和生成的患者表示。WRDP 评估大语言模型对数值电子健康记录特征的嵌入,发现原始数值特征往往仍然具有竞争力或更强[4];Decode Like a Clinician 对时序电子健康记录观测进行语言化以便微调大语言模型[3];TimeCP 使用基于大语言模型的上下文化进行时间序列事件预测[13];Record2Vec 嵌入由大语言模型生成的不规律重症监护时间序列的临床摘要[7]。这些方法激发了将文本或语言模型接口用于结构化临床数据的动机,具有利用预训练语言模型先验知识的潜力。然而,它们通常通过序列化、语言化、嵌入或生成为每个患者构建语言模型输入或表示。相比之下,TreeText-CTS 将群体级结构学习与患者级证据构建分离开来。固定的树模型在窗口摘要上学习可重用的分裂阈值;患者特定的激活路径将这些阈值实例化为可溯源的文本证据单元,选择器从中保留一个紧凑子集供语言模型分类器使用。
##### 语言模型与基于树的结构化预测。
近期的大语言模型-树混合方法在表格预测中使用决策树进行大语言模型引导的特征生成或规则细化[15,27]。而 TreeText-CTS 保持树固定,将激活路径作为不规律临床时间序列的中间证据表示。这实现了局部证据提取与基于语言的证据组合的分离,而非使用大语言模型修改表格预测器。先前的基于树的表示方法也将叶节点或规则用作派生特征,但通常将它们作为数值指标而非渲染为可溯源文本以供语言模型分类。
## 3 方法
##### 概述。
TreeText-CTS 在不规律电子健康记录轨迹与语言模型分类器之间构建了一个紧凑、人类可读、可溯源的文本接口。如图1所示,多尺度窗口摘要通过固定的 XGBoost 模型路由,激活路径由树到证据映射器渲染为确定性条件文本,紧凑证据选择器选出这些证据单元的一个紧凑子集。语言模型分类器从静态协变量前缀开始,随后是选中的证据,避免了原始轨迹序列化、患者级自由形式摘要以及推理时的自回归解码。我们使用自批判目标训练 CES 以处理紧凑选择。
图1:TreeText-CTS 概览。不规律电子健康记录轨迹在多个窗口上汇总,通过每个窗口的固定 XGBoost 模型路由,并由树到证据映射器映射为确定性、可溯源的树路径证据单元。紧凑证据选择器最多选择 K 个证据单元,这些单元在静态协变量前缀之后拼接,由临床语言编码器读取,无需患者级自由形式生成。
##### 问题设定。
对于患者 i,设 O_i = { (v_j, t_j, x_j) }_{j=1}^{n_i} 表示 n_i 次不规律电子健康记录观测,其中 v_j 是被测量的变量,t_j 是观测时间,x_j 是观测值。设 s_i 表示静态协变量,设 y_i ∈ {0,1} 是二值结果。我们将 s_i 渲染为确定性文本前缀 c_i,例如 “年龄为...”,并前置到语言模型分类器读取的选中证据序列之前;只有树路径证据单元计入证据预算 K。从 O_i 出发,TreeText-CTS 构建一个候选树路径证据集 E_i = { e_{i1}, ..., e_{iN_i} },CES 从中选出 S_i ⊆ E_i。最终预测器为:
p̂_i = σ( w^T f_θ( c_i ∥ concat_{e ∈ sort(S_i)} Text(e) ) + b ), (1)
其中 p̂_i 是 y_i=1 的预测概率,σ 是 sigmoid 函数,∥ 表示文本拼接,sort 按源时间和窗口大小排序证据,f_θ 表示语言模型编码器表示,w、b 是线性分类头。
##### 多尺度树证据。
临床风险信号可能出现在不同的时间尺度上,从短窗口中的急剧变化到较长历史中的持续性异常。因此,我们在提取树路径证据之前,在每个患者轨迹上对多个回溯窗口进行摘要。对于每个患者、候选时间点 t 和回溯窗口大小 W,我们在源区间 [t-W, t] 上形成局部摘要,其中 t 是窗口的右端点,W 是时间尺度。对于固定窗口大小 W,候选窗口放置在非重叠网格上。针对每个变量和窗口大小 W,我们在对应区间 [t-W, t] 上计算九个固定统计量:最后一个值、均值、标准差、最小值、最大值、计数、净变化、距上次观测时间、缺失指示符。例如,在 t=24 小时处,W=1 小时和 W=8 小时的摘要分别描述区间 [23,24] 小时和 [16,24] 小时。候选预测时间集按照第4节中数据集特定的评估协议确定。
对于每个窗口大小 W,我们分别在动态摘要行上训练一个 XGBoost 集成:{ (φ_W(i,t), y_i) : i∈D_train, t∈G_i(W) },其中 φ_W(i,t) 表示源窗口端点 t 处的九统计量摘要。训练后,我们冻结树,得到一个固定的阈值规则库存,后续患者只能激活这些规则,不能修改。对于患者-端点-窗口元组 (i,t,W),窗口特定 XGBoost 集成中的每棵树 b 激活一个叶节点 ℓ。对应的根到叶路径定义了一个树路径证据单元,由源元组 (t,W,b,ℓ) 索引。源元组记录了出处,而路径记录了...相似文章
PatTree:一种用于医学分类任务的自动化构建多模态、基于图的患者表示的新方法
本文介绍了PatTree,一种基于图的多模态患者表示方法,能够自动对异构临床数据进行结构化处理,以用于医学分类任务。在ADNI-1队列上,它达到了最先进的性能,阿尔茨海默病分类的平衡准确率为98.5%。
CT-HEG:一种用于ICU院内死亡预测的双向、时间戳属性事件图——一项架构消融研究
介绍了CT-HEG,一种用于ICU死亡预测的连续时间异质EHR图模式,通过消融研究表明双向连接和时间注意力边特征很重要;令人惊讶的是,在MIMIC-IV队列上,简化的同质图优于完整的异质模型。
概率文本时间序列抑郁症检测
本文提出PTTSD,一种从临床访谈转录中检测抑郁症严重程度的概率框架,该框架对不确定性进行建模并提供时间可解释性,在基准数据集上取得了具有竞争力的性能。
DT-Transformer:一个在真实世界健康系统上进行疾病轨迹预测的基础模型
DT-Transformer是一个基础模型,在Mass General Brigham(MGB)健康系统的11家医院中,基于170万名患者的5710万条结构化EHR记录进行训练,在896个疾病类别的下一事件预测中展现出强大的区分能力。
基于严重性知识图谱和检索增强生成的轨迹感知临床风险预测
提出了TRACER框架,该框架集成了基于严重性的知识图谱和检索增强生成,用于轨迹感知的临床风险预测,在MIMIC-III和MIMIC-IV数据集上,死亡率和再入院预测取得了大幅提升。