通过LLM引导的概念集成实现移动传感数据的可解释预测

arXiv cs.LG 论文

摘要

本文介绍了概念集成Transformer(CIT),该模型利用大型语言模型进行概念监督,以在小规模队列健康研究中从移动传感数据中实现准确且可解释的预测。

arXiv:2609.11995v1 公告类型:新 摘要:移动传感使得在日常环境中对行为和生理模式进行纵向监测成为可能。然而,在小规模队列健康传感研究中,准确预测仍然具有挑战性,因为与异构传感数据相比,任务特定的结果监督有限。可解释性也很重要,因为模型输出应反映有意义的行为和生理模式,而不仅仅是预测分数。我们开发了概念集成Transformer(CIT),采用LLM引导的概念监督,以从移动传感数据中实现可解释预测。CIT使用预训练的大型语言模型生成具有置信度权重的基线感知概念异常目标,无需手动概念标注。在两个纵向数据集上,CIT在AFFECT上取得了最高的F1分数(0.756),并在PHQ-9数据集上并列最高(0.765)。学习到的概念分数也揭示了可解释的行为和生理模式;在AFFECT中,睡眠数量和质量在高低负面情感组之间显示出最明显的差异。这些发现支持LLM引导的概念集成在小规模队列移动传感研究中实现准确且可解释的预测。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:30

# 通过大语言模型引导的概念整合实现移动传感数据的可解释预测  
来源:https://arxiv.org/html/2609.11995  
Yuning Wang  
隶属机构:图尔库大学计算系,图尔库,芬兰  
隶属机构:yuning\.y\.wang@utu\.fi  
Amir M\. Rahmani  
隶属机构:加州大学尔湾分校计算机科学系,加利福尼亚,美国  
Pasi Liljeberg  
隶属机构:图尔库大学计算系,图尔库,芬兰  

###### 摘要  
移动传感技术使得在日常环境中对行为与生理模式进行纵向监测成为可能。然而,在小队列健康传感研究中,由于任务特定的结果监督相对于异质性传感数据较为有限,准确预测仍具挑战。可解释性同样重要,因为模型输出应反映有意义的行为与生理模式,而不仅仅是预测分数。我们开发了一种概念整合Transformer(CIT),结合大语言模型引导的概念监督,实现从移动传感数据中进行可解释预测。CIT利用预训练的大语言模型生成基线感知的概念异常目标及其置信权重,无需手动概念标注。在两个纵向数据集上,CIT在AFFECT数据集上取得了最高F1分数(0.756),并在PHQ-9数据集上并列最高(0.765)。所学的概念分数也揭示了可解释的行为与生理模式;在AFFECT数据集中,睡眠数量和质量在高负性情感组与低负性情感组之间表现出最显著的差异。这些发现支持了在小队列移动传感研究中使用大语言模型引导的概念整合,以实现准确且可解释的预测。  

###### 关键词  
移动传感,可解释人工智能,大语言模型,基于概念的学习  

## 1 引言  
移动传感技术(包括可穿戴设备和智能手机收集的数据)使得在日常环境中对行为与生理状态进行持续观测成为可能。这类技术能够收集连续的纵向数据,包括睡眠、体力活动、生理调节、智能手机使用情况以及自我报告的状态等指标。此类数据随时间捕捉行为与生理模式,为构建模型和预测相关健康结局提供了机会。然而,实际上从移动传感数据实现准确预测仍然具有挑战性,特别是在现实世界的小队列研究中。深度学习模型已广泛应用于基于纵向和多模态传感数据的健康预测。例如,Paz‑Arbaizar 等人开发了一种基于Transformer的情绪预测模型,利用被动收集的移动传感变量(如步数、位置和睡眠模式)预测自我报告的情绪状态并检测情绪效价的突变。Li 和 Zhang 提出了一种 CNN‑Transformer 架构,用于从日常生活中收集的长期多模态生理数据中识别情感状态。这些研究为深度学习模型在捕捉健康传感数据中的时间依赖性和多模态交互方面的有效性提供了坚实证据。然而,在现实世界的小队列研究中,其性能仍可能受到限制,因为可靠的结局标签往往稀疏,而自我报告工具或临床评估成本高、负担重,或难以重复收集。  

除了预测准确性之外,从多模态传感数据进行健康预测的可解释性仍是一个主要挑战。输入归因方法常被用于支持健康预测的可解释性。例如,Yang 等人使用 SHapley Additive exPlanations(SHAP)通过量化可穿戴传感器特征和自我报告日记变量对个体预测的贡献,来解释个性化情感预测模型。基于概念的方法通过将预测与临床或行为上有意义的领域相关联,提供更高层次的解释。例如,Wu 等人使用概念瓶颈框架进行临床时间序列预测,使模型输出能够通过包括肾功能、呼吸和氧合状态以及整体疾病严重程度在内的概念进行解释。然而,在纵向多模态传感数据中,输入层面的解释可能仍然难以转化为针对特定参与者的总结,因为特征的含义可能取决于参与者的基线、时间趋势以及共现的行为或生理信号。基于概念的模型提供了一种更结构化的替代方案,但其训练需要对单个样本或时间窗口的概念层面监督。虽然相关概念类别通常可以从领域知识中定义,但在现实世界的传感数据集中,可靠的概念标签很少可用,且由领域专家手动标注每个纵向窗口的成本高且难以扩展。  

大型语言模型(LLMs)最近被探索作为模型监督的外部知识源。先前的研究已使用 LLMs 为下游学习生成任务标签、伪标签和文本注释。这些能力促使我们将其作为弱概念监督的来源,而非直接作为健康结局的预测器。在纵向移动传感中,我们相信由 LLM 衍生的概念监督有助于解决上述两个挑战:在结局标签稀疏时提高预测准确性,并实现概念层面的解释。  

在本文中,我们开发了一个概念整合Transformer(CIT)框架,并结合大语言模型引导,用于从移动传感数据中进行可解释的健康相关预测。CIT 使用预训练的 LLM 提供概念异常监督,无需手动概念标注。具体而言,LLM 评估基线感知的统计摘要,并生成带有置信权重的概念层面异常目标。这些目标为预测模型提供辅助监督,同时定义了可解释的中间概念表示。因此,Transformer 学习直接从传感数据预测健康相关结局和概念分数,使得同一概念层能够同时支持预测学习和概念层面解释。LLM 仅用于模型开发期间构建概念监督,在推理阶段不需要使用。  

本研究的主要贡献如下。  
1. 提出 CIT,一个概念整合 Transformer 框架,用于从纵向多模态传感数据中进行可解释的健康相关预测。  
2. 开发一种无需标注的 LLM 引导概念异常监督流程,其中 LLM 评估基线感知的统计摘要,并基于一致性生成带有置信权重的概念异常目标,无需手动概念标注。  
3. 使用两个纵向多模态传感数据集评估 CIT,包括 AFFECT 数据集上的情感预测和 PHQ‑9 数据集上与抑郁相关的预测。  
4. 展示所学的概念分数如何支持模型行为的类级、群体级和个体级解释。  

## 2 方法  
我们提出一个概念整合 Transformer(CIT)框架,用于从纵向多模态传感数据中进行可解释的健康相关预测。该框架利用概念层面监督在有限结局标签下指导学习,同时通过健康相关概念组织模型解释。如图1所示,所提框架包含两个相连的模块:模块A:LLM引导的概念异常监督,以及模块B:概念监督的Transformer预测。  

CIT 的输入是从纵向可穿戴和移动传感数据构建的多模态传感窗口。每个窗口包含固定时间段内行为、生理和上下文特征的观测值,在训练期间与一个健康相关结局标签相关联。该输入窗口在两个模块中的使用方式不同:模块A 将其转换为概念监督目标,而模块B 使用原始时间序列窗口进行预测学习。  

模块A 从多模态传感窗口生成概念异常监督。首先将传感器数据转换为基线感知的统计摘要,包括当前窗口统计量、参与者特定的基线统计量以及相对于基线的偏差指标。然后,LLM 为五个行为和生理概念分配异常分数,并生成基于一致性的置信权重。这些由 LLM 得出的概念异常分数不用于最终预测;相反,它们作为模型训练的概念监督信号。  

模块B 在概念层面监督下估计健康相关结局。原始多模态传感窗口被嵌入,与位置嵌入结合,并由 Transformer 编码器编码。编码后的表示被传递到两个预测头:一个用于健康相关标签,另一个用于概念异常分数。在训练期间,分类头由真实标签监督,而概念头则通过置信加权的概念损失由 LLM 得出的概念目标监督。在测试阶段,不再需要 LLM 引导模块。训练好的 Transformer 直接输出健康预测和概念分数,后者用作概念层面的解释。  

下文将详细描述两个模块。参考标题:图 1:概念整合 Transformer(CIT)概述。该框架使用纵向多变量传感窗口 \( X \in \mathbb{R}^{T \times F} \),其中 \( T \) 是窗口长度,\( F \) 是传感特征数量。LLM引导的概念异常监督模块从基线感知的摘要统计中推导无需标注的概念目标和置信权重。概念监督的 Transformer 预测模块编码原始传感窗口,并使用分类损失和置信加权的概念损失联合学习目标预测和概念预测。在测试阶段,CIT 不查询 LLM,仅从传感数据中输出预测概率和概念异常分数。  

### 2.1 模块A:LLM引导的概念异常监督  
该模块提取概念层面的监督信号,无需手动概念标注。对于每个训练窗口,模块接收原始多变量传感段和参与者的历史基线作为输入,构建基线感知的摘要表,并使用 LLM 为预定义的行为和生理概念分配异常分数。模块为每个样本‑概念对输出两个量:一个由 LLM 得出的概念异常目标,以及一个基于一致性的置信权重。这些输出仅在训练期间用于监督 CIT 的概念头。需要注意的是,它们不被视为目标标签,在测试阶段不需要使用。  

#### 2.1.1 基线感知摘要表构建  
每个传感窗口被转换为一个结构化摘要表,描述最近窗口模式及其相对于参与者自身历史基线的偏差。该摘要表作为基于 LLM 的概念异常评分的输入证据。设 \( X_i \in \mathbb{R}^{T \times F} \) 表示样本 \( i \) 的多变量传感窗口,其中 \( T \) 是窗口长度,\( F \) 是传感特征数量。在我们的实验中,\( T=7 \),每个窗口与一个二分类结局标签 \( y_i \in \{0,1\} \) 对齐,其中 \( 1 \) 表示负类。  

对于每个特征 \( f \),我们计算三组统计量。首先,窗口统计量概括当前窗口内的最近模式:\( \text{mean7}_f, \text{std7}_f, \text{slope7}_f, \text{last}_f, \text{miss7}_f \)。这里,\( \text{slope7}_f \) 表示线性趋势,\( \text{last}_f \) 表示最后观测值,\( \text{miss7}_f \) 表示窗口内的缺失率。  

其次,基线统计量描述参与者特定的历史参考模式。在我们的实验中,我们使用排除当前窗口的前28天来计算:\( \text{baseMean}_f, \text{baseStd}_f \)。  

第三,基线相对偏差量化当前窗口相对于参与者基线的差异:  

\[
z\text{Base}_f = \frac{\text{last}_f - \text{baseMean}_f}{\text{baseStd}_f},
\]  
\[
z\text{BaseMean7}_f = \frac{\text{mean7}_f - \text{baseMean}_f}{\text{baseStd}_f},
\]  
\[
\text{pctBase}_f = \frac{\text{mean7}_f - \text{baseMean}_f}{|\text{baseMean}_f|},
\]  
\[
\text{pctBaseLast}_f = \frac{\text{last}_f - \text{baseMean}_f}{|\text{baseMean}_f|}.
\]  

得到的每个特征的统计量被组织为结构化摘要表中的键值条目。该表随后用作下面描述的 LLM 引导概念异常评分步骤的输入证据。  

#### 2.1.2 生成概念目标和置信权重  
基线感知摘要表被输入 LLM 以生成两个输出:概念异常目标及其对应的置信权重。概念目标为概念头提供无需标注的监督,而置信权重决定了每个目标对概念损失的贡献强度。  

##### LLM引导的概念异常评分。  
我们定义五个高级概念,概括可穿戴和移动传感数据中的主要行为和生理维度:  
1. 睡眠数量和质量  
2. 白天活动量  
3. 活动规律性和依从性  
4. 心脏调节和压力  
5. 上下文和环境  

完整的特征‑概念映射见补充表 S1 和 S2。对于每个训练样本,我们向 LLM(GPT‑4.1‑mini)提示上述摘要表。提示是无标签的:它不包含目标标签,也不要求 LLM 推断结局。相反,LLM 被要求评估每个概念相对于参与者的基线证据是否显得异常,并返回一个包含概念异常分数的 JSON 对象:  

\[
c^{\text{LLM}} = [c_1, \dots, c_K], \quad c_k \in [0,1] \cup \{\text{null}\},
\]

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

基于LLM探针的主要ICD类别预测

arXiv cs.AI

本文提出了一种方法,利用冻结的医学大型语言模型(LLM)表示作为共享嵌入空间,从结构化和非结构化电子健康记录数据中预测主要ICD诊断类别,在MIMIC-IV上取得了优于基线方法的准确率,并展示了向MIMIC-III的迁移能力。