设备端语言模型在隐私保护压力预测中的应用:移动健康的多模态评估

arXiv cs.LG 论文

摘要

本文评估了利用移动设备上的多模态数据进行隐私保护压力预测的设备端语言模型,发现轻量级模型实现了低延迟和可预测的资源使用,同时指出了移动心理健康应用的实际限制。

arXiv:2609.11961v1 公告类型:新 摘要:压力是心理健康的普遍决定因素,也是移动健康干预的关键目标。设备端语言模型(ODLMs)提供了无需云依赖的隐私保护推理,但其在移动资源限制下用于健康预测的可行性仍待深入研究。我们评估了使用零样本提示的设备端语言模型在多模态压力预测中的表现,测量了预测准确性以及延迟和吞吐量。我们的结果表明,客观传感器特征平均略优于主观自我报告,并且轻量级小于2B的模型实现了低延迟和可预测的资源使用。我们的发现既突出了设备端语言模型在移动心理健康中的潜力,也指出了实际限制。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:29

# 面向隐私保护压力预测的设备端语言模型:移动健康领域的多模态评估
来源:https://arxiv.org/html/2609.11961

###### 摘要

压力是影响心理健康的普遍因素,也是移动健康干预的关键目标。设备端语言模型(ODLMs)能在无云端依赖的情况下实现隐私保护推理,但其在移动设备资源限制下用于健康预测的可行性仍有待深入探索。我们采用零样本提示方法评估ODLMs进行多模态压力预测的能力,同时测量预测准确率以及延迟与吞吐量。结果表明,平均而言客观传感器特征略优于主观自我报告,且轻量级的小于20亿参数模型能在可预测的资源使用下实现低延迟。研究结果揭示了ODLMs在移动心理健康应用中的潜力和实际限制。

## I 引言

压力是日常生活中常见的一种状况,会对认知表现、情绪调节以及长期身心健康产生负面影响[4 (https://arxiv.org/html/2609.11961#bib.bib46),12 (https://arxiv.org/html/2609.11961#bib.bib42),14 (https://arxiv.org/html/2609.11961#bib.bib49)]。长期的慢性压力与不良健康和心理健康结果相关,这推动了能够在现实环境中检测和预测压力的移动健康(mHealth)系统的发展[13 (https://arxiv.org/html/2609.11961#bib.bib40),14 (https://arxiv.org/html/2609.11961#bib.bib49)]。可穿戴传感和基于智能手机的数据收集技术的进步,使得能够持续捕获多模态生理和行为信号,包括:心率变异性、活动水平、睡眠模式和自我报告的情绪状态[16 (https://arxiv.org/html/2609.11961#bib.bib11),20 (https://arxiv.org/html/2609.11961#bib.bib25)]。这些感知能力支持了在普适计算环境中从时间序列数据进行压力预测的机器学习(ML)方法[18 (https://arxiv.org/html/2609.11961#bib.bib2)]。

大多数传统的压力检测系统依赖于直接在结构化数值特征上训练的特定任务监督模型[7 (https://arxiv.org/html/2609.11961#bib.bib50)]。虽然有效,但这些模型通常仅限于预定义的预测目标,并且需要为新任务或数据配置重新训练。与此同时,大型语言模型(LLMs)在处理一系列结构化和半结构化输入时展示了灵活的推理能力[17 (https://arxiv.org/html/2609.11961#bib.bib32),6 (https://arxiv.org/html/2609.11961#bib.bib45)]。近期研究表明,语言模型可以利用零样本提示解释序列化的时间序列数据,这为构建更具通用性的推理管道(减少针对特定任务的工程设计)提供了可能性[10 (https://arxiv.org/html/2609.11961#bib.bib9)]。

然而,在移动健康背景下部署基于LLM的推理面临重大挑战。基于云的模型在处理敏感生理和行为数据时会引入隐私风险,且网络延迟可能阻碍实时反馈。近期通过量化[2 (https://arxiv.org/html/2609.11961#bib.bib26)]、剪枝[11 (https://arxiv.org/html/2609.11961#bib.bib27)]和知识蒸馏[8 (https://arxiv.org/html/2609.11961#bib.bib28)]来缩小LLM规模的技术进步,使得小型语言模型能够直接在边缘设备上运行。设备端语言模型(ODLMs)提供了更强的隐私保证和更低的延迟,但它们在资源限制下对多模态健康时间序列数据进行推理的能力仍未得到充分理解。

在本研究中,我们探讨了使用ODLMs从结合客观(传感器提取)和主观(自我报告)的时间序列数据进行压力预测的可行性。我们不依赖微调,而是评估了变化健康数据模态和时间上下文序列化的结构化零样本提示方法。我们系统地测量预测准确率以及设备级指标,包括推理延迟和吞吐量,以表征模型能力与边缘设备限制之间的权衡。

我们的贡献是:(1)使用结构化零样本提示对ODLMs进行多模态压力事件预测的实证评估;(2)在边缘设备限制下,针对时间序列推理的模态组合和时间序列化策略的系统分析。通过研究预测能力、资源效率和部署可行性,本工作推进了对ODLMs如何在普适计算系统中支持实时、隐私敏感的压力监测的理解。

## II 相关工作

近期工作探索了使用LLM进行结构化健康事件预测任务。Kim等人[10 (https://arxiv.org/html/2609.11961#bib.bib9)]评估了流行LLM从客观和自我报告数据推断主观健康结果的能力,涵盖了多个数据集。他们的研究比较了多种提示策略,包括零样本、少样本、思维链、自一致性和微调,表明明确定义任务上下文能显著提高预测准确性。Wang等人[18 (https://arxiv.org/html/2609.11961#bib.bib2)]将这一研究路线扩展到ODLMs,在HealthLLM框架内使用PMData数据集[16 (https://arxiv.org/html/2609.11961#bib.bib11)]评估了零样本提示。他们报告称,像TinyLlama-1.1B这样的小型模型在推理准确率上可与更大的基于云的模型相媲美,同时在延迟和隐私方面具有优势。

并行的努力探索了LLM在心理健康评估和咨询应用中的应用。Wei等人[19 (https://arxiv.org/html/2609.11961#bib.bib39)]引入了MoPHES,一个微调紧凑型LLM以提供多轮心理健康支持的移动框架,证明了领域适应能够实现有竞争力的设备端性能。Liu等人[12 (https://arxiv.org/html/2609.11961#bib.bib42)]提出了ChatCounselor,基于专业整理的咨询对话进行训练,表明高质量的领域能数据显著提升回应质量。Zheng等人[21 (https://arxiv.org/html/2609.11961#bib.bib43)]通过合成大规模的情感支持对话来解决数据可扩展性问题,以改善共情能力和上下文基础。虽然这些系统展示了基于LLM的心理健康工具的潜力,但它们在很大程度上依赖于微调和整理过的对话语料库,而非结构化的多模态生理输入。此外,许多方法优先考虑对话生成质量,而非延迟和内存占用等部署权衡因素。

## III 方法论

表I:构建的零样本提示示例
| 组件 | 提示内容 |
| :--- | :--- |
| **系统提示** | 你是一个个性化医疗代理,受过训练根据生理数据和用户信息预测压力分数,分数范围从1到5。 |
| **用户上下文** | 给定用户资料:年龄:{48}岁,性别:{男性},身高:{195}厘米 |
| **时间上下文** | 过去{14天}的近期数据显示: |
| **健康数据(NLS)** | **客观数据** | **主观数据** |
|  | 步数:{1476.0, 4809.0, ..., NaN} | 情绪(5分制):{3.0, 4.0, ..., NaN} |
|  | 消耗卡路里:{169.0, 419.0, ..., NaN} | 睡眠质量(5分制):{1.0, ..., NaN} |
|  | 静息心率:{53.24, ..., 51.40} | 疲劳度(5分制):{1.0, 5.0, ..., NaN} |
|  | 睡眠分钟数:{110.0, 524.0, ..., 481.0} | |
| **标签条件** | 分数3为正常;1–2为低于正常;4–5为高于正常。 |
| **回答提示** | 回应应为一个离散的整数值。使用以下格式生成输出:"预测的压力水平是[你的回复]" |

为评估选定的最先进ODLMs,我们将LLM集成到一个基于研究的平台“Assuage”中,该平台支持离线存储和数据同步[3 (https://arxiv.org/html/2609.11961#bib.bib38)]。实验在iOS和iPadOS设备上进行,所有设备均运行各自18.5版本的操作系统。

### III-A 模型选择

我们的实验设计结合了先前工作的方法。与[15 (https://arxiv.org/html/2609.11961#bib.bib3)]类似,我们利用MLXExamples来方便部署、下载和与HuggingFace上可用的ODLMs进行接口。模型大小分类为:小型(< 10亿)、中型([10亿, 70亿])和大型([70亿, ∞亿)][15 (https://arxiv.org/html/2609.11961#bib.bib3)]。我们选定的ODLMs如下:
**Qwen3-0.6B** 和 **Qwen3-1.7B** 是来自阿里巴巴的Qwen3系列的量化版本,分别具有约0.6亿和1.7亿参数,设备端存储占用分别为*0.33*GB和*0.94*GB。
**Granite-3.3-2b** 是来自IBM的一个20亿参数的指令微调模型,设备端占用*1.33*GB。

### III-B 提示策略

我们的评估遵循既定的提示工程实践,包括零样本提示、时间上下文提示、用户上下文、标签条件和结构化答案格式[5 (https://arxiv.org/html/2609.11961#bib.bib15),9 (https://arxiv.org/html/2609.11961#bib.bib19),1 (https://arxiv.org/html/2609.11961#bib.bib33),10 (https://arxiv.org/html/2609.11961#bib.bib9),17 (https://arxiv.org/html/2609.11961#bib.bib32)]。

**时间上下文提示:** 为了向语言模型呈现时间序列数据,我们采用时间上下文提示。先前工作将时间上下文表示分为三类:自然语言字符串(NLS)[5 (https://arxiv.org/html/2609.11961#bib.bib15)]、统计摘要(SS)[9 (https://arxiv.org/html/2609.11961#bib.bib19)]和模态特定编码[1 (https://arxiv.org/html/2609.11961#bib.bib33)]。在本研究中,我们采用前两种表示方法。

NLS表示法将时间序列数据呈现为有序的字符串序列,使用NaN表示缺失条目。
SS表示法使用聚合统计量(均值、标准差、最小值和最大值)编码时间序列数据[1]。例如:睡眠时长:平均=6.03,标准差=2.53,最小=0.97,最大=9.83。

为确保模型间公平比较,提示模板已标准化,未针对每个模型进行优化。所有ODLMs接收相同的系统指令、时间上下文格式和回答约束。我们有意避免模型特定的提示调优,以隔离模型架构、规模和量化对压力预测性能的影响。虽然提示优化可能提高单个模型的准确性,但我们的目标是在一致的提示框架下评估鲁棒性。

### III-C 数据集

PMData是一个为期五个月的生活记录数据集,包含来自16名参与者的主观和客观时间序列健康数据[16 (https://arxiv.org/html/2609.11961#bib.bib11)]。客观数据通过Fitbit Versa 2收集,包括多速率测量,如步数、卡路里、心率和睡眠。主观数据通过PMSys移动应用和Google Forms自我报告,捕获的指标包括睡眠质量、疲劳、情绪和就绪状态。

## IV 实验

图1:实验工作流程
图1 (https://arxiv.org/html/2609.11961#S4.F1) 展示了我们实验流程的高层工作流程。先前在PMData数据集上评估语言模型进行压力预测的工作,通常采用[10 (https://arxiv.org/html/2609.11961#bib.bib9)]提出的原始提示,该提示结合了客观测量与主观情绪分数。相比之下,我们分解了这个提示,并通过整合数据集中可用的其他指标进行了扩展,使我们能够隔离客观和主观信号对压力预测的贡献。

表I (https://arxiv.org/html/2609.11961#S3.T1) 展示了我们提示设计的一个示例,说明了本研究中开发的三种提示变体。第一种仅包含客观特征,与先前工作使用的默认提示相同,但排除了主观情绪分数。第二种仅包含主观特征。每个主观指标都相对于其上限进行情境化,并通过明确指定哪些值对应于低、正常和高水平来定义量表的语义含义。第三种提示结合了客观和主观特征。

我们使用捕获四个时间间隔的提示来评估这些模型:1天(1D)、1周(1W)、2周(2W)和1个月(1M),并使用NLS和SS两种提示策略。每个实验实例由一个参考日期及其相关的回溯时间窗口定义。提示让语言模型基于在此窗口内收集的数据(包括参考日期记录的主观和客观信号)进行条件化,并任务模型预测该日期患者的应力水平。对于基线比较,我们评估了几种传统ML模型,包括决策树、随机森林(RF)、支持向量机(SVM)、梯度提升、k近邻(kNN)、朴素贝叶斯和逻辑回归,使用70:30的训练-测试划分。

表II:使用传统ML基线的MAE比较
| 模型 | 1D | 1W | 2W | 1M | 1D | 1W | 2W | 1M | 1D | 1W | 2W | 1M |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| | **客观↓** | | | | **主观↓** | | | | **客观 + 主观↓** | | | |
| 决策树 | 0.96±0.17 | 0.96±0.20 | 0.82±0.27 | 0.91±0.18 | 0.69±0.15 | 0.65±0.20 | 0.71±0.23 | 0.77±0.19 | 0.68±0.13 | 0.69±0.25 | 0.72±0.19 | 0.70±0.10 |
| 随机森林 | 0.69±0.17 | 0.58±0.24 | 0.55±0.22 | 0.52±0.20 | 0.58±0.17 | 0.53±0.20 | 0.52±0.19 | 0.52±0.19 | 0.52±0.21 | 0.53±0.19 | 0.52±0.21 | 0.50±0.20 |
| SVM | 0.56±0.13 | 0.61±0.12 | 0.59±0.11 | 0.54±0.16 | 0.52±0.18 | 0.52±0.20 | 0.57±0.08 | 0.54±0.12 | 0.52±0.19 | 0.50±0.19 | 0.53±0.15 | 0.53±0.15 |
| 梯度提升 | 0.91±0.20 | 0.77±0.20 | 0.70±0.19 | 0.71±0.21 | 0.63±0.15 | 0.62±0.23 | 0.59±0.22 | 0.57±0.21 | 0.55±0.18 | 0.56±0.23 | 0.53±0.24 | 0.54±0.22 |
| k近邻 | 0.90±0.26 | 0.82±0.22 | 0.83±0.18 | 0.92±0.23 | 0.61±0.18 | 0.69±0.07 | 0.73±0.09 | 0.74±0.11 | 0.66±0.24 | 0.73±0.09 | 0.72±0.12 | 0.77±0.11 |
| 朴素贝叶斯 | 0.71±0.10 | 0.95±0.14 | 0.95±0.13 | 1.04±0.11 | 0.83±0.17 | 0.72±0.26 | 0.72±0.31 | 0.70±0.34 | 0.73±0.10 | 0.73±0.20 | 0.78±0.17 | 0.93±0.11 |
| 逻辑回归 | 1.35±0.62 | 1.34±0.63 | 1.42±0.56 | 1.61±0.46 | 1.23±0.59 | 1.02±0.33 | 0.91±0.23 | 0.91±0.14 | 1.19±0.55 | 0.89±0.25 | 0.97±0.26 | 1.04±0.16 |

表III:模型性能 - 自然语言字符串
| 模型 | 1D | 1W | 2W | 1M | 1D | 1W | 2W | 1M | 1D | 1W | 2W | 1M |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| | **客观↓** | | | | **主观↓** | | | | **客观 + 主观↓** | | | |
| Qwen3-0.6B | 0.57 ± 0.36 | 0.56 ± 0.31 | 0.60 ± 0.31 | 0.57 ± 0.32 | 0.53 ± 0.34 | 0.57 ± 0.35 | 0.54 ± 0.33 | 0.51 ± 0.35 | 0.55 ± 0.35 | 0.55 ± 0.32 | 0.56 ± 0.34 | 0.55 ± 0.35 |
| Qwen3-1.7B | 0.58 ± 0.38 | 0.58 ± 0.29 | 0.63 ± 0.37 | 0.61 ± 0.40 | 0.59 ± 0.37 | 0.59 ± 0.33 | 0.61 ± 0.37 | 0.59 ± 0.40 | 0.59 ± 0.41 | 0.59 ± 0.38 | 0.58 ± 0.38 | 0.58 ± 0.43 |
| Granite-3.3-2b | 0.62 ± 0.30 | 0.73 ± 0.21 | 0.70 ± 0.23 | 0.70 ± 0.22 | 0.85 ± 0.20 | 0.80 ± 0.15 | 0.86 ± 0.19 | 0.73 ± 0.22 | 0.84 ± 0.11 | 0.72 ± 0.16 | 0.74 ± 0.17 | 0.64 ± 0.24 |

表IV:模型性能 - 统计摘要
| 模型 | 1D | 1W | 2W | 1M | 1D | 1W | 2W | 1M | 1D | 1W | 2W | 1M |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| | **客观↓** | | | | **主观↓** | | | | **客观 + 主观↓** | | | |
| Qwen3-0.6B | 0.55 ± 0.34 | 0.56 ± 0.27 | 0.58 ± 0.28 | 0.51 ± 0.28 | 0.52 ± 0.34 | 0.52 ± 0.29 | 0.51 ± 0.29 | 0.48 ± 0.28 | 0.54 ± 0.34 | 0.53 ± 0.30 | 0.53 ± 0.29 | 0.49 ± 0.29 |
| Qwen3-1.7B | 0.43 ± 0.24 | 0.52 ± 0.30 | 0.55 ± 0.28 | 0.51 ± 0.27 | 0.52 ± 0.31 | 0.55 ± 0.28 | 0.55 ± 0.30 | 0.50 ± 0.29 | 0.52 ± 0.33 | 0.53 ± 0.28 | 0.52 ± 0.29 | 0.50 ± 0.28 |
| Granite-3.3-2b | 0.55 ± 0.33 | 0.62 ± 0.22 | 0.60 ± 0.20 | 0.56 ± 0.21 | 0.66 ± 0.25 | 0.65 ± 0.20 | 0.68 ± 0.21 | 0.59 ± 0.21 | 0.60 ± 0.28 | 0.63 ± 0.19 | 0.64 ± 0.21 | 0.54 ± 0.22 |

相似文章

语言模型能否识别乳腺癌放疗的副作用?

arXiv cs.CL

本文提出了一种面向部署的压力测试框架,用于评估大型语言模型在识别乳腺癌放疗副作用方面的表现。该研究揭示了LLM在可靠性方面的局限性,例如对文档细微变化的敏感性以及对罕见副作用的低召回率,表明以临床医生整理的清单为输出依据可提高鲁棒性。

微语言模型实现即时响应

Hugging Face Daily Papers

研究人员推出 8M–30M 参数的微型语言模型,可在本地设备瞬间生成前几个词,再由云端模型补全,让智能手表等超受限设备也能拥有响应迅速的 AI 体验。

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。