Peak-Detector:基于指令微调大语言模型的生理信号可解释峰值检测

arXiv cs.LG 论文

摘要

介绍了Peak-Detector框架,该框架利用指令微调的大语言模型对心电(ECG)、光电容积脉搏波(PPG)、心冲击图(BCG)和体震图(BSG)等生理信号进行鲁棒、跨模态且可解释的峰值检测。该方法将时间序列数据转换为压缩的“峰值表示”格式,并通过监督微调及后续多目标奖励的强化学习进行优化。

arXiv:2605.16452v1 公告类型:新 摘要:准确检测多种心脏生理信号(包括心电图ECG、光电容积脉搏波PPG、心冲击图BCG和体震图BSG)中的峰值是心血管监测的基础,但常受到伪迹和信号变异性的干扰。传统算法通常针对单一信号模态由专家知识设计,限制了其普适性。相反,基于深度学习的方法往往缺乏可解释性,限制了专家验证的透明度并阻碍了人机交互。为解决这些局限,我们提出了Peak-Detector,一种利用指令微调大语言模型(LLM)进行鲁棒、跨模态且可解释峰值检测的新颖框架。我们框架的核心创新是一种“峰值表示”技术,它将时间序列数据转换为压缩格式,在保留关键事件信息的同时显著缩短信号长度。这种表示提供了关键的归纳偏置,引导LLM对生理上有意义的事件进行推理,而非原始噪声数据。模型通过两阶段过程优化:监督微调(SFT)后接多目标奖励函数的强化学习(RL)。模型的自我解释能力通过在自定义构建的Peak-Explanation数据集上进行微调而培养。在覆盖四种模态(ECG、PPG、BCG、BSG)的七个数据集(六个公开基准加一个真实世界队列)上,Peak-Detector展现了强大的跨模态性能,在临床相关的时间容差下实现了最佳或并列最佳的检测。除了准确性,生成的推理过程揭示了失败模式,并支持验证和错误分析。
查看原文
查看缓存全文

缓存时间: 2026/05/19 06:43

# 峰值检测器:通过指令微调的大语言模型对生理信号进行可解释的峰值检测  
来源:https://arxiv.org/html/2605.16452  

Yida Zhang0009-0000-5555-3778 (https://orcid.org/0009-0000-5555-3778)  
佐治亚大学  
佐治亚州雅典市  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Zixuan Zeng0009-0005-7051-7421 (https://orcid.org/0009-0005-7051-7421)  
佐治亚大学  
佐治亚州雅典市  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Jiayu Chen0009-0003-0904-4114 (https://orcid.org/0009-0003-0904-4114)  
佐治亚大学  
佐治亚州雅典市  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Yingjian Song0009-0005-5601-4465 (https://orcid.org/0009-0005-5601-4465)  
佐治亚大学  
佐治亚州雅典市  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Yin Xiao0009-0005-2247-8042 (https://orcid.org/0009-0005-2247-8042)  
宜兴市人民医院  
宜兴市,江苏省  
中国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Nishan Dong  
宜兴市人民医院  
宜兴市,江苏省  
中国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  
0009-0006-4463-9246 (https://orcid.org/0009-0006-4463-9246)  

Junjie Lu0000-0001-7547-6378 (https://orcid.org/0000-0001-7547-6378)  
宜兴市人民医院  
宜兴市,江苏省  
中国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Younghoon Kwon0000-0002-8152-9170 (https://orcid.org/0000-0002-8152-9170)  
华盛顿大学  
西雅图,华盛顿州  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Xiang Zhang0000-0001-5097-2113 (https://orcid.org/0000-0001-5097-2113)  
北卡罗来纳大学夏洛特分校  
夏洛特,北卡罗来纳州  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Jin Lu0000-0003-1356-0202 (https://orcid.org/0000-0003-1356-0202)  
佐治亚大学  
佐治亚州雅典市  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

Wenzhan Song0000-0001-8174-1772 (https://orcid.org/0000-0001-8174-1772)  
佐治亚大学  
佐治亚州雅典市  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

以及  
Fei Dou0000-0003-4246-8616 (https://orcid.org/0000-0003-4246-8616)  
佐治亚大学  
佐治亚州雅典市  
美国  
[email protected] (https://arxiv.org/html/2605.16452v1/mailto:[email protected])  

###### 摘要  
准确的心电(ECG)、光电容积脉搏波(PPG)、心冲击图(BCG)和体震图(BSG)等不同心脏生理信号中的峰值检测,是心血管监测的基础,但常常受到伪迹和信号变异性的干扰。传统算法通常针对单一信号模态,依赖专家知识设计,限制了其泛化能力。相反,基于深度学习的方法往往缺乏可解释性,限制了专家验证的透明度,并阻碍了人机交互。为解决这些限制,我们提出了Peak-Detector,一个新颖的框架,利用指令微调的大语言模型(LLMs)实现稳健、跨模态且可解释的峰值检测。该框架的核心创新是一种“峰值表示”技术,将时间序列数据转换为紧凑格式,保留关键事件信息的同时显著减少信号长度。这种表示提供了一个关键的归纳偏置,引导LLM在具有生理意义的事件而非原始噪声数据上进行推理。模型通过两阶段过程进行优化:监督微调(SFT)后接强化学习(RL)及多目标奖励函数。通过在自建的Peak-Explanation数据集上进行微调,模型培养了自解释能力。在涵盖ECG、PPG、BCG和BSG四种模态、七个数据集(六个公开基准加一个真实世界队列)上,Peak-Detector展示了强大的跨模态性能,在临床相关时间容差下达到最佳或并列最佳检测效果。除了准确性,生成的解释文本能够揭示失败模式,支持验证和错误分析。这些结果共同表明,这是一个透明且泛化能力强的框架,可用于可信的峰值分析和心血管指标提取。  

峰值检测,大语言模型,生理信号处理,心血管监测,可解释人工智能,指令微调,多模态信号分析  

††版权:cc  
††ccs:以人为中心的计算 人机交互(HCI)  

## 1. 引言  
连续心血管监测是移动和普适健康的重要组成部分,支持在可穿戴、非接触式和临床传感环境下纵向评估心脏功能。无扰传感模态,特别是心电(ECG)、光电容积脉搏波(PPG)、心冲击图(BCG)和体震图(BSG),已成为纵向评估个体健康状况的基石技术(Gordon,1877(https://arxiv.org/html/2605.16452#bib.bib1);Kim等人,2016(https://arxiv.org/html/2605.16452#bib.bib2);Song等人,2024(https://arxiv.org/html/2605.16452#bib.bib3);Penzel等人,2016(https://arxiv.org/html/2605.16452#bib.bib4);Temko,2017(https://arxiv.org/html/2605.16452#bib.bib5))。这些传感器能够及时识别心脏心律失常——如房性早搏(PACs)、室性早搏(PVCs)和心房颤动(AFib)——对于预防不良健康结局至关重要。然而,这些监测系统的有效性取决于对采集到的生理数据中关键突出点(即“峰值”)的准确且稳健的检测。  

该领域的主要挑战在于这些信号模态的内在异质性。每种模态通过不同的物理原理捕获心脏周期的不同方面,导致独特的信号形态(图1(https://arxiv.org/html/2605.16452#S2.F1))。ECG记录心脏的电活动,显著的R波代表心室去极化的峰值(Setiawidayat和Rahman,2018(https://arxiv.org/html/2605.16452#bib.bib6))。PPG波形具有收缩期峰值,代表心室收缩期间外周组织中最大血容量的点(Castaneda等人,2018(https://arxiv.org/html/2605.16452#bib.bib7))。BCG通过测量心脏射血引起的身体微弱振动提供非接触式方法,以显著的J波为特征(Li等人,2024(https://arxiv.org/html/2605.16452#bib.bib8);Su等人,2009(https://arxiv.org/html/2605.16452#bib.bib9);Azhaginiyan等人,2019(https://arxiv.org/html/2605.16452#bib.bib10))。BSG通过有效包含BCG(全身运动)和SCG(直接心前区振动)的特征,提供更丰富的信息内容(Song等人,2024(https://arxiv.org/html/2605.16452#bib.bib3);Pitafi等人,2025(https://arxiv.org/html/2605.16452#bib.bib67);Song等人,2025(https://arxiv.org/html/2605.16452#bib.bib68))。这种信号来源和质量的多样性需要一种通用且稳健的峰值检测方法(Warmerdam等人,2018(https://arxiv.org/html/2605.16452#bib.bib14);Fung等人,2004(https://arxiv.org/html/2605.16452#bib.bib15))。  

现有的峰值检测方法在这方面仍然有限。传统信号处理方法依赖于模态特定的领域知识,采用手工设计的特征和启发式规则,通常非常脆弱且需要精心参数调整(Chakraborty等人,2020(https://arxiv.org/html/2605.16452#bib.bib11);Elgendi等人,2013(https://arxiv.org/html/2605.16452#bib.bib12);Kuntamalla和Reddy,2014(https://arxiv.org/html/2605.16452#bib.bib13))。因此,这些方法缺乏跨不同信号类型的泛化能力。虽然深度学习模型通过直接从数据中学习特征提供了更大的适应性,但它们常被批评为“黑箱”(Kazemi等人,2022(https://arxiv.org/html/2605.16452#bib.bib16);Sarkar和Etemad,2021(https://arxiv.org/html/2605.16452#bib.bib17);Xu和Shuttleworth,2024(https://arxiv.org/html/2605.16452#bib.bib18);Castelvecchi,2016(https://arxiv.org/html/2605.16452#bib.bib19))。这种缺乏透明度和可解释性的问题在关键临床应用中对信任和采用构成了重大障碍,因为理解模型的推理过程与其输出同样重要。  

为解决上述限制,我们引入了Peak-Detector,这是一个利用LLMs将心脏峰值检测重构为语言引导推理任务的框架。通过利用LLMs的高级推理和语言能力(Bi等人,2024(https://arxiv.org/html/2605.16452#bib.bib20);Wang等人,2024(https://arxiv.org/html/2605.16452#bib.bib21)),我们的方法采用了一种新颖的峰值表示(Peak Representation),将稀疏的高频生理信号转换为紧凑的符号序列。这种转变有效解决了处理长时间连续数值序列时通常出现的性能下降问题(Fons等人,2024(https://arxiv.org/html/2605.16452#bib.bib25))。为了增强可解释性,我们通过专门的数据生成流水线开发了Peak-Explanation数据集,旨在增强模型的自解释能力。  

模型使用两阶段指令微调策略进行训练。第一阶段,监督微调(SFT),建立可靠且格式正确的输出结构。第二阶段使用基于组相对策略优化(GRPO)的强化学习(RL),针对多目标奖励函数优化模型。该奖励函数旨在同时增强格式有效性、心率一致性、位置准确性和检测完整性,确保输出稳健且符合生理规律。  

我们将Peak-Detector定位为更广泛心血管传感工作流中的一个可解释且更高保真度的分析组件,而不是用于电池受限可穿戴设备的严格实时、始终在线边缘模型。在这种定位下,轻量级前端方法可用于连续筛查,而Peak-Detector可以在标记窗口、不确定片段、信号质量下降或需要对可解释性和可审计性特别重要的回顾性总结中,被选择性调用。这一视角在普适传感流水线中特别相关,因为这些场景下的部署决策需要在信号质量、计算预算和可靠下游指标提取需求之间进行权衡。  

总之,本工作做出以下贡献:  
- •我们引入了一种模态无关的峰值表示(Peak Representation),将生理信号总结为带时间戳和信号值的局部极值,实现令牌高效、可审计的推理。它有效压缩原始ECG、PPG和BCG数据,分别达到87%、97%和89%的压缩率,同时保持高保真度,信号重建的相关系数分别为0.94、0.94和0.97。  
- •我们开发了Peak-Detector,一个两阶段SFT→RL流水线,结合多目标奖励,共同优化检测准确性、时间一致性以及简洁、结构化的解释文本,并由一个可扩展的数据生成流水线支持,构建了自解释的峰值检测数据集。  
- •在ECG/PPG/BCG/BSG四种模态上,跨越六个公开数据集和一个真实世界队列,Peak-Detector在临床相关容差下达到最佳或并列最佳的检测效果,同时具有有竞争力的HR/HRV误差,并提供逐步的解释文本。  

## 2. 相关工作  
### 2.1. 心脏生理信号中的峰值检测  
心脏生理信号中基准点的检测主要沿着两条方法论路径发展:传统信号处理方法和数据驱动的学习方法。  

信号处理方法。经典方法依赖于模态特定的领域知识和手工设计的启发式规则。对于ECG的R波检测,Pan-Tompkins算法仍然是基础性方法,使用带通滤波、微分、平方和移动窗口积分来隔离QRS波群(Fariha等人,2020(https://arxiv.org/html/2605.16452#bib.bib26);Sathyapriya等人,2014(https://arxiv.org/html/2605.16452#bib.bib28);Wu等人,2020(https://arxiv.org/html/2605.16452#bib.bib27))。基于小波的方法为描绘显著峰值提供了多尺度替代方案(Banerjee等人,2012(https://arxiv.org/html/2605.16452#bib.bib29))。在PPG分析中,收缩期峰值通常通过局部最大值搜索或结合自适应阈值的一阶导数方法检测(Lerddararadsamee和Jiraraksopakun,2012(https://arxiv.org/html/2605.16452#bib.bib32);Kelley等人,2008(https://arxiv.org/html/2605.16452#bib.bib33);Li等人,2010(https://arxiv.org/html/2605.16452#bib.bib35);Brüser等人,2013(https://arxiv.org/html/2605.16452#bib.bib36);Shin等人,2008(https://arxiv.org/html/2605.16452#bib.bib37))。BCG的J波检测通常需要更具噪声鲁棒性的策略,如模板匹配、自相关或运动伪迹重建(Alivar等人,2019(https://arxiv.org/html/2605.16452#bib.bib38))。类似地,BSG分析常通过识别自相关函数(ACF)中的主导峰值来估计心脏周期(Song等人,2023(https://arxiv.org/html/2605.16452#bib.bib69))。尽管在受控环境中有效,但这些方法在信号形态、传感器特性变化或信号质量下降时往往非常脆弱,并且通常需要大量特定模态的调整。  

深度学习方法。为了解决手工设计启发式规则的局限性,深度学习架构——特别是卷积神经网络(CNNs)——已被应用于ECG、PPG和BCG信号的峰值检测(Schranz等人,2024(https://arxiv.org/html/2605.16452#bib.bib39);Kazemi等人,2022(https://arxiv.org/html/2605.16452#bib.bib16);Chen等人,2023b(https://arxiv.org/html/2605.16452#bib.bib40))。这些方法,如RPNet,将峰值检测视为监督预测问题,直接从数据中学习显著特征,通常相对于传统流程提高了鲁棒性和准确性(Vijayarangan等人,2020(https://arxiv.org/html/2605.16452#bib.bib41))。然而,它们的预测通常没有提供明确的人类可读的理由。因此,尽管这些模型可以是有效的检测器,但当信号噪声或模糊时,它们对专家验证、审计或失败分析的支持有限。这一局限性促使探索可解释的基于LLM的方法,旨在将具有竞争力的检测性能与结构化的、可解释的峰值选择理由结合起来。  

### 2.2. 生理时间序列分析中的大语言模型  
参见图注  
图1. 带有标记峰值的生理信号  
已注释的生理信号示例,标有基准峰值。  

大语言模型(LLMs)越来越多地被应用于生理时间序列分析,尽管目前的研究集中在高级语义任务上,如OpenTSLM中的睡眠阶段描述(Langer等人,2025(https://arxiv.org/html/2605.16452#bib.bib22))或ECG-LM中的心律失常诊断(Yang等人,2025(https://arxiv.org/html/2605.16452#bib.bib45))。尽管这些模型功能强大,但它们常常难以处理“数值定位”——即精确定位证据

相似文章

提示嵌入探针(PEP):从隐藏状态检测大语言模型幻觉

arXiv cs.CL

本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。

利用生理信号通过机器学习预测考试结果

arXiv cs.LG

本研究探讨了利用皮肤电活动、心率和皮肤温度等生理数据,通过机器学习模型预测考试结果,发现深度学习方法与随机森林等简单模型均能有效发挥作用。