用于资源受限人类活动识别的覆盖感知虚拟IMU增强

arXiv cs.AI 论文

摘要

本文提出了一种覆盖感知的虚拟IMU增强框架,以解决人类活动识别中的数据稀缺问题,通过生成和选择合成传感器数据来提高有限标注数据下的模型性能。

arXiv:2609.16768v1 Announce Type: new 摘要: 基于IMU的人类活动识别(HAR)通过可穿戴传感器实现连续、隐私友好的日常活动监测。然而,构建能够在不同用户和真实条件下泛化的可靠HAR模型需要大量标注的IMU数据,这些数据收集起来既昂贵又困难。现有方法主要依赖于增强或合成来扩展可用数据,但不加选择地添加虚拟样本可能提供的新覆盖有限,并引入不可靠的监督。为了克服这些挑战,我们提出了一种新颖的覆盖感知虚拟IMU增强框架,它决定在哪里补充真实数据,如何生成和选择虚拟候选样本,以及在训练中如何加权它们。具体来说,我们在学习到的传感器嵌入空间中选择多样性和稀缺性锚点,将锚点动态转换为提示,并为每个锚点生成虚拟IMU候选样本。然后,我们根据结合锚点接近度和标签一致性的选择成本对候选样本进行排序,并将选定的候选样本以基于可靠性的权重纳入HAR训练。在公开HAR基准上的实验表明,我们的方法在识别性能上持续优于竞争基线,消融研究证实了所提框架设计的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/16 09:03

# 面向低资源人体活动识别的覆盖感知虚拟惯性测量单元增强
来源:https://arxiv.org/html/2609.16768  
作者:Yingwei Zhang, Ziyao Tang, Yuejia Ma, Yuanzhe Chen, Shuchao Song, Boshi Tang†  
††致谢:Jiayuan Gao, Yingwei Zhang, Shuchao Song隶属于中国科学院计算技术研究所移动计算与普适设备北京市重点实验室,北京,中国,同时隶属于中国科学院大学,北京,中国(电子邮箱:[email protected]; [email protected]; [email protected])。  
††致谢:Ziyao Tang隶属于南洋理工大学,新加坡(电子邮箱:[email protected])。  
††致谢:Yuejia Ma隶属于北京科技大学,北京,中国(电子邮箱:[email protected])。  
††致谢:Yuanzhe Chen隶属于中国科学院大学,北京,中国(电子邮箱:[email protected])。  
††致谢:Boshi Tang隶属于清华大学,北京,中国(电子邮箱:[email protected])。  
††致谢:通讯作者:Yingwei Zhang。  

###### 摘要
基于惯性测量单元的人体活动识别利用可穿戴传感器实现对日常活动的持续、隐私友好的监测。然而,要构建在不同用户和真实场景下具有泛化能力的可靠HAR模型,需要大量带标签的IMU数据,而这些数据的采集成本高昂且困难。现有方法主要依赖增强或合成来扩充可用数据,但随意添加虚拟样本可能无法提供有效的新覆盖范围,并引入不可靠的监督信号。为应对这些挑战,我们提出了一种新颖的覆盖感知虚拟IMU增强框架,该框架能够决策在何处补充真实数据、如何生成和选择虚拟候选样本,以及在训练中如何赋予权重。具体而言,我们在学习到的传感器嵌入空间中选择多样性和稀缺性锚点,将锚点动态转换为提示,并为每个锚点生成虚拟IMU候选样本。然后,我们结合锚点接近度和标签一致性构建选择成本,对候选样本进行排序,并基于可靠性权重将选中的候选样本纳入HAR训练。在公共HAR基准测试上的实验表明,我们的方法始终优于竞争基线,消融研究证实了所提框架设计的有效性。  

###### 索引关键词:人体活动识别、可穿戴传感、合成IMU数据、数据增强、大语言模型。  

本文已提交给IEEE以供可能发表。版权可能在未通知的情况下转移,之后此版本可能将无法访问。  

## I 引言  
基于惯性测量单元的人体活动识别通过分析可穿戴惯性测量单元采集的信号来识别人类日常活动[1](https://arxiv.org/html/2609.16768#bib.bib1)。它支持日常活动监测、健身辅助和家庭康复等应用[2](https://arxiv.org/html/2609.16768#bib.bib2)。与基于摄像头的系统相比,可穿戴IMU降低了视觉隐私担忧,并支持在日常环境中进行持续监测[3](https://arxiv.org/html/2609.16768#bib.bib3)。然而,可靠的HAR模型需要捕捉用户、活动执行风格、传感器放置位置和感知环境重要变化的训练数据。有限的标注数据集仅提供了活动分布的不完整视图,而跨这些变化来源收集数据代价高昂,且常受时间、监督和部署条件的限制。  
参考图注图1:覆盖感知虚拟IMU增强的动机。有限的真实IMU采集提供可靠但不完整的活动模式观测,而虚拟IMU数据可以扩展训练覆盖范围,但可能引入偏移或不可靠的样本。  
如图1所示[1](https://arxiv.org/html/2609.16768#bib.bib1),虚拟IMU数据可以扩展训练覆盖范围,超越有限真实IMU采集所能提供的范围。由于此类数据可以大规模生成并根据目标活动进行条件控制,它们为补充有限的真实训练数据提供了一种实用方式[4](https://arxiv.org/html/2609.16768#bib.bib4), [5](https://arxiv.org/html/2609.16768#bib.bib5)。近期关于基于扩散的数据集蒸馏的研究也表明,合成样本的评估不仅应考虑其真实性,还应考虑其下游效用、代表性、多样性和伪影缓解能力[6](https://arxiv.org/html/2609.16768#bib.bib6), [7](https://arxiv.org/html/2609.16768#bib.bib7)。这个问题对于基于IMU的HAR尤为重要。即使一个看似合理的生成序列,如果其落在真实训练数据已充分代表的区域,也可能提供很少的额外覆盖范围,或者可能偏离特定活动模式。将此类样本与真实数据同等对待可能会降低模型性能。因此,我们将虚拟IMU样本视为候选训练数据:它们的效用取决于其提供的覆盖范围以及与目标活动的一致性,而它们在训练中的影响则取决于其可靠性。  

为应对这些挑战,我们提出了一种面向有限真实训练数据的HAR覆盖感知虚拟IMU增强框架。该框架解决三个实际问题:*在何处补充真实训练分布*、*如何生成虚拟候选样本*以及*如何控制它们在训练中的影响*。首先,我们在学习到的传感器嵌入空间中选择真实训练窗口作为锚点。多样性锚点代表不同的类内运动模式,而稀缺性锚点使用局部密度标准选择,旨在针对观测训练分布中覆盖稀疏的区域。其次,每个锚点根据锚点级动态属性(如节奏、强度、周期性)被转换为锚点条件提示,并为每个锚点生成多个虚拟IMU候选样本。第三,使用嵌入空间中与相应锚点的接近度以及仅在真实训练数据上训练的种子编码器分类器头估计的标签一致性来评估生成的候选样本。基于此评估,以可靠性为依据的样本权重将选定的候选样本纳入HAR训练,使得可靠性较低的虚拟样本对模型优化的贡献较小。  

主要贡献总结如下:  
1. 我们提出了一种面向有限真实训练数据的HAR覆盖感知虚拟IMU增强框架,其中从真实训练数据中选择的锚点指导虚拟IMU生成,并对生成的候选样本进行评估以确定保留哪些样本以及它们对HAR训练的贡献强度。  
2. 我们引入了一种锚点条件化的虚拟IMU生成策略。它在学习到的传感器嵌入空间中选择真实训练窗口作为多样性和稀缺性锚点,并从锚点级动态属性构建生成提示,从而指导虚拟候选生成朝向观测训练分布中多样的类内模式和覆盖稀疏的区域。  
3. 我们提出了一种基于可靠性的候选样本选择与加权方案。它根据与相应锚点的嵌入空间接近度和标签一致性计算选择成本,保留选择成本最低的候选样本,并以基于可靠性的样本权重将其纳入HAR训练。  

本文其余部分组织如下。第2节回顾了与活动识别相关的虚拟和合成数据、标签高效学习与领域泛化,以及噪声标签学习与鲁棒训练的相关工作。第3节介绍问题设置,并提出锚点条件化虚拟IMU生成、候选样本选择和可靠性加权集成的框架。第4节描述实验设置并报告评估结果。第5节讨论局限性和未来工作。第6节总结本文。  

## II 相关工作  
### II-A 活动识别的虚拟与合成数据  
虚拟和合成数据被广泛用于缓解人体活动识别中标注数据的稀缺性。现有方法大致可分为四个方向:信号级增强、生成式时间序列建模、文本驱动虚拟IMU生成和基于模型的IMU模拟。信号级方法对时间结构、幅度或方向施加变换,而近期工作探索自动增强策略搜索和物理合理的增强策略[8](https://arxiv.org/html/2609.16768#bib.bib8), [9](https://arxiv.org/html/2609.16768#bib.bib9), [10](https://arxiv.org/html/2609.16768#bib.bib10)。生成模型为低资源环境合成惯性序列,近期工作探索了基于扩散的时间序列生成[9](https://arxiv.org/html/2609.16768#bib.bib9), [11](https://arxiv.org/html/2609.16768#bib.bib11)。文本驱动方法通过跨模态运动合成管道,从文本描述生成虚拟IMU信号[4](https://arxiv.org/html/2609.16768#bib.bib4), [5](https://arxiv.org/html/2609.16768#bib.bib5), [12](https://arxiv.org/html/2609.16768#bib.bib12)。同时,基于模型的模拟方法使用人体和传感器模型生成合成惯性数据,可显式控制运动和传感器配置[13](https://arxiv.org/html/2609.16768#bib.bib13), [14](https://arxiv.org/html/2609.16768#bib.bib14), [10](https://arxiv.org/html/2609.16768#bib.bib10)。总体而言,这些方法在增强、生成和模拟范式中,推动了合成惯性数据在规模、多样性、真实性和物理合理性方面的发展[9](https://arxiv.org/html/2609.16768#bib.bib9), [5](https://arxiv.org/html/2609.16768#bib.bib5), [13](https://arxiv.org/html/2609.16768#bib.bib13), [14](https://arxiv.org/html/2609.16768#bib.bib14), [11](https://arxiv.org/html/2609.16768#bib.bib11), [10](https://arxiv.org/html/2609.16768#bib.bib10)。近期关于基于扩散的数据集蒸馏研究进一步表明,合成数据的评估不仅应考虑真实性,还应考虑下游效用、多样性和伪影缓解能力[6](https://arxiv.org/html/2609.16768#bib.bib6), [7](https://arxiv.org/html/2609.16768#bib.bib7)。然而,上述增强和生成方法主要旨在优化变换策略、生成保真度或物理一致性,而未明确考虑真实训练分布中哪些区域被充分代表或代表不足。因此,合成样本可能满足其特定方法的目标,但对经验类条件分布中代表不足的区域提供的额外覆盖很少。这激发了覆盖感知的虚拟IMU生成观点,即同时考虑经验训练分布和生成样本在下游学习中的可靠性。  

### II-B 标签高效学习与领域泛化  
传感器人体活动识别中的标签高效学习旨在通过利用无标签或稀疏标注的传感器流来降低标注成本。半监督方法通过联合使用带标签和未带标签的样本来改进HAR模型,包括基于插值的训练[15](https://arxiv.org/html/2609.16768#bib.bib15)。自训练方法通过伪标签进一步利用未带标签的序列,使用高置信度预测迭代优化模型[16](https://arxiv.org/html/2609.16768#bib.bib16)。此外,无监督的跨用户领域适应将知识从带标签的源受试者迁移到未带标签的目标受试者,解决了无目标域标签下的用户差异问题[17](https://arxiv.org/html/2609.16768#bib.bib17)。除了标注效率,近期领域泛化的HAR研究关注分布偏移下的鲁棒性。不变表示学习已在跨主体、跨数据集和跨位置设置下进行了研究[18](https://arxiv.org/html/2609.16768#bib.bib18),而近期基准测试评估了自监督HAR模型对未见目标分布的泛化能力[19](https://arxiv.org/html/2609.16768#bib.bib19)。这些研究共同强调了学习跨用户、跨数据集和跨传感器位置泛化的传感器表示的重要性。然而,上述标签高效和领域泛化的HAR方法主要从现有观测中改善学习。它们提高了数据利用率和表示迁移能力,但没有明确扩展代表不足的活动模式的经验覆盖范围。因此,它们没有解决生成的传感器数据如何补充有限的真实数据覆盖范围而不引入不可靠训练信号的问题。  

### II-C 噪声标签学习与鲁棒训练  
噪声标签学习与鲁棒训练旨在通过降低对不可靠监督的敏感性来减少错误标签的影响。代表性的方法包括鲁棒损失函数,如广义交叉熵损失,它降低了对错误标签的敏感性[20](https://arxiv.org/html/2609.16768#bib.bib20)。另一类工作关注样本选择和重加权,在训练中优先考虑小损失或高置信度的实例。协同教学通过训练两个网络为彼此选择小损失样本来提高鲁棒性,从而减少噪声标签带来的错误累积[21](https://arxiv.org/html/2609.16768#bib.bib21)。后续方法通过针对特定实例的样本选择、标签修正以及基于置信度的正则化或追踪扩展了这一路线[22](https://arxiv.org/html/2609.16768#bib.bib22), [23](https://arxiv.org/html/2609.16768#bib.bib23), [24](https://arxiv.org/html/2609.16768#bib.bib24), [25](https://arxiv.org/html/2609.16768#bib.bib25), [26](https://arxiv.org/html/2609.16768#bib.bib26)。这些研究表明,将所有训练样本视为同等可靠会降低学习效果,而基于置信度或选择的策略可以缓解噪声引起的误差传播。然而,它们主要针对具有潜在损坏标签的固定训练集,而非针对由生成过程产生额外训练样本的场景。对于虚拟IMU数据,不可靠性可能源于生成伪影、分布不匹配或与预期活动的不一致性。因此,生成的序列不应被视为统一可靠的训练数据,它们对学习的贡献应反映其估计的可靠性。  

## III 方法  
参考图注图2:框架概述。(1) 锚点引导的虚拟IMU生成:在学习到的传感器嵌入空间中选择真实训练窗口作为多样性和稀缺性锚点,从活动标签和锚点级节奏、强度、周期性属性构建锚点条件提示,并合成多个虚拟IMU候选样本。(2) 虚拟候选样本评估:使用候选样本与相应锚点的嵌入空间接近度以及种子分类器头估计的标签一致性来评估候选样本,将两个标准组合成选择成本,并为每个锚点保留选择成本最低的候选样本。(3) 可靠性加权HAR训练:使用候选样本选择成本和锚点内排名分配基于可靠性的样本权重,并在真实IMU窗口和选定的虚拟候选样本上训练HAR模型。

相似文章

用于单IMU活动识别的动态影响加权蒸馏

arXiv cs.LG

本文介绍了动态影响加权(DIW),一种知识蒸馏方法,通过在训练过程中动态加权来自多个IMU的教师目标,来改进单IMU活动识别,实现了显著的性能提升。

ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。