物理自监督学习:无人工标签的IMU传感

arXiv cs.LG 论文

摘要

提出物理自监督学习,一种用于无标签IMU传感的自编码器范式,该范式用基于物理的解码器替换神经解码器,在无人工标签的情况下,在跟踪和动作捕捉任务中实现高达5倍的误差减少。

arXiv:2607.18361v1 Announce Type: new 摘要:深度神经网络已成为基于IMU传感的一种有前途的方法,但其可扩展性从根本上受到昂贵标记数据和对于异构设备、放置位置和用户鲁棒性差的限制。现有的无监督和自监督方法减少了但这种依赖并未消除,仍然需要标记数据进行域适应,并且很大程度上忽略了已知的物理结构。我们提出物理自监督学习,一种用于无标签IMU传感的自编码器风格范式。我们用自适应物理解码器替换传统神经解码器,这是一个可学习的运动学方程族,在跨环境适应时强制执行显式物理结构,并采用混合两阶段IMU编码器,在结构化潜在空间中进行重建以减轻传感器噪声。我们的框架进一步引入了概率频率空间约束以分离传感器和物体运动,多视图运动学树以利用稀疏的物理自监督信号,以及一种不确定性感知公式来处理IMU推理固有的模糊性。在公共数据集和实际部署中的惯性跟踪和全身动作捕捉评估中,物理自监督学习在挑战性泛化场景中将跟踪误差减少多达5倍,动作捕捉误差减少多达4倍,始终优于最先进的监督和自监督基线,且无需任何标签。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:20

# 物理自监督学习:无需手动标注的IMU传感
来源: https://arxiv.org/html/2607.18361

Renyuan Liu  
George Mason University  
Fairfax, VA, USA  
[email protected] (https://arxiv.org/html/2607.18361v1/mailto:[email protected])

Shaohan Hu  
Global Technology Applied Research, JPMorgan Chase  
New York, NY, USA  
[email protected] (https://arxiv.org/html/2607.18361v1/mailto:[email protected])

Peijun Zhao  
Global Technology Applied Research, JPMorgan Chase  
New York, NY, USA  
[email protected] (https://arxiv.org/html/2607.18361v1/mailto:[email protected])

Chun-Fu (Richard) Chen  
Global Technology Applied Research, JPMorgan Chase  
New York, NY, USA  
[email protected] (https://arxiv.org/html/2607.18361v1/mailto:[email protected])

Songqing Chen  
George Mason University  
Fairfax, VA, USA  
[email protected] (https://arxiv.org/html/2607.18361v1/mailto:[email protected])

and  
Shuochao Yao  
George Mason University  
Fairfax, VA, USA  
[email protected] (https://arxiv.org/html/2607.18361v1/mailto:[email protected])

(2026)

###### 摘要

深度神经网络已成为基于IMU传感的一种有前景的方法,但其可扩展性从根本上受到昂贵标注数据和较差鲁棒性(对于异构设备、部署位置和用户)的限制。现有的无监督和自监督方法虽然减少了但这种依赖性并未消除,仍然需要标注数据进行领域适应,并且很大程度上忽略了已知的物理结构。我们提出物理自监督学习,一种用于无标签IMU传感的自编码器范式。我们将传统的神经解码器替换为自适应物理解码器——一个可学习的运动学方程族,在强制显式物理结构的同时能够跨环境适应——并采用混合两阶段IMU编码器,在结构化潜在空间中进行重建,以减轻传感器噪声。我们的框架进一步引入了概率频率-空间约束来解耦传感器运动和物体运动,利用多视角运动学树来利用稀疏的物理自监督信号,以及一种不确定性感知公式来处理IMU推断固有的歧义性。在公共数据集和实际部署场景下的惯性跟踪和全身运动捕捉评估中,物理自监督学习在具有挑战性的泛化场景下,跟踪误差最多降低5倍,运动捕捉误差最多降低4倍,持续优于最先进的监督和自监督基线,且无需任何标注。代码可在GitHub (https://github.com/YuyangLeng/physical-ssl-imu-label-free) 获取。

移动传感,IMU传感,无标签学习,运动捕捉

††期刊年份:2026  
††版权:cc  
††会议:第24届移动系统、应用与服务国际会议; 2026年6月21–25日; 英国剑桥  
††书号:第24届移动系统、应用与服务国际会议 (MobiSys '26), 2026年6月21–25日, 英国剑桥  
††doi:10.1145/3745756.3809252  
††isbn:979-8-4007-2027-7/26/06  
††ccs:计算方法 机器学习  
††ccs:计算机系统组织 传感器网络

## 1. 引言

十多年来,移动传感社区一直利用深度神经网络 (DNN) 来应对各种挑战 (Lane and Georgiev, 2015 (https://arxiv.org/html/2607.18361#bib.bib37); Lane et al., 2015 (https://arxiv.org/html/2607.18361#bib.bib38); Yao et al., 2017a (https://arxiv.org/html/2607.18361#bib.bib75))。深度学习的快速进步带来了强大的数据驱动范式,能够在移动设备上高效解决日益复杂的移动传感问题 (Jiang et al., 2018 (https://arxiv.org/html/2607.18361#bib.bib28); Ouyang et al., 2021 (https://arxiv.org/html/2607.18361#bib.bib55); Yao et al., 2018b (https://arxiv.org/html/2607.18361#bib.bib77); Liu et al., 2025b (https://arxiv.org/html/2607.18361#bib.bib45), a (https://arxiv.org/html/2607.18361#bib.bib43), 2024 (https://arxiv.org/html/2607.18361#bib.bib44); Leng et al., 2023b (https://arxiv.org/html/2607.18361#bib.bib40); Yao et al., 2017b (https://arxiv.org/html/2607.18361#bib.bib78), 2018a (https://arxiv.org/html/2607.18361#bib.bib76))。在众多传感模态中,惯性测量单元 (IMU) 是最普遍的之一:IMU 嵌入几乎所有现代智能手机、可穿戴设备和物联网设备中,并支撑着诸如智能健康、自动驾驶汽车、无人机和增强现实等大规模应用。然而,尽管取得了这些进展,两大挑战仍然制约着数据驱动 (基于 DNN) 的移动传感:标注数据的稀缺和传感环境的异质性。

与视觉和语言等成熟的 DNN 应用领域不同(在这些领域中,由于数据的人类可解释性,数据收集和标注可以解耦),嵌入式移动传感任务通常要求标注与数据收集同时进行。这通常依赖于部署额外传感器模态或在受控实验室环境中让人类标注员参与,使得标注极其昂贵且从根本上不可扩展。同时,数据驱动模型的性能对传感环境高度敏感。诸如设备制造差异、用户行为、部署位置、传感器方向、传感期间的运动(例如,佩戴松散的智能手表或置于宽松口袋或包中的智能手机)以及其他上下文变量等因素,都可能关键影响模型性能 (Stisen et al., 2015 (https://arxiv.org/html/2607.18361#bib.bib64))。这两个问题相互强化:为了应对环境异质性,我们需要在受控实验室环境之外收集更多标注数据,然而获取这些标注需要大量人工努力或额外仪器,且在实践中难以规模化。因此,本文提出以下问题:
*我们能否开发一种 IMU 传感的学习范式,既无需人工标注数据,又能在多样化的传感环境中达到与监督方法相当甚至更优的性能?*

无监督和自监督学习范式是减少标注工作量的自然候选者。该领域许多最成功的方法是自编码器风格的方法:从经典自编码器 (Goodfellow et al., 2016 (https://arxiv.org/html/2607.18361#bib.bib18)),到变分自编码器 (VAEs) (Kingma and Welling, 2013 (https://arxiv.org/html/2607.18361#bib.bib34)),再到最近提出的掩码自编码器 (MAEs) (He et al., 2022 (https://arxiv.org/html/2607.18361#bib.bib23))。每一种都启发了一系列旨在减少标注需求、同时从原始数据中自动学习有用表示的模型。在移动传感领域,也有大量的努力将这些技术适配到传感任务中 (Xu et al., 2021 (https://arxiv.org/html/2607.18361#bib.bib71); Haresamudram et al., 2020 (https://arxiv.org/html/2607.18361#bib.bib21); Rahimi Taghanaki et al., 2021 (https://arxiv.org/html/2607.18361#bib.bib58); Ouyang et al., 2022 (https://arxiv.org/html/2607.18361#bib.bib54); Kara et al., 2024 (https://arxiv.org/html/2607.18361#bib.bib30))。不幸的是,这些努力都没有完全消除对标注的需求:仍然需要非少量的标注数据(通常在10%∼20%的量级)来进行领域适应。因此,移动传感中的数据规模化问题仍未解决,因为每当传感环境发生变化时,仍然需要手动数据收集和标注。

我们的关键观察是,现有方法赋予了自编码器风格模型过多的自由度。一方面,由于编码器和解码器都由 DNN 参数化,这些模型擅长学习保持信息并抑制噪声的表示,但同时也倾向于生成不可解释的潜在空间。因此,需要额外的标注数据将这些潜在表示映射到感兴趣的物理量,并跨传感环境对齐它们。另一方面,大多数 IMU 传感任务受已知先验的运动学方程支配。在缺乏显式指导的情况下,当前的自编码器风格方法将其大部分容量用于拟合这些已知的物理动力学,而不是专注于适应真实世界传感环境的底层变异性。我们的直觉是,物理定律已经提供了丰富的先验知识,可以嵌入到一种新的学习范式中——该范式同时指导模型输出物理上有意义的 IMU 量,并将其容量导向自动适应复杂、难以建模的传感环境。

为此,我们提出**物理自监督学习**,一种新颖的自编码器风格范式,使得 IMU 传感任务(例如,惯性跟踪和全身运动捕捉)能够实现无标签学习。我们的范式将完全由 DNN 参数化的解码器替换为**自适应物理解码器**:一个参数化的运动学方程集,能够自动适应数据以建模一个运动学系统族。与传统的基于物理的建模(需要为每个传感设置手工制作精确的物理模型——通常费力且脆弱)以及纯粹的数据驱动解码器(产生不透明的表示)不同,我们的自适应物理解码器嵌入显式的运动学结构,同时学习适应多样化的传感场景,包括传感器放置和运动的变异。此外,我们将单一编码器替换为**混合两阶段 IMU 编码器**,并在结构化潜在空间中进行重建,使得重建损失在潜在域中起作用,从而减轻传感器噪声的影响。

在这个核心架构设计之上,我们的物理自监督框架引入了三项额外贡献。首先,我们提出**概率频率-空间约束**,自然地解耦传感器运动与目标运动。其次,我们将用于铰接物体的经典运动学树扩展为**多视角运动学树**,从而能够利用来自多个传感器位置的稀疏物理自监督信号。第三,我们开发了一种**不确定性感知公式**,显式建模歧义性,并帮助解决 IMU 传感任务固有的不适定性问题。

我们在两个代表性的 IMU 传感任务上评估了我们的物理自监督学习框架:(1) 惯性跟踪:使用单个 IMU 估计物体的全局平移和朝向,以及 (2) 运动捕捉:使用多个 IMU 恢复全身姿态。在多个公共数据集和实际部署场景中,我们的框架始终优于最先进的监督和自监督微调基线。对于惯性跟踪,与先前的深度学习方法相比,误差降低 1.5×–2×,在具有挑战性的泛化设置下,改进幅度高达 5×。对于运动捕捉,我们的方法实现了 1.3×–1.8× 的误差降低,在泛化场景中获得 3×–4× 的提升。总体而言,这些结果表明,我们的无标签物理自监督学习框架不仅优于所有监督和自监督基线,而且能够在传感器部署、用户、运动模式和数据集之间稳健地泛化。

本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.18361#S2) 回顾相关工作。第3节 (https://arxiv.org/html/2607.18361#S3) 介绍物理自监督学习框架的技术细节。实验设置和评估结果在第4节 (https://arxiv.org/html/2607.18361#S4) 和第5节 (https://arxiv.org/html/2607.18361#S5) 中给出。最后,第6节 (https://arxiv.org/html/2607.18361#S6) 总结本文。

## 2. 相关工作

**自监督学习。** 由于标注数据的稀缺和传感数据的多样性,自监督学习已成为移动传感社区的一个关键研究领域。诸如对比学习 (Ouyang et al., 2022 (https://arxiv.org/html/2607.18361#bib.bib54); Haresamudram et al., 2021 (https://arxiv.org/html/2607.18361#bib.bib22); Qian et al., 2022 (https://arxiv.org/html/2607.18361#bib.bib57)) 和掩码重建 (Xu et al., 2021 (https://arxiv.org/html/2607.18361#bib.bib71); Haresamudram et al., 2020 (https://arxiv.org/html/2607.18361#bib.bib21); Rahimi Taghanaki et al., 2021 (https://arxiv.org/html/2607.18361#bib.bib58)) 等技术已被适配并专门为传感数据定制。此外,多模态传感已被探索以促进跨域信息融合 (Ouyang et al., 2022 (https://arxiv.org/html/2607.18361#bib.bib54); Kara et al., 2024 (https://arxiv.org/html/2607.18361#bib.bib30))。尽管这些方法在缓解有限标注数据和传感异质性带来的挑战方面取得了进展,但它们仍然依赖中等比例的标注数据(大约10%∼20%)才能达到与监督方法相当的性能。此外,来自不同传感领域的标注数据仍然需要结合,以有效解决传感异质性问题。

**物理增强学习。** 利用物理信息来增强学习过程已在各个社区被广泛探索。在机器学习领域,物理信息神经网络已被开发用于将物理知识(如微分方程和物理对称性)直接嵌入学习过程。然而,大多数现有方法旨在使用预定义的物理规则来增强和正则化学习过程,而不是实现完全无标签训练。此外,这些方法通常在简化的合成数据集上进行评估,限制了它们在更复杂、真实世界传感场景中的适用性。在移动传感研究中,最近也有工作致力于利用物理信息来增强基于学习的传感任务。研究人员探索了通过综合来自各种来源的补充数据来增强IMU数据,例如物理知识、视频片段、图像、多传感器相关性和文本到运动合成模型。这些数据增强的技术虽在一定程度上有帮助,但它们对运动理解和估计的提升有限,并且仍然要求广泛的监督训练。相比之下,我们的物理自监督学习范式将物理定律作为核心学习信号的一部分,使得无需任何标注数据即可学习有价值的表示。

相似文章

从视频中自监督学习结构化动态

Hugging Face Daily Papers

本文提出了结构化动态模型(SDM),该模型通过自监督学习从冻结的图像特征中分离相机运动和物体运动,并在新的评估套件上优于基线方法。

基于物理感知潜空间代理的变分参数校准

arXiv cs.LG

本文介绍了一种基于物理感知自编码器的潜空间框架,用于参数化动力系统的降阶正向建模和变分参数估计,并在计算流体动力学基准上进行了演示。该方法实现了基于可微代理的逆向建模,并在现实噪声或部分观测条件下展现出更好的校准鲁棒性。

极简视觉惯性里程计

Hugging Face Daily Papers

一种极简视觉惯性里程计方法,使用四个带有光学Gabor掩模的光电二极管和一个时序卷积网络,实现对差动驱动机器人的精确平面运动估计,并在多种室内外地形上进行了验证,无需实际场景微调。

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。