Inertia-1:可穿戴运动基础模型的开源探索

arXiv cs.LG 论文

摘要

Inertia-1 是一项完全开源的可穿戴运动基础模型探索,利用了超过 1820 万小时的加速度计数据,系统性地研究了 15 个数据集中的数据、模型和训练选择,用于活动识别和疾病预测等任务。

arXiv:2607.06617v1 Announce Type: new 可穿戴运动传感为人类行为和健康提供了一个持续且可扩展的窗口,因此自然适合用于基础模型,但其预训练和扩展原理仍未被充分理解。先前的研究通常针对孤立的设计选择(如传感器放置位置或采样频率),往往在固定设置和狭窄的下游任务下进行,未能捕捉真实世界的传感多样性。我们提出了 Inertia-1,一项完全开源的可穿戴运动基础模型探索。利用来自全球来源、涵盖超过 1820 万小时的加速度计数据大规模语料库,我们构建了一个受控框架,用于研究可穿戴运动基础模型的完整生命周期,涵盖数据选择(如传感器模态、设备放置位置、采样率、窗口长度)、模型选择(如架构和模型大小)以及训练选择(如预训练目标和数据规模)。在 15 个数据集上的广泛评估,涵盖人类活动识别、步态冻结检测和疾病预测,揭示了构建跨任务和传感条件泛化的运动基础模型的有趣发现。总的来说,Inertia-1 不仅为各种下游任务提供了最先进的配方,而且还充当了可穿戴运动表示学习的全面、实用且开源的指南。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:41

# Inertia-1:可穿戴运动基础模型的开放探索
来源:https://arxiv.org/html/2607.06617
\\correspondingauthor

∗同等贡献\.†通讯作者:yuzhey@ucla\.edu\.\\codelinkhttps://github\.com/yang\-ai\-lab/Inertia\-1\\projecturlhttps://yang\-ai\-lab\.github\.io/Inertia\-1

Aakarsh AnandSarah JiangChuntung Zhuang约翰霍普金斯大学Zitao Shuai加州大学洛杉矶分校Sriram Sankararaman加州大学洛杉矶分校Yuzhe Yang

###### 摘要

可穿戴运动传感为人类行为和健康提供了一个连续且可扩展的窗口,使其天然适合基础模型,然而其预训练和扩展原则仍未被充分理解。以往的研究孤立地考察设计选择,例如传感器放置位置或采样频率,通常是在固定设置和狭窄的下游任务下进行,无法捕捉真实世界的传感多样性。我们提出了Inertia\-1,一项对可穿戴运动基础模型的完全开放探索。利用来自全球来源、涵盖超过18.2百万小时的加速度计数据大规模语料库,我们构建了一个受控框架,用于研究可穿戴运动基础模型的完整生命周期,涵盖数据选择(如传感器模态、设备放置位置、采样率、窗口长度)、模型选择(如架构和模型大小)以及训练选择(如预训练目标和数据规模)。在15个数据集上的广泛评估,涵盖人体活动识别、步态冻结检测和疾病预测,揭示了构建能跨任务和传感条件泛化的运动基础模型的有趣发现。总的来说,Inertia\-1不仅为多样化的下游任务提供了最先进的配方,而且作为可穿戴运动表示学习的全面、实用且开放的食谱。

###### 摘要

可穿戴运动传感为人类行为和健康提供了一个连续且可扩展的窗口,使其天然适合基础模型,然而其预训练和扩展原则仍未被充分理解。以往的研究孤立地考察设计选择,例如传感器放置位置或采样频率,通常是在固定设置和狭窄的下游任务下进行,无法捕捉真实世界的传感多样性。我们提出了Inertia\-1,一项对可穿戴运动基础模型的完全开放探索。利用来自全球来源、涵盖超过18.2百万小时的加速度计数据大规模语料库,我们构建了一个受控框架,用于研究可穿戴运动基础模型的完整生命周期,涵盖数据选择(如传感器模态、设备放置位置、采样率、窗口长度)、模型选择(如架构和模型大小)以及训练选择(如预训练目标和数据规模)。在15个数据集上的广泛评估,涵盖人体活动识别、步态冻结检测和疾病预测,揭示了构建能跨任务和传感条件泛化的运动基础模型的有趣发现。总的来说,Inertia\-1不仅为多样化的下游任务提供了最先进的配方,而且作为可穿戴运动表示学习的全面、实用且开放的食谱。

## 1引言

基础模型将规模转化为可复用的结构\[xu2026sleeplm,shuai2026osf,zhang2025sensorlm\]。对于可穿戴智能而言,运动是这种结构最自然的来源之一:连续的加速度计和陀螺仪流记录了人们在日常生活中的移动、休息和功能活动,将日常行为与活动能力\[daphnet\_freezing\_of\_gait\_245,chan2024capture,li2026hearts\]、生理状态\[narayanswamy2025scaling,yang2022artificial\]和个人健康\[metwally2026insulin,doherty2017large\]联系起来。大型人群队列现在收集数天或数周的纵向运动记录\[doherty2017large,chen2011china,patten2026all\],支持从日常活动分析和活动能力评估到疾病风险分层等应用。主要研究如英国生物银行\[doherty2017large\]包含了数百万小时的运动信号,然而这些数据大多未标记且未被充分利用。这为可穿戴运动基础模型创造了清晰的可能性:从大型未标记队列中学习通用模型,并将其迁移到多样化的行为和健康任务中。

然而,实现这一潜力受到了碎片化研究格局的阻碍。这种碎片化是多层次的:数据管道在采样率、窗口长度、传感器模态、身体放置位置和轴表示方面存在差异;方法论在预训练目标、架构、表示领域和训练配方上各不相同;数据集在规模、持续时间、标签密度和临床背景上不同;下游评估也跨越人体活动识别(HAR)、步态分析和疾病预测。如表1 (https://arxiv.org/html/2607.06617#S2.T1) 所总结,现有的运动研究通常只覆盖传感器、放置位置、任务和规模的一个子集,使得该领域虽然有强大的局部发现,但构建通用可穿戴运动基础模型的指导有限。

参见图注图 1:Inertia\-1概述。我们提出了一个统一且完全开放的可穿戴运动基础模型探索,涵盖大规模加速度计预训练、多样化的自监督目标、受控传感设置以及跨活动识别、步态分析和疾病预测的下游评估。Inertia\-1覆盖了来自超过115,000名个体和15个数据集的1820万小时运动数据,能够系统研究数据、模型和训练选择如何塑造可迁移的运动表示。更多细节见附录A (https://arxiv.org/html/2607.06617#A1)。具体来说,这种碎片化的性质是双重的。首先,数据配置和建模方法很少在共享协议下被检验。先前的研究在不相交的数据集上研究了多样化但孤立的因素,如窗口化\[banos2014window\]、传感器位移\[banos2014displacement\]和设备异质性\[stisen2015smart\],而最近的基础模型工作探索了重建\[miao2024spatial\]、对比\[yang2023simper\]、自蒸馏\[vu2025smooth\]和频域目标\[logacjov2024selfpab\],通常是在固定输入设置下。然而,当目标、预处理选择、传感设置和表示域都同时变化时,很难将进展归因于任何一个单一的设计选择。其次,数据集规模和任务定义在不同体制间分离。大规模队列提供人群水平的纵向数据和健康结果,但通常发布压缩的运动表示,如下采样迹线或矢量幅度摘要\[nebeker2026sharing,patten2026all\]。相比之下,用于HAR和步态冻结(FoG)的数据集提供细粒度、高频率的信号,但本质上规模较小,参与者有限且会话时间短\[daphnet\_freezing\_of\_gait\_245\]。这留下了一个问题:大规模未标记队列能否产生同时桥接小规模、标签稀缺的运动任务和人群水平疾病建模的表示。

为了填补这些空白,我们提出了Inertia\-1,一项对可穿戴运动基础模型的开放探索。Inertia\-1并非仅仅提出一个新的架构,而是旨在厘清预训练目标、传感配置、规模和下游任务如何共同塑造可迁移的运动表示(见图1 (https://arxiv.org/html/2607.06617#S1.F1)):❶预训练。我们在相同的训练和评估设置下整合了10种代表性方法,涵盖5类预训练目标,包括通用的自监督以及运动特定的方法。❷数据管道。我们在实验轴的严格网格上评估模型,包括采样率、窗口长度、传感器模态、传感器轴维度和身体放置位置(表7 (https://arxiv.org/html/2607.06617#A1.T7))。❸规模。我们整合了据我们所知迄今为止最大的波形级可穿戴运动数据集合,涵盖来自超过115,000人和15个数据集的1820万小时运动数据(表1 (https://arxiv.org/html/2607.06617#S2.T1))。❹下游任务。我们在10个人体活动识别数据集、3个步态冻结数据集和7个疾病预测任务上进行评估,涵盖从细粒度运动理解到人群水平健康建模。

Inertia\-1设计为易于扩展,支持随着领域发展而加入新的模型、数据集和任务。借助统一的框架和超过1000个训练好的模型,我们揭示了构建最先进可穿戴运动基础模型的有趣经验教训和未来方向:

- •预训练有益,但并非普遍适用 – 自监督预训练始终优于监督对应物,但没有任何单一目标在所有任务族和指标上占据主导地位。
- •数据表示是一阶建模选择 – 三轴运动信号优于幅度摘要,而采样率和窗口长度在不同任务粒度上的重要性不同。
- •规模有帮助,但并非所有规模都等同 – 更多(多样化)的预训练数据比更大的模型规模带来更稳定的收益,多传感器融合在传感器扩展设置中带来了显著提升。
- •最先进的运动基础模型需要协同设计 – 性能取决于数据保真度、传感设置、目标和规模的联合选择,而非任何单一的配方。
- •Inertia\-1作为开放食谱 – 作为迄今为止最多样化和统一的测试平台,Inertia\-1为研究、扩展和部署可穿戴运动基础模型提供了实用的基础。

## 2相关工作

表 1:可穿戴运动数据建模研究的比较。我们比较了主要设备放置位置的一个子集;Inertia\-1中覆盖的完整放置位置集合见附录A的表7。研究†\#人数\#小时数据集传感器放置位置任务(千)ACCGYRMAGWRARCHHPLGANHARFoGDPBanos等人\[banos2014displacement\]17≪11✓✓✓✓✓✓✓✓✓✓✗✗Stisen等人\[stisen2015smart\]9≪11✓✓✗✓✗✗✓✗✗✓✗✗Haresamudram等人\[haresamudram2022ssl\]320410✓✗✗✓✗✗✓✓✓✓✓✗Yuan等人\[yuan2024self\]100,00015,7009✓✗✗✓✗✗✗✗✗✓✗✗Logacjov等人\[logacjov2024selfpab\]35,0001006✓✗✗✓✗✓✓✓✓✓✗✗Hoddes等人\[hoddes2025scaling\]601.64✓✓✗✓✗✗✗✗✗✓✗✗Xu等人\[xu2025relcon\]87,3807207✓✗✗✓✗✗✓✓✗✓✓✗Inertia\-1(本文)115,45018,22415✓✓✓✓✓✓✓✓✓✓✓✓

ACC:加速度计。GYR:陀螺仪。MAG:磁力计。WR:手腕。AR:手臂。CH:胸部。HP:髋部。LG:腿部。AN:踝部。

HAR:人体活动识别。FoG:步态冻结检测。DP:疾病预测。†仅考虑原始波形研究。

可穿戴运动建模的应用。可穿戴运动信号支持跨截然不同时间和临床尺度的任务。HAR将惯性数据的短窗口分类为步行、坐着、跑步或家务活动等活动\[9257355,6365160\],而FoG检测识别帕金森病中短暂的临床意义的步态事件\[10.3389/fnagi.2023.1119956,rodriguezmartin2017fog\]。在更大尺度上,人群研究使用多日加速度测量法来量化休息-活动节律、睡眠、活动能力、久坐行为和疾病风险\[Master_Annis_Huang_Beckman_Ratsimbazafy_Marginean_Carroll_Natarajan_Harrell_Roden_et_al_2022,Shim2023,doherty2017large\]。这些领域通常各自发展:HAR强调细粒度标签和高分辨率窗口,FoG强调针对目标队列的症状特异性检测,而人群健康研究则强调聚合的纵向行为。相比之下,Inertia\-1在一个统一框架下研究这些体制之间的迁移,拥有迄今为止最广泛的覆盖范围,包括十个人体活动识别数据集、三个步态冻结数据集和六个疾病预测任务(表1 (https://arxiv.org/html/2607.06617#S2.T1))。

传感配置与部署设置。可穿戴运动模型不仅受架构影响,还受信号采集和表示方式的影响。先前的研究表明,窗口长度影响识别准确性和延迟\[banos2014window\],身体放置位置和位移可能导致较大的性能变化\[banos2014displacement,info:doi/10.2196/23681\],设备异质性导致传感行为、硬件和操作系统处理的差异\[stisen2015smart\]。采样率、轴表示和传感器模态也决定了可用的时间和空间运动结构\[yamane2025effects,huang2022smartphone\]。这些因素通常一次孤立地研究,往往在监督式HAR设置中,且不在现代大规模预训练的背景下。Inertia\-1在统一的预训练设置下重新审视这些传感和部署选择,测试采样频率、窗口长度、三轴与简化轴输入、时域与频域表示、传感器模态、放置位置、模型大小和数据规模(表1 (https://arxiv.org/html/2607.06617#S2.T1))。

自监督学习与运动基础模型。自监督学习(SSL)天然适合可穿戴运动,因为未标记的加速度测量数据丰富,而密集标签成本高且任务特定。早期可穿戴SSL研究探索了HAR的预文本和对比目标\[haresamudram2022ssl,tang2021selfhar\],而近期方法则将掩蔽重建、对比、时间预测、自蒸馏和频域建模适配到惯性信号\[yuan2024self,logacjov2024selfpab,yang2023simper,10.1145/3410531.3414306\]。另一条平行的线索将预训练扩展到大型队列(如英国生物银行\[doherty2017large\]),表明大型加速度计语料库可以改善活动识别和健康预测\[doherty2017large,nhanes2011,yuan2024self,xu2025lsm2learningincompletewearable\]。相关的生物信号基础模型进一步展示了大规模生理预训练的前景\[abbaspourazad2024largescaletrainingfoundationmodels,doi:10.1056/AIoa2401033\]。然而,现有的运动基础模型研究通常侧重于单一目标、输入格式、语料库或任务设置。相比之下,Inertia\-1在受控条件下比较代表性目标,并研究它们如何跨活动识别、步态分析和疾病预测进行迁移,为构建稳健、可泛化且在不同数据集、任务、输入模态和部署设置中有用的可穿戴运动基础模型提供实用指导。

## 3 *Inertia*\-1

参见图注图 2:Inertia\-1的覆盖广度。完整设置包含在表7 (https://arxiv.org/html/2607.06617#A1.T7)中。Inertia\-1的目标是将可穿戴运动建模的碎片化格局转变为一个受控探索的统一空间。我们并非寻找一个最佳架构,而是将运动基础模型视为一个涉及数据、传感配置、预训练算法和下游任务的联合问题。这对于运动感知至关重要:相同的行为在不同放置位置、采样率、传感器模态和时间窗口下可能呈现出不同的形式,而相同的预训练表示应能够从短期活动识别迁移到长期疾病预测。

Inertia\-1被设计为一个开放、可扩展的框架,用于研究这些交互。它聚合了来自3个任务族和18个下游任务的15个数据集,预训练了一组广泛且有代表性的目标,并在受控的传感和规模选择网格上评估模型。这些组件共同使我们不仅能够询问哪个模型表现最佳,还能询问哪些设计选择使可穿戴运动基础模型在真实世界条件下变得稳健、可迁移且有用。图2 (

相似文章

Inertia-1:对统一运动基础模型的开放探索

Hacker News Top

Inertia-1是一个研究项目,系统性地探索运动模型的完整生命周期——数据、感知、目标和规模——以产生一种统一的表示,该表示无需重新训练即可跨身体位置、设备和任务迁移,利用了在1800万小时加速度计数据上的自监督预训练。

OpenMHC:加速可穿戴基础模型科学研究

arXiv cs.LG

OpenMHC推出了最大的开放获取可穿戴健康数据集,包含超过6000万小时的数据,并提供了可穿戴基础模型的开源实现,包括用于预测、插补和时序预测的统一基准测试。

Embodied-R1.5: 通过具身基础模型进化物理智能

Hugging Face Daily Papers

Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。

Inkling:我们的开放权重模型

Hacker News Top

Thinking Machines AI 发布了 Inkling,这是一个新的开放权重混合专家多模态基础模型,总参数 975B,激活参数 41B,支持文本、图像、音频和视频,同时提供了 Inkling-Small 的预览。