用于单IMU活动识别的动态影响加权蒸馏
摘要
本文介绍了动态影响加权(DIW),一种知识蒸馏方法,通过在训练过程中动态加权来自多个IMU的教师目标,来改进单IMU活动识别,实现了显著的性能提升。
arXiv:2608.24904v1 公告类型:新
摘要:在多个身体部位部署惯性传感器可以提高活动识别性能,但在推理时要求所有传感器会增加部署负担。我们研究在训练期间使用四个同步IMU是否能改进一个在拟合和推理时仅使用右臂IMU的学生模型。一个冻结的四IMU教师模型提供logit和特征目标。固定权重知识蒸馏以相同强度将每个目标应用于每个拟合样本,尽管学生模型可能不会从中获得同等收益。我们引入动态影响加权(DIW),它在单独的折叠内部训练参与者上测试一步候选更新。然后DIW为logit和特征损失分配独立的样本级门控。在WEAR数据集上,我们使用受试者不相交的五折交叉验证,对22名参与者的19个标签和68,298个完整窗口进行评估。池化折外宏F1分数为:监督学习0.561820,固定权重KD为0.571623。DIW达到0.638451,分别提升了7.66和6.68个百分点。它在19个标签中的18个和22个保留参与者中的21个上超过了监督学习。所有三种方法在推理时都保留相同的80,915参数右臂学生模型。在此协议下,DIW将仅训练时的多位置信息转化为更强的单IMU模型,而无需改变部署的传感设备或学生模型的前向图。
查看缓存全文
缓存时间: 2026/08/27 09:27
# 动态影响加权蒸馏在单IMU活动识别中的应用
来源:https://arxiv.org/html/2608.24904
###### 摘要
多个身体位置的惯性传感器可以改善活动识别,但推理时需要所有传感器会增加部署负担。我们研究训练阶段可用的四个同步IMU,是否能够改进在适配和推理时仅使用右臂IMU的学生模型。一个冻结的四IMU教师模型提供逻辑值和特征目标。固定权重知识蒸馏对每个适配样本施加相同强度的目标,但学生模型可能并非从这些目标中同等受益。我们引入了动态影响加权(DIW),该方法在单独的折叠内训练参与者上测试一步候选更新。DIW随后为逻辑损失和特征损失分配独立的样本级门控。在WEAR数据集上,我们使用主体分离的五折交叉验证评估了来自22名参与者的19个标签和68,298个完整窗口。汇总的折外宏观F1值,监督学习为0.561820,固定权重KD为0.571623。DIW达到0.638451,分别提升了7.66和6.68个百分点。它在19个标签中的18个和22名留出参与者中的21名上超过了监督学习。所有三种方法在推理时都保留了相同的80,915参数右臂学生模型。在此协议下,DIW将仅用于训练的多位置信息转化为更强的单IMU模型,而无需改变部署的传感设备或学生前向计算图。
## 1引言
基于穿戴式惯性流的人体活动识别已从手工设计的流程发展到深度时序模型\[5 (https://arxiv.org/html/2608.24904#bib.bib2),16 (https://arxiv.org/html/2608.24904#bib.bib3),10 (https://arxiv.org/html/2608.24904#bib.bib5),20 (https://arxiv.org/html/2608.24904#bib.bib6),9 (https://arxiv.org/html/2608.24904#bib.bib4)\]\。单个身体位置的传感器只能捕获动作的一部分。下半身传感器强调周期性腿部运动,而手臂传感器直接捕获许多上半身锻炼。因此,结合多个位置可以提供更广泛的运动覆盖。
同样的覆盖也使部署变得更困难。每个额外的设备都必须穿戴、同步、供电和维护。受控的数据收集比日常使用更能容忍这种负担。因此,先前的工作在推理时保留一个目标传感器的情况下,使用了额外的训练传感器、跨位置表示学习和虚拟传感器融合\[15 (https://arxiv.org/html/2608.24904#bib.bib11),7 (https://arxiv.org/html/2608.24904#bib.bib12),19 (https://arxiv.org/html/2608.24904#bib.bib13)\]\。我们采用这种设置,使用四个同步训练IMU和一个仅接收右臂IMU的最终分类器。
利用特权信息进行学习形式化了对部署预测器不可用的观测信息的访问\[28 (https://arxiv.org/html/2608.24904#bib.bib7)\]\。广义蒸馏通过师生学习应用了这一思想\[17 (https://arxiv.org/html/2608.24904#bib.bib8)\]\。四IMU教师可以向右臂学生提供软化的类别目标\[12 (https://arxiv.org/html/2608.24904#bib.bib18)\]和中间特征目标\[24 (https://arxiv.org/html/2608.24904#bib.bib19)\]\。然而,更准确的教师并不能保证对学生的每次更新提供有用的指导。教师可能依赖于右臂学生无法观测到的腿部或左臂运动。在任何给定步骤,固定权重KD仍然对每个适配样本应用相同的逻辑值和特征系数。
我们引入了*动态影响加权*(DIW)来决定每个教师目标应该对当前学生产生多强的影响。DIW首先构建一个分离的一一步候选更新,并在折叠内部元集上对其进行评估。然后,它沿着产生的元反馈方向探测每个适配样本的逻辑损失和特征损失。解析出的正对齐被分别映射到两个[0,1]范围内的门控值。教师、元集和门控估计操作仅在训练期间使用。
我们在WEAR数据集\[3 (https://arxiv.org/html/2608.24904#bib.bib1)\]上比较了监督学习的右臂学生、使用固定权重KD的同一学生以及使用DIW的同一学生。在主体分离的五折评估下,汇总的折外(OOF)宏观F1分别为0.561820、0.571623和0.638451。DIW在19个标签中的18个和22名留出参与者中的21名上超过了监督学习。折0的门控诊断和针对性消融研究了所学选择在知识组件、训练阶段和活动类别上的变化情况。
我们的贡献有三方面:
- •我们定义了一个受控的四IMU教师和右臂学生协议,所有可部署路径都使用相同的单IMU推理。
- •我们开发了DIW,它结合了分离的前瞻评估和为逻辑值和特征蒸馏独立估计的样本级门控。
- •我们在共同的折外预测上评估了三种路径,并将聚合性能与标签级、参与者级、门控诊断和消融证据联系起来。
## 2相关工作
### 2\.1训练期间的丰富传感与推理时的受限传感
利用特权信息进行学习允许在训练期间使用辅助观测,同时要求最终预测器在没有这些观测的情况下运行\[28 (https://arxiv.org/html/2608.24904#bib.bib7)\]\。蒸馏提供了一种通用机制,将这种仅训练信息转移到定义在部署输入上的模型中\[17 (https://arxiv.org/html/2608.24904#bib.bib8)\]\。相关工作通过模态幻觉和特权循环表示传递了侧信息\[13 (https://arxiv.org/html/2608.24904#bib.bib9),25 (https://arxiv.org/html/2608.24904#bib.bib10)\]\。在可穿戴传感领域,这种区别尤其有用,因为精心策划的数据收集可以临时在比预期日常佩戴更多身体位置上安装仪器。
几项活动识别研究直接实例化了这种训练/部署的不对称性。Lago*等人*在训练期间使用额外的穿戴式传感器来改善从单个保留传感器的识别效果\[15 (https://arxiv.org/html/2608.24904#bib.bib11)\]\。Fortes Rey*等人*跨传感器位置对齐表示,并仅评估目标位置\[7 (https://arxiv.org/html/2608.24904#bib.bib12)\]\。虚拟融合通过对比学习联合利用同步训练传感器,同时支持单传感器推理分支\[19 (https://arxiv.org/html/2608.24904#bib.bib13)\]\。这些方法表明,临时传感可以为最终输入受限的预测器提供信息。
相关系统将相同的思想扩展到异构模态或显式师生学习。MESEN在模型设计期间使用多模态数据,以支持少量标签的单模态活动识别\[31 (https://arxiv.org/html/2608.24904#bib.bib14)\]\。TSAK将语义表示从多位置、多模态教师转移到更小的单手模型\[2 (https://arxiv.org/html/2608.24904#bib.bib15)\]\。传感器到传感器的过程化协同学习通过输入适配和多层次特征目标对齐传感器丰富的教师和传感器有限的学生\[30 (https://arxiv.org/html/2608.24904#bib.bib16)\]\。这些研究使用了不同形式的仅训练信息,但都旨在改进部署时输入更少的模型。
### 2\.2蒸馏与验证引导加权
模型压缩确立了一个更广泛的前提,即一个紧凑的预测器可以从一个更强的模型中学习\[4 (https://arxiv.org/html/2608.24904#bib.bib17)\]\。经典的KD训练学生模型以匹配教师的软化输出分布\[12 (https://arxiv.org/html/2608.24904#bib.bib18)\],而基于特征的方法则对齐内部表示或注意力模式\[24 (https://arxiv.org/html/2608.24904#bib.bib19),32 (https://arxiv.org/html/2608.24904#bib.bib20)\]\。综述文献在更广泛的蒸馏文献中组织了这些目标\[8 (https://arxiv.org/html/2608.24904#bib.bib21)\]\。当教师包含的信息未直接由学生输入暴露时,组合输出和特征目标是常见的,但恒定的损失系数对每个适配样本的处理方式相同。
验证引导重加权提供了一种适应训练贡献的方法。学习重加权示例从训练和干净验证梯度方向之间的一致性中得出当前批次的权重\[22 (https://arxiv.org/html/2608.24904#bib.bib23)\]\。元权重网络则从元集中学习损失到权重的映射\[26 (https://arxiv.org/html/2608.24904#bib.bib24)\]\。动态损失教学根据学生状态和训练阶段调整所学目标\[29 (https://arxiv.org/html/2608.24904#bib.bib25)\]\。经典的影响函数估计训练权重的微小变化如何影响模型预测\[14 (https://arxiv.org/html/2608.24904#bib.bib22)\]\。这些研究使用瞬时训练损失之外的反馈来决定样本或目标的贡献强度。
自适应加权也在蒸馏内部进行了研究。多教师KD可以学习输出和特征级信息的不同组合\[33 (https://arxiv.org/html/2608.24904#bib.bib26)\]\。LGTM定义了基于验证的蒸馏影响,用于单个训练样本,并使用有限差分近似来塑造教师学习\[23 (https://arxiv.org/html/2608.24904#bib.bib27)\]\。在这些方法中,自适应蒸馏可以作用于不同的对象,包括教师组合、训练样本以及教师自身的更新。
## 3方法
### 3\.1问题设定
令P=\{RA,RL,LL,LA\}P=\\{\\mathrm{RA},\\mathrm{RL},\\mathrm{LL},\\mathrm{LA}\\}表示右臂、右腿、左腿和左臂的传感器位置。同步训练样本为(XiP,yi)(X_{i}^{\\mathcal{P}},y_{i}),其中XiP={xip:p∈P}X_{i}^{\\mathcal{P}}=\\{x_{i}^{p}:p\\in\\mathcal{P}\\},yi∈{1,...,K}y_{i}\\in\\{1,\\ldots,K\\},K=19K=19。四IMU教师TφT_{\phi}接收XiPX_{i}^{\\mathcal{P}}。右臂学生SθS_{\theta}在适配和推理时仅接收xiRAx_{i}^{\\mathrm{RA}}。因此,教师的非右臂输入是特权训练信息,而非学生需要重构的缺失输入。
在每个外部交叉验证折内,外部训练参与者被划分为适配集Dfit\\mathcal{D}_{\\mathrm{fit}}和折叠内部元集Dmeta\\mathcal{D}_{\\mathrm{meta}}。三名参与者构成Dmeta\\mathcal{D}_{\\mathrm{meta}},其余外部训练参与者构成Dfit\\mathcal{D}_{\\mathrm{fit}}。适配集提供归一化统计量、类别权重、教师训练数据和直接学生更新。DIW仅使用元集来评估候选蒸馏更新。Dfit\\mathcal{D}_{\\mathrm{fit}}、Dmeta\\mathcal{D}_{\\mathrm{meta}}和外部测试折Dtest\\mathcal{D}_{\\mathrm{test}}中的参与者集合是两两不相交的。外部测试折不影响训练、门控估计、轮次计数或检查点选择。
请参见标题图1:学生训练期间的DIW。一个分离的一步更新在折叠内部的元批次上进行评估,有限差分探测为逻辑值和特征蒸馏产生独立的样本级门控。推理时仅保留右臂学生模型。
### 3\.2输入与网络
每个位置提供一个50样本、三轴加速度窗口。对于一阶差分通道,我们预置第一个样本,使得初始差分恰好为零。我们还附加了信号幅度矢量(SMV)
SMVt=ax,t2+ay,t2+az,t2。\\operatorname{SMV}_{t}=\\sqrt{a_{x,t}^{2}+a_{y,t}^{2}+a_{z,t}^{2}}。(1)所得通道顺序为[ax,ay,az,Δax,Δay,az,SMV][a_{x},a_{y},a_{z},\\Delta a_{x},\\Delta a_{y},\\Delta a_{z},\\operatorname{SMV}],每个位置产生一个50×750\\times 7张量。差分通道是原始的时间一阶差分,而不是按采样间隔归一化的导数。均值和总体标准差分别从Dfit\\mathcal{D}_{\\mathrm{fit}}估计每个位置和通道;标准差下限为10−610^{-6}。
右臂学生是一个紧凑的时序卷积模型\[1 (https://arxiv.org/html/2608.24904#bib.bib29)\]\。它使用两个残差一维卷积块\[11 (https://arxiv.org/html/2608.24904#bib.bib28)\],分别有64和96个通道,核大小为5,膨胀率为1和2,批量归一化,GELU激活,丢弃率为0.15。拼接的时序平均池化和最大池化产生一个192维表示hiSh_{i}^{S},随后是一个192→192192\\!\\rightarrow\\!192投影和一个19类线性头。学生模型有80,915个可训练参数。
四IMU教师将一个共享的时序编码器应用于固定顺序RA, RL, LL, LA的四个位置。它们的四个192维表示被拼接,并通过一个学习到的768→192768\\!\\rightarrow\\!192融合投影,产生hiTh_{i}^{T},然后经过19类头。所得的共享编码器融合教师有191,507个参数。教师优化有两个阶段。首先,共享编码器和分类器使用四个位置特定的硬标签损失的平均值训练32个轮次。融合阶段加载此检查点,并使用新的优化器和调度器再训练完整教师32个轮次。在Dfit\\mathcal{D}_{\\mathrm{fit}}上的最终逻辑值ziTz_{i}^{T}和融合特征hiTh_{i}^{T}以FP32格式缓存,并且φ\\phi在整个学生训练过程中保持冻结。
### 3\.3监督学习与固定权重蒸馏
令NcN_{c}为适配集中类别c的样本数,N=|Dfit|N=|\\mathcal{D}_{\\mathrm{fit}}|,K=19K=19。监督项使用截断的逆频率加权:
αc=clip(NKNc,1,4),liCE(θ)=−αyilogpS(yi∣xiRA;θ)。\\alpha_{c}=\\operatorname{clip}\\!\\left(\\frac{N}{KN_{c}},1,4\\right),\\qquad\\ell_{i}^{\\mathrm{CE}}(\\theta)=-\\alpha_{y_{i}}\\log p_{S}\\!\\left(y_{i}\\mid x_{i}^{\\mathrm{RA}};\\theta\\right)。(2)对于冻结的教师,令ziTz_{i}^{T}和hiTh_{i}^{T}表示其逻辑值和融合特征,并令ziS(θ)z_{i}^{S}(\\theta)和hiS(θ)h_{i}^{S}(\\theta)表示相应的学生量。设Tkd=2T_{\\mathrm{kd}}=2,d=192d=192,两个样本级蒸馏分量为
qi\\displaystyle q_{i}=softmax(ziT/Tkd),\\displaystyle=\\operatorname{softmax}\\!\\left(z_{i}^{T}/T_{\\mathrm{kd}}\\right),pi(θ)\\displaystyle p_{i}(\\theta)=softmax(ziS(θ)/Tkd),\\displaystyle=\\operatorname{softmax}\\!\\left(z_{i}^{S}(\\theta)/T_{\\mathrm{kd}}\\right),liL(θ)\\displaystyle\\ell_{i}^{L}(\\theta)=Tkd2DKL(qi∥pi(θ)),\\displaystyle=T_{\\mathrm{kd}}^{2}D_{\\mathrm{KL}}\\!\\left(q_{i}\\,\\|\\,p_{i}(\\theta)\\right),liF(θ)\\displaystyle\\ell_{i}^{F}(\\theta)=1d‖hiS(θ)−hiT‖22。\\displaystyle=\\frac{1}{d}\\left\\|h_{i}^{S}(\\theta)-h_{i}^{T}\\right\\|_{2}^{2}。(3)教师目标被分离。上标LL和FF分别表示逻辑值蒸馏和特征蒸馏,并在整个DIW过程中保持独立。
两种蒸馏路径都使用基础系数λL=0.2\\lambda_{L}=0.2和λF=相似文章
通过影响力匹配进行数据集浓缩
本文提出了影响力匹配(Inf-Match)方法,这是一种数据集浓缩技术,通过学习一个紧凑的合成集,使其对收敛参数的影响与完整数据集相匹配,从而对齐最终训练结果。该方法在分类基准测试上达到了最先进的准确率,并在视觉-语言浓缩任务中优于强基线方法。
通过混合层蒸馏和关键信息的逐步注意力改进小模型的推理能力
本文提出一种新颖的思维链蒸馏框架,通过混合层模块的动态层对齐,将教师模型对关键信息的逐步注意力转移到学生模型中。该方法通过明确指导学生模型在推理过程中逐步聚焦关键信息,在数学和常识推理基准测试中实现了一致的性能提升。
基于IMU传感器的手写轨迹重建的域适应方法
本文提出了一种基于IMU传感器的手写轨迹重建的域适应方法,针对成人和儿童手写信号差异,提高在教育应用中的重建精度。
AMRD:面向轻量级语音情感识别的自适应多教师关系蒸馏
本文介绍了AMRD,一种自适应多教师关系蒸馏方法,用于将大型自监督语音情感识别模型压缩为面向边缘设备的轻量级学生模型。它解决了教师可靠性变化和关系结构丢失的问题,在IEMOCAP和CREMA-D数据集上展示了改进。
AffectFlow-DINO: 基于条件修正流的不确定性感知多任务情感估计
本文提出了AffectFlow-DINO,一种用于第11届ABAW挑战赛的多任务学习系统,该系统采用条件修正流头来建模真实场景下面部行为估计中的不确定性,相比基线取得了显著提升。