使用基于查询的Transformer的多模态表面肌电手部手势识别用于假肢控制
摘要
本文介绍了EMG-CrossFormer,一种用于多模态sEMG手部手势识别的混合卷积-Transformer模型,通过交叉注意力融合sEMG和惯性信号,在NinaPro数据集上达到了最先进的准确率。
查看缓存全文
缓存时间: 2026/07/28 06:21
# 基于查询Transformer的多模态表面肌电手势识别及其在假肢控制中的应用 来源:https://arxiv.org/html/2607.22779 \[ type=author, auid=000, bioid=1, orcid=0009\-0004\-0698\-962X \]\\cormark\[1\] \\credit 概念化、方法学、软件、形式化分析、撰写 - 初稿 \[ type=author, auid=001, bioid=2, orcid=0000\-0002\-4755\-1577 \]\\credit形式化分析、软件、可视化、调查研究、撰写 - 审阅与修改 \[ type=author, auid=002, bioid=3, orcid=0000\-0001\-5397\-2063 \]\\credit督导、资金获取、项目管理、撰写 - 审阅与修改 1\] 组织=帕多瓦大学信息工程系,城市=帕多瓦,邮编=35131,国家=意大利 2\] 组织=帕多瓦大学帕多瓦神经科学中心,城市=帕多瓦,邮编=35129,国家=意大利 3\] 组织=帕多瓦大学生物医学科学系,城市=帕多瓦,邮编=35131,国家=意大利 4\] 组织=帕多瓦大学神经科学系,城市=帕多瓦,邮编=35121,国家=意大利 5\] 组织=瑞士西部应用科学与艺术大学(HES-SO瓦莱州)信息系统研究所,城市=锡永,邮编=3960,国家=瑞士 \\cortext \[1\]通讯作者。本文档是欧盟“地平线欧洲”研究与创新计划资助项目(资助协议编号 101137074 - HEREDITARY)的研究成果。 Elisa [email protected] [email protected]\[\[\[\[\[ ###### 摘要 基于表面肌电信号(sEMG)的手势识别是人机交互和假肢控制的基础。在该领域,深度学习方法已成为黄金标准。然而,当前架构在扩展方面存在困难;随着手部动作数量的增加,模型性能通常会下降。性能下降与解码扩展手势集所需统计复杂度的增加有关,同时也受到当前最先进方法局限性的影响——这些方法主要依赖低延迟的单模态卷积架构。卷积运算具有局部性,限制了模型捕捉长程时序模式的能力。单模态设置无法利用协调信号(如惯性和眼动追踪数据)中表征运动执行的互补信息。这些局限性推动了能够跨多模态生理序列整合局部与全局特征的架构的发展。为弥补这一差距,本研究提出了EMG-CrossFormer——一种用于无缝多模态集成的端到端混合卷积-Transformer模型。EMG-CrossFormer通过级联交叉注意力融合层整合任意数量单模态编码器的表征,并利用可学习的手势查询通过交叉注意力解码融合后的表征。研究在四个NinaPro数据集(DB2、DB3、DB7和DB10)上对EMG-CrossFormer进行了评估,并与六种使用递增多模态数量的最先进模型进行了基准对比。仅使用sEMG信号时,EMG-CrossFormer在DB2、DB3、DB7和DB10上分别达到了72.33%、52.48%、79.16%和73.49%的平均准确率,始终取得最高性能。引入惯性信号后,性能提升至90.66%、80.40%、92.79%和92.06%。这些结果表明,联合局部-全局特征建模可改善纯sEMG解码效果,而多模态融合则显著放大了这一收益,凸显了这两种设计原则在复杂假肢手势识别中的价值。 ###### 关键词: 交叉注意力\\sep深度学习\\sep肌电图\\sep手势识别\\sep机器学习\\sep多模态\\sepTransformer ## 1 引言 自20世纪60年代以来,表面肌电信号(sEMG)控制的上肢假肢已在临床中使用\[upperlimbrev\],随后数十年的研究逐步改进了其控制算法并提高了可靠性。这些肌电设备已被证明通过部分恢复肢体运动功能\[semgissue2,semgissue3,semgissue1\],能够提高经桡骨截肢者的生活质量。 迄今为止,商用肌电解决方案集成了模式识别算法,用于自动的sEMG手势识别,通常支持有限的功能性抓取动作组合,且具有高精度和低延迟\[semgdevices\]。与此同时,嵌入式系统计算能力的进步推动研究界从传统机器学习方法转向深度学习范式\[DLTrio\]。然而,这一转变尚未体现在商用模式识别系统中,后者仍主要依赖经典算法。 在研究环境中,多项研究报告了出色的解码性能,在包含多达17种日常生活活动代表性手部动作的常用手势集上,准确率常超过90%\[mkcnn,emghandnet,lstm1,trahgr\]。然而,当前该领域的文献普遍缺乏可重复性,使得在相同实验条件下直接比较不同架构变得复杂。此外,常见的评估协议常常省略定量分类学\[taxonomy\]中识别出的高度相似动作,简化了分类任务,可能导致报告的性能被高估,并降低了基准数据集的实用性。这些评估空白使得难以批判性地评估深度学习框架相较于经典机器学习模型(如随机森林RF或支持向量机SVM)的真正优势——后者仍持续展现出极具竞争力的性能\[ninapro\]。 当前深度学习方法在扩展至更大手势集时,其局限性尤为明显。在这些高要求场景下,深度学习模型的性能显著下降,通常低于机器学习分类器。例如,在\[shallowcnn\]中,作者在一组来自非侵入式自适应假肢(NinaPro)数据集\[ninaprodb\]的51种不同手部动作上评估了一个浅层卷积神经网络(CNN),发现其性能相较于RF下降了超过10%,且在健全和截肢者群体中均如此。 报告的性能下降突显了现有深度学习框架的一些局限性。最先进的网络主要依赖于为低延迟优化的单模态卷积架构。虽然传统卷积能够实现高度并行化和高效的计算,使系统延迟低于建议的实时阈值125毫秒\[latency\],但其本质限制在于仅能提取局部特征。这种局部感受野限制了模型将复杂的神经激活模式与噪声区分开的能力,从而降低了解码精度,并阻止模型充分利用深度神经网络带来的性能提升。相比之下,注意力层提供了一种互补方案,使sEMG深度学习模型能够捕捉更长的时序动态\[transformer\]。然而,将其集成到低延迟、资源受限模型中的研究仍十分匮乏。 同样,单模态(仅sEMG)方法阻碍了这些架构有效利用其他信号模态(如加速度计数据)的互补信息,而后者有助于表征运动意图和运动的物理执行。先前的研究已证明,将sEMG信号与加速度计数据结合可以提高截肢者受试者的分类准确率,达到与健全个体相当的水平\[semgacc,semgacc2\]。与这些发现一致,\[nkdff\]中的作者通过一种新颖的多模态卷积模型,在紧凑的端到端框架中整合sEMG和加速度计数据,取得了相当的结果。 尽管有这些益处,但整合更多模态(如眼动追踪、场景视频)的多模态解决方案仍研究不足。这些局限性促使我们需要开发能够跨异构多模态生理序列同时提取并整合局部和全局特征的新型架构。 **贡献:** 为弥补这一差距,本研究引入了EMG-CrossFormer——一种专为无缝多模态信号集成设计的端到端混合卷积-Transformer框架。EMG-CrossFormer通过级联交叉注意力融合层整合来自任意数量单模态编码器的表征。然后,它通过与可学习手势查询的交叉注意力解码融合后的表征,这一思路受启发于其他领域已确立的基于查询的解码方法(如DETR\[detr\])。研究在四个NinaPro数据库(DB2、DB3、DB7和DB10)上对EMG-CrossFormer进行了评估,并与六种使用递增多模态输入数量的最先进模型进行了基准比较。虽然本研究的重点是sEMG与加速度计和眼动追踪数据的集成,但EMG-CrossFormer的设计使其易于扩展到其他数据模态,从而促进包含例如场景摄像头或EEG数据的多模态架构的开发。 **论文结构:** 本文大纲如下。第2节(https://arxiv.org/html/2607.22779#S2)详细描述了模型架构和实验设置。第3节(https://arxiv.org/html/2607.22779#S3)展示了EMG-CrossFormer与其他选定模型在使用递增多模态数据量条件下的比较分析。第4节(https://arxiv.org/html/2607.22779#S4)批判性地讨论了结果,突出了潜在的局限性和未来方向。最后,在第5节(https://arxiv.org/html/2607.22779#S5)得出研究结论。 ## 2 方法 本节概述研究的方法学设计,提供程序与架构的详细细节,以促进结果的可重复性。具体而言,涵盖数据集选择、数据预处理、模型架构、训练超参数、性能评估和统计分析。 ### 2.1 数据集 所提出的EMG-CrossFormer模型使用来自公共NinaPro仓库222\[在线\] 获取:https://ninapro.hevs.ch/\[ninapro\]的四个不同数据集进行评估:数据集2、3、7和10,分别称为DB2、DB3、DB7和DB10。表1(https://arxiv.org/html/2607.22779#S2.T1)总结了其主要采集配置。 选择这些数据集是为了确保在异质性群体(包括健全受试者和经桡骨截肢者)中对解码性能进行全面评估,同时研究传感器多模态性的递进水平。DB2、DB3和DB7提供使用12通道Delsys TrignoTM系统(Delsys, Natick, MA, USA)记录的同步表面肌电信号(sEMG)和三轴加速度计数据。它们包含从健全受试者(DB2、DB7)和经桡骨截肢者(DB3、DB7)收集的大范围手部运动和抓取动作。动作按三次会话组织,分别称为练习B、C和D,分别包含17、23和9个动作。每个手势重复六次;有效试验持续5秒,随后休息3秒。DB7仅包含练习B和C。因此,为统一三个数据集的标签空间,从DB2和DB3中排除了练习D,最终得到40个离散手势加上静止状态。sEMG信号的采集频率为2 kHz,而加速度计信号的采集频率为148 Hz,并由原研究人员上采样以匹配sEMG采样率。除两名DB3受试者外(根据NinaPro作者的使用说明\[ninapro\],因残肢空间不足而减少了电极数量),所有受试者均纳入分析。 DB10包括10个抓取动作和静止状态,选自基于日常生活活动的练习B和C。数据来自30名健全受试者和15名经桡骨截肢者受试者的群体\[db10\]。每个动作重复持续5至6秒,随后休息4秒。DB10同时使用三种记录模态获取:sEMG、加速度计和眼动信号。sEMG信号使用12通道Delsys TrignoTM无线系统记录,采样频率为1926 Hz。上肢运动学通过三轴加速度计采集,原生采样率为148 Hz;眼动动态使用Tobii Pro Glasses 2记录,采样率为100 Hz。加速度计和眼动信号均由原研究人员上采样以匹配sEMG采样率,确保各模态间的时间对齐\[db10\]。根据作者的使用说明,因信号质量差丢弃了六名受试者,并排除了原作者标记为不可靠的重复试验\[db10\]。 表1:本研究使用的NinaPro数据集的主要采集配置。数据集名称 受试者数量∗ 设备 通道数 sEMG采样率 \[Hz\] 使用模态 动作数量 重复次数 DB2 40 Delsys Trigno 12 2000 sEMG + ACC 40 + 静止 6 DB3∗∗ 11(截肢者) Delsys Trigno 12 2000 sEMG + ACC 40 + 静止 6 DB7 20 + 2(截肢者) Delsys Trigno(无线) 12 2000 sEMG + ACC 40 + 静止 6 DB10∗∗∗ 30 + 15(截肢者) Delsys Trigno(无线) 12 1926 sEMG + ACC + 眼动 10 + 静止 10 ∗A表示截肢者;∗∗根据\[ninapro\]的使用说明,受试者6和7被排除;∗∗∗根据\[db10\]的使用说明,六名受试者和不可靠的重复试验被排除。 ### 2.2 数据预处理 原始sEMG信号按以下流程进行预处理: 1. \[∙\\bullet\] 2. 1. 标度转换:sEMG信号转换为毫伏,以提高数值稳定性,避免混合精度(FP16)训练期间的表示问题。 3. 2. 直流分量去除:从每个sEMG通道中减去通道均值,相当于去除直流分量。 4. 3. 滤波:使用二阶(12 dB/oct)前向-后向巴特沃斯带通滤波器对sEMG信号进行滤波,截止频率为20 Hz和500 Hz。滤波器阶数和截止频率根据生物力学和临床应用指南\[semgfilt\]选择。工频噪声及其谐波已由原研究人员使用Hampel滤波器\[Hampel\]去除。 5. 4. 重采样:sEMG信号重采样至1 kHz,以减少深度学习架构所需的内存占用和浮点运算次数(FLOPs)。 6. 5. 窗口提取:将sEMG数据分割成100、150或200 ms的窗口,步进为10%(对应90%重叠),以增加样本数量。 7. 6. 静止类别平衡:对属于静止类别的窗口进行欠采样,以匹配手势类别的比例。 加速度计数据仅进行重采样和窗口提取,以保持时间一致性。眼动信号表现为图像空间中的\((x,y)\)坐标,在通过线性插值填补短间隔缺失值后,按照\[gazeinterp\]提供的指南进行相同处理。 ### 2.3 EMG-CrossFormer架构 EMG-CrossFormer是一种混合卷积-Transformer模型,旨在联合处理和融合多个输入模态(本研究中的信号)以进行手部运动解码。如图1(https://arxiv.org/html/2607.22779#S2.F1)所示,该架构由四个主要部分
相似文章
表面EMG手势解码中跨记录会话的识别与无标签自适应
本文介绍了一种用于表面EMG手势解码的与电极布局无关的编码器,它无需重新校准即可在多次记录会话中保持识别准确率,并表明在测试时进行特征统计对齐可改善在NinaPro DB6上的自适应效果。
单通道表面肌电图用于手势分类的探索性研究
本研究探索了使用单通道sEMG信号结合轻量级机器学习模型对十种手势进行分类的可行性,准确率高达90%。该研究展示了在低成本、低功耗手势识别方面的潜力。
基于sEMG信号的实时手势识别图神经网络模型
本文介绍了一种基于前臂表面肌电(sEMG)信号的实时手势识别图神经网络模型。该方法在M1 Pro CPU上实现了99%的分类准确率,平均处理时间为48毫秒,性能优于现有最先进技术。
A Montage-Agnostic Encoder for Calibration-Light Cross-User Gesture Recognition from Surface Electromyography
Introduces a montage-agnostic encoder for calibration-light cross-user gesture recognition from surface EMG, using shared weights and electrode coordinates to handle variable channel counts and reduce per-user calibration. It outperforms per-user baselines on some datasets and analyzes factors affecting cross-user transfer.
基于生理信号的多模态情感识别的深度时间建模与集成融合
本文评估了深度学习模型(LSTM、TCN、Transformer)在WESAD数据集上基于生理信号的多模态情感识别表现,结果表明集成方法达到了98.91%的准确率。