基于sEMG信号的实时手势识别图神经网络模型
摘要
本文介绍了一种基于前臂表面肌电(sEMG)信号的实时手势识别图神经网络模型。该方法在M1 Pro CPU上实现了99%的分类准确率,平均处理时间为48毫秒,性能优于现有最先进技术。
arXiv:2607.07850v1 Announce Type: new
摘要:为了实现先进手部假肢和增强现实的无缝控制,准确且即时的的手势识别至关重要。从前臂获取的表面肌电(sEMG)信号常被用于此目的。本文提出了一种新颖的sEMG表示方法,该方法利用包含前臂肌肉激活模式信息的图网络。基于这些图网络,我们开发了一种机器学习算法,能够使用图神经网络进行实时手势识别。该算法的性能使用从myoband采集的sEMG信号进行评估,myoband有8个电极放置在前臂周围,涉及8名健康受试者。所提出的方法平均分类准确率达到99\%,超过了最先进技术的性能。图构建和预测的平均时间为48毫秒(使用M1 Pro CPU),使得该方法非常适合实时应用。
查看缓存全文
缓存时间: 2026/07/10 06:06
# 基于表面肌电信号实时手势识别的图神经网络模型 ††致谢:本研究基于美国国家科学基金会资助项目#2123635以及迈阿密大学教务长跨学科计算奖学金支持。
来源:https://arxiv.org/html/2607.07850
###### 摘要
为了实现高级手部假肢和增强现实的无缝控制,准确且即时的手势识别至关重要。前臂获取的表面肌电图(sEMG)信号通常用于此目的。本文提出了一种基于图网络的sEMG表示新方法,该图网络包含前臂肌肉激活模式信息。基于这些图网络,我们开发了一种利用图神经网络进行实时手势识别的机器学习算法。使用从myoband(围绕前臂放置8个电极)获取的sEMG信号,对8名健康受试者进行了算法性能评估。所提出的方法平均分类准确率达到99%,超越了最先进技术。使用M1 pro CPU,图构建和预测的平均时间为48ms,使得该方法非常适合实时应用。
## I 引言
在人机交互领域,实时手势识别在实现人与机器之间的无缝通信中起着关键作用。准确且快速地解读人类手势的能力在虚拟现实(VR)、增强现实(AR)系统以及医疗健康和机器人等领域具有巨大潜力。其中一些系统利用从前臂捕获的表面肌电图(sEMG)信号[17, 6]。手势识别的常见方法是从采集的sEMG记录中提取时域和频域特征,然后使用各种学习算法进行分类,例如支持向量机(SVM)、线性判别分析(LDA)和神经网络(NN)[5, 21, 4, 15, 8]。
尽管已有大量研究致力于从预录的sEMG信号中准确分类手势[21, 14, 11],但只有少数研究集中于使用前臂sEMG信号进行*实时*手势识别[7, 9, 16]。现有方法大多利用sEMG信号的分箱(binning)技术,并在每个分箱内提取波的特定特征进行分类[20, 11, 7, 9]。因此,连续分箱带来的计算复杂性问题对实时手势预测构成了挑战。针对这些挑战,本文引入了一种创新的利用图论进行实时手势识别的方法。本研究的动机源于对鲁棒且高效、能够实时运行的手势识别系统的需求,以实现人类与数字界面之间自然直观的交互。
基于图的方法为建模数据中的复杂关系和模式提供了灵活框架,使其非常适合捕捉手势的空间和时间动态[24]。通过将手势表示为动态图,我们弥合了原始传感器数据与有意义的手势表示之间的差距。每个手势被概念化为一个图,节点代表人体上的电极,边捕捉节点之间的时间依赖性和空间相关性[9]。传统的基于图核的方法,如最短路径核[2]、图元核[19]、随机游走核[22]、Weisfeiler-Lehman子树核[18]、传播核[12]和深度图核[23],在处理较小图时,与基于神经网络的方法[25]相比,往往性能不足。
在本文中,我们提出了一种基于图的方法,该方法基于图神经网络(GNN)、图卷积网络(GCN)和图信号处理(GSP)的最新进展,以实现对复杂手势的识别,且延迟极低[10, 3]。我们采用了一种新思路,即根据时间序列sEMG信号构建图网络,该网络能够表示前臂肌肉的个体和相互激活模式。我们研究了如何利用该图网络检测手势开始的时间,并对不同手势类型进行分类(为此我们使用了GNN)。我们评估了其计算效率、实时功能和准确性,并证明其性能超越了最先进的实时手势分类算法。
## II 方法
### II-A 概述
在我们的研究中,我们借鉴了先前研究的见解,这些研究强调了sEMG信号之间的相关性在理解神经系统中复杂的电化学过程方面的重要作用[8]。以此为基础,我们采用基于图的方法来建模时间序列数据中的复杂关系。具体来说,我们构建了一个图表示,其中电极作为节点,计算出的对应时间序列之间的相关性作为边。通过基于这些相关性将时间序列数据转换为图结构,我们获得了对单个电极活动及其相互依赖关系的整体视角。这种基于图的表示为分析sEMG信号与手势之间的动态交互和相关性提供了强大框架,使我们能够揭示复杂模式并获得对神经肌肉通信的更深入理解。
### II-B 图生成
用 \(\{X_1(t), X_2(t), \ldots, X_M(t)\}, t=0,1,2,\ldots\) 表示从 \(M\) 个通道记录的表面sEMG信号时间序列。在我们探索的数据集(见第III-A节)中,这些时间序列对应人类受试者不同肌肉群产生的sEMG信号。这里,\(t\) 是一个非负整数,代表采样时刻。图1展示了从这些sEMG时间序列中提取图以进行手势分类的流程。
[图1: 从sEMG时间序列中提取图以进行手势分类的流程。仅从检测到手势的窗口中提取图。]
首先,每个连续的sEMG时间序列信号 \(X_i(\cdot)\) 被划分为窗口 \(W[n], n=0,1,2,\ldots\),每个窗口长度为 \(L\) 个样本,且与下一个连续窗口的重叠百分比为 \(\delta\) 个样本。这些加窗的时间序列使我们能够捕获信号中的细粒度时间模式。令 \(X_i[n]\) 表示时间序列信号 \(X_i\) 限制在窗口 \(W[n]\) 内的部分,即:
\[
X_i[n] = \{X_i[n](t) = X_i(nL + t), \; t=0,1,\ldots,L-1\}. \tag{1}
\]
接下来,在每个窗口 \(W[n]\) 内,我们计算每对时间序列信号 \(X_i[n]\) 和 \(X_j[n]\) 之间的皮尔逊相关系数。这将产生一个大小为 \(M \times M\) 的相关矩阵 \(\underline{P}[n]\),其第 \((i,j)\) 个元素是时间序列 \(X_i[n]\) 和 \(X_j[n]\) 之间的皮尔逊相关系数,计算公式为:
\[
\underline{P}[n]_{i,j} = \frac{\displaystyle\sum_{t=0}^{L-1}(X_i[n](t) - \overline{X_i[n]}) \, (X_j[n](t) - \overline{X_j[n]})}{\sqrt{\displaystyle\sum_{t=0}^{L-1}(X_i[n](t) - \overline{X_i[n]})^2} \sqrt{\displaystyle\sum_{t=0}^{L-1}(X_j[n](t) - \overline{X_j[n]})^2}}, \tag{2}
\]
其中 \(\overline{X_i}[n]\) 表示时间序列 \(X_i[n](t), t=0,1,\ldots,L-1\) 的平均信号幅度。\(\underline{P}[n]_{i,j}\) 的值衡量了 \(X_i[n]\) 和 \(X_j[n]\) 之间的线性关系;其取值范围在 \([-1, +1]\) 内,\(+1\) 表示完全正相关,\(-1\) 表示完全负相关,\(0\) 表示不相关。
最后,我们使用这个相关矩阵 \(\underline{P}[n]\),将其对角线元素固定为零(即 \(\underline{P}[n]_{i,i}=0, i=1,\ldots,M\)),作为图 \(\mathcal{G}[n] = (\mathcal{V}[n], \mathcal{E}[n])\) 的邻接矩阵。这里,\(\mathcal{V}[n]\) 表示节点集合,\(\mathcal{E}[n]\) 表示边集合,计算出的皮尔逊相关系数构成边权重。注意,\(\mathcal{G}[n]\) 是无向图(因为 \(P[n]_{i,j} = P[n]_{j,i}\))且无自环(因为 \(P[n]_{i,i}=0\))。因此,它是一个简单的、完全连接的无向图[13],与落在窗口 \(W[n]\) 内的 \(M\) 个时间序列相关联。
### II-C 事件检测
根据生成的无向图序列 \(\mathcal{G}[n], n=0,1,2,\ldots\),我们的目标是识别发生了显著手势的有意义的时间段。类似于文献[8]中使用的方法,我们采用以下事件检测度量来实现:
\[
\Delta[n,\tau] = \sqrt{\sum_{i=1}^{M}\sum_{t=0}^{L-1}\left(X_i[n](t) - X_i[n-\tau](t)\right)^2}, \tag{3}
\]
其中 \(X_i[n-\tau](t)\) 是落在较早窗口 \(W[n-\tau]\) 内的时间序列,\(\tau\) 为正整数。注意,这可以视为某个“误差”矩阵的Frobenius范数。具体来说,考虑大小为 \(M \times L\) 的矩阵:
\[
\underline{X}[n](0:L-1) = \begin{bmatrix}
X_1[n](0) & X_1[n](1) & \cdots & X_1[n](L-1) \\
X_2[n](0) & X_2[n](1) & \cdots & X_2[n](L-1) \\
\vdots & \vdots & \ddots & \vdots \\
X_M[n](0) & X_M[n](1) & \cdots & X_M[n](L-1)
\end{bmatrix}, \tag{4}
\]
对于 \(n=0,1,\ldots\)。那么,
\[
\Delta[n,\tau] = \|\underline{X}[n](0:L-1) - \underline{X}[n-\tau](0:L-1)\|_F. \tag{5}
\]
矩阵 \(\underline{X}[n](0:L-1)\) 的第 \(i\) 行对应于时间序列 \(X_i\) 中位于窗口 \(W[n]\) 内的样本 \(0,1,\ldots,L-1\);矩阵 \(\underline{X}[n-\tau](0:L-1)\) 的第 \(i\) 行对应于时间序列 \(X_i\) 中位于窗口 \(W[n-\tau]\) 内的样本。
我们仅在 \(\Delta[n,\tau]\) 超过预设阈值的窗口 \(W[n]\) 中标记手势事件的发生。与文献[8]中采用的策略类似,对于事件检测,我们仅考虑落在这些已发生手势事件的窗口 \(W[n]\) 内的长度为 \(L\) 的时间序列 \(X_i[n], i=1,\ldots,M\)。这种聚焦方法确保我们的预测基于具有显著事件的有意义的时间段,从而避免低信噪比的区域。
### II-D 分类
#### II-D1 训练
与发生事件的窗口相关联的图,连同相应手势标签,构成了我们分类算法的训练数据。它们封装了信号通道之间的相关性,从而反映了与特定手势相关的肌肉活动。然后,在此训练数据集上训练一个简单的GNN架构,该架构包含两个全连接层,并使用ReLU激活函数。
#### II-D2 测试
训练后的GNN用于对手势进行分类。值得一提的是,利用图结构在通道之间传播和维持信息,即使是简单的网络也能理解数据的上下文和关系[1]。
## III 实验
### III-A 数据集
[图2: 上排从左到右:数据集中的sEMG信号捕获了5种手势:食指、中指屈曲、无名指屈曲、V形屈曲和握拳。下排:前臂处于中立位置,Myo手环佩戴在前臂上。]
数据集来源于文献[8],捕获了 \(C=5\) 种手势:食指、中指屈曲、无名指屈曲、V形屈曲和握拳(见图2)。信号以 \(200\,\text{Hz}\) 的采样率从 \(K=8\) 名健康受试者(4男4女,年龄 \(25\pm2\) 岁)处记录,使用Myo手环(Thalamic Labs,加拿大)采集。在数据采集过程中,受试者被要求用右手重复每种手势20次。每个受试者重复执行一个手势,每次持续 \(5\,\text{s}\),然后休息 \(5\,\text{s}\),生成一个时间序列(约20,000个样本)。每个受试者对每种手势使用8个电极进行此任务,从而生成40个时间序列。由于有 \(K=8\) 名受试者参与研究,我们总共有 \(40K=320\) 个时间序列。
### III-B 参数
为了从时间序列中提取图,我们使用了宽度为 \(L=80\,\text{samples}\)(对应 \(0.4\,\text{s}\))的窗口,连续窗口之间的重叠 \(\delta=95\%\),并且用于计算事件检测度量(公式(3))的 \(\tau\) 值设定为……(原文不完整,但翻译需忠实)。相似文章
单通道表面肌电图用于手势分类的探索性研究
本研究探索了使用单通道sEMG信号结合轻量级机器学习模型对十种手势进行分类的可行性,准确率高达90%。该研究展示了在低成本、低功耗手势识别方面的潜力。
具有心理基础标签结构的图正则化深度学习在基于脑电图的情感识别中的应用
本文介绍了一种用于基于脑电图的情感识别的图正则化深度学习框架,该框架将心理基础的情感拓扑结构融入训练目标,在SEED数据集上实现了准确率提升高达5.42个百分点以及心理上不合理的误分类减少39%。
基于领域知识的时空图卷积网络用于心电图识别
本文提出了一种基于领域知识的时空图卷积网络用于心电图识别,该网络利用PRQST关键点和双流有向图来建模心电图周期内和周期间的依赖关系,在首届中国心电图智能竞赛数据集上取得了最先进的F1分数。
设备端神经架构搜索
提出了一种轻量级神经架构搜索方法,直接在部署设备上执行,用于近传感器计算。在sEMG手语和故障诊断数据集上进行了验证,提高了准确率并减少了RAM占用。
人类通用抓取
一种流匹配模型可从RGB-D图像生成多样化的人类抓取动作,实现零样本机器人抓取,性能优于现有方法。该模型在大规模自我中心数据集上训练,在新基准测试中显著超越当前最先进的基线方法。