SignX:在紧凑且富含姿态的潜在空间中进行连续手语识别

arXiv cs.CL 论文

摘要

SignX提出了一种用于连续手语识别的新框架,该框架将异构姿态格式统一到紧凑的潜在空间中,并在像素空间基线基础上实现50倍计算加速,同时达到最先进的准确率。

arXiv:2504.16315v4 公告类型:replace-cross 摘要:手语数据处理的复杂性带来了诸多挑战。当前识别手语符号的方法旨在通过姿态信息将RGB手语视频翻译为基于单词的ID词汇(Glosses),这些词汇用于唯一标识符号。本文提出了SignX,一种在紧凑且富含姿态的潜在空间中进行连续手语识别(SLR)的新框架。首先,我们构建了一个统一的潜在表示,将异构姿态格式(SMPLer-X、DWPose、Mediapipe、PrimeDepth和Sapiens Segmentation)编码到一个紧凑且信息密集的空间中。其次,我们训练了一个基于ViT的视频到姿态模块,直接从原始视频中提取这种潜在表示。最后,我们开发了一种完全在此潜在空间中运行的时序建模和序列细化方法。这种多阶段设计实现了端到端的SLR,同时显著降低了计算消耗。实验结果表明,SignX在连续SLR和翻译任务上达到了最先进的准确率,相比像素空间基线实现了近50倍的加速。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:32

# SignX: 紧凑姿态丰富潜空间中的连续手语识别
来源: https://arxiv.org/html/2504.16315
111institute: 1罗格斯大学 2南洋理工大学 3哥伦比亚大学 4佐治亚理工学院 5威斯康星大学麦迪逊分校 6马克斯·普朗克智能系统研究所 7德克萨斯大学奥斯汀分校
https://signerx.github.io/SignXYalin Fenghttps://orcid.org/0009-0000-8932-1545同等贡献Chunyu Suihttps://orcid.org/0009-0008-0497-3463Hongbin Zhonghttps://orcid.org/0009-0003-2564-9674Yanxin Zhanghttps://orcid.org/0009-0001-2307-901XHongwei Yihttps://orcid.org/0000-0001-8669-2009Hezhen Huhttps://orcid.org/0000-0003-0327-1562Dimitris N\. Metaxashttps://orcid.org/0000-0001-7142-7642

###### 摘要

手语(SL)数据处理的复杂性带来了诸多挑战。当前识别手语手势的方法旨在通过姿态信息将RGB手语视频翻译为基于词的ID Glosses,这些Glosses作为手势的唯一标识符¹。本文提出了SignX,一种在紧凑姿态丰富潜空间中进行连续手语识别(SLR)的新型框架。首先,我们构建一个统一的潜表示,将异构姿态格式(SMPLer-X, DWPose, Mediapipe, PrimeDepth和Sapiens Segmentation)编码到一个紧凑且信息密集的空间中。其次,我们训练一个基于ViT的视频到姿态(Video-to-Pose)模块,直接从原始视频中提取这种潜表示。最后,我们开发了一种完全在此潜空间中运行的时序建模和序列精炼方法。这种多阶段设计实现了端到端的手语识别,同时显著降低了计算消耗。实验结果表明,SignX在连续手语识别和翻译任务上达到了最先进的准确率,与像素空间基线相比实现了近50倍的加速。

## 1 引言

手语识别(SLR)旨在自动将手语视频转换为文本或Glosses(以大写文本表示,作为手势的唯一标识符)。它在促进聋人与听人之间的无障碍交流方面具有重要社会价值[camgoz2018neural, camgoz2020sign, stoll2020text2sign, yin-etal-2021-including-signed-languages]。然而,SLR面临技术挑战:(1)手语是复杂的多模态运动,涉及手部和手臂运动以及面部表情和身体姿态,这些模态之间存在复杂的时序依赖关系[Bohacek_2022_WACV, signor, SIGNUM]。(2)现有手语数据集规模有限且缺乏统一预处理格式,处理流程复杂,严重限制了深度学习方法的适用性[duarte2021how2sign, JAsigning, camgoz2020sign]。(3)不同的姿态处理格式关注不同的视觉方面,导致分布偏移,限制了跨模型类型创新优势的有效整合[fang2025signllmsignlanguageproduction, fang2025signdiffdiffusionmodelamerican]。

为解决这些挑战,我们受到五种最强大的姿态估计模型的启发,利用新型ViT模型[dosovitskiy2020vit]开发了一个Vid2Pose模块。如图1 (https://arxiv.org/html/2504.16315#S1.F1) 所示,我们通过统一的姿态表示在ViT模型的编码器中学习Vid2Pose过程。具体而言,SMPLer-X[cai2023smplerx]提供带有运动学和姿态参数的3D人体网格,用于建模身体动态;

参考图注图1: 多模态姿态估计方法: SMPLer-X[cai2023smplerx]可提供准确的3D人体参数;DWPose[yang2023effective]专注于实时2D关键点检测;Mediapipe[MediaPipe]提供轻量但高效的3D姿态预测;PrimeDepth[zavadski2024primedepth]可获取场景深度信息;而Sapiens Segmentation[khirodkar2024sapiens]提供细粒度的人体部位分割结果。这些方法各具特色,为手语识别提供了丰富的特征表示。DWPose[yang2023effective]捕捉带有丰富面部标志的2D关键点,这对语法表达至关重要;MediaPipe[MediaPipe]提供表示整体身体运动趋势的3D关节坐标。此外,PrimeDepth[zavadski2024primedepth]提供空间深度信息以消除前后定位的歧义,而Sapiens Segmentation[khirodkar2024sapiens]通过细粒度的部位边界捕捉人体形状。这种互补设计不仅捕捉手部运动,还捕捉身体动态、面部表情、运动轨迹、空间深度和身体形状等细节,目标是全面捕捉人的姿态[saunders2020progressive, stoll2020text2sign, pose_format_helper]。这种端到端处理方法极大地简化了SL识别所需的姿态表示过程[Bohacek_2022_WACV, cho2021unifying, chiang2019unified]。

接着,我们采用Pose2Gloss方法在潜空间中识别姿态特征,但现有大多数识别模型存在几个局限性:(1)大多基于原始姿态数据学习,在实际应用中不便,需要借助其他姿态信息提取模型[wang2018video, wang2018high]。(2)此外,能够实时翻译的模型准确率低,而高准确率的模型输出速度慢[saunders2021mixed]。(3)即使是纯像素空间模型也受限于高计算成本,其注意力机制无法支持更长和更准确翻译的更高性能上限[cui2017recurrent, koller2020quantitative, gloss-informal, zelinka2020neural]。

为解决这些局限性,我们开发了一个完全在紧凑姿态丰富潜空间中运行的识别框架。从Vid2Pose提取的2048维姿态特征开始,我们采用ResNet34主干[7780459]后接TemporalConv层[10.1007/978-3-319-49409-8_7]来捕捉分层时序模式。这些与姿态特征联合学习。为了将这些预测精炼为连贯的序列,我们应用基于Transformer的编码器-解码器[zhang2023sltunet],它使用束搜索和CTC正则化[camgoz2020sign, vaswani2017attention]执行序列到序列精炼。这种设计直接在潜空间中实现准确识别,消除了原始姿态处理的需求,并相比基于视觉的方法降低了计算开销。

通过这种多阶段训练,SignX在保持架构简洁的同时实现了强大功能:它从多种先验知识格式中学习,并可以直接使用原始视频作为输入。实验结果表明,SignX在我们的ASL和主流数据集[asllrp2025signbank, forster2012rwth, Zhou2021ImprovingSLT-with-monolingual-CSLDaily, WLASL]上取得了良好性能,在准确性和鲁棒性方面超越了现有方法[Chen-arxiv-2023-Robust]。

本文的主要贡献可归纳为以下三点:

- • 我们提出了SignX,一种新颖的连续手语识别框架,运行在紧凑姿态丰富潜空间中,将五种强大估计方法的异构姿态表示统一为单一信息密集编码。
- • 我们开发了一个基于ViT的Vid2Pose模块,以端到端的方式直接从原始视频中提取统一的姿态表示(涵盖面部表情、身体动态、运动轨迹、空间深度和身体形状),无需显式姿态估计流程,显著简化了工作流。
- • 我们设计了一种潜空间识别方法,结合了ResNet时序建模与基于Transformer的序列精炼,在降低计算开销的同时实现了准确的手语识别。

## 2 相关工作

**手语识别。** 虽然传统的SLR框架主要依赖从高维像素流或原始骨骼坐标中提取特征,但这些方法常受到数据噪声和难以捕捉细粒度语法细微差别的阻碍。相比之下,扩散模型最近通过在压缩、结构化的潜空间中操作重新定义了手语生成[fang2025stablesignerhierarchicalsign, fang2025signllmsignlanguageproduction]。与现有SLR范式不同,我们的工作引入了一种新颖的识别框架,直接在特定于手语的潜空间中执行推理。受扩散过程中高效潜建模的启发[rombach2021highresolution, fang2025streamflowtheoryalgorithmimplementation],我们利用一个姿态丰富的潜域来绕过原始数据处理的局限性。这一转变使我们的模型能够更有效地捕捉复杂的时空依赖和语言结构,为鲁棒高效的ASL识别建立了新方向。

**视觉Transformer。** 自ViT[dosovitskiy2020vit]发展以来,Transformer在视觉任务中的应用日益广泛。与传统架构相比,Transformer可以通过自注意力机制更好地建模长程依赖[saunders2021continuous, huang2021towards]。原始ViT首次将纯Transformer结构应用于图像分类,开创了视觉Transformer的新范式。随后的改进,如Swin Transformer等模型,通过引入局部注意力机制进一步提升了模型在视觉任务中的性能[camgoz2020sign, ko2019neural]。在视频事件识别领域,研究人员引入了时空注意力机制,使ViT能够更好地处理视频序列数据[Bohacek_2022_WACV, forster2012rwth]。这一进步对手语识别特别重要,因为手语视频包含丰富的时序信息。通过精心设计的时空注意力机制,模型可以有效捕捉手语序列中的时序依赖[koller15:cslr, saunders2021mixed]。

参考图注图2: 构建紧凑姿态丰富潜空间: 总体而言,我们利用ViT[dosovitskiy2020vit]来构建和容纳姿态潜空间。它有两个入口点: 顶层的视频入口和中部的姿态数据入口。(a) 对于训练阶段1(Sec.3.2 (https://arxiv.org/html/2504.16315#S3.SS2)),我们首先训练姿态融合层以输出简单文本信息,确保学习到的姿态表示有意义。(b) 对于训练阶段2(Sec.3.3 (https://arxiv.org/html/2504.16315#S3.SS3)),我们冻结所有其他组件,仅学习RGB视频如何正确转换为我们的姿态特征。推理时仅使用RGB作为输入,因此我们必须确保能够将RGB输入编码为我们的姿态特征。

## 3 构建紧凑姿态丰富潜空间

### 3.1 数据处理

为了解决整合异构姿态信息进行手语识别的挑战,我们首先构建了一个全面的处理流程,标准化多种姿态格式。首先,我们使用一个高质量的ASLLRP SignStream® 3语料库[neidle2022asl, asllrp2025signbank]数据集,该数据集包含超过80小时的美式手语(ASL)视频,并伴有同步的正视图、侧视图和面部特写录制。对于每个输入视频V∈RT×H×W×3,其中T表示帧数,H、W分别表示高度和宽度,我们为每种姿态类型提取顺序姿态表示: PDWPose∈RT×384,PMediaPipe∈RT×258,PSMPLer-X∈RT×165,PPrimeDepth∈RT×576,PSapiens∈RT×576。每种姿态类型的维度反映了其特定的信息结构。例如,DWPose包含18个身体关键点、每只手21个关键点和68个面部关键点,以及各自的置信度分数,每帧共384维。

如图2 (https://arxiv.org/html/2504.16315#S2.F2) 所示,我们将每帧信息展平为一维列表,连接五种姿态类型形成长度为1959的输入,然后通过投影层进行简单变换和维度匹配;随后是融合层进行多模态整合。通过这种方式,我们为每帧获得了丰富的姿态信息。这种标准化结构不仅防止了不同类型的姿态信息相互干扰,还使异构类型的姿态信息彼此兼容。

### 3.2 多模态姿态融合

为了确保多轨道姿态特征有意义,我们首先进行简单训练,使融合后的姿态特征能够轻松转换为文本:我们修改了ViT的姿态条目到输出层,学习从统一姿态表示到自然语言描述的映射。它包含几个关键组件:用于多模态融合的姿态编码器、用于特征处理的若干层,以及用于生成最终输出的文本解码器。

我们选择ViT用于姿态潜空间构建,原因如下:(1) ViT的自注意力机制能够有效融合来自不同提取工具(SMPLer-X、DWPose、Mediapipe、PrimeDepth、Sapiens)的异构姿态表示,形成统一的潜空间。(2) ViT的深层分层架构自然创建了一个分层潜空间,能够在保留必要姿态细节的同时,将丰富的多源姿态信息压缩为紧凑的表示——这使其成为我们姿态丰富潜空间的理想容器。(3) 与专门的VAE编码器[he2022masked]不同,ViT的Transformer架构能够很好地扩展到高维输入,使我们能够将Stable Diffusion在紧凑潜空间中的成功复制到手语领域。

##### 多模态姿态融合层。

姿态编码器Epose使用类型特定的编码器处理五种姿态信息,并通过多头注意力机制进行融合:

fi = Ei(Pi),  (1)
ffused = MultiHeadAttention(f1, f2, ..., f5)

其中Ei是姿态类型i的编码器,fi∈Rdh是编码后的特征。这种融合方法保留了每种姿态类型的独特特征,同时允许它们之间共享信息[ko2019neural, liu2022bevfusion, zhang2020fusionnet]。

对于每个fi,我们通过维度匹配层将其投影到统一的表示空间:

zi = PadMatch(fi) ∈ R2048  (2)

其中zi是位置i处的统一表示;PadMatch指零填充后接投影。ViT层通过多头自注意力和交叉注意力机制处理这个统一表示:

zlatent = ViTlayers(z1, z2, ..., zn)  (3)

其中zlatent代表最终

相似文章

无标注表示学习用于跨数据集手语词汇检测

arXiv cs.CL

本文提出了一种无标注表示学习方法,用于跨数据集手语词汇检测,利用土耳其手语广播中的弱对齐字幕。研究表明,LLM辅助的伪标注规范化能改善时间定位和下游翻译质量。

手语间的直接翻译

arXiv cs.CL

本文介绍了一个直接的手语到手语翻译模型,它绕过了中间文本,通过使用回译来创建合成的平行手语数据,在ASL、CSL和DGS上,相较于级联方法,在速度和准确性上取得了显著提升。

手语对话中的情感识别

arXiv cs.CL

本文介绍了用于手语对话情感识别的eJSL Dialog数据集,填补了现有数据集缺乏对话上下文的空白。基准测试表明,应用通用多模态模型时存在领域差距,凸显了针对手语的上下文感知视觉提取器的必要性。