手语模型的音系感知

arXiv cs.CL 论文

摘要

本文通过使用最小对立对来探测手语识别模型,评估它们是否展现出音系敏感性,揭示了架构上的权衡以及涌现但有限的音系感知。

arXiv:2606.28667v1 公告类型:新 摘要:手语是组合系统,意义通过组合次词汇音系参数(如手形、位置和运动)而产生。尽管用于手语识别(SLR)的深度学习模型在翻译基准上取得了更高的性能,但这些模型是区分抽象音系特征还是仅仅依赖低层次的统计相关性,尚不清楚。本研究通过使用最小对立对探测音系敏感性,并评估表征与人类行为数据的一致性,来评估在美式手语(ASL)上训练的SLR模型的音系感知。我们的结果表明,SLR模型展现出涌现的音系敏感性,但存在明显的架构权衡:基于姿态的模型对手形对比敏感,而基于像素的模型更能捕捉位置变化。此外,基于姿态的模型学习到的潜在表征与人类感知相似性判断相关(r~0.49)。这些发现表明,尽管SLR模型展现出涌现的音系现象,但当前的训练范式不足以使它们超越架构的归纳偏差。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:27

# 手语模型的音韵感知
来源:https://arxiv.org/html/2606.28667
Jessica Carter 约翰霍普金斯大学 Alex X\. Lu 微软研究院 Annemarie Kocab 约翰霍普金斯大学

###### 摘要

手语是具有组合结构的语言系统,意义通过手形、位置和运动等亚词汇音韵参数的组合而产生。尽管用于手语识别(SLR)的深度学习模型在翻译基准测试上取得了更高性能,但这些模型是区分抽象音韵特征,还是仅仅依赖低层统计相关性,仍不清楚。本研究通过使用最小对立体探测音韵敏感性,并评估模型表征与人类行为数据的一致性,来评估在美式手语(ASL)上训练的SLR模型的音韵感知能力。我们的结果表明,SLR模型展现出涌现的音韵敏感性,但存在清晰的结构权衡:基于姿态的模型对手形对比敏感,而基于像素的模型更能捕捉位置变化。此外,基于姿态的模型学习到的潜在表征与人类感知相似性判断相关(r≈0.49r≈0.49)。这些发现表明,尽管SLR模型表现出涌现音韵学能力,但当前的训练范式不足以使其超越自身的结构归纳偏置。111代码和数据:https://github.com/kayoyin/sign-phonology

## 1 引言

在符号语言中,手势由亚词汇音韵参数构成:手形、位置、运动、朝向和非手控标记(Stokoe,1960 (https://arxiv.org/html/2606.28667#bib.bib25))。尽管现代手语识别(SLR)模型实现了高翻译保真度(Camgoz等人,2020 (https://arxiv.org/html/2606.28667#bib.bib30);Yin和Read,2020 (https://arxiv.org/html/2606.28667#bib.bib11);Guan等人,2025 (https://arxiv.org/html/2606.28667#bib.bib28)),但尚不清楚它们是否获得了鲁棒的音韵表征。当前评估主要集中在狭窄数据集上的翻译准确性(Desai等人,2024 (https://arxiv.org/html/2606.28667#bib.bib8))。然而,高准确性并不能保证语言能力;它可能掩盖了在训练分布之外泛化能力有限的问题。高分可能源于对辅助线索(如口型)的过拟合——而口型与核心音韵参数不同,是可选的,并且因手势和打手势者而异。模型可能无法泛化到不同打手势者之间的显著变异性,或者过拟合到训练数据中的录制条件。这种对虚假特征的依赖对将SLR模型用作语言分析的通用工具(尤其是对于低资源手语)构成了重大限制。考虑到区分音韵参数对人类词汇访问至关重要(Lieberman和Borovsky,2020 (https://arxiv.org/html/2606.28667#bib.bib38);Williams等人,2017 (https://arxiv.org/html/2606.28667#bib.bib39)),如果模型对真正的底层音韵不敏感,它们就缺乏跨语言迁移或语言理解所需的鲁棒表征质量。

在本工作中,我们通过使用手势的**最小对立体**(图1 (https://arxiv.org/html/2606.28667#S1.F1))来探测SLR模型,评估它们是否表现出音韵敏感性。这些手势仅在一个音韵元素上有所不同(例如,QUEEN与KING,它们具有相同的发音位置和手势运动,仅在手形上不同)。这一框架使我们能够明确测量模型的潜在空间是否沿着音韵维度区分手势。此外,通过研究潜在表征而非模型输出,我们的框架可以直接比较各种架构和数据源,而无需显式地使用音韵标签进行训练。

参见说明 图1:使用最小对立体审计音韵敏感性。最小对立体中每个手势(如QUEEN与KING)的特征表示从模型的倒数第二层提取。我们通过计算这些潜在表示之间的余弦相似度来量化模型对音韵对比的敏感性。我们将这一框架应用于两个实验。首先,我们在自然主义的美式手语(ASL)数据中评估可区分性。我们比较不同的架构(基于像素 vs. 基于姿态)和训练领域(手语 vs. 一般动作识别),以确定哪些特征有助于音韵敏感性。

其次,我们研究模型表征与人类感知之间的一致性。我们使用受控的合成数据来研究模型潜在空间如何组织手形,并与基于人类感知数据的理论音韵模型进行比较。

我们的结果揭示了由结构约束主导的模型敏感性权衡。基于像素的模型更能捕捉像手势位置这样的更广泛的空间对比,而基于姿态的模型则显示出对细粒度手形区别的更高敏感性。我们还发现,基于姿态的模型的潜在空间与人类感知判断显著对齐,部分再现了在人类打手势者中发现的混淆模式和层次分组。这些发现表明,尽管SLR模型中存在涌现音韵学,但设计时采用不同视觉处理方式的模型表现出不同的音韵敏感性,这凸显了以认知为基础的基准测试对于指导鲁棒计算手语系统发展的关键重要性。

## 2 背景与相关工作

##### 手语的音韵结构。

手语包含亚词汇结构,有意义的手势由组合参数构成。我们采用Battison(1978 (https://arxiv.org/html/2606.28667#bib.bib24))和Liddell与Johnson(1989 (https://arxiv.org/html/2606.28667#bib.bib14))建立的五参数标准模型,该模型扩展了Stokoe(1960 (https://arxiv.org/html/2606.28667#bib.bib25))最初的分类,包括:**手形**、**位置**、**运动**、**手掌朝向**和**非手控标记**。这种组合结构使我们能够定义**最小对立体**——恰好在一个参数上不同的手势——来测量可区分性。虽然最初是为ASL描述的,但这个参数模型也适用于不同的手语(Sandler,2012 (https://arxiv.org/html/2606.28667#bib.bib23))。心理语言学研究证明,打手势者在词汇访问过程中会逐步激活这些亚词汇表征(Meade等人,2018 (https://arxiv.org/html/2606.28667#bib.bib33)),而行为研究表明音韵相似性会影响手势的产生和识别速度(Carreiras等人,2008 (https://arxiv.org/html/2606.28667#bib.bib34);Williams等人,2017 (https://arxiv.org/html/2606.28667#bib.bib39))。

##### 手语识别。

SLR研究主要优先考虑端到端的翻译准确性,通常将模型视为“黑箱”,其内部表征未得到检验(Camgoz等人,2020 (https://arxiv.org/html/2606.28667#bib.bib30);Yin和Read,2020 (https://arxiv.org/html/2606.28667#bib.bib11))。现有的分析音韵学的尝试通常依赖于显式监督,训练分类器来预测特定特征(Tavella等人,2022 (https://arxiv.org/html/2606.28667#bib.bib21);Bilge等人,2022 (https://arxiv.org/html/2606.28667#bib.bib16))。然而,这种方法受到稀有特征数据稀缺和统计混杂因素的限制(例如,特定手形与特定位置相关,因此分类器可以通过在相关参数出现时预测该特征来获得高分,而不是通过检测感兴趣的参数)。为了避免这些有效性问题,我们使用最小对立体策略评估**隐式**音韵涌现。这种方法控制了混淆变量,并且不需要音韵标签,使我们能够直接探测模型的潜在结构。

##### 口语模型中的音韵表征。

语音处理中的类似工作表明,在神经网络中,音韵结构是无需显式监督而涌现的。研究表明,音韵信息编码在语音识别模型的低层到中层(Belinkov和Glass,2017 (https://arxiv.org/html/2606.28667#bib.bib19);Pasad等人,2021 (https://arxiv.org/html/2606.28667#bib.bib18)),并且可以通过线性几何检索(Gauthier等人,2025 (https://arxiv.org/html/2606.28667#bib.bib10))。我们将这一探究线扩展到视觉-空间领域,研究手语模型是否表现出类似的、对音韵约束的涌现敏感性。

## 3 方法

为了评估SLR模型的音韵敏感性,我们使用一个**最小对立体**框架。我们不依赖最终分类输出,而是分析模型对于在单个音韵参数上不同的手势对的潜在表征。这种方法允许我们量化模型对特定音韵变化的敏感性,这些模型是在没有显式音韵监督的情况下训练的。

### 3.1 最小对立体与数据集

我们从三个数据集中选取最小对立体:ASL Citizen(Desai等人,2023 (https://arxiv.org/html/2606.28667#bib.bib12))、Sem-Lex(Kezar等人,2023 (https://arxiv.org/html/2606.28667#bib.bib13))和Handshapes in Context Stimuli(Carter等人,2026 (https://arxiv.org/html/2606.28667#bib.bib35))。我们采用Battison(1978 (https://arxiv.org/html/2606.28667#bib.bib24))和Liddell与Johnson(1989 (https://arxiv.org/html/2606.28667#bib.bib14))的参数清单进行最小对立决策:每个最小对立体恰好包含手形、位置、运动、朝向或非手控标记中的一个变化,并由一位聋人作者验证。我们的实验聚焦于手形、位置和运动对比,因为朝向和非手控对比在可用的自然语料库中过于稀疏,无法可靠评估。我们在图2 (https://arxiv.org/html/2606.28667#S3.F2) 中提供每个数据集的样本。

参见说明 图2:最小对立体数据和模型敏感性度量示例。(左、中)来自ASL Citizen和Sem-Lex的自然最小对立体,分别对比手形和位置。下方:tt检验结果显示SLR模型区分这些对体的统计显著性。(右)来自HCS的受控最小对立体,对比手形。下方:余弦相似度得分量化模型潜在空间中两个无意义手势之间的距离(相似度越低 = 敏感性越高)。##### ASL Citizen。

ASL Citizen是一个大规模、众包的、包含52位聋人或听力困难(DHH)打手势者的数据集。一位聋人作者挑选了259个最小对立体,涵盖360个独特手势,以覆盖多样化的音韵变化:137对在手形上不同,31对在位置上不同,73对在运动上不同,18对在朝向或非手控标记上不同。为了建立人类感知相似性的基线,我们请一位听力正常的**新手**打手势者将这些对体标注为“非常相似”(51对)、“有点相似”(98对)或“不相似”(103对)。我们使用标准测试划分,包含来自11位打手势者的4,427个选定手势视频。

##### Sem-Lex。

由于本研究中的所有SLR模型都在ASL Citizen上训练,为了测试泛化能力,我们还从Sem-Lex基准测试中选取了对体。与ASL Citizen(用户模仿种子视频)不同,Sem-Lex用概念提示打手势者,这导致了手势产生中的自然变异性。我们将ASL Citizen最小对体映射到Sem-Lex,方法是手动验证每个共享词条的(gloss)视频是否与预期手势匹配,并排除那些在其产生上与对体伙伴在多个参数上不同的词汇变体。这确保我们的框架评估鲁棒的音韵敏感性,而不是被错误标记的视频或词汇变异所混淆。这产生了178个对体,覆盖263个手势(来自42位打手势者的8,934个视频)。

##### Handshapes in Context Stimuli (HCS)。

现实世界的词汇通常缺乏音韵组合的系统覆盖。为了解决这个问题,我们使用HCS,这是一组受控的实验刺激,由无意义手势组成,旨在系统地采样手形和音韵语境的变化。这些刺激的设计受到先前音韵清单的指导(Lane等人,1976 (https://arxiv.org/html/2606.28667#bib.bib36);Stungis,1981 (https://arxiv.org/html/2606.28667#bib.bib32)),而特定的手形清单基于词汇数据库的频率得分从20个扩展到36个形状(Sehyr等人,2021 (https://arxiv.org/html/2606.28667#bib.bib31))。HCS包括972个视频,覆盖27个音韵语境(3个位置 × 3个运动 × 3个朝向)中的36种手形。这种系统设计允许即使在自然词汇中罕见的特征也能进行精确的最小对立体对比。与ASL Citizen和Sem-Lex不同,HCS由一位聋人打手势者提供,每个无意义手势对应一个视频,在受控实验室环境中录制。

### 3.2 模型

我们评估两种不同的视频分类架构(I3D和STGCN)的变体,它们代表了当前SLR文献中主要的建模范式222在发表时,I3D和STGCN是基于像素和基于姿态的SLR中占主导的、有权重的代表性模型。尽管最近的工作提出了更先进的系统,但它们大多不公开权重,从而阻碍了系统比较。(即基于视觉与基于姿态)(Desai等人,2023 (https://arxiv.org/html/2606.28667#bib.bib12))。通过比较这些标准骨干网络,我们研究**训练领域**(一般人类动作 vs. 手语识别)和**输入模态**(原始像素 vs. 姿态估计)如何影响音韵感知。两种输入模态在附录A.1 (https://arxiv.org/html/2606.28667#A1.SS1) 中展示。

##### I3D(基于像素)。

膨胀三维卷积网络(I3D;Carreira和Zisserman,2017 (https://arxiv.org/html/2606.28667#bib.bib26))是一种双流架构,直接对RGB视频帧进行操作。我们评估三个变体:\(1\) **I3D-Rand**,初始化随机权重作为基线;\(2\) **I3D-Kine**,在Kinetics数据集上为一般动作识别训练;\(3\) **I3D-ASL**,在ASL Citizen上为手语识别训练。

##### STGCN(基于姿态)。

时空图卷积网络(STGCN;Yan等人,2018 (https://arxiv.org/html/2606.28667#bib.bib27))在身体的骨骼图表示上操作。我们评估:\(1\) **STGCN-Rand**,随机初始化的基线;\(2\) **STGCN-ASL**,在ASL Citizen上训练。我们排除了在Kinetics上训练的STGCN模型,因为现有的预训练模型使用缺少细粒度手部地标的动作识别姿态图。

##### 严格排除测试手势。

为了确保我们的分析测量的是广义的音韵敏感性而非词汇记忆,我们在明确排除出现在最小对立体测试集中的所有手势的数据集划分上重新训练了两个ASL训练的模型(I3D-ASL和STGCN-ASL)。

表1:模型对ASL Citizen上音韵变化的敏感性。结果按语言特征(手形、位置、运动)和人类感知相似性分组。t-统计量表示该类别中所有最小对立体的平均t-统计量。%胜率(vs. 基线)表示在训练模型具有显著t-统计量(p<0.05p<0.05)且高于其随机初始化模型的对体中的百分比。

相似文章

基于音系激活映射的音素分割与识别

Hugging Face Daily Papers

本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。

手语间的直接翻译

arXiv cs.CL

本文介绍了一个直接的手语到手语翻译模型,它绕过了中间文本,通过使用回译来创建合成的平行手语数据,在ASL、CSL和DGS上,相较于级联方法,在速度和准确性上取得了显著提升。

手语对话中的情感识别

arXiv cs.CL

本文介绍了用于手语对话情感识别的eJSL Dialog数据集,填补了现有数据集缺乏对话上下文的空白。基准测试表明,应用通用多模态模型时存在领域差距,凸显了针对手语的上下文感知视觉提取器的必要性。