无标注表示学习用于跨数据集手语词汇检测
摘要
本文提出了一种无标注表示学习方法,用于跨数据集手语词汇检测,利用土耳其手语广播中的弱对齐字幕。研究表明,LLM辅助的伪标注规范化能改善时间定位和下游翻译质量。
arXiv:2608.11332v1 公告类型:新
摘要:资源受限语言的手语研究常受制于密集语言标注(如手语词汇标注、时间边界和手语顺序)的成本。广播新闻通过将连续手语与口语字幕配对提供了一种实用替代方案,但这种监督是弱监督,因为文本和手语只是松散对齐。像土耳其语这样形态丰富的语言进一步增加了难度,因为同一词汇意义可能以多种屈折形式出现,而某些派生形式应保持区分。我们研究在这种设置下,弱字幕监督能否预训练一个可复用的手语编码器,其中文本规范化不足会碎片化伪手语词汇标注目标并削弱表示学习。与先前主要用于改善翻译的伪手语词汇流水线不同,我们测试预训练编码器是否可以作为可复用的表示迁移到跨数据集手语词汇检测。我们在TSL-News(一个新的土耳其语广播语料库)上进行预训练,使用从字幕而非人工标注中导出的伪手语词汇标签,在固定词汇表上比较基于规则的形态词形还原与受约束的LLM辅助规范化。我们通过在一个基于TSL词典语料库构建的新TSL词汇检测基准上的跨数据集手语词汇检测来评估学习到的表示。LLM辅助编码器将top-5时间定位平均IoU从0.235提升到0.465,其中56.2%的示例达到至少0.50的IoU;频率分析表明这一提升并非主要来自对频繁伪手语词汇标签的记忆。在随后的翻译检查中,相同的预训练将BLEU-4从9.60提升到11.04,ROUGE从23.48提升到27.43。这些结果表明,松散对齐的广播数据可以为学习捕获词汇内容和时间结构的手语表示提供有效的弱监督。
查看缓存全文
缓存时间: 2026/08/13 15:25
# 面向跨数据集手语定位的无Gloss表示学习
来源:https://arxiv.org/html/2608.11332
Ezgi Ekin https://orcid.org/0009-0006-6008-4308 单位:哈塞特佩大学,安卡拉,土耳其 单位:电子邮件[\{oguztufekcioglu,ezgiekin21,kaancevik21,hacerkeles\}@hacettepe\.edu\.tr](mailto:) Mustafa Kaan Çevik https://orcid.org/0009-0000-0092-2660 单位:哈塞特佩大学,安卡拉,土耳其 Hacer Yalim Keles https://orcid.org/0000-0002-1671-4126 单位:哈塞特佩大学,安卡拉,土耳其
###### 摘要
资源受限语言的手语研究往往受到密集语言标注(包括gloss标签、时间边界和手语词序)高昂成本的制约。新闻广播通过将连续手语与口语文本转录配对提供了一种实用的替代方案,但这种监督是弱监督,因为文本与手语之间仅存在松散的对应关系。土耳其语等形态丰富的语言进一步增加了难度,因为同一个词汇意义可能以多种屈折形式出现,而某些派生形式则应保持区分。我们研究在如此形态丰富的场景下,基于文本转录的弱监督能否预训练一个可复用的手语编码器;在该场景中,文本规范化不足可能会碎片化伪gloss目标并削弱表示学习。与先前主要旨在改进翻译的伪gloss流水线不同,我们测试预训练编码器是否能作为可复用表示迁移到跨数据集手语定位任务。我们使用TSL-News(为本研究收集的土耳其语广播语料库)进行预训练,使用从转录中提取的伪gloss标签而非人工标注的gloss标签。我们比较了两种伪gloss构建策略,即基于规则的形态词形还原和受限的LLM辅助固定词汇表归一化。我们通过在基于TSL词典语料库构建的新TSL手语定位基准上的跨数据集手语定位评估所学表示。LLM辅助编码器将top-5时间定位平均IoU从原始空间特征的0.235提升至0.465,其中56.2%的示例达到至少0.50的IoU。频率分析进一步表明,定位质量并非主要源于对高频伪gloss标签的记忆。在下游翻译检查中,相同的预训练将BLEU-4从9.60提升至11.04,ROUGE从23.48提升至27.43。这些结果表明,松散对齐的广播数据可以为学习同时捕获词汇内容和时间结构的手语表示提供有效的弱监督。
###### 关键词:
土耳其手语 手语定位 翻译 无Gloss 弱监督 伪Gloss 时间定位
## 1 引言
手语翻译(SLT)[3 (https://arxiv.org/html/2608.11332#bib.bib19),17 (https://arxiv.org/html/2608.11332#bib.bib20),2 (https://arxiv.org/html/2608.11332#bib.bib18)]、手语识别[7 (https://arxiv.org/html/2608.11332#bib.bib17)]和手语定位[2 (https://arxiv.org/html/2608.11332#bib.bib18)]都依赖于同时保留词汇内容与时间结构的视觉表示。然而,训练此类模型常用的标注成本高昂。Gloss标签需要语言学专业知识,时间边界需要帧级或片段级标注,且手语词序可能与对应的口语语句不同。这些要求对于资源有限的手语尤其受限,因为此类语言的平行语料库和专家gloss标注都很稀缺。
新闻广播数据提供了一种实用的连续手语来源,并与口语或书面语言翻译配对。然而,这种监督是弱的:文本和手语仅松散对齐,在词汇选择、词序和细节程度上可能存在差异。这些问题在土耳其语等形态丰富的口语中更为突出,因为许多表层形式可能指向同一词汇单元,而某些派生形式则应保持区分。因此,本文探讨的问题并非能否设计新的定位或翻译架构,而是弱文本监督能否用于预训练一个可复用的手语编码器。我们在土耳其语Sign2GPT风格流水线[20 (https://arxiv.org/html/2608.11332#bib.bib5)]的预训练阶段研究这一问题,将其视为无gloss表示学习问题。目标是测试从土耳其语文本中派生的句子级伪gloss标签能否将视频编码器塑造为一种可超越原始广播数据迁移的表示。我们通过手语定位评估这种迁移:给定一个孤立词典手语作为视觉模板,模型必须在句子级示例视频中定位对应的手语。我们不仅基于训练期间使用的伪gloss标签进行评估,还在TSL词典语料库(TSLD)上测试所学表示,以孤立手语作为模板,句子视频作为定位目标。
评估使用隐状态序列之间的归一化互相关(NCC)。给定一个孤立的TSLD手语视频和一个连续的TSLD句子视频,将孤立手语表示在连续表示上滑动,并将得分最高的时间窗口与人工时间标注进行比较。该设置直接检验表示学习问题。如果预训练编码器学习了可复用的手语结构,那么孤立词典手语应与句子视频中的对应手语匹配,尽管这两个视频都不来自用于预训练的广播语料库。
结果支持这一假设。采用受限LLM辅助伪gloss策略预训练的编码器在NCC时间定位上优于未适应的空间特征基线。在TSL手语定位基准(TSL-SB)上,平均IoU在top-1从0.124提升至0.271,top-3从0.192提升至0.403,top-5从0.235提升至0.465。同一策略在词汇覆盖率和定位精度方面也优于基于规则的形态词形还原基线。这些提升是在弱监督下实现的。在预训练期间,模型仅接收从土耳其语文本中派生的句子级伪gloss标签,没有精确的手语标签或时间边界标注。
##### 贡献。
本文做出了四点贡献。首先,我们将Sign2GPT风格伪gloss预训练流水线[20 (https://arxiv.org/html/2608.11332#bib.bib5)]——最初提出用于为无gloss翻译提供弱监督——重新用于回答该方向尚未解决的问题:所得表示本身是否足够强大以支持跨数据集手语定位——这一对手语识别和翻译都至关重要的任务。这将对现有弱监督预训练范式的探讨重构为一个表示学习问题,并在其原始翻译目标和训练语料库之外进行测试。其次,我们设计了两种针对土耳其语的伪gloss构建策略,从基于规则的形态词形还原转向受限的LLM辅助词汇归一化,以应对土耳其语黏着形态带来的词汇变异。第三,我们将TSL-News和TSL-SB记录为此场景下的广播预训练和跨数据集定位资源。第四,我们引入了一个多角度评估协议——结合孤立模板NCC匹配、时间IoU、直接伪gloss分数定位和全词汇表局部NCC——该协议将表示质量与词汇覆盖率或分类器偏差等混淆因素隔离开来,并辅以一次下游翻译检查。
## 2 相关工作
##### 手语定位与基于词典的定位。
手语定位旨在回答目标手语是否出现在连续、共发音的手语中及其位置。早期现代定位系统强调了与此处相同的实际困难:孤立词典版本是有用的查询项,但它们在速度、上下文和手语者行为方面与连续广播手语存在差异。Watch、Read和Lookup通过多实例对比目标从稀疏局部标签、字幕和孤立词典示例中学习定位嵌入,明确将字幕和词典视为弱监督源而非密集gloss标注[11 (https://arxiv.org/html/2608.11332#bib.bib1)]。基于口语监督的大词汇量连续手语识别(CSLR)通过使用检索式目标、伪标签清洗、同义词聚合以及BBC-Oxford英国手语(BOBSL)广播数据集上带时间手语区间的密集评估扩展了这一方向[16 (https://arxiv.org/html/2608.11332#bib.bib2)]。最近的切分工作则使用开始-内部-外部(BIO)标签、Transformer时间建模、手部姿态特征和连接主义时间分类(CTC)序列约束直接预测时间边界[5 (https://arxiv.org/html/2608.11332#bib.bib3)]。这些方法表明,定位质量不仅取决于分类器,还取决于用于跨域匹配的表示以及时间提议机制。本研究遵循词典查询式定位视角,但将其用作评估协议:孤立TSLD手语作为模板,连续TSLD示例作为搜索视频,隐状态上的NCC测试弱广播预训练是否学习了可复用的词汇-时间结构。
##### 无Gloss与弱监督手语表示。
Gloss标注仍然昂贵,因为它们需要语言学专业知识、手语词序决策,且通常需要时间对齐。因此,无gloss SLT试图避免人工标注的gloss瓶颈。无Gloss手语翻译与视觉-语言预训练(GFSLT-VLP)通过视觉-语言预训练和掩码语言建模在无gloss监督下对齐视觉和文本表示[23 (https://arxiv.org/html/2608.11332#bib.bib4)],而Sign2GPT使用自动提取的伪gloss在连接大型语言模型之前预训练视觉编码器[20 (https://arxiv.org/html/2608.11332#bib.bib5)]。其他表示学习工作也具有相关性:学习对比概念(LCC)嵌入使用口语词嵌入来正则化手语嵌入并实现自动时间定位[19 (https://arxiv.org/html/2608.11332#bib.bib6)],SignRep学习可迁移到识别、词典检索和翻译的手语特定自监督红绿蓝(RGB)表示[21 (https://arxiv.org/html/2608.11332#bib.bib7)]。这些研究支持更广泛的前提:无需密集人工gloss边界即可学习有用的手语表示。我们的设置更狭窄且更具诊断性:伪gloss标签是土耳其语文本派生的句子级词袋,成功衡量标准是跨数据集时间定位而非翻译分数或孤立识别精度。
##### 时间对齐与后处理。
连续手语中的弱监督还需要谨慎的时间处理。CSLR模型通常使用序列损失或对齐约束从没有帧边界的视频级gloss顺序中学习,而CorrNet等运动感知编码器表明局部手部和面部轨迹是连续手语表示的核心[6 (https://arxiv.org/html/2608.11332#bib.bib8)]。视觉评分之后,后处理往往决定弱预测是否能成为可用的标注:字幕窗口被填充或偏移、静止帧被裁剪、重复的高置信度检测被合并、分数阈值抑制孤立尖峰,以及同义词或字幕对齐用于减少词汇噪声。Gloss对齐使用口语嵌入在手语字幕时间与手语顺序不对齐时将定位到的gloss重新分配给相邻字幕[18 (https://arxiv.org/html/2608.11332#bib.bib9)];大语言模型消歧类似地在视觉匹配后使用句子级语言上下文对基于词典的定位候选进行重新排序[4 (https://arxiv.org/html/2608.11332#bib.bib10)]。在本文中,后处理刻意保持简单——固定裁剪、NCC峰值选择和top-kk时间IoU——以便实验主要检验表示迁移。因此,失败案例直接与文献相关联:一旦编码器显示出跨数据集定位信号,更强的提议生成、上下文感知重排序和文本-gloss重对齐是自然的下一步。
## 3 方法
### 3\.1 无Gloss弱伪Gloss预训练
设V=\{xt\}t=1TV=\{x_\{t\}\}\_\{t=1\}^\{T\}为一个手语视频,设G\(V\)⊆GG\(V\)\subseteq\mathcal\{G\}为从配对的土耳其语文本中提取的伪gloss标签集合。这些标签是句子级词袋而非带时间边界的sl手语gloss;预训练期间不使用任何人工标注的手语gloss。第一阶段模型将视频映射为时间隐状态
H=Eθ\(V\)∈RT′×d\.H=E_\{\theta\}\(V\)\in\mathbb\{R\}^\{T^\{\prime\}\times d\}\.\(1\)
这里,xtx_\{t\}是时间tt处的输入帧,TT是输入视频长度,G\mathcal\{G\}是伪gloss词汇表,EθE_\{\theta\}是参数为θ\\theta的可训练视频编码器,HH是隐状态序列,T′T^\{\prime\}是时间下采样后的输出序列长度,dd是隐特征维度。注意,tt以帧分辨率索引输入视频(t=1,...,Tt=1,\dots,T),而下采样的隐状态序列HH在下面单独索引。在当前模型设置中,EθE_\{\theta\}使用DINOv2[14 (https://arxiv.org/html/2608.11332#bib.bib11)](一种自监督视觉Transformer骨干)结合轻量级适应来提取帧特征,随后使用MetaFormer[22 (https://arxiv.org/html/2608.11332#bib.bib12)]时间编码器进行带局部注意力和下采样的token混合。输出隐状态被传递到原型头,其类别原型从土耳其语fastText[1 (https://arxiv.org/html/2608.11332#bib.bib13)]子词嵌入初始化。对于下采样序列中位置t′∈\{1,...,T′\}t^\{\prime\}\in\\\{1,\dots,T^\{\prime\}\^\}处的类别gg,该头计算投影隐状态与词原型之间的余弦相似度st′,gs_\{t^\{\prime\},g\}。时间类分数结合了类别和时间归一化,
pg=∑t′softmaxg\(st′,g/τc\)softmaxt′\(st′,g/τt\),p_\{g\}=\sum_\{t^\{\prime\}\}\operatorname\{softmax\}\_\{g\}\left\(s_\{t^\{\prime\},g\}/\\tau_\{c\}\right\)\operatorname\{softmax\}\_\{t^\{\prime\}\}\left\(s_\{t^\{\prime\},g\}/\\tau_\{t\}\right\),\(2\)
这里,pgp_\{g\}是伪gloss gg的句子级分数,softmaxg\operatorname\{softmax\}\_\{g\}在伪gloss类别间归一化相似度,softmaxt′\operatorname\{softmax\}\_\{t^\{\prime\}\}在T′T^\{\prime\}个下采样时间步骤间归一化。可训练温度τc\\tau_\{c\}和τt\\tau_\{t\}控制TSL-News预训练设置中类别和时间分布的锐度。模型使用句子级伪gloss集合上的二元交叉熵(BCE)进行训练:
Lpg=BCE\(\{pg\}g∈G,\{1\[g∈G\(V\)\]\}g∈G\)\.\mathcal\{L\}\_\{\mathrm\{pg\}\}=\operatorname\{BCE\}\left\(\\\{p_\{g\}\\\}\_\{g\\in\mathcal\{G\}\},\\\{\mathbb\{1\}\[g\\in G\(V\)\]\\\}\_\{g\\in\mathcal\{G\}\}\right\)\.\(3\)
这里,Lpg\mathcal\{L\}\_\{\mathrm\{pg\}\}是相似文章
SignX:在紧凑且富含姿态的潜在空间中进行连续手语识别
SignX提出了一种用于连续手语识别的新框架,该框架将异构姿态格式统一到紧凑的潜在空间中,并在像素空间基线基础上实现50倍计算加速,同时达到最先进的准确率。
DualAnchor:在无注释手语翻译中保留语言先验并提升词汇保真度
DualAnchor是一个面向无注释手语翻译的训练框架,利用词元级先验锚定来保留大语言模型的语言先验,并通过最优传输对齐提升词汇保真度,在PHOENIX-2014T和CSL-Daily上取得了强劲结果。
SIGNPOST-Bench:多模态大语言模型中文本-视觉冲突消解基准
提出SIGNPOST-Bench,一个用于评估多模态大语言模型如何消解文本与视觉线索之间冲突的基准,采用反事实图像变体与地理定位作为诊断手段。
迈向实时句子级手语翻译
本文提出一个句子级手语翻译系统,在How2Sign子集上用QLoRA微调,BLEU达到15.9。主要贡献是一个硬件感知的流式处理流水线,使用Raspberry Pi 4B客户端和CPU/GPU后端,平均延迟降低27.71%。
手语间的直接翻译
本文介绍了一个直接的手语到手语翻译模型,它绕过了中间文本,通过使用回译来创建合成的平行手语数据,在ASL、CSL和DGS上,相较于级联方法,在速度和准确性上取得了显著提升。