VTaMo: 用于手语翻译的视频-文本对齐模型

arXiv cs.CL 论文

摘要

VTaMo 引入了显式的多粒度视频-文本对齐方法,通过最优传输和对比学习实现手语翻译,在四个基准测试上取得了最先进的性能。

arXiv:2607.09126v1 公告类型:跨域 摘要:手语翻译(SLT)将连续的手语视频转换为口语文本。无标注方法利用预训练的视觉编码器和语言模型,但仅依赖来自翻译监督的隐式跨模态对齐。我们提出了 VTaMo,一个引入三个层次的显式多粒度对齐框架:(1) 通过熵正则化最优传输与可学习空标记实现的局部对齐,用于细粒度的帧到标记对应;(2) 通过可学习正交变换实现的全局对齐,该变换通过推土机距离校准嵌入空间几何;(3) 用于判别性标记级表示的位置对齐对比学习。在 Phoenix-2014T、CSL-Daily、How2Sign 和 OpenASL 上的实验表明,该方法始终达到最先进的性能,消融实验确认了每个组件的互补贡献。代码可在 https://github.com/junyi2005/vtamo 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

###### 摘要  
手语翻译(SLT)将连续手语视频转换为口语文本。无词汇标注方法利用预训练的视觉编码器和语言模型,但仅依赖翻译监督中的隐式跨模态对齐。我们提出 VTaMo,一个引入显式多粒度对齐的框架,包括三个层面:(1)局部对齐,通过熵正则化最优传输与可学习空令牌实现细粒度帧到令牌对应;(2)全局对齐,通过可学习正交变换利用 Earth Mover’s Distance 校准嵌入空间几何;(3)位置对齐对比学习,用于区分性令牌级表征。在 Phoenix-2014T、CSL-Daily、How2Sign 和 OpenASL 上的实验一致达到最先进性能,消融实验证实各部分互补贡献。代码见 https://github.com/junyi2005/vtamo。

## 1 引言

参考图注  
图 1:VTaMo 的动机与性能。(a) 先前无词汇标注手语翻译方法通常依赖在解码器注意力内部学习的*隐式*跨模态对齐,可能导致弥散或失配的交叉注意力及翻译错误。(b) VTaMo 引入*显式*多粒度视觉-文本对齐——包括基于局部最优传输的令牌-帧匹配、全局分布对齐和位置对齐对比学习——以增强对应关系并改善解码。(c) VTaMo 在四个基准(Phoenix-2014T、CSL-Daily、How2Sign 和 OpenASL)上取得最先进手语翻译质量,与 SpaMo[hwang2025efficient]、Uni-Sign[li2025unisign]、SHuBERT[gueuwou2025shubert] 和 SSVP-SLT[rust2024towards] 对比。(a) 和 (b) 中的视频帧来自 How2Sign 数据集[duarte2021how2sign]。

手语翻译(SLT)旨在将连续手语视频转换为口语语句,促进聋哑及重听手语者与健听社区之间的无障碍交流[camgoz2018neural,zhou2021improving]。近年来的无词汇标注系统利用大型预训练序列到序列语言模型[ wong2024sign2gpt,gong2024llms,chen2024factorized ]直接从视觉特征解码文本,避免了基于词汇标注流程所需的昂贵词汇标注。然而,大多数无词汇标注基准仅提供自然语句作为监督,没有词汇标注或时间分割[duarte2021how2sign,shi2022open]。因此核心难点有两重:视觉与文本之间的语义差距,以及视觉手语时间顺序与目标文本令牌顺序之间的未知对应关系。手语通常不遵循对应口语的语序:手语者可能先表达关键内容词,再添加语法关系,因此手势的时间进程可能与目标词序不同。结果,沿视频时间轴提取的视觉特征往往与自回归解码器训练预测的文本令牌错位。若不解决,解码器必须同时学习翻译并隐式发现潜在跨模态排列,增加了优化难度并降低了准确性,尤其在 How2Sign 和 OpenASL 等大规模基准上。图 1 (https://arxiv.org/html/2607.09126#S1.F1) 展示了这一差距:当对齐保持隐式时,交叉注意力图可能嘈杂,解码器可能产生错误词序,而我们的方法使对齐显式化。

现有方法大多将视觉流视为有序序列,依赖解码器注意力来弥合模态差距。ShuBERT[gueuwou2025shubert] 和 Uni-Sign[li2025unisign] 通过大规模预训练增强表征,但未显式建模句子内部的帧-令牌对应关系;而 SpaMo[hwang2025efficient] 使用批次级对比学习,却未解决细粒度的句内对齐。这些局限促使我们需要一个能学习视觉片段与文本令牌之间对应关系的模型,并用它向解码器呈现语义有序的视觉序列。

我们提出 VTaMo,一个用于无词汇标注 SLT 的视觉-文本对齐模型,在文本生成前显式对齐并重排视觉特征。由于许多口语词汇(如冠词、介词)没有手语层面对应项,我们对目标句的实词*伪词汇*进行对齐和解码,而非原始句子。给定手语视频,我们从冻结的语言模型嵌入层构建令牌级伪词汇嵌入,从视频编码器提取时间视觉嵌入,然后通过求解一个带有可学习空令牌的熵正则化最优传输问题[cuturi2013sinkhorn]来估计视觉位置与伪词汇令牌之间的软对齐。空令牌吸收不对应任何显式词汇的过渡手势和协同发音,稳定连续手语中的对齐。利用得到的传输计划,我们将视觉特征重排为遵循目标令牌顺序的序列,并馈送给语言模型解码器。推理时目标令牌顺序未知,因此视觉特征不被重排;解码器直接从手势顺序特征生成伪词汇,一个轻量级纯文本恢复模型还原口语词序并补全被省略的功能词。

VTaMo 以端到端方式训练,除了标准翻译损失外还包含三个互补对齐目标。首先,*局部*最优传输损失鼓励时间视觉片段与文本令牌之间的细粒度对应,同时允许未对齐帧映射到空令牌。其次,*全局*损失通过可学习正交变换校准句子级视觉和文本嵌入空间的几何,并辅以记忆队列多样化用于对齐的句子对。第三,*位置对齐对比学习*损失[oord2018infonce]在不改变语言模型嵌入空间的前提下增强重排后视觉特征与其文本令牌嵌入之间的令牌级可区分性。这些损失共同使重排后的视觉特征语义连贯,简化解码器学习,提高跨数据集的鲁棒性。

我们在四个广泛使用的基准上评估,涵盖三种语言和不同数据规模:Phoenix-2014T(德语)、CSL-Daily(中文)、How2Sign 和 OpenASL(英语)。在所有基准上,VTaMo 在无词汇标注设置下达到最先进性能,并对未显式对齐的强基线实现一致提升。消融研究验证了每个对齐组件贡献互补改进,对学习到的传输计划进行定性分析揭示了手势片段与目标令牌之间的可解释对应关系。

## 2 相关工作

### 2.1 无词汇标注 SLT、对齐与大规模预训练

无词汇标注手语翻译(SLT)将连续手语视频翻译为口语语句而不需要词汇监督,但由于缺乏显式中间结构,其性能通常低于基于词汇标注的流程[camgoz2020sign,zhou2021improving,zhou2021spatial,yin2021simul,chen2022simple,chen2022twostream,zhang2023sltunet,jing2024vk]。先前工作通过增强时间建模[li2020tspnet]、引入跨模态对齐目标[zhao2021conditional,lin2023gloss,fu2023token,jiao2024vap]、融入大语言模型[wong2024sign2gpt,gong2024llms,chen2024factorized]、扩展训练数据[uthus2024youtube,rust2024towards]以及大规模手语预训练(如 ShuBERT[gueuwou2025shubert] 和 Uni-Sign[li2025unisign])来改进无词汇标注 SLT;SpaMo[hwang2025efficient]进一步通过对比目标强调非平凡的手语-文本对应。这些方法——包括 VAP[jiao2024vap](仅将文本衍生约束用作视觉预训练)——使句内对应保持隐式,依赖粗粒度的解码器注意力来解决词序问题。我们的方法则通过 Sinkhorn 最优传输(带可学习空赋值)和互补的局部与全局目标,在解码前估计令牌级对齐并重排视觉特征。

### 2.2 跨模态与视频-文本对齐

我们的目标建立在通用跨模态对齐工具之上,但针对手语结构进行了调整。熵正则化最优传输及 Sinkhorn 算法[cuturi2013sinkhorn]是跨模态特征匹配的标准手段,例如在视觉-语言模型中对齐视觉特征与文本提示[chen2023plot];可学习正交变换关联两个嵌入空间而不扭曲其几何,如跨语言词嵌入对齐[lample2018word];对比视频-文本框架如 CLIP4Clip[luo2022clip4clip]、VideoCLIP[xu2021videoclip] 和 X-CLIP[ma2022xclip]学习用于检索的联合嵌入。更近似的,过程学习和步骤定位方法将视频帧与有序过程步骤序列对齐,例如通过叙述定位教程文章步骤[mavroudi2023learning]和基于最优传输的过程学习[chowdhury2024opel]。然而,这些方法针对全局或片段级对应,或假设大致固定的单调步骤顺序。手语翻译有所不同:词汇层面的映射是*非单调*且*部分*的,因为许多帧是过渡性的,且词汇没有手动对应物。VTaMo 通过将最优传输与空赋值、句子级正交校准和位置对齐对比学习相结合,生成重排后的视觉序列,从而解决了这些问题。

## 3 方法

参考图注  
图 2:VTaMo 流程。手语视频通过冻结的 CLIP-ViT 骨干网络编码为视觉令牌,随后经过轻量级时间编码器和融合投影(A、B)。给定真实文本嵌入(D),VTaMo 通过熵正则化最优传输求解器(Sinkhorn)执行*局部对齐*,获得软令牌-帧匹配,并通过正交变换和记忆队列将手语特征映射到文本空间以进行*全局对齐*(C1、C2)。得到的对应关系用于*窗口重排*(C3)和*位置对齐对比学习*(C4)。LoRA 适配的 Flan-T5 解码器生成翻译(E)。视频帧来自 Phoenix-2014T 数据集[camgoz2018neural]。

我们提出 VTaMo,一个无词汇标注手语翻译框架,在文本生成前显式对齐并重排视觉特征。如图 2 (https://arxiv.org/html/2607.09126#S3.F2) 所示,VTaMo 引入三个互补对齐目标:(1)*局部对齐*,通过熵正则化最优传输实现细粒度帧-令牌对应;(2)*全局对齐*,通过可学习正交变换在句子级校准嵌入空间;(3)*位置对齐对比学习*,用于区分性表征。

### 3.1 问题形式化

给定一个手语视频,我们使用预训练的 CLIP-ViT 编码器提取帧级特征 \(\mathbf{V}=\{\mathbf{v}_{1},\dots,\mathbf{v}_{L}\}\),其中 \(\mathbf{v}_{i}\in\mathbb{R}^{d_{v}}\)。目标是产生与视频对应的口语语句。口语语句包含许多没有直接手语层级实现的功能词,这使得严格的帧-词对齐不恰当。因此,我们对一个由目标句子通过固定离线过滤器得到的 *伪词汇* 序列 \(\mathbf{Y}=\{y_{1},\dots,y_{U}\}\)(共 \(U\) 个令牌)进行对齐和解码。具体地,我们应用冻结的 spaCy 词性标注器,保留与手语相关的内容令牌(NOUN、VERB、ADJ、ADV、NUM、PRON、PROPN),并移除通常缺乏直接手语对应项的令牌(DET、ADP、AUX、PART、PUNCT、CCONJ);所有数据集均使用语言特定的 spaCy 模型应用相同的过滤规则。用于对齐的文本令牌和解码器目标均为伪词汇,一个轻量级纯文本恢复模型在推理时恢复流畅句子。视觉特征通过线性层投影到 \(\mathbb{R}^{d_{h}}\),再通过基于注意力的编码器进行时间下采样产生 \(\mathbf{H}=\{\mathbf{h}_{1},\dots,\mathbf{h}_{M}\}\)(\(M\ll L\)),然后由融合投影器映射到语言模型维度 \(d_{t}\)。LoRA 适配的 Flan-T5 模型自回归生成伪词汇序列。核心挑战在于手语不遵循口语词序,且视觉帧的时间粒度远超语言令牌。

### 3.2 基于注意力的时间编码

我们使用一个基于注意力的时间卷积模块,包含 \(N_{\ell}\) 个级联层,每层通过可学习的注意力加权聚合对局部窗口(大小 \(W\))进行 \(2\times\) 下采样。对于每个输出位置 \(i\),提取以位置 \(2i\) 为中心的局部窗口 \(\mathcal{W}_{i}\),并从平均池化的局部上下文加上可学习位置嵌入 \(\mathbf{p}\) 形成查询:
\[
\mathbf{q}_{i}=\frac{1}{|\mathcal{W}_{i}|}\sum_{j\in\mathcal{W}_{i}}\mathbf{x}_{j}+\mathbf{p}. \tag{1}
\]
然后,带相对位置偏置的多头注意力聚合局部上下文:
\[
\alpha_{i,j}=\mathrm{softmax}\!\left(\frac{\mathbf{q}_{i}^{\top}\mathbf{k}_{j}}{\sqrt{d_{h}/N_{\text{head}}}}+r_{j-c_{i}}\right),\qquad \mathbf{o}_{i}=\sum_{j\in\mathcal{W}_{i}}\alpha_{i,j}\,\mathbf{v}_{j}, \tag{2}
\]
其中 \(c_{i}\) 是窗口中心,\(r_{j-c_{i}}\) 是可学习相对位置偏置,\(N_{\text{head}}\) 是注意力头数。这确保了梯度流向所有帧,比最大池化产生更富表现力的时间表征。

### 3.3 通过最优传输的局部对齐

局部对齐是 VTaMo 的核心组件,建立时间视觉片段与文本令牌之间的细粒度对应,形式化为一个熵正则化最优传输问题。设 \(\mathbf{S}=\{\mathbf{s}_{1},\dots,\mathbf{s}_{M}\}\in\mathbb{R}^{M\times d_{t}}\) 为融合投影后的视觉特征,\(\mathbf{E}=\{\mathbf{e}_{1},\dots,\mathbf{e}_{U}\}\in\mathbb{R}^{U\times d_{t}}\) 为来自冻结编码器嵌入层的伪词汇令牌嵌入。由于 \(\mathbf{S}\) 在对齐和翻译损失下针对固定文本嵌入 \(\mathbf{E}\) 进行优化,它们的余弦相似度反映了手语层级的语义对应,因此成为有意义的传输代价。我们引入一个单一的可学习空令牌 \(\mathbf{e}_{\varnothing}\in\mathbb{R}^{d_{t}}\),将其前置在文本序列的位置 0,形成增强序列 \(\tilde{\mathbf{E}}\in\mathbb{R}^{K\times d_{t}}\),其中 \(K=\)

相似文章

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。

CaVe-VLM-CoT:一个可解释的视觉-语言模型框架

arXiv cs.AI

CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。