基于ODE的Transformer解码器用于迭代手语翻译

arXiv cs.CL 论文

摘要

本文提出使用Runge-Kutta积分方法的基于ODE的Transformer解码器,以改进手语翻译的迭代细化过程,在不增加模型大小的情况下,取得了比IPSLT基线更好的BLEU分数。

arXiv:2608.11352v1 公告类型:新 摘要:手语翻译使用Transformer架构已取得了强劲的结果,但近期的改进主要依赖于扩大模型容量,代价是计算量增加。我们提出了一种参数高效的替代方案,在不增加模型大小的情况下提升表达能力。我们不是扩大容量,而是专注于增强迭代细化解码器的更新动态,其中每个细化步骤对应一次内部解码器迭代,在翻译生成之前逐步改进潜在表示。我们从常微分方程(ODE)的角度重新解释残差细化更新,并将其替换为高阶数值积分方法,即Runge--Kutta方法(RK-2和RK-4)。这些方法在每个细化步骤内执行多次函数评估,以产生更准确和稳定的表示更新,且不增加解码器参数。据我们所知,这是首次将ODE启发的更新动态应用于手语翻译。RK-2在PHOENIX-2014-T测试集上达到22.96 BLEU-4,在CSL-Daily测试集上达到19.34 BLEU-4,在两个基准上都优于IPSLT基线,且在CSL-Daily上使用更少的解码器层和细化迭代。这些结果表明,在参数高效的解码器设计下,更强的细化动态可以提高翻译性能,为传统模型扩展提供了一种互补的替代方案。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:26

# 基于 ODE 的 Transformer 解码器用于迭代手语翻译
来源: https://arxiv.org/html/2608.11352
###### 摘要

手语翻译在使用 Transformer 架构时已取得了显著成果,但近期的改进主要依赖扩展模型容量,同时以增加计算量为代价。我们提出一种参数高效的替代方案,在不增加模型规模的前提下提升表达能力。我们并未聚焦于扩展容量,而是专注于增强迭代精炼解码器的更新动态,其中每个精炼步骤对应一次内部解码器迭代,在生成翻译结果之前逐步改善潜在表示。我们借鉴常微分方程(ODE)的视角重新解读残差精炼更新,并将其替换为高阶数值积分格式,即龙格-库塔方法(RK-2 和 RK-4)。这些方法在每个精炼步骤内执行多次函数求值,从而产生更准确、更稳定的表示更新,而无需增加解码器参数。据我们所知,这是首次将 ODE 启发的更新动态应用于手语翻译。RK-2 在 PHOENIX-14T 测试集上达到 22.96 BLEU-4,在 CSL-Daily 测试集上达到 19.34 BLEU-4,在两个基准上都优于 IPSLT 基线,并且在 CSL-Daily 上使用了更少的解码器层和精炼迭代次数。这些结果表明,在参数高效的解码器设计下,更强的精炼动态能够提升翻译性能,为传统的模型扩展提供了一种互补的替代方案。

###### 关键词:

手语翻译 迭代精炼 常微分方程 龙格-库塔方法

## 1 引言

参见图 1:所提出架构的概述。一个冻结的视觉编码器提取特征,随后是堆叠的 Transformer 编码器层。在每个阶段,表示由基于 ODE 的 Transformer 解码器在迭代精炼框架内进行解码。手语翻译(SLT)旨在直接从连续的视觉手语输入生成流畅的口语文本。SLT 可以表述为依赖中间注释(gloss)表示的基于注释的方法,也可以表述为将视觉输入直接映射为文本的无注释方法,后者通过消除昂贵的注释标注而提供了更好的可扩展性。无注释 SLT 需要联合建模细粒度的时空线索,如手形、运动和面部表情,并捕获长距离依赖,而视觉-文本对齐的缺乏以及手语与口语之间的语言差异进一步使任务复杂化。

近年来 SLT 的进展主要由扩展模型容量和利用大型预训练组件(如强大的视觉编码器和大语言模型)所推动。虽然这些策略带来了显著的性能提升,但也增加了计算成本,而对于表示如何在层间更新则关注相对较少。

基于 Transformer 的架构构成了大多数现代 SLT 系统的基础,其中表示通过残差连接在层间更新。这种连接可以被视为底层常微分方程(ODE)的离散化,其中每一层执行一步一阶欧拉积分[25,58]。这种一阶形式可能限制表示演化的准确性和稳定性,这表明更先进的数值积分方法可以改善表示更新的质量。这一视角提供了一种扩展之外的替代方案,即改进来自更好的更新动态,而非更大的模型。

在这项工作中,我们提出一种参数高效的方法,通过改进更新动态而非增加模型容量来增强模型表达能力。据我们所知,这是首个将基于 ODE 的视角引入 SLT 的工作。基于迭代精炼框架,我们将标准残差解码器更新替换为高阶龙格-库塔方法(RK-2 和 RK-4),这些方法通过每一步的多次函数求值来近似底层动态,从而产生更准确、更稳定的更新。

我们在 PHOENIX-14T 和 CSL-Daily 上评估了所提出的方法。结果表明,ODE 引导的更新动态可以在不增加解码器参数的情况下提升测试性能。这些结果提示,提升迭代表示更新的质量是 SLT 一个有前景的参数高效方向,可作为传统模型扩展的补充。

## 2 相关工作

### 2.1 手语翻译

手语翻译(SLT)是更广泛的手语理解(SLU)领域中的一项具有挑战性的任务,旨在从视觉手语数据中推断语义含义。SLU 的早期工作主要集中于识别:孤立手语识别从短视频片段中对单个手语进行分类[27,43,26,61],而连续手语识别则将手语视频转写为注释序列[19,27,20,48],其中注释作为近似手语级标注的中间表示。

SLT 既可以表述为端到端的无注释任务,也可以表述为基于注释的框架,后者利用注释监督,无论是显式地还是通过辅助对齐目标[8,44]。在显式设置中,首先通过连续手语识别(CSLR)预测注释序列,然后将其映射到口语文本[56,53,11,10,7]。虽然注释监督因其与手语的时间对齐而提供了强中间约束,但它耗费人力且需要领域专业知识,限制了可扩展性。此外,在诸如 YouTube-SL25[45], OpenASL[42], YouTube-ASL[47] 和 BOBSL[3] 等大规模开放域数据集中,注释标注通常不可用,这使得无注释方法成为端到端 SLT 更具可扩展性的替代方案。

由于 SLT 数据集规模有限且任务具有多模态特性,迁移学习和预训练已成为关键策略。大多数 SLT 框架将视觉表示学习与语言建模解耦,采用独立预训练的视觉编码器和语言解码器[10,59,49,33]。为了缓解模态差距,近期方法采用带有对比目标和掩码建模的视觉-语言预训练[59],而无注释设置则引入伪注释预训练[49]和注释注意力机制[55]来近似注释监督。

近期的进展越来越多地利用大型预训练模型和基础模型。在语言侧,诸如 GPT[49], LLaMA[23,15], FlanT5-XL[22] 和 mBART[12] 等大语言模型被集成作为解码器或辅助监督器[18],增强了语言流畅性和长距离依赖建模。在视觉侧,在大规模图像或视频语料库上预训练的基础模型,包括 DINOv2[49,17], CLIP[50,22] 和 VideoMAE[22],提供了强大的时空表示。虽然这些方法取得了可观的收益,但它们通常依赖于增加的模型容量和大型预训练骨干网络,反映了更广泛的扩展趋势。

### 2.2 Transformer 与常微分方程(ODE)技术

Transformer 架构越来越多地从基于 ODE 的视角进行解释,其中残差层对应于底层连续变换的离散积分步骤。这一观点建立在早期 Neural ODE 与深度网络均衡公式之间的联系之上[9,6],在这种观点下,标准残差更新类似于一阶数值求解器,从而激发了更具表达力的更新规则。

近期研究将这一视角专门扩展到 Transformer。Zhong 等人[58]通过 Neural ODE 公式分析了 Transformer 层,而 Li 等人[25]为序列生成引入了受龙格-库塔启发的更新,将一阶残差步骤替换为高阶积分。Tong 等人[46]进一步探索了连续深度架构、深度相关参数化以及自适应微调,以提升灵活性和稳定性。

先前的工作主要将 ODE 视角应用于一般序列生成或常规 Transformer 层堆叠。相比之下,我们在迭代 SLT 的背景下研究这一公式,其中表示在多个更新步骤上被反复精炼。基于 Li 等人[25]的工作,我们将龙格-库塔更新集成到精炼过程中。

### 2.3 迭代精炼

迭代精炼是一种通用策略,通过在多个步骤中反复更新中间表示或输出来改善预测。它以多种形式出现在视觉和语言任务中,包括渐进式生成精炼[16,1,39,2,40],结构对齐优化[29,37,30,57],以及自我反馈机制[32]。

在 Transformer 架构中,精炼通常通过递归或权重共享设计来实现,其中同一模块被多次应用,有效深度由迭代次数决定[4,51,41]。相关方法,如 Universal Transformer 和深度自适应变体,通过重用共享层或动态调整计算深度进一步探索了迭代计算[13,14,5]。

在手语翻译中,迭代精炼已被采用,以在多个步骤中逐步改善解码输出[52]。类似的策略也已在手语生成中得到探索,其中迭代更新精炼生成的手语序列[24]。这些方法改进了精炼什么或精炼步骤的数量,而每个步骤内的更新仍然是残差运算。相比之下,我们将每个精炼步骤重新解释为底层连续变换的高阶数值积分,在不增加参数或精炼步骤的情况下产生更准确的单步更新,从而补充了现有的迭代精炼方法。

## 3 方法

我们提出了用于手语翻译的 ODE 引导解码器,基于迭代精炼框架[52],并通过高阶数值积分格式增强表示更新。所提出模型架构的概述如图 1 所示。

### 3.1 视觉特征

我们使用在 CSLR 设置下预训练的、针对数据集定制的 ResNet-18 骨干网络提取 512 维帧级视觉特征。对于 PHOENIX-14T,我们使用带有 VAC 框架[34]预训练的 ResNet-18 骨干网络。对于 CSL-Daily,我们使用带有 Self-Emphasizing Network 框架[21]预训练的 ResNet-18 骨干网络。为降低训练成本,视觉骨干网络在训练期间保持冻结。提取的视觉嵌入随后通过一组 1D 时间卷积和最大池化层处理,这些层建模局部运动模式并提供层次化时间抽象,然后再将特征传递给翻译模型。

### 3.2 初始化

在初始化阶段,一个编码器-解码器对从视觉特征生成初始预测。初始编码器 \(E_1\) 处理输入特征,其表示用于获得预测 \(Y_0\)。该表示随后被传递给迭代精炼模块,作为后续编码阶段 \(E_2\) 的输入。初始化解码器仅在训练期间使用,不参与推理。

### 3.3 迭代精炼

在初始表示的基础上,我们进行迭代精炼以逐步改善模型预测。精炼阶段使用一个专用编码器(记为 \(E_2\))实现,并以迭代方式应用。在每次迭代 \(k\) 时,模型通过同时以视觉特征 \(V\) 和上一迭代获得的表示为条件来更新其表示。具体来说,给定前一个表示 \(H_{k-1}\),精炼编码器 \(E_2\) 产生更新后的表示

\[
H_k = E_2(H_{k-1}, V).
\tag{1}
\]

式 (1) 中的更新后表示 \(H_k\) 随后被传递给解码器以生成精炼后的预测 \(Y_k\)。此过程重复 \(K\) 次迭代,使模型输出能够逐步改善。

在初始化阶段和迭代精炼阶段,编码器都使用 [55] 中引入的注意力模块,而不是标准

相似文章

迈向实时句子级手语翻译

arXiv cs.CL

本文提出一个句子级手语翻译系统,在How2Sign子集上用QLoRA微调,BLEU达到15.9。主要贡献是一个硬件感知的流式处理流水线,使用Raspberry Pi 4B客户端和CPU/GPU后端,平均延迟降低27.71%。

手语间的直接翻译

arXiv cs.CL

本文介绍了一个直接的手语到手语翻译模型,它绕过了中间文本,通过使用回译来创建合成的平行手语数据,在ASL、CSL和DGS上,相较于级联方法,在速度和准确性上取得了显著提升。

训练、阅读和编辑可解释的Transformer

arXiv cs.LG

本文介绍了一种通过清晰度惩罚训练带有可解释性算子的Transformer的方法,该惩罚利用每通道方差下限避免崩溃,实现了高可解释性并与传统基线保持质量一致。