DualAnchor:在无注释手语翻译中保留语言先验并提升词汇保真度
摘要
DualAnchor是一个面向无注释手语翻译的训练框架,利用词元级先验锚定来保留大语言模型的语言先验,并通过最优传输对齐提升词汇保真度,在PHOENIX-2014T和CSL-Daily上取得了强劲结果。
arXiv:2607.27614v1 公告类型:新
摘要:近年来,大语言模型(LLMs)的进展使得手语翻译(SLT)——将手语视频转换为口语文本的任务——越来越多地采用LLMs作为文本骨干。然而,尽管现有基于LLM的SLT方法具有很强的语言建模能力,它们常常削弱而非利用这种语言先验,产生不流畅的翻译,我们将这种失败称为语言先验退化。同时,现有方法通常在句子级别对齐视频和文本,这无法确保准确的词汇细节,造成了词汇保真度缺口。为解决这两个问题,我们提出了DualAnchor,一种基于LLM的无注释SLT训练框架,它结合两个互补的锚点以实现语言流畅和视觉保真的生成。词元级先验锚定(TPA)通过在每一个解码步骤将多模态解码器正则化到以相同自回归前缀为条件的冻结LLM的下一个词元分布,从而保留LLM的语言先验。最优传输对齐(OTA)通过将视觉-文本匹配形式化为熵正则化部分最优传输,并在余弦代价下通过Sinkhorn优化在视觉词元和文本内容词元之间产生软对齐,从而提升词汇保真度。DualAnchor在PHOENIX-2014T和CSL-Daily上都取得了优异的整体性能。针对性分析表明,这些提升归因于两个锚点的互补效应:TPA提升了流畅性,而OTA减少了细粒度的词汇错误。
查看缓存全文
缓存时间: 2026/07/31 10:01
# DualAnchor:在无词汇注释手语翻译中保留语言先验并提升词汇保真度
来源:https://arxiv.org/html/2607.27614
洪彬璋1,2\同等贡献, 刘钧豪1\同等贡献, 白雪峰1, 潘友成2, 项阳2, 陈科海1,2
###### 摘要
近年来,大语言模型(LLMs)的进展使得手语翻译(SLT)——即将手语视频转换为口语文本的任务——越来越多地采用LLM作为文本骨干网络。然而,尽管LLM具备强大的语言建模能力,现有的基于LLM的SLT方法往往削弱而非利用这种语言先验,从而产生不流畅的翻译——我们将这一失败称为*语言先验退化*。与此同时,现有方法通常仅在句子层面进行视频与文本的对齐;这种对齐并不保证词汇细节的准确性,从而造成*词汇保真度鸿沟*。为解决这两个问题,我们提出DualAnchor,一种无词汇注释的基于LLM的SLT训练框架,它通过两个互补的锚点实现语言学上流畅且视觉上忠实的生成:(i)*词元级先验锚定(TPA)*通过在每一步解码时,将多模态解码器朝向一个冻结LLM在相同自回归前缀条件下给出的下一词元分布进行正则化,从而保留LLM的语言先验。(ii)*最优传输对齐(OTA)*通过将视觉-文本匹配建模为熵正则化的部分最优传输问题,并在余弦代价下利用Sinkhorn优化在视觉词元与文本内容词元之间诱导软对齐,从而提升词汇保真度。DualAnchor在PHOENIX-2014T和CSL-Daily两个基准上均取得了强劲的整体性能。针对性分析表明,性能提升源于TPA带来的流畅度改善和OTA带来的细粒度词汇错误减少。
## 引言
手语翻译(SLT)通过从连续视觉信号中恢复语言内容,并以目标语言语法加以表达,将手语视频翻译为口语文本(Camgoz et al.2018 (https://arxiv.org/html/2607.27614#bib.bib1); Camgöz et al.2020 (https://arxiv.org/html/2607.27614#bib.bib26); Yin and Read2020 (https://arxiv.org/html/2607.27614#bib.bib27))。近年来,LLM的进展使得无词汇注释SLT方法采用一种生成框架:模型对手语视频进行编码,将所得视觉表示映射到LLM的语言空间,并使用预训练的LLM作为翻译的文本骨干(Wong et al.2024 (https://arxiv.org/html/2607.27614#bib.bib5); Gong et al.2024 (https://arxiv.org/html/2607.27614#bib.bib6); Chen et al.2024 (https://arxiv.org/html/2607.27614#bib.bib7); Hwang et al.2025 (https://arxiv.org/html/2607.27614#bib.bib8))。在该框架中,跨模态对齐通常通过配对视频与文本表示的对比目标或传递的语义相似性在句子层面学习(Zhou et al.2023 (https://arxiv.org/html/2607.27614#bib.bib3); Yin et al.2023 (https://arxiv.org/html/2607.27614#bib.bib9); Jiang et al.2024 (https://arxiv.org/html/2607.27614#bib.bib29))。
参照说明 参照说明
图1:LLM-based SLT中两个问题的示例性说明。上方:*语言先验退化*尽管使用LLM解码器仍产生不流畅文本。下方:强全局对齐仍可与薄弱的词汇基础共存,体现了*词汇保真度鸿沟*。
然而,这一范式留下了两个互补的问题悬而未决。尽管其LLM骨干具有强大的语言建模能力,现有方法在视觉适配过程中往往削弱而非利用预训练的语言先验。多模态适配可能使解码器的下一词元分布偏离文本预训练期间获得的语言结构,从而降低输出流畅度;我们将此问题称为*语言先验退化*。句子级目标将整个手语视频与其配对句子对齐,但并未将个别内容词直接关联到局部手语证据。因此,模型可能在取得强全局视频-文本对齐的同时,错误翻译动作、实体或属性;我们将这一差异称为*词汇保真度鸿沟*。这两个问题影响翻译质量的互补维度:语言先验退化削弱语言形式,而词汇保真度鸿沟则损害细粒度内容准确性。图1 (https://arxiv.org/html/2607.27614#Sx1.F1)提供了直观说明。上方输出尽管有LLM解码器却不符合语法。下方示例显示强全局语义对齐,却将*冰箱*和*苹果*替换为视觉上无支持的*橱柜*和*橙子*。
为解决这些问题,我们提出DualAnchor,一种无词汇注释的基于LLM的SLT框架,包含两个锚点:词元级先验锚定和最优传输对齐。
*词元级先验锚定(TPA)*在分布空间中运行。在相同的自回归前缀下,它将多模态下一词元分布朝向冻结LLM先验进行正则化,并按先验的置信度缩放约束强度。这种设计保留了预训练解码行为,同时仍允许视觉证据影响不确定位置。
*最优传输对齐(OTA)*在表示空间中运行。熵正则化的部分传输将视觉词元与内容词元匹配,同时一个未匹配的汇聚单元(sink)吸收不可靠的对应关系。部分公式处理视觉-词汇粒度不匹配,而无需强制每个词元都对齐。
TPA保留语言形式,而OTA将词汇选择锚定在细粒度视觉证据上。
我们在PHOENIX-2014T(Camgoz et al.2018 (https://arxiv.org/html/2607.27614#bib.bib1))和CSL-Daily(Zhou et al.2021 (https://arxiv.org/html/2607.27614#bib.bib2))上评估DualAnchor。在两个基准上,DualAnchor在所比较的无词汇注释方法中取得了最佳BLEU-4,并在报告的十个指标中取得最高算术平均值。针对性分析将性能提升与更流畅的生成和更少的细粒度词汇错误相关联,支持了TPA和OTA相较于普通模型容量的预期作用。
我们的贡献有三方面:
- •我们识别出两个互补的基于LLM的SLT问题:*语言先验退化*,它在多模态适配期间损害流畅度;以及*词汇保真度鸿沟*,即句子级对齐仍会留下内容词错误。
- •我们提出DualAnchor,将置信度感知的词元级先验锚定与熵正则化的部分传输相结合,以保留预训练语言先验并将词汇选择锚定于视觉证据。
- •在PHOENIX-2014T和CSL-Daily上,DualAnchor在所比较的无词汇注释方法中实现了最佳BLEU-4,针对性分析表明更好的流畅度和更少的细粒度词汇错误。
参照说明 (a) CSL-Daily:流畅度差距 参照说明 (b) CSL-Daily:先验发散 参照说明 (c) PHOENIX-2014T:全局对齐 vs. 词汇保真度
图2:先验漂移和词汇保真度的初步诊断。(a) 在CSL-Daily上,81.9%81.9\%的适配基线假设(hypotheses)具有比其配对参考更高的冻结LM困惑度。(b) 在多模态适配期间,学生到先验的KL散度增加并保持在初始水平之上。(c) 在PHOENIX-2014T上,视频-参考对齐度最高四分位数中31.7%31.7\%的基线假设IDF加权内容词F1低于50%50\%,表明高全局兼容性可以与词汇翻译错误共存。
## 初步分析
为刻画促使我们方法提出的两个问题,我们进行了两项初步诊断。我们首先检验多模态适配是否伴随输出层面的流畅度差距以及与预训练语言先验的偏离增大。接下来我们探究高全局视频-参考兼容性是否可能与词汇错误共存。
**诊断I:多模态适配是否同时伴随输出层面的流畅度差距和更大先验发散?** 给定手语视频Vi={vi,t}t=1TiV_{i}=\{v_{i,t}\}_{t=1}^{T_i}及其口语参考Yi={yi,n}n=1NiY_{i}=\{y_{i,n}\}_{n=1}^{N_i},受控基线自回归生成Y^i∼pθ(Y∣Vi)\widehat{Y}_{i}\sim p_{\theta}(Y\mid V_{i})。我们在CSL-Daily(中文)(Zhou et al.2021 (https://arxiv.org/html/2607.27614#bib.bib2))和PHOENIX-2014T(德语)(Camgoz et al.2018 (https://arxiv.org/html/2607.27614#bib.bib1))的留出集上评估其假设。我们使用冻结的外部语言模型qφq_{\phi}衡量流畅度,其中中文使用Baichuan2-7B(Yang et al.2023 (https://arxiv.org/html/2607.27614#bib.bib20)),德语使用Qwen2.5-7B(Yang et al.2024 (https://arxiv.org/html/2607.27614#bib.bib21))。对于分词后的句子S={sn}n=1|S|S=\{s_{n}\}_{n=1}^{|S|},我们计算其困惑度以及配对的log空间流畅度差距为
PPLφ(S)=exp(−1|S|∑n=1|S|logqφ(sn∣s0:n−1)),Δiflu=logPPLφ(Y^i)−logPPLφ(Yi)。\operatorname{PPL}_{\phi}(S)=\exp\left(-\frac{1}{|S|}\sum_{n=1}^{|S|}\log q_{\phi}(s_{n}\mid s_{0:n-1})\right),\qquad\Delta_{i}^{\mathrm{flu}}=\log\operatorname{PPL}_{\phi}(\widehat{Y}_{i})-\log\operatorname{PPL}_{\phi}(Y_{i})。(1)
其中Δiflu>0\Delta_{i}^{\mathrm{flu}}>0表示在相同评估器下,假设比其配对参考的概率更低。图2 (https://arxiv.org/html/2607.27614#Sx1.F2)(a)揭示了CSL-Daily上明显的输出层面流畅度差距:81.9%81.9\%的适配基线假设具有比其配对参考更高的困惑度,且平均困惑度相差3.4×3.4\times(335.8335.8对98.398.3)。
接下来,我们通过追踪整个多模态训练过程中的学生到先验KL散度,检验这种输出层面的流畅度差距是否与偏离预训练语言先验的增大同时发生。在第ee个epoch,令pe,i,nsp^s_{e,i,n}表示基线在相同金标准自回归前缀下的下一词元分布,pi,npp^p_{i,n}表示冻结先验分布。我们对所有有效目标位置Ω\Omega上的反向KL取平均:
Deprior=1|Ω|∑(i,n)∈ΩDKL(pe,i,ns∥pi,np)。D_{e}^{\mathrm{prior}}=\frac{1}{|\Omega|}\sum_{(i,n)\in\Omega}D_{\mathrm{KL}}\!\left(p^s_{e,i,n}\,\|\,p^p_{i,n}\right)。(3)
数值越大表示在同步解码上下文下偏离冻结语言先验越多。图2 (https://arxiv.org/html/2607.27614#Sx1.F2)(b)显示KL散度从2.502.50增加到接近epoch 65时的高峰2.772.77,并在epoch 220后稳定在约2.632.63,始终高于初始水平。
**发现I。** 多模态适配与输出层面的流畅度差距和先验发散增大相关:适配基线的假设相比其配对参考获得了显著更高的外部LM困惑度,而学生到先验的KL在训练期间增加并保持在初始水平之上。这种耦合模式提示需要在视觉适配期间保留预训练语言先验。
**诊断II:高全局视频-参考兼容性能否与词汇翻译错误共存?** 使用与诊断I相同的基线输出和留出样本,我们检验在句子层面匹配良好的金标准视频-参考对,其对应假设是否仍可能具有较弱的内容词保真度。令gvg_v和gtg_t表示句子级检索诊断所用的视频和文本编码器。对于每个金标准视频-参考对,我们度量全局兼容性为
sisent=sim(gv(Vi),gt(Yi)),s_{i}^{\mathrm{sent}}=\operatorname{sim}\!\left(g_{v}(V_{i}),g_{t}(Y_{i})\right),
其中数值越大表示在诊断表示空间中视频与其参考翻译之间的句子级兼容性越强。为度量细粒度词汇保真度,令Kih=K(Y^i)K_{i}^{h}=K(\widehat{Y}_{i})和Kir=K(Yi)K_{i}^{r}=K(Y_{i})分别表示假设和参考的归一化内容词集合,并定义W(A)=∑w∈Aidf(w)W(A)=\sum_{w\in A}\operatorname{idf}(w)。IDF加权内容词F1为
F1,iidf=2W(Kih∩Kir)W(Kih)+W(Kir)。F_{1,i}^{\mathrm{idf}}=\frac{2W(K_{i}^{h}\cap K_{i}^{r})}{W(K_{i}^{h})+W(K_{i}^{r})}。(4)
所得分数衡量基线假设与其参考之间的内容词一致性。IDF赋予稀有且有信息量的词更大权重,而F1同时捕捉参考中缺失的内容和假设引入的不匹配内容。内容词感知翻译同样将词汇单元视为对句子意义具有不同重要程度(Chen et al.2020a (https://arxiv.org/html/2607.27614#bib.bib30))。
图2 (https://arxiv.org/html/2607.27614#Sx1.F2)(c)显示,即使在全局匹配良好的金标准视频-参考对中,词汇错误仍然常见:在对齐度最高的四分位数内,31.7%31.7\%的基线假设IDF加权内容词F1低于50%50\%。因此,即使具有高全局视频-参考兼容性,细粒度词汇错误仍可能持续存在。
**发现II。** 高全局视频-参考兼容性可以与大量词汇翻译错误共存:即使在对齐度最高的四分位数内,31.7%31.7\%的基线假设IDF加权内容词F1低于50%50\%。这种共存促使我们在比句子级匹配更细的词汇粒度上进行视觉-文本对齐。
## 方法
### 问题定义
给定手语视频V={vℓ}ℓ=1TV=\{v_{\ell}\}_{\ell=1}^{T}及其口语翻译Y={yt}t=1NY=\{y_{t}\}_{t=1}^{N},一个基于LLM的SLT模型将VV映射为解码器兼容的视觉词元:
Zv=Fψ(V)={ziv}i=1n,ziv∈Rd,\mathbf{Z}^{v}=F_{\psi}(V)=\{\mathbf{z}^{v}_{i}\}_{i=1}^{n},\qquad\mathbf{z}^{v}_{i}\in\mathbb{R}^{d},(5)
其中FψF_{\psi}由骨干网络的视觉编码器和模态投影组成。多模态学生模型将翻译概率自回归分解为
pθs(Y∣V)=∏t=1Npθs(yt∣Zv,y0:t−1)。p_{\theta}^{s}(Y\mid V)=\prod_{t=1}^{N}p_{\theta}^{s}(y_{t}\mid\mathbf{Z}^{v},y_{0:t-1})。(6)
### 词元级先验锚定
TPA旨在保留预训练语言先验 pθp(Y∣y0:t−1)p_{\theta}^{p}(Y\mid y_{0:t-1}) 同时仍允许视频证据 ctv=Attn(Q([ziv]i=1n),KW,VW) 覆盖自回归前缀。 它工作在分布空间中:在相同自回归前缀下,将学生模型的下一词元分布朝向冻结先验进行正则化。我们使用反向KL形式避免在学生分布支持不覆盖先验的情况下出现无限项。关键地,对该约束引入分布置信度加权:当冻结先验对某个位置高度确定时,强制学生与该先验匹配;当先验不确定时,约束放宽以便视觉证据参与。具体而言,固定先验分布 pp≜pθp(⋅∣y0:t−1) 和学生分布 ps≜pθs(⋅∣Zv,y0:t−1),我们使用归一化反向KL:
RKL(ps∥pp)=∑wps(w)logps(w)pp(w),\operatorname{RKL}(p^{s}\|p^{p})=\sum_{w}p^{s}(w)\log\frac{p^{s}(w)}{p^{p}(w)},(7)
以及先验置信度权重
conf(pp)=1−H(pp)Hmax,\operatorname{conf}(p^{p})=1-\frac{H(p^{p})}{H_{\max}},(8)
其中 H(pp)H(p^{p}) 是熵,Hmax=log|V|H_{\max}=\log|\mathcal{V}|。在解码的每一步,TPA 正则化项为
LTPA=1T∑t=1Tconf(pp)⋅RKL(pθs(⋅∣Zv,y0:t−1)∥pθp(⋅∣y0:t−1))。\mathcal{L}_{\mathrm{TPA}}=\frac{1}{T}\sum_{t=1}^{T}\operatorname{conf}(p^{p})\cdot\operatorname{RKL}\bigl(p_{\theta}^{s}(\cdot\mid\mathbf{Z}^{v},y_{0:t-1})\,\|\,p_{\theta}^{p}(\cdot\mid y_{0:t-1})\bigr)。(9)
直觉:当先验集中在少数高概率词元上时,置信度接近1,约束较强;当先验在多个合理续写上分散时,置信度低,约束放松。这使视觉证据能够影响不确定位置,同时在明确的语言上下文中保留语言形式。
### 最优传输对齐
OTA在表示空间中运行,以细粒度的词元级粒度将视觉证据锚定到文本内容词上。设 Zv∈Rn×d\mathbf{Z}^{v}\in\mathbb{R}^{n\times d} 为视觉词元特征。文本特征由冻结LLM在其金标准前一词元嵌入上计算得出;每个目标位置 t 的上下文表示记为 ht\textbf{h}_t。我们用文本内容向量集表示 Zc={ht}t=1N\mathbf{Z}^{c}=\{\mathbf{h}_t\}_{t=1}^{N}。余弦代价矩阵定义所有真实对(i,j)的取值:
Dij=1−cos(ziv,hj)。D_{ij}=1-\cos(\mathbf{z}_i^v,\mathbf{h}_j)。(10)
视觉词元数量与文本词元数量之间不匹配,且某些视觉词元缺乏明确语义内容。我们利用熵正则化的部分最优传输来处理这一多对多匹配问题,通过加入一个汇聚单元吸收不可靠的对应关系。设 a∈R+n\mathbf{a}\in\mathbb{R}_+^n 为视觉边权重,b∈R+m\mathbf{b}\in\mathbb{R}_+^m 为文本边权重,并设 ρ∈(0,1]\rho\in(0,1] 为要传输的总质量比例。扩展边际为
aˉ=[a;1−ρ],bˉ=[b;1−ρ]。(12) \bar{\mathbf{a}}=[\mathbf{a};\,1-\rho],\qquad\bar{\mathbf{b}}=[\mathbf{b};\,1-\rho]。(12)
其中扩展维度表示汇聚垃圾箱。然后,熵正则化部分OT问题为
Pˉ⋆=argminPˉ∈U(aˉ,bˉ)⟨Pˉ,Dˉ⟩+τH(Pˉ),\bar{\mathbf{P}}^{\star}=\underset{\bar{\mathbf{P}}\in\mathcal{U}(\bar{\mathbf{a}},\bar{\mathbf{b}})}{\arg\min}\,\langle\bar{\mathbf{P}},\bar{\mathbf{D}}\rangle+\tau\mathcal{H}(\bar{\mathbf{P}}),(14)
其中 τ>0\tau>0 控制传输平滑度,(14) H(\bar{\mathbf{P}})=−∑_{i,j}\bar{P}_{ij}(\log\bar{P}_{ij}-1),且 0log0=00\log 0=0。 因此 H(Pˉ)=H(P)+H(sv)+H(sc)\mathcal{H}(\bar{\mathbf{P}})=\mathcal{H}(\mathbf{P})+\mathcal{H}(\mathbf{s}^v)+\mathcal{H}(\mathbf{s}^c), 显式正则化未匹配容量,而真实块精确传输 ρ\rho 质量。设 M\mathbf{M} 除 M_{n+1,m+1}=0 外均为1; 掩码Sinkhorn缩放给出
K=M⊙exp(−Dˉ/τ),Pˉ⋆=diag(u)Kdiag(r),\mathbf{K}=\mathbf{M}\odot\exp(-\bar{\mathbf{D}}/\tau),\qquad\bar{\mathbf{P}}^{\star}=\operatorname{diag}(\mathbf{u})\,\mathbf{K}\,\operatorname{diag}(\mathbf{r}),(15)
其中Sinkhorn迭代交替重新缩放 u\mathbf{u} 和 r\mathbf{r} 以匹配 aˉ\bar{\mathbf{a}} 和 bˉ\bar{\mathbf{b}}。Pˉ⋆\bar{\mathbf{P}}^{\star} 的真实块给出 P⋆\mathbf{P}^{\star},而汇聚单元吸收剩余的 1−ρ1-\rho 质量。
OTA随后最小化由真实匹配携带的平均代价:
LOTA=⟨P⋆,D⟩∑i=1n∑j=1mPij⋆。\mathcal{L}_{\mathrm{OTA}}=\frac{\langle\mathbf{P}^{\star},\mathbf{D}\rangle}{\sum_{i=1}^{n}\sum_{j=1}^{m}P^{\star}_{ij}}。(16)
传输计划提供词元级结构,而汇聚单元防止模糊或语义空洞的单元产生虚假监督。
### 联合优化与推理
两个锚点正则化互补的模型对象,并与翻译监督组合为
L=LCE+αTPALTPA+αOTALOTA,\mathcal{L}=\mathcal{L}_{\mathrm{CE}}+\alpha_{\mathrm{相似文章
基于表示锚定与语言-动作对齐的泛化VLA微调
Anchor-Align通过视觉-语言锚定增强行为克隆,以保留预训练表示和语言-动作对齐,在xArm7上使真实机器人成功率提升超过20%,并在模拟基准测试中持续取得改进。
无标注表示学习用于跨数据集手语词汇检测
本文提出了一种无标注表示学习方法,用于跨数据集手语词汇检测,利用土耳其手语广播中的弱对齐字幕。研究表明,LLM辅助的伪标注规范化能改善时间定位和下游翻译质量。
扩散大语言模型中面向格式约束生成的动态填充锚点
本文提出了动态填充锚点(DIA),一种适用于扩散大语言模型的免训练方法。该方法通过动态估计终止锚点位置来强制执行格式约束(如可解析的 JSON、推理模板),同时避免了固定跨度方法的僵硬性。实验表明,DIA 在 GSM8K 和 MATH 基准测试上取得了显著的零样本性能提升。
当信心误导:面向扩散语言模型的后缀锚定与锚邻域置信度调制
研究人员提出一种名为“后缀锚定置信度调制”的无训练方法,通过解决EOT标记和过早解码的问题,改进扩散语言模型中基于置信度的解码。
# 支持性令牌揭示:用于快速扩散语言模型解码
本文提出了 AXON,一种无需训练的模块,通过智能选择"锚点"(anchor)token 优先揭示,并利用注意力、不确定性和置信度信号来辅助后续去噪步骤,从而改善离散扩散语言模型解码的质量-延迟权衡。在推理和代码生成基准测试上的实验表明,AXON 在保持或提升准确率的同时减少了函数评估次数。