OmniAlign:一个统一的多语言词对齐与句对齐工具

arXiv cs.CL 论文

摘要

OmniAlign 是一个统一的多语言对齐工具,它使用单个轻量级模型同时支持词级和句子级对齐,在基准测试中表现出色,并能良好地泛化到未见过的语言对。

arXiv:2608.18474v1 Announce Type: new 摘要:跨语言序列对齐对于构建和利用平行语料库至关重要,其范围涵盖从文档和句子到单词和子词的映射。然而,现有工具通常仅专注于单一粒度,因此实践者往往需要使用不同的系统分别进行词级和句子级对齐——尤其是在多语言和长文本场景下。我们提出了 OmniAlign,这是一个统一的多语言对齐工具,它使用单个轻量级模型同时支持词级和句子级对齐。OmniAlign 基于一个具有强大长上下文建模能力的仅编码器(encoder-only)主干网络构建,它从基于上下文的词元相似度矩阵中推导出词对齐结果,并通过句子嵌入结合动态规划来获取文档级的 $m$--$n$ 句子对齐。为了平衡细粒度的对齐精度和句子表示质量,我们采用了四阶段训练流程:面向对齐的持续预训练、自监督学习、基于人类标注的监督微调,以及从一个强大的多语言教师模型进行句子嵌入蒸馏。实验表明,OmniAlign 在词级和句子级对齐基准测试上均取得了极具竞争力的性能,并能很好地泛化到未见过的语言对。令人惊讶的是,在后期针对短文本进行的监督微调进一步提升了对齐质量,同时保留了前期训练中获得的长上下文理解能力,使模型在长文本词对齐任务上保持稳健。 \normalsize {\color{blue}\textbf{代码}: https://github.com/MilkDargon/OmniAlign}\par {\color{blue}\textbf{模型}: https://huggingface.co/WPS-Qingqiu/OmniAlign}
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:11

# OmniAlign:统一的多语言词级与句级对齐器
来源:https://arxiv.org/html/2608.18474
杨孟鹏 杨景旭 陈超 夏天 孙亚波 刘强
单位:WPS青丘 / 中国武汉
单位:yangmengpeng@wps\.cn, yangjingxu1@wps\.cn, chenchao9@wps\.cn
单位:xiatian3@wps\.cn, sunyabo@wps\.cn, liuqiang2@wps\.cn

###### 摘要

跨语言序列对齐是构建和利用平行语料库的基础,其映射范围从文档、句子直至词汇和子词。然而,现有工具通常专注于单一粒度,因此从业者在处理词汇和句子级对齐时——尤其是在多语言和长文本场景中——往往需要依赖不同的系统。我们提出了OmniAlign,这是一个统一的多语言对齐器,通过一个轻量级模型同时支持词汇级和句级对齐。OmniAlign基于具有强大长上下文建模能力的纯编码器骨干网络,从上下文化令牌相似性矩阵中诱导词对齐,并通过句子嵌入结合动态规划获取文档级m–n句对齐。为了平衡细粒度对齐精度和句子表示质量,我们采用了四阶段训练流程:面向对齐的持续预训练、自监督学习、基于人工标注的监督微调,以及从一个强大的多语言教师模型进行的句子嵌入蒸馏。实验表明,OmniAlign在词对齐和句对齐基准测试中均取得了极具竞争力的性能,并且能很好地泛化到未见过的语言对。令人惊讶的是,在短文本上进行后期监督微调,不仅能进一步提升对齐质量,还能保留早期训练中获得的长上下文理解能力,使模型在长文本词对齐上保持稳健。

代码:https://github.com/MilkDargon/OmniAlign
模型:https://huggingface.co/WPS-Qingqiu/OmniAlign

## 1引言

**跨语言序列对齐**是构建和利用平行语料库的核心基础任务。其目标是在不同语言的文本序列之间建立精确且一致的对应关系。此任务通常跨越多个粒度层级——从文档或段落层级的粗粒度对齐,到句子级对齐,再进一步到词汇或子词级的细粒度对齐。这些对齐过程共同构成了跨语言信息映射的关键路径,使模型能够在多语言空间中建立稳定的语义对应关系。它们为构建平行爬取管道、在计算机辅助翻译系统中构建翻译记忆库(31)、跨语言投射语言学注释和XML结构标签(6; 12)、检测神经机器翻译中的欠翻译现象(30)、开发跨语言迁移NLP工具(21; 17)以及改进或多语言预训练模型(3)等任务提供了必要支持。

\(a\) 词对齐示例。红色方框表示人工标注的黄金对齐。
\(b\) 句对齐示例。
图1:序列对齐示意图。
尽管近年来出现了针对不同粒度序列对齐的各种模型,但目前仍缺乏一个实用的单一工具,能够同时覆盖词级和句级的对齐需求,并同时具备多语言和长上下文处理能力。先前的研究通常只关注对齐问题的某个子任务。例如,诸如SimAlign(26)、AwesomeAlign(7)、AccAlign(34)、WSPAlign(35)、BinaryAlign(14)等方法主要探索词对齐;然而,它们中的大多数在序列长度增加时性能会显著下降,并且无法处理超过512个令牌的对齐场景。一些方法声称支持多语言,但它们需要为不同语言训练单独的模型,并且也没有在同一个模型中提供句级对齐。

另一方面,诸如CrocoAlign(19)、SentAlign(28)、VecAlign(29)、BertAlign(15)等方法依赖于像LaBSE(9)或LASER(1)这样的跨语言表示模型来获取句子嵌入,并通过相似性计算确定句子对齐。然而,这些方法不提供细粒度的词级对齐信息。

为解决这些局限性,我们提出了OmniAlign——一个统一的多语言对齐器,通过单一模型同时支持词级和句级对齐。词级和句级输出通过特定任务的对齐流程从同一个编码器中获得,使开发者无需维护多个系统即可满足多样化的跨语言对齐需求。本工作的主要贡献如下:
1.  **我们引入了OmniAlign**。这是一个新颖的开源多语言序列对齐模型,仅拥有0.3B参数并支持高效推理。它支持十一种主要语言之间的双向词级和句级对齐。
2.  **多阶段训练方案**。我们设计了一个多阶段训练框架:首先通过持续预训练增强模型的令牌级语义表示。然后结合自监督学习和监督信号来优化令牌级对齐精度,并获得词对齐模型。最后,冻结词对齐模块,并采用知识蒸馏来恢复并进一步增强模型的句级表示能力。
3.  **广泛适用性和竞争性能**。OmniAlign支持现实世界应用中遇到的广泛对齐任务,并在句级和词级对齐基准测试中均取得了极具竞争力的结果。它在长文本词对齐上保持稳健(短文本监督微调能进一步提升质量),并且能很好地泛化到未见过的语言对。

| 方法 | 多语言 | 长文本 | 词对齐 | 句对齐 |
| :--- | :---: | :---: | :---: | :---: |
| FastAlign (8) |  | ✓ | ✓ |  |
| GIZA++ (22) |  | ✓ | ✓ |  |
| SimAlign (26) |  |  | ✓ |  |
| AwesomeAlign (7) |  |  | ✓ |  |
| AccAlign (34) |  |  | ✓ |  |
| WSPAlign (35) |  |  | ✓ |  |
| BinaryAlign (14) |  |  | ✓ |  |
| Gale-Church (10) |  | ✓ |  | ✓ |
| BleuAlign (27) |  | ✓ | - | ✓ |
| VecAlign (29) |  | ✓ | - | ✓ |
| BertAlign (15) |  | ✓ | - | ✓ |
| SentAlign (28) |  | ✓ | - | ✓ |
| CrocoAlign (19) |  | ✓ | - | ✓ |
| **OmniAlign** | **✓** | **✓** | **✓** | **✓** |

表1:本报告将OmniAlign与一系列现有的最先进的序列对齐方法进行了比较。符号“-”表示该能力与特定模型选择无关。
本文其余部分组织如下:首先描述OmniAlign的训练方法,然后展示模型各个变体阶段的实验结果,最后总结关键发现。

## 2 OmniAlign

本节重点阐述OmniAlign在序列对齐任务中的运行机制,并详细说明其训练流程。

图2:OmniAlign整体架构,包括序列对齐模型(左)和多阶段训练流程(右)。
### 2.1 基础模型

我们采用mGTE基础模型(36)作为OmniAlign的基础模型,以支持多粒度、跨语言和可变长度序列对齐。主要原因如下:
- **纯编码器架构提供更强的上下文建模能力。** 与Seq2Seq或解码器专属模型相比,纯编码器模型在捕获句内令牌依赖性方面具有天然优势。这使得更细粒度的语义表示学习成为可能,特别适合词级对齐任务。
- **跨语言对齐需要强大的多语言能力。** 有效的跨语言词级和句级对齐要求模型具备强大且可靠的多语言能力。
- **mGTE克服了传统多语言模型的序列长度限制。** 传统模型如mBERT(24)和XLM系列(4)受到最大序列长度512个令牌的限制,不足以处理长文本对齐场景。相比之下,mGTE支持显著更长的输入序列,能够对扩展上下文进行对齐。

### 2.2 从令牌嵌入中提取词对齐

为使OmniAlign同时支持词级和句级对齐,我们从多语言预训练语言模型的上下文化令牌嵌入中诱导词对齐。

如图2(a)所示,给定源文本$\mathbf{x}=\langle x_{1},x_{2},\ldots,x_{i}\rangle$和目标文本$\mathbf{y}=\langle y_{1},y_{2},\ldots,y_{j}\rangle$,我们用OmniAlign第$m$层的上下文化令牌嵌入分别表示为$\mathbf{s}=\langle s_{1},s_{2},\ldots,s_{i}\rangle$和$\mathbf{t}=\langle t_{1},t_{2},\ldots,t_{j}\rangle$。遵循先前的工作(26; 7; 34),我们计算$\mathbf{s}$和$\mathbf{t}$之间的点积以获得相似性矩阵:
$$\mathbf{S}=\mathbf{s}\mathbf{t}^{\mathrm{T}}, \tag{1}$$
相似性矩阵$\mathbf{S}$的每一行使用Softmax函数进行归一化,得到源到目标概率对齐矩阵$\mathbf{S}_{xy}$。$\mathbf{S}_{xy}$的第$i$行代表令牌$x_{i}$与$\mathbf{y}$中所有令牌的对齐概率。类似地,我们计算目标到源概率对齐矩阵$\mathbf{S}_{yx}$,最终对齐矩阵通过两个概率矩阵的交集获得:
$$\mathbf{A}=(\mathbf{S}_{xy}>c)*(\mathbf{S}_{yx}^{T}>c), \tag{2}$$
其中$c$表示阈值,$\mathbf{A}_{ij}=1$表示$x_{i}$和$y_{j}$对齐。上述过程诱导了令牌级的对齐;如果任何一对令牌对齐,则相应的单词被视为对齐,从而生成最终的词级对齐结果。

### 2.3 从句子嵌入中提取句子对齐

为支持句级平行语料库对齐,OmniAlign集成了一个受Bertalign(15)启发的两阶段对齐算法。

**基于相似性检索的1–1对齐。** 给定源文档$\mathbf{X}=\langle X_{1},X_{2},\ldots,X_{N}\rangle$和目标文档$\mathbf{Y}=\langle Y_{1},Y_{2},\ldots,Y_{M}\rangle$,句子编码器将每个句子映射到一个稠密向量表示,得到源句子嵌入$\mathbf{S}=\langle S_{1},S_{2},\ldots,S_{N}\rangle$和目标句子嵌入$\mathbf{T}=\langle T_{1},T_{2},\ldots,T_{M}\rangle$。

我们首先执行最大内积搜索,为每个源句子检索前$k$个候选目标句子:
$$(\mathbf{D},\mathbf{I})=\mathrm{TopK}\big(\mathbf{S}\mathbf{T}^{\mathrm{T}},k\big), \tag{3}$$
其中$\mathbf{S}\mathbf{T}^{\mathrm{T}}$表示源句和目标句之间的相似性矩阵。Top$k$操作为每个源句子生成相似性分数矩阵$\mathbf{D}$和相应的目标句子索引矩阵$\mathbf{I}$。

随后,构建一个动态调整的对角搜索窗口,在其中应用动态规划以确定最佳对齐路径。状态转移$(a_{1},a_{2})\in\{(0,1),(1,0),(1,1)\}$分别对应目标句插入、源句删除和一对一句子对齐。评分函数定义为:
$$\mathrm{score}(i,j)=\max_{(a_{1},a_{2})}\left[\mathrm{score}(i-a_{1},j-a_{2})+\delta_{1-1}(a_{1},a_{2},i,j)\right]. \tag{4}$$
此处,$\delta_{1-1}$是一个指示函数,仅当对齐操作为$(1,1)$且目标句$j$属于源句$i$的前$k$个候选集$\mathbf{I}$时,才贡献来自$\mathbf{D}$的相似性分数;否则贡献为零。

最后,通过回溯动态规划表,我们获得整个文档的一对一对齐锚点序列。

**锚点约束m–n对齐。** 在1–1锚点的指导下,我们将第二阶段的搜索限制在语义相邻锚点的局部区域内,从而实现灵活的m–n对齐。在第二阶段,允许更灵活的对齐模式$(a_{1},a_{2})$(其中$a_{1}+a_{2}\geq 2$)。此阶段的对齐分数定义为:
$$\mathrm{sim}(i,j,a_{1},a_{2})=\langle\mathbf{S}_{a_{1}}(i),\mathbf{T}_{a_{2}}(j)\rangle\times\mathrm{LengthPenalty}, \tag{5}$$
其中$\langle\mathbf{S}_{a_{1}}(i),\mathbf{T}_{a_{2}}(j)\rangle$表示源文本跨度$\mathbf{S}_{a_{1}}(i)$和目标文本跨度$\mathbf{T}_{a_{2}}(j)$的嵌入向量之间的内积,而$\mathrm{LengthPenalty}$表示基于令牌长度比率差异的惩罚项。与基于句子计数的约束相比,这种令牌级比率在结构差异显著的语言(如中英)对齐场景中更为稳健。

最终对齐结果通过回溯第二阶段的动态规划表获得,可以表示为:$\mathcal{A}=\{([i_{1}:i_{2}],[j_{1}:j_{2}]),\ldots\}$。$\mathcal{A}$表示文档级的m–n对齐集。$[i_{1}:i_{2}]$,$[j_{1}:j_{2}]$分别对应于源文档中从第$i_{1}$句到第$i_{2}$句的连续片段,以及目标文档中从第$j_{1}$句到第$j_{2}$句的连续片段。

相似文章

PolyAlign: 条件化人类分布对齐

arXiv cs.CL

PolyAlign是一个分布感知的对齐框架,它将语言模型对齐到特定上下文的人类回复分布,而不是单一的全局风格,从而提升了双语环境下的自然性和忠实度。

LAMAR:一种开放的语言感知多语言对齐重排序器

Hugging Face Daily Papers

LAMAR 是一种语言感知的多语言交叉编码器重排序器,它利用基于英语锚定的相关性蒸馏和偏好对齐,在保持语义相关性的同时,优先考虑与查询同语言的文档,在多语言基准测试中表现优异。