严肃的翻译:将互懂性建模为概率推理

arXiv cs.CL 论文

摘要

本文提出了一种基于贝叶斯框架的互懂性模型(即无需训练即可理解相关语言),采用噪声信道方法。该模型在三种语言对上的预测与人类行为进行了比较,显示出比更大的零样本模型更一致的结果。

arXiv:2607.12169v1 公告类型:新 摘要:互懂性是指一种语言(L1)的使用者对另一种相关但不熟悉的语言(L2)的部分可理解性。这种零样本跨语言理解是如何实现的?在本工作中,我们扩展了以往关于噪声信道推理的算法模型,在贝叶斯框架下对互懂性进行建模。该模型仅使用 L1 语言模型来对观察到的 L2 话语的翻译潜在假设进行评分,并采用通用噪声模型基于形式相似性或符号规则推断 L2 与 L1 词汇之间的映射。随后,我们进行了一项人类行为实验,分别让英语、西班牙语和俄语的使用者对荷兰语、意大利语和乌克兰语的话语进行推断。我们的完整模型在人类互懂性表现分布上的对齐程度优于消融模型,并且与更大的零样本提示模型相比也表现更优。这些结果提供了一个认知上合理的互懂性计算模型,并突显了理解者在现实跨语言场景中面对广泛不确定性时所做出的灵活推断。我们公开了代码。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# 将跨语言理解建模为概率推理 来源:https://arxiv.org/html/2607.12169

## We Hebben Een Serieus Translatie: 将跨语言理解建模为概率推理

Thomas Hikaru Clark, Edward Gibson, & Roger Levy  
Department of Brain and Cognitive Sciences  
MIT  
Cambridge, MA 02139, USA  
\{thclark,egibson,rplevy\}@mit\.edu

###### 摘要

跨语言理解(Intercomprehension)指的是使用某一语言 L1 的人能够部分理解与其相关的陌生语言 L2 的现象。这种零样本跨语言理解是如何实现的?在本文中,我们扩展了先前关于噪声信道推断算法模型的研究,将其应用于贝叶斯框架下的跨语言理解建模。该模型仅使用 L1 语言模型对观察到的 L2 话语的可能翻译的潜在假设进行评分,并利用一个通用的噪声模型,基于形式相似性或符号规则推断 L2 与 L1 单词之间的映射。接着,我们进行了一项人类行为实验,分别让英语、西班牙语和俄语使用者对荷兰语、意大利语和乌克兰语的话语进行推理。结果表明,完整模型的输出与人类跨语言理解表现的分布更接近(优于消融模型),并且在零样本提示下也与规模大得多的模型表现相当。这些结果提供了一个认知上可信的跨语言理解计算模型,并突显了在真实跨语言场景中,理解者在高度不确定性下所做出的灵活推断。我们公开了代码¹。  
¹Github: https://github.com/thomashikaru/intercomprehension-colm-2026

## 1 引言

自然语言并非孤立存在。语言演化过程中,语言之间按照语言相近程度形成层级结构。相关语言之间通常存在一定程度的**互通性**或**跨语言理解**,即使用 L1 的人无需经过正式训练或接触 L2 即可理解相关语言 L2 中的大量内容(Gooskens et al., 2018(https://arxiv.org/html/2607.12169#bib.bib21); Bonvino et al., 2018(https://arxiv.org/html/2607.12169#bib.bib2); Carlo & Garbarino, 2021(https://arxiv.org/html/2607.12169#bib.bib3); Golubović & Gooskens, 2015(https://arxiv.org/html/2607.12169#bib.bib18); Beijering et al., 2008(https://arxiv.org/html/2607.12169#bib.bib1))。由于这一过程可能是不对称的,而非互惠的,我们统一使用**跨语言理解**来指代对陌生或未学习但相关语言的部分理解。从认知科学角度看,这一能力是一种引人注目的现象,反映了在高度不确定性下处理分布外观测并做出丰富推断的能力(Tenenbaum & Griffiths, 2001(https://arxiv.org/html/2607.12169#bib.bib47); Rule et al., 2020(https://arxiv.org/html/2607.12169#bib.bib44); Ellis et al., 2015(https://arxiv.org/html/2607.12169#bib.bib15); Tenenbaum et al., 2011(https://arxiv.org/html/2607.12169#bib.bib49); Xu & Tenenbaum, 2007(https://arxiv.org/html/2607.12169#bib.bib53); Zhi-Xuan et al., 2020(https://arxiv.org/html/2607.12169#bib.bib54))。从实践角度看,理解人脑如何执行这种推理,对语言教学、跨文化交流与合作具有重要意义(Doye, 2004(https://arxiv.org/html/2607.12169#bib.bib13))。在自然语言处理中,翻译未知语言的问题被称为**解读(decipherment)**,并在考古学和历史学中用于研究已灭绝语言的未翻译文献(Ravi & Knight, 2011(https://arxiv.org/html/2607.12169#bib.bib40); Luo et al., 2019(https://arxiv.org/html/2607.12169#bib.bib32); Naim et al., 2018(https://arxiv.org/html/2607.12169#bib.bib36); Luo et al., 2021(https://arxiv.org/html/2607.12169#bib.bib33))。

为了提供一个激励性例子,荷兰语短语“We hebben een serieus probleem”因英语使用者(没有荷兰语基础)也能理解而走红²。这个简单句子的词序与对应的英文翻译完全一致,并且包含与英语词汇在表面形式上相似的同源词和/或借词。虽然英语使用者似乎显然能够推断出句子的含义,但这个例子对于令人满意的认知解释(尤其是在算法解释层次上)提出了一些挑战(Marr, 1982(https://arxiv.org/html/2607.12169#bib.bib34))。例如,荷兰语单词“een”与其英语对应词“a”在表面形式上几乎没有相似性,但理解者似乎能够“从上下文”推断其含义。理解者究竟如何利用上下文进行这种推断,目前尚不明确。同样,单词“serieus”也与英语中的其他单词(如“series”)相似,而不仅仅是正确的翻译“serious”。因此,理解者似乎能够快速整合多种信息源,产生符合概率推断的解释。

在本文中,我们将心理语言学和认知科学中的**噪声信道语言处理**框架(Gibson et al., 2013(https://arxiv.org/html/2607.12169#bib.bib16); Levy, 2008(https://arxiv.org/html/2607.12169#bib.bib26); Chen et al., 2023(https://arxiv.org/html/2607.12169#bib.bib6))扩展到跨语言理解问题。该框架的一个基本前提是,人类既使用语言**先验**(对哪些消息更可能被发送的预期),也使用植根于隐性或显式错误模型的**似然**,该模型捕捉可能“扭曲”或改变意图消息的不同类型转换的相对概率。该范式下的近期工作提供了候选算法模型,用于在变化假设下模拟噪声信道理解者的细粒度、增量行为(Clark et al., 2025a(https://arxiv.org/html/2607.12169#bib.bib7); b(https://arxiv.org/html/2607.12169#bib.bib8)),但据我们所知,该框架尚未应用于理解者在跨语言理解中面临的更一般类型的“噪声”。

过去的研究通过使用Levenshtein距离对语言互通性进行建模(Gooskens & Heeringa, 2004(https://arxiv.org/html/2607.12169#bib.bib20); Beijering et al., 2008(https://arxiv.org/html/2607.12169#bib.bib1))。然而,仅凭编辑距离只能捕捉依赖于表面形式相似性的那部分可理解性,而忽略了一个重要变量:对意图消息的先验预期。目前尚不清楚人类理解陌生语言句子时,其推断是源于天真的表面形式相似性,还是源于整合了理性的推理。此外,一个悬而未决的问题是,哪些具体的算法推断成分最能预测人类跨语言理解的成功与失败模式。

Nieder & List(2024(https://arxiv.org/html/2607.12169#bib.bib38))提出了一个基于线性判别学习的模型,但该模型作用于同源词数据集(而非生成任意句子的翻译)。与此同时,Luo et al.(2019(https://arxiv.org/html/2607.12169#bib.bib32))提出了一个用于古代失落语言的解读模型,但该模型基于手工构建的历史音变模式(而非作为天真的零样本理解者的认知模型),并且同样根据同源词对齐(识别的同源词比例)而非完整句子翻译进行评估。

在本工作中,我们的独特贡献在于实现了一个可运行的跨语言理解认知模型,该模型适用于任意自然句子,并整合了形式相似性与语言先验以形成推断。

## 2 模型:用于零样本解读的退火SMC

### 2.1 生成模型

我们建立了一个生成模型,用于描述一种语言(L1)的句子如何可能被转换为另一种语言(L2)的句子。我们假设一个L1句子\(z\)是从语言模型中采样得到的,该语言模型只是一个关于字符串的概率分布\(p(z)\)。在实践中,我们使用Goldfish(Chang et al., 2026(https://arxiv.org/html/2607.12169#bib.bib5))提供的简单自回归语言模型,该模型在350种语言上提供了单语模型,参数数量和训练数据大小都相互匹配。由于语言模型的目的仅在于捕捉字符串的概率分布,而非执行推理或推断,因此我们不使用具有思维链(Wei et al., 2023(https://arxiv.org/html/2607.12169#bib.bib52))、指令微调或广泛多语言训练数据的语言模型。

给定L1句子\(z\),生成模型在单词级别应用转换,得到L2句子\(y\)。该生成模型反映了L1理解者对向未知但相关语言进行语言转换的一种直觉理论,因此误差模型应该非常通用,而不是反映特定语言对之间发生的具体转换知识。对于\(z\)中的每个单词,生成模型随机决定是否应用**字符串编辑**转换或**记忆替换**转换。

对于给定单词\(z_t\),字符串编辑转换的分布由关系\(\log p(y_t \mid z_t) \propto -\text{editDistance}(y_t, z_t)\)隐式定义。因此,较大的字符串编辑比较小的编辑概率低,每增加一次编辑,概率呈指数下降。这反映了一种天真的字符串转换直觉理论,即编辑是独立、随机的过程。我们考虑两种不同类型的编辑距离:一种通过基于字符串的编辑距离实现**正字法似然**;另一种通过首先使用Python中的`g2p_en`单词发音模块³将L2单词转换为ARPABET表示(该模块利用神经网络预测词汇外单词的发音),然后在此空间中计算与L1词表中项目的ARPABET表示之间的编辑距离,从而实现**语音似然**。最终的\(\text{editDistance}()\)函数采用正字法和语音编辑距离的等权平均值。

记忆替换转换是生成模型的一个组成部分,反映了并非所有单词(即使在高度相关的语言中)都有同源词的观点。因此,L1和L2之间的某些单词映射仅仅需要被记忆下来。生成模型包含一个规则库\(\mathcal{L}\),用于存储形如\(a \rightarrow b\)的重写规则。规则库上的概率分布由关系\(\log p(\mathcal{L}) \propto \text{charCount}(\mathcal{L})\)隐式定义,强制施加了一个**最小描述长度**先验:规则库越简单、越简洁,先验概率越高(Rissanen, 1978(https://arxiv.org/html/2607.12169#bib.bib42); Grünwald, 2007(https://arxiv.org/html/2607.12169#bib.bib22))。此外,这一先验的后果是,即使同一规则被多次使用,在\(\mathcal{L}\)中也只计数一次,从而隐式奖励能够解释多个观测的规则。完整的生成模型规范见附录A(https://arxiv.org/html/2607.12169#A1)。

### 2.2 SMC推断

序列蒙特卡洛(SMC)是一种推断算法,用于从难以精确采样的分布中进行采样,其中将问题分解为一系列子问题有利于推断(Naesseth et al., 2024(https://arxiv.org/html/2607.12169#bib.bib35); Doucet et al., 2001(https://arxiv.org/html/2607.12169#bib.bib12))。简单来说,SMC涉及维护一组加权的**粒子**,每个粒子对应关于潜在随机变量值的一个假设,并在遍历子问题时顺序更新粒子权重。在许多情况下,SMC应用于时间上顺序的推断问题,例如依赖于时间序列观测的随机变量推断。Clark et al.(2025a(https://arxiv.org/html/2607.12169#bib.bib7))采用这种方法对噪声信道推断的心理语言学特征进行建模:句子中可能带有噪声的单词随时间顺序被观测到,同时SMC更新一组对应于潜在意图消息分布的粒子。

对于跨语言理解建模,我们不模拟顺序观测,而是模拟一个推断目标序列,其中语言先验的作用逐渐增强。给定观察到的L2句子\(y\),我们近似该句子的L1翻译\(z\)的分布。因此,目标后验为:\(\pi_{\text{post}}(z \mid y) \propto p(y \mid z) p(z)\)。我们通过引入一个参数\(\beta\)来建立一系列目标分布,该参数充当先验的退火指数,逐步增加先验的贡献(Neal, 1998(https://arxiv.org/html/2607.12169#bib.bib37); Del Moral et al., 2006(https://arxiv.org/html/2607.12169#bib.bib11))。这反映了推断从解决一个更简单、更天真的问题开始(即识别L1和L2之间的表面级别相似性),然后逐步过渡到更具挑战性、更高层次的问题(即将似然和语言先验结合起来,识别强有力的候选翻译):

\[\pi_{\beta} \propto p(y \mid z) p(z)^{\beta}, \quad \beta \in [0,1]\]

\(\pi_{\beta}\)现在代表一族目标。对于\(\beta=0\),语言模型先验没有贡献,因此我们仅根据字符串编辑距离初始化粒子,即通过计算观测\(y_0 \dots y_T\)与L1词表中单词之间的编辑距离,从\(\pi_0(z \mid y)\)中采样。随着\(\beta\)增大,目标分布逼近真实后验;在每一步,粒子权重被更新。如果有效样本量(ESS)低于阈值,则进行重采样。推断细节见附录B(https://arxiv.org/html/2607.12169#A2)。

### 2.3 MCMC复兴移动

重采样后执行**复兴**,以在不改变粒子权重的情况下重新引入多样性(Gilks & Berzuini, 2001(https://arxiv.org/html/2607.12169#bib.bib17); Del Moral et al., 2006(https://arxiv.org/html/2607.12169#bib.bib11))。使用几种特定的MCMC核来应用复兴。**单词替换提议**:针对观察到的单词\(y_t\),简单地从L1词表中的单词分布中采样一个不同的单词作为潜在翻译\(z_t\),其对数概率与\(y_t\)的编辑距离成反比。**常用词规则库提议**:针对观察到的单词\(y_t\),提议一个新的规则库规则,将其映射到一个L1功能词\(z_t\)。**上下文规则库提议**:针对观察到的单词\(y_t\),在潜在上下文中(针对单个粒子)提议一个新的规则库规则。同样,规则库消融表明,推断符号重写规则的能力会导致模型推断与人类推断的更好对齐。比较朴素模型和完整模型,我们发现完整模型(反映了逐渐退火的L1语言模型先验)始终表现更好。

相似文章