跨语言推理的软令牌对齐

arXiv cs.CL 论文

摘要

提出SOLAR,一种辅助微调目标,通过跨语言对齐软令牌表示来提高多语言推理一致性,准确率提升高达+17.7个百分点。

arXiv:2606.26466v1 公告类型:新 摘要:多语言大语言模型通常会对不同语言中语义等价的提示生成不一致的推理过程和答案。先前研究表明,中间表示可以是相对语言无关的,但随着模型承诺于离散输出令牌,生成过程会越来越语言特异性。这带来了问题,因为语言特定的词汇选择可能导致语义等价的推理路径在跨语言间出现分歧。这些分歧促使我们寻找一种更少绑定于单个词汇项或书写系统的跨语言对齐信号。我们提出SOLAR,一种用于监督微调的辅助目标,它以英语为枢轴,跨语言对齐软令牌表示。软令牌是词汇嵌入的概率加权混合,产生连续的表示,可以聚合跨语言语义相关令牌的信息。然后,我们将每个非英语的软令牌摘要与共享嵌入空间中的英语对应部分对齐。在四个多语言推理基准测试中,SOLAR相比基础模型准确率提升高达+17.7个百分点,相比标准监督微调提升+3.8个百分点,且在低资源语言上提升最大。SOLAR还增强了最后一层的跨语言相似性,并大幅降低了语言聚类的可分离性,表明对齐软令牌表示有助于在多语言推理过程中保留共享的语义结构。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:16

# 跨语言推理的软标记对齐 来源:https://arxiv.org/html/2606.26466 ###### 摘要 多语言大语言模型在面对不同语言中语义等价的提示时,常常产生不一致的推理过程和答案。先前的研究表明,中间表示可以相对语言无关,但随着模型承诺生成离散的输出标记,生成过程逐渐变得语言特异性。这很麻烦,因为语言特定的词汇选择会导致语义等价的推理路径在不同语言中产生分歧。这些分歧促使我们寻找一种跨语言对齐信号,该信号较少依赖于任何单个词汇项或文字。我们提出SOLAR,一种用于监督微调的辅助目标,它通过使用英语作为枢轴来对齐跨语言的软标记表示。软标记是词汇嵌入的概率加权混合,产生的连续表示可以聚合跨语言中语义相关标记的信息。然后,我们将每个非英语的软标记摘要对齐到共享嵌入空间中的英语对应物上。在四个多语言推理基准上,SOLAR 相较于基础模型提升了高达 +17.7 个百分点的准确率,相较于标准监督微调提升了 +3.8 个百分点,且在低资源语言上收益最大。SOLAR 还增强了最终层的跨语言相似性,并显著降低了语言簇的可分离性,表明对齐软标记表示有助于在多语言推理中保留共享的语义结构。

## 1 引言

大型语言模型(LLM)越来越多地服务于多语言用户,但常常对语义等价的提示在不同语言中产生不一致的推理和答案[39(https://arxiv.org/html/2606.26466#bib.bib6),75(https://arxiv.org/html/2606.26466#bib.bib2)]。近期关于多语言模型内部表示的研究[57(https://arxiv.org/html/2606.26466#bib.bib4),27(https://arxiv.org/html/2606.26466#bib.bib81),37(https://arxiv.org/html/2606.26466#bib.bib74)]揭示了一个一致的机制:中间Transformer层编码了很大程度上语言无关的语义,而最终层随着模型选择目标语言文字(例如,汉字或泰文字形)中的离散标记进行生成而变得语言专业化。这种从共享语义到语言特定表层的后期分歧被认为导致了跨语言推理的不一致,即使中间表示可能已经收敛于相同的解决方案。从最终层表示到离散标记的过渡可能成为一个瓶颈,将语义相关标记上的概率质量坍缩为单个语言特定的选择。连续空间推理提供了一种软化这种坍缩的方式:软思考[73(https://arxiv.org/html/2606.26466#bib.bib5)]用词汇嵌入的概率加权混合替换离散的下一个标记选择。得到的软标记聚合了跨词汇的信息,并作为下一个自回归步骤的输入嵌入反馈回去。由于软标记不绑定于单个标记或语言,它们可能保留了离散标记选择所丢弃的跨语言语义内容。然而,先前的软思考方法主要将软标记用作推理时的生成机制。它们软化了离散解码决策,但并未直接鼓励不同语言中语义等价的推理路径保持对齐。这一差距激发了我们的假设:软标记表示可以为跨语言对齐提供比离散标记更好的训练时信号。

我们提出SOLAR(跨语言推理的软标记对齐),一种轻量级的辅助微调目标,它在监督微调(SFT)期间将英语和非英语并行推理轨迹的软标记表示进行对齐(图1(https://arxiv.org/html/2606.26466#S1.F1))。对于每条推理轨迹和最终响应,SOLAR将模型的下一个标记分布总结为嵌入矩阵上的期望。然后它按位置进行平均池化,以获得一个不依赖于任何单个标记身份的连续向量。使用英语作为枢轴,SOLAR最小化英语表示与每个非英语对应物之间的余弦距离,将所有语言拉向以英语锚定的语义空间。由于软标记在共享嵌入空间中操作,它们使得跨语言的直接比较成为可能,无论表层形式如何差异。我们的实验表明,SOLAR在四个多语言推理基准上同时提高了任务准确率和跨语言一致性。对于Qwen3-4B[68(https://arxiv.org/html/2606.26466#bib.bib1)],SOLAR在AIME 2024上相对于SFT提升了高达+3.8的准确率和高达+4.5的跨语言一致性,其中在低资源语言如斯瓦希里语上收益最大。表示分析表明,在基础模型上,软标记比离散标记携带更强的最终层跨语言信号,而SOLAR产生的最终层跨语言对齐比SFT以及仅推理时软思考强得多。同时,行为分析表明,这些增益保留了母语推理:在MGSM上,经过SOLAR调优的Qwen3-4B以98.13%的比例用目标语言文字进行推理(基础模型为98.81%),Qwen3-8B为98.16%。这逆转了基础8B模型在非中文语言上向英语的坍缩(日语/泰语/泰卢固语低于5%;四种语言平均27.43%)。据我们所知,SOLAR是第一个在训练后阶段利用软标记(最初为推理时连续推理引入)作为跨语言对齐目标的方法。

参见说明图1:SOLAR框架。并行的英语和非英语输入由共享的LLM在教师强制下处理,产生每个位置的软标记 \(\mathbf{e}^{\,\text{soft}}_{t}\),该软标记混合了模型下一个标记分布下的词汇嵌入。软标记在响应位置上被平均池化为每个语言的摘要向量(\(\bar{\mathbf{e}}^{\,\text{soft}}_{\text{en}}, \bar{\mathbf{e}}^{\,\text{soft}}_{\ell}\))。对齐目标 \(\mathcal{L}_{\text{align}}\) 是英语和非英语摘要之间的余弦距离;英语侧的停止梯度将对齐梯度限制在非英语分支上。两个分支都受交叉熵监督(\(\mathcal{L}^{( \text{en})}_{\text{CE}}, \mathcal{L}^{(\ell)}_{\text{CE}}\)),非英语目标额外添加了由 \(\lambda > 0\) 加权的 \(\mathcal{L}_{\text{align}}\),\(\lambda\) 控制对齐强度。

## 2 SOLAR:跨语言推理的软标记对齐

在本节中,我们首先回顾离散思考和软思考作为自回归推理中构建输入表示的两种范式(§2.1(https://arxiv.org/html/2606.26466#S2.SS1)),然后描述SOLAR如何在SFT期间将软标记嵌入重新用作跨语言对齐信号(§2.2(https://arxiv.org/html/2606.26466#S2.SS2))。

### 2.1 背景:离散思考 vs. 软思考

在思维链(CoT)[61(https://arxiv.org/html/2606.26466#bib.bib41)]中,我们称之为离散思考,推理通过自回归生成离散标记进行。令 \(x_{1:n}\) 表示输入提示标记,\(\hat{x}_{n+1:t-1}\) 表示先前生成的推理标记。令 \(\mathbf{E}[\cdot]\) 表示标记嵌入查找函数,嵌入为 \(\mathbf{e}_i = \mathbf{E}[x_i]\) 对于 \(i \leq n\),以及 \(\mathbf{e}_i = \mathbf{E}[\hat{x}_i]\) 对于 \(i > n\)。下一步 \(t\) 的标记从 \(p_\theta(\cdot \mid \mathbf{e}_{1:t-1})\) 解码(例如,贪婪或采样):
\[
\hat{x}_t \sim p_\theta(\cdot \mid \mathbf{e}_{1:t-1}), \qquad \mathbf{e}^{\,\text{discrete}}_t = \mathbf{E}[\hat{x}_t].
\]
(1)
对于词汇表 \(V\) 和标记嵌入矩阵 \(\mathbf{E} \in \mathbb{R}^{|V| \times d}\) 的语言模型 \(f_\theta\),logit 向量 \(\mathbf{z}_t = f_\theta(\mathbf{e}_{1:t-1}) \in \mathbb{R}^{|V|}\) 诱导出分布 \(p_\theta(\cdot \mid \mathbf{e}_{1:t-1}) = \operatorname{softmax}(\mathbf{z}_t / \tau)\),其中 \(\tau\) 是温度。因此,等式(1)构成了从词汇表 \(V\) 上的分布到单个离散标记 \(\hat{x}_t \in V\) 的嵌入的硬投影。也就是说,无论概率质量如何分布,只有 \(\mathbf{E}[\hat{x}_t]\) 被作为下一步的输入表示。

软思考[73(https://arxiv.org/html/2606.26466#bib.bib5)]是一种推理时的自回归方法,它在推理过程中用通过下一个标记分布形成的连续表示替换这种硬离散投影。在步骤 \(t\),它定义一个**软标记**嵌入作为在截断并重新归一化的分布下标记嵌入 \(\mathbf{E}[v]\)(对于 \(v \in V\))的期望:
\[
\mathbf{e}^{\,\text{soft}}_{t} = \sum_{v \in V} \tilde{p}_\theta(v \mid \mathbf{e}_{1:t-1}) \cdot \mathbf{E}[v],
\]
(2)
其中 \(\tilde{p}_\theta\) 是通过对原始分布 \(p_\theta(v \mid \mathbf{e}_{1:t-1}) = \left[ \operatorname{softmax}\!\left(\mathbf{z}_t / \tau\right) \right]_v\) 应用 top-\(k\) 过滤构建的。具体来说,令 \(F_t \subseteq V\) 是通过保留 \(k\) 个最高概率标记获得的标记集。过滤后的分布是
\[
\tilde{p}_\theta(v \mid \mathbf{e}_{1:t-1}) = \frac{p_\theta(v \mid \mathbf{e}_{1:t-1})\mathbf{1}[v \in F_t]}{\sum_{v' \in F_t} p_\theta(v' \mid \mathbf{e}_{1:t-1})}.
\]
(3)
得到的 \(\mathbf{e}^{\,\text{soft}}_{t}\) 不对应于任何单个离散标记,并作为步骤 \(t+1\) 的输入嵌入反馈回去,从而在连续表示上关闭自回归循环,而不是离散标记。

### 2.2 对齐软标记以实现跨语言一致性

#### 从推理时解码到训练时对齐。
软标记最初被引入为单语言推理时增强 CoT [73(https://arxiv.org/html/2606.26466#bib.bib5)] 的手段,在解码期间它们被自回归地反馈回去。对于跨语言对齐,它们的连续形式很有用,因为每个软标记混合共享的词汇嵌入,而不是承诺于单个语言特定的标记或文字。仅推理时软思考可以软化解码决策,但并未明确训练不同语言中语义等价的推理路径保持对齐。相反,SOLAR 在 SFT 期间将软标记用作训练时的对齐信号:前向传递保持教师强制在离散参考标记上,软标记仅用于计算辅助对齐损失,非英语软标记摘要被拉向共享嵌入空间中的英语枢轴。

#### 软标记摘要和对齐。
给定一组语言 \(\mathcal{L}\)(其中英语 \(\text{en} \in \mathcal{L}\))上的并行输入-响应对 \(\{ (x^{(\ell)}, y^{(\ell)}) \}_{\ell \in \mathcal{L}}\) 的小批量,教师强制前向传递在每个响应位置 \(t \in \{1, \dots, T\}\) 产生 logits \(\mathbf{z}_t\)。在 top-\(k\) 过滤和温度缩放之后,\(\tilde{p}_\theta(v \mid \mathbf{e}_{1:t-1})\) 通过等式(2)定义软标记嵌入 \(\mathbf{e}^{\,\text{soft}}_{t}\)。对于每条推理轨迹和最终响应,我们将这些软标记进行平均池化,得到一个摘要向量
\[
\bar{\mathbf{e}}^{\,\text{soft}}_{\ell} = \frac{1}{T} \sum_{t=1}^{T} \mathbf{e}^{\,\text{soft}}_{t} \in \mathbb{R}^{d}.
\]
与离散标记嵌入不同,该向量总结了共享嵌入空间中可能的延续,而不是单个词汇项或 \(\mathbb{R}^{|V|}\) 上的分布。因此,即使词汇表不相交,也可以跨语言比较响应:SOLAR 对齐的是**嵌入的语义混合**,而不是原始标记分布的支持集。

#### 跨语言对齐目标。
给定一个由两种不同语言 \(\ell^*\) 和 \(\ell\) 的响应组成的并行训练对,令 \(\bar{\mathbf{e}}^{\,\text{soft}}_{\ell^*}\) 和 \(\bar{\mathbf{e}}^{\,\text{soft}}_{\ell}\) 表示枢轴和目标响应的平均池化软标记嵌入。为了鼓励它们的响应级软标记摘要接近共享嵌入空间,我们使用余弦距离最小化它们的差异:
\[
\mathcal{L}_{\text{align}}(\ell^*, \ell) = 1 - \cos\!\left( \bar{\mathbf{e}}^{\,\text{soft}}_{\ell^*}, \; \bar{\mathbf{e}}^{\,\text{soft}}_{\ell} \right),
\]
(4)
其中 \(\ell^*\) 表示枢轴语言。我们为每个非枢轴语言 \(\ell\) 形成 \((\ell^*, \ell)\) 对,将枢轴摘要 \(\bar{\mathbf{e}}^{\,\text{soft}}_{\ell^*}\) 视为固定目标,使得对齐梯度仅通过 \(\bar{\mathbf{e}}^{\,\text{soft}}_{\ell}\) 流动。这会将非枢轴表示拉向枢轴。我们在所有实验中设置 \(\ell^* = \text{en}\)(英语),因为英语在我们的基准中始终获得最高准确率(表2(https://arxiv.org/html/2606.26466#S3.T2))。

#### 与监督微调的集成。
在 SFT 设置中,对齐目标 \(\mathcal{L}_{\text{align}}\) 作为辅助损失添加到每个非英语训练样本(语言 \(\ell\))中:
\[
\mathcal{L}^{(\ell)}_{\text{SFT}} = \mathcal{L}^{(\ell)}_{\text{CE}} + \lambda \cdot \mathcal{L}_{\text{align}}(\ell^*, \ell),
\]
(5)
其中 \(\mathcal{L}^{(\ell)}_{\text{CE}}\) 是语言 \(\ell\) 响应的交叉熵损失,\(\lambda > 0\) 控制对齐强度,软标记使用与评估 \(\mathcal{L}_{\text{CE}}\) 相同的教师强制前向传递计算。对于英语样本,省略对齐项,留下 \(\mathcal{L}^{(\text{en})}_{\text{SFT}} = \mathcal{L}^{(\text{en})}_{\text{CE}}\)。

## 3 实验

我们在多语言推理基准上评估 SOLAR,以检验软标记对齐是否同时提高准确率和跨语言一致性。更多细节见附录D(https://arxiv.org/html/2606.26466#A4)。

### 3.1 实验设置

#### 训练。
我们对 Qwen3-4B/8B 和 Gemma3-4B/12B [53(https://arxiv.org/html/2606.26466#bib.bib42)] 应用监督微调,使用 M-s1k [1(https://arxiv.org/html/2606.26466#bib.bib76)]

相似文章

LAMAR:一种开放的语言感知多语言对齐重排序器

Hugging Face Daily Papers

LAMAR 是一种语言感知的多语言交叉编码器重排序器,它利用基于英语锚定的相关性蒸馏和偏好对齐,在保持语义相关性的同时,优先考虑与查询同语言的文档,在多语言基准测试中表现优异。

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。

面向多语言推理的跨语言在线策略自蒸馏

Hugging Face Daily Papers

本文提出了跨语言在线策略自蒸馏(COPSD)方法,该方法通过共享的学生-教师架构,将高资源语言的推理能力迁移到低资源语言中。在17种非洲语言上的实验表明,该方法的数学推理能力和答案格式遵循度均得到显著提升,性能优于组相对策略优化(GRPO)。