低资源东南亚语言中的原生多语言思维链推理
摘要
介绍了OSCD,一种后训练算法,用于改进低资源东南亚语言中的原生多语言思维链推理,在数学基准上实现了高达3.2倍的提升。
arXiv:2608.00533v1 公告类型:新
摘要:大语言模型在推理能力方面取得了显著进展。然而,在低资源原生环境中,许多模型会出现跨语言崩溃,在需要复杂逻辑推理的中间步骤中退回到英语。这给策略优化带来了冷启动瓶颈,而标准微调则可能因跨语言表征漂移而导致灾难性遗忘。为了解决这些挑战,我们提出了Onramp-Sequence交叉蒸馏(OSCD),这是一种后训练算法,通过集成的翻译器智能体循环,在生成式训练滚动过程中将高资源推理轨迹投影到低资源词汇子空间,确保动态生成的参考样本能够稳定高效地翻译用于微调。同时结合了参考语言和目标语言推理轨迹的联合嵌入语义对齐,从而弥合配对跨语言表征差距。使用AIME25和HMMT25基准的综合评估表明,OSCD在东南亚本地语言的数学推理中实现了高达3.2倍的总体提升,其中联合嵌入语义对齐组件在语言去偏方面相比仅翻译基线贡献了高达6.4%的提升。
查看缓存全文
缓存时间: 2026/08/04 07:42
# 低资源东南亚语言中的原生多语言思维链推理
来源:https://arxiv.org/html/2608.00533
###### 摘要
大语言模型在推理能力方面取得了显著进展。然而,在低资源原生场景下,许多模型会遭遇跨语言坍缩(cross-lingual collapse),在需要复杂逻辑推理的中间步骤中退回到英语。这为策略优化带来了冷启动瓶颈,而标准微调则因跨语言表示漂移而存在灾难性遗忘的风险。为应对这些挑战,我们提出了Onramp序列交叉蒸馏(OSCD),一种后训练算法,该算法通过集成的翻译智能体循环,在生成式训练滚动期间将高资源推理轨迹投影到低资源词汇子空间,确保动态生成的参考样本能够稳定高效地翻译并用于微调。该方法配合参考语言和目标语言推理轨迹的联合嵌入语义对齐,从而弥合成对跨语言表示差距。使用AIME25和HMMT25基准的综合评估表明,OSCD在数学推理任务上为东南亚原生语言带来了高达3.2倍的整体提升,其中联合嵌入语义对齐组件在语言去偏方面相较于仅翻译基线贡献了高达6.4%的提升。代码、数据集、模型——https://github.com/SG-Lim/OSCD
## 引言
大语言模型(LLM)已取得显著的推理能力,这在很大程度上得益于思维链(CoT)提示和强化学习(RL)的进展(Wei等人2022 (https://arxiv.org/html/2608.00533#bib.bib29);Shao等人2024 (https://arxiv.org/html/2608.00533#bib.bib3))。然而,这些进展仍然高度依赖于高资源文字体系,主要是英语(Tran等人2026 (https://arxiv.org/html/2608.00533#bib.bib4);Schut等人2025 (https://arxiv.org/html/2608.00533#bib.bib5);Barua等人2026 (https://arxiv.org/html/2608.00533#bib.bib11))。因此,数据严重匮乏的语言区域被远远甩在后面。例如,东南亚(SEA)拥有6.71亿人口,但缺乏用于区域原生前沿能力发展的训练数据(Lovenia等人2024 (https://arxiv.org/html/2608.00533#bib.bib28))。为弥补这种资源不对称,多语言模型天然具有以英语为中心的偏差,利用高资源语言作为低资源问题求解的结构性锚点(Schut等人2025 (https://arxiv.org/html/2608.00533#bib.bib5))。这为用户可访问性制造了根本性障碍,因为理解逐步推理过程的能力在教育、研究等关键领域依然至关重要。由于CoT生成的中间过程在复杂逻辑转换后系统性地退回到英语(Park等人2026 (https://arxiv.org/html/2608.00533#bib.bib8);Zhao等人2026a (https://arxiv.org/html/2608.00533#bib.bib9);Kang等人2026 (https://arxiv.org/html/2608.00533#bib.bib10)),非英语母语使用者被置于严重不利地位,削弱了人工智能的真正价值与公平性。
参见图注:图1:大语言模型在AIME25基准上的Pass@5评估,包含7种目标语言(ZH、EN、Fi、IN、TA、TH、VI)的语言对齐验证。
参见图注:图2:Onramp序列交叉蒸馏(OSCD)算法的图形表示。
参见图注:图3:用于长上下文推理轨迹翻译的智能体循环系统图形表示。
由于许多具备思考能力的模型在复杂多步推理任务上天然难以生成低资源原生轨迹(图1 (https://arxiv.org/html/2608.00533#Sx1.F1)),我们识别出现代RL方法应用中的一个关键瓶颈,尤其是那些依赖既有知识空间和推理轨迹来优化采样效率的策略优化算法(Yue等人2026 (https://arxiv.org/html/2608.00533#bib.bib30);Kim等人2025 (https://arxiv.org/html/2608.00533#bib.bib31))。这带来了冷启动训练问题:在缺乏成功的原生样本来触发足够奖励的情况下,模型无法将其策略从高资源英语路径中优化出来。另一方面,在精选多语言数据集上进行标准监督微调(SFT)或继续预训练(CPT)则引入了另外的挑战,最显著的是灾难性遗忘的风险(Alexandrov等人2024 (https://arxiv.org/html/2608.00533#bib.bib33);Aggarwal等人2024b (https://arxiv.org/html/2608.00533#bib.bib35);Liu和Niehues2025 (https://arxiv.org/html/2608.00533#bib.bib32))。这主要归因于模型隐藏状态表示的逐语言错位,导致语义相似的平行文本因语言差异而被映射到不相交的嵌入子空间(Aggarwal等人2024a (https://arxiv.org/html/2608.00533#bib.bib34);Lim等人2025 (https://arxiv.org/html/2608.00533#bib.bib23);Li等人2025 (https://arxiv.org/html/2608.00533#bib.bib36))。因此,未弥合这一差距的朴素训练会加剧表示漂移(Gurgurov等人2026 (https://arxiv.org/html/2608.00533#bib.bib6)),反而危及已建立的高资源嵌入几何结构。为同时解决表示瓶颈和冷启动RL困境,我们提出了一种训练框架,该框架在优化跨语言生成式滚动语义等价性的同时,扩展低资源多语言推理的知识搜索空间(图2 (https://arxiv.org/html/2608.00533#Sx1.F2))。
我们的主要贡献总结如下:
- •我们提出了OSCD,一种新颖的训练框架,旨在实现低资源区域语言(特别是东南亚语言)的原生多语言CoT推理。这涉及生成式滚动的动态跨策略本地化以用于微调,并结合联合嵌入语义对齐来弥合不同语言平行文本之间的表示差异。
- •在开放式数学推理任务上的大量实验证明了我们训练方法的效率和鲁棒性。我们证明,使用合成本地化数据可以将英语主导模型的推理能力有效迁移到低资源场景,从而扩展后续RL所需的多语言知识搜索空间。
- •在AIME25和HMMT25基准上跨语言变体的综合评估表明,使用OSCD后训练的模型优于同等规模现有的多语言东南亚模型。我们的训练框架既保留了模型在高资源场景中的智能,又成功解决了导致非预期语言回退的系统性语言偏差。
## 相关工作
#### 多语言推理
多语言推理是NLP领域的一项重大挑战,尤其是对于低资源语言而言(Tran等人2026 (https://arxiv.org/html/2608.00533#bib.bib4))。因此,模型通常先将决策映射到英语邻近的潜在空间,然后再生成目标语言输出(Schut等人2025 (https://arxiv.org/html/2608.00533#bib.bib5))。这种以英语为中心的偏差导致跨语言理解失败、推理质量不均,以及“跨语言坍缩”现象——即在难度增加时中间CoT退回到英语(Hwang等人2025 (https://arxiv.org/html/2608.00533#bib.bib7);Park等人2026 (https://arxiv.org/html/2608.00533#bib.bib8);Zhao等人2026a (https://arxiv.org/html/2608.00533#bib.bib9);Kang等人2026 (https://arxiv.org/html/2608.00533#bib.bib10))。为弥合这一差距,多种方法利用英语作为中介,包括翻译、语码转换、跨语言蒸馏或平行微调(Chen等人2024 (https://arxiv.org/html/2608.00533#bib.bib15);Kang等人2026 (https://arxiv.org/html/2608.00533#bib.bib10);Chai等人2025 (https://arxiv.org/html/2608.00533#bib.bib14);Barua等人2026 (https://arxiv.org/html/2608.00533#bib.bib11);Zheng等人2026 (https://arxiv.org/html/2608.00533#bib.bib13))。原生推理方法包括将问题映射到语言无关的符号空间(Ranaldi和Pucci2025 (https://arxiv.org/html/2608.00533#bib.bib16))、通过因果干预减去语言特定的隐藏状态(Zhao等人2026b (https://arxiv.org/html/2608.00533#bib.bib12)),以及使用强化学习进行语言一致性奖励(Hwang等人2025 (https://arxiv.org/html/2608.00533#bib.bib7))。然而,原生目标语言推理在系统性上仍落后于以英语为枢纽的方法,存在语言特定的生成错误和概念误解(Barua等人2026 (https://arxiv.org/html/2608.00533#bib.bib11))。
#### 联合嵌入预测架构
将不同语义上下文映射到共享潜在空间的做法与联合嵌入预测架构(JEPA)的基础原理一致(Garrido等人2024 (https://arxiv.org/html/2608.00533#bib.bib18);Maes等人2026 (https://arxiv.org/html/2608.00533#bib.bib19))。Huang等人(2026a (https://arxiv.org/html/2608.00533#bib.bib20))提出了LLM-JEPA,将标准自回归与嵌入空间预测损失相结合,以对齐同一知识的不同语义视图。后续框架利用这一目标,通过几何正则化器约束隐藏状态轨迹(Huang等人2026b (https://arxiv.org/html/2608.00533#bib.bib27);Yuan2026 (https://arxiv.org/html/2608.00533#bib.bib26)),将潜在推理与token生成解耦(Liu等人2026 (https://arxiv.org/html/2608.00533#bib.bib25)),并将查询和文档嵌入投影到共享空间(Chen等人2026 (https://arxiv.org/html/2608.00533#bib.bib24))。Lim等人(2025 (https://arxiv.org/html/2608.00533#bib.bib23))证明了在低资源多语言情境中对齐语义属性的重要性,否则模型通常会退回到不相交、不够准确的表示。在相关主题上,应用于单语英语数据的对比学习已被证明可以将跨语言表示投影到共享的、语言无关的空间(Wang等人2022 (https://arxiv.org/html/2608.00533#bib.bib22)),而最小化概率潜在变量之间的跨语言散度则引导模型捕获结构化的、语言无关的语义表示(Sherborne等人2023 (https://arxiv.org/html/2608.00533#bib.bib21))。
## 方法
OSCD框架包含两个组件:(1)带序列变异的滚动生成,该组件动态合成原生语言推理轨迹以填充低资源词汇子空间;(2)多目标交叉蒸馏,该组件在携带本地化推理轨迹的补全上进行微调的同时强制执行序列级语义对齐。
### 带序列变异的滚动生成
给定一个针对低资源语言l∈L的提示p,流水线首先从高资源参考模型πφ中以πφ(·∣p)采样一个补全序列c。为隔离其中间CoT,我们将token序列解码为文本字符串s=D(c),其中D(·)是解码函数。使用预定义的结构分隔符集合Δ={δopen,δclose}(例如开/关思考标签),我们将s划分为推理字符串sr和答案字符串sa:
(sr,sa)=Split(D(c),Δ) (1)
为将推理过程动态本地化到低资源词汇子空间VL中,随后对外部翻译函数T应用所生成的推理字符串,生成以l为条件的低资源原生轨迹:
sr′=T(sr,l) (2)
此后,将文本段投影回离散token空间,同时保留原始补全的拓扑边界。设E∗(·)表示受控编码函数。变异后的补全序列c′通过重新编码段及其结构分隔符的有序拼接(⊕)重建:
c′=δopen⊕E∗(sr′)⊕δclose⊕E∗(sa) (3)
我们将翻译函数T完全限定在推理轨迹上,原样保留教师模型的原始答案字符串sa。这旨在建立一个稳定的锚点,从而保证底层推理路径始终绑定到一个已知的有效结果上。
### 多目标交叉蒸馏
#### 全序列交叉熵
为驱动原生多语言习得,我们在学生补全的整个序列上应用全序列对数似然(LCE),将学生模型πθ初始化为其参考教师πφ。这确保πθ在目标媒介VL上构建其中间推理步骤,同时保持锚定在一个与其原始分布接近的稳定答案上:
LCE=−1/|c′| ∑_{t=0}^{|c′|−1} log πθ(c′_t∣p,c,<t) (4)
#### 联合嵌入语义对齐
#### 总体目标
## 实验
### 设置
#### 基准与数据集
我们将OSCD框架应用于AIME25和HMMT25基准,两者均包含高难度竞赛级数学问题,需要多步推理。我们使用有限步骤预算生成推理轨迹。为构建初始无标注问题集,我们从开放数学竞赛数据集中检索问题,确保AIME25和HMMT25测试集零重叠。
#### 基线
我们在强基线集合上评估模型的原始能力。AIME25和HMMT25都要求数值答案准确匹配,因此我们在此处采用贪婪解码和带格式奖励的多数投票。
### 主要结果
### 消融研究
#### 跨语言蒸馏效率
#### 坍缩评估
## 数据集、模型
## 结论
在本研究中,我们提出了OSCD,一种用于低资源多语言推理的后训练框架,并从实证角度验证了其有效性。我们的方法将高资源CoT轨迹本地化到低资源词汇子空间,同时通过联合嵌入语义对齐保持多语言语义等价性,使得OSCD能够同时实现跨语言迁移和高资源推理能力的保持。我们的实验表明,在所涵盖的7种目标语言中,模型在数学推理能力上取得了平均3.2倍的整体提升,其中联合嵌入语义对齐组件为这一提升贡献了高达6.4%。因此,我们的工作证明了以下经验性结论:
- OSCD利用机器翻译作为数据基础,并加入结构保留约束,跨低资源语言实现更强的推理迁移。
- 联合嵌入语义对齐通过隐式对齐跨语言语义内容来减轻多语言表示漂移,增强通过翻译进行的监督。
- 跨语言联合嵌入对齐方法能够应对低资源多语言高难度推理问题,为后续RL冷启动解锁高资源模型知识空间。
在当前模型规模下,我们注意到大规模算术错误以及语言特定惩罚仍然存在,建议未来工作探索扩展模型规模或集成更强的基础模型。在我们提出的框架中整合语言特定的部署约束,有望进一步提升低资源环境中的多语言推理能力。最终,我们的目标是为高性能、原生的多语言模型铺平道路,使其为全球数百万用户提供真正的价值。相似文章
面向多语言推理的跨语言在线策略自蒸馏
本文提出了跨语言在线策略自蒸馏(COPSD)方法,该方法通过共享的学生-教师架构,将高资源语言的推理能力迁移到低资源语言中。在17种非洲语言上的实验表明,该方法的数学推理能力和答案格式遵循度均得到显著提升,性能优于组相对策略优化(GRPO)。
有限监督下的链式思维推理再探讨:半监督链式思维学习
本文介绍了Semi-CoT,一种用于链式思维推理的半监督学习框架,该框架利用未标记问题并通过基于熵的选择生成可靠的伪推理链,在数学推理基准上展示了有希望但混合的结果。
低资源语言数学教育中的大语言模型:僧伽罗语和泰米尔语研究
本文评估了大语言模型在僧伽罗语和泰米尔语(两种资源匮乏的南亚语言)中的数学推理能力,采用独立编写问题的平行数据集进行评估。研究表明,虽然基础算术在跨语言间转移良好,但复杂推理任务在非英语语言中表现出显著性能下降,这对在多语言教育环境中部署AI辅导工具具有重要启示。
更少语言、更少Token:高效统一逻辑跨语言链式思维推理框架
UL-XCoT在统一逻辑空间中剪枝低质量多语言推理路径,削减>50% token开销,同时提升低资源语言的准确率与鲁棒性。
面向多语言数学推理的同策略Delta蒸馏
本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。