多语言思维,而非更难的思维:教授推理模型代码切换的数据高效框架

arXiv cs.CL 论文

摘要

本文介绍了一个数据高效的微调框架,用于教授推理模型有效地进行代码切换(混合使用多种语言),证明了战略性的代码切换可以提升低资源语言的推理能力。该工作分析了大型语言模型在不同语言、任务和领域中的代码切换行为,并开发了促进有益代码切换模式的干预措施。

arXiv:2604.15490v1 公告类型:新 摘要:最近推理能力的发展使大型语言模型能够解决越来越复杂的数学、符号和逻辑任务。有趣的是,虽然推理模型通常经过训练以生成单语文本,但这些模型也表现出代码切换(即混合使用语言)的行为。先前的工作要么将代码切换视为不可取的错误,要么尝试通过修改输入提示或输出解码过程来控制代码切换,要么仅关注语言、领域、任务和模型的狭窄子集。我们通过引入第一个在语言学和行为上有动机支持的微调框架来解决这些空白,该框架用于识别大型语言模型中有益的代码切换推理行为,并教授这些模型更有效地进行推理代码切换。首先,我们创建并系统地分析了来自不同模型、语言、任务和领域的推理轨迹数据集,以理解现有推理模型中存在的代码切换行为类型。然后,我们开发了微调干预措施,根据我们在现有模型中观察到的有帮助行为,教授推理模型进行代码切换。我们发现我们的框架可以以数据高效的方式显著增加有益的代码切换推理行为。有趣的是,我们还发现推理模型中的代码切换行为可以通过为不直接演示推理中代码切换的任务(例如,机器翻译)进行微调而被修改。我们的工作表明,数据高效的干预措施可以在推理模型中灌输有帮助的代码切换行为形式。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:27

# 多语言思考,而非更难:教授推理模型代码混用的数据高效框架

来源: https://arxiv.org/html/2604.15490

###### 摘要

推理能力的最近进展使大型语言模型能够解决越来越复杂的数学、符号和逻辑任务。有趣的是,虽然推理模型通常被训练生成单语文本,但这些模型也被观察到进行代码混用(即混合语言)。以往的研究要么将代码混用视为不可取的错误,要么试图通过修改输入提示或输出解码过程来控制代码混用,要么仅关注语言、领域、任务和模型的狭窄子集。我们通过引入第一个在语言学和行为学上都有动机的微调框架来解决这些问题,用于识别大型语言模型中有益的代码混用推理行为,并教导这些模型更有效地进行推理时的代码混用。首先,我们创建并系统地分析来自不同模型、语言、任务和领域的推理轨迹数据集,以理解现有推理模型中发现的代码混用行为类型。然后,我们开发微调干预措施,根据我们对现有模型中有益行为的观察,教导推理模型进行代码混用。我们发现我们的框架可以以数据高效的方式显著增加有益的代码混用推理行为。有趣的是,我们还发现推理模型中的代码混用行为可以通过针对不直接展示推理中代码混用的任务(例如机器翻译)进行微调而被修改。我们的工作表明,数据高效的干预可以在推理模型中灌输有益的代码混用行为形式。

## 1 引言

当多语言使用者在交流中混合多种语言时,他们被称为进行**代码混用**(Myers-Scotton, 2017)。最近,包括Guo等人(2025)在内的工作已观察到推理中代码混用的类似现象——大型语言模型(LLM)在解决复杂问题时生成的长链式思维文本中的代码混用。虽然人类代码混用的机制已被广泛研究(例如,参见Myers-Scotton(2017)和Bullock & Toribio(2009)的概述),但相比之下,LLM推理中代码混用这一新兴行为仍然相对较少被理解。一些工作(例如,Guo等人,2025;Marchisio等人,2024)将代码混用视为一种错误,而其他工作则尝试在特定推理任务中战略性地使用代码混用(Li等人,2025a)。在这项工作中,我们特别关注代码混用的LLM推理作为改进低资源语言推理能力的途径。这个问题至关重要,因为目前可用的推理模型主要局限于英语等高资源语言(Ghosh等人,2025)。

为了理解最先进的推理模型如何进行代码混用并设计改进代码混用质量的干预措施,我们寻求以下问题的答案:

1. **RQ 1** LLM在推理时如何进行代码混用?
2. **RQ 2** 哪些类型的代码混用有助于提高需要推理的任务的性能?
3. **RQ 3** 哪些类型的微调干预可以教导推理模型进行有益的代码混用推理?

为了解决我们对模型代码混用推理行为理解中的差距,首先我们创建了一个数据集来研究推理中的代码混用,该数据集来自不同的模型、语言、任务和领域(第3部分)。然后,基于我们第一项研究的发现,我们设计监督微调方法(包括训练和评估数据)来开发有益的代码混用推理行为。最后,我们分析由微调模型生成的推理轨迹,以识别对有益代码混用推理行为的显著影响(第4部分)。

我们的贡献如下。首先,我们引入**代码混用推理(CoRe)语料库**,其中包含来自不同模型、语言、任务和领域的约7000条推理轨迹,并识别有益于推理性能的代码混用行为的特征。其次,我们引入一个在语言学和行为学上都有动机的微调框架,用于教导推理模型进行代码混用以获得更好的推理性能。该框架使用1M个token的训练数据对CoRe进行扩展,涵盖每个任务每种语言,共6个任务和7种语言。最后,我们对通过我们框架产生的代码混用行为变化进行系统分析,以及这些行为变化对推理性能的影响。总体而言,我们希望这项工作将成为进一步未来工作的基础,将代码混用作为在低资源设置中改进多语言LLM推理的手段。我们将在发布时在MIT许可证下发布我们的模型、数据和代码。

## 2 相关工作

我们融合了有关人类代码混用研究的先前见解,为控制模型在推理期间使用的语言这一不断增长的研究领域做出贡献(例如,Tam等人,2025;Gao等人,2025)。广义上讲,代码混用发生在多语言使用者在交流中混合多种语言时(Myers-Scotton, 2017)。人类代码混用由复杂的社会和认知因素驱动,例如族群语言认同和语言熟练程度(Myers-Scotton, 2017;Gumperz, 1977;Bullock & Toribio, 2009)。虽然语言模型——特别是推理模型——也被观察到进行代码混用,但这种行为背后的机制仍然知之甚少。一些工作将语言模型的代码混用视为不可取的行为(Marchisio等人,2024;Guo等人,2025)。然而,我们的工作更接近Li等人的工作,他们反而试图利用代码混用作为有用的推理行为。这项工作与Li等人(2025a)之间的主要区别在于,虽然他们试图在解码阶段控制推理语言,但我们通过监督微调修改模型行为。

先前关于代码混用推理的工作缺乏我们所涵盖的不同模型、语言、领域、任务和推理行为的覆盖范围。Yong等人(2025)使用4种非英语语言的提示,在常识、事实、文化和因果推理基准上研究英语为中心的s1模型家族。Li等人(2025b;a)从中英文QwQ32B-Preview模型研究中英文数学推理。Wang等人(2025b;a)研究中英文DeepSeek-R1模型家族和多语言QwQ-32B、Qwen3和Gemini 2.0 Flash Thinking模型,在15种语言的常识、事实和逻辑推理上进行研究。相比之下,我们覆盖来自10个家族的17个模型,具有不同的多语言能力,21种语言,以及超出先前工作范围的推理领域/任务,例如道德推理。

在表征代码混用行为时,Yong等人识别了"引用-思考"模式,并应用了既有的语言学概念,即矩阵语言和语内/语际切换。Wang等人量化了推理语言的相对比例。Li等人识别了四种主要模式。相比之下,我们在三个维度上引入了代码混用模式的结构化分类法,并通过9个经语言学和NLP文献验证的代码混用指标量化这些模式。我们的工作结合了自上而下、理论驱动和自下而上、数据驱动的推理行为分类方法。Gandhi等人(2025)通过识别既驱动性能又平行人类行为的推理模型行为,证明了理论驱动方法的价值。相比之下,Lee等人(2025)使用自下而上的LLM辅助头脑风暴和生成文本的聚类来表征推理。虽然我们基于Lee等人的方法,但我们特别关注代码混用。我们引入手动策划作为额外步骤,将产生的代码混用行为分类法基于先前真实观察和代码混用和推理的理论(在人类和LLM中)。与Lee等人不同的是,我们在研究中包括了较小的多语言模型,以及超出数学、科学和一般知识的领域。

与先前的工作相比,我们进行推理模型的监督微调(SFT)以修改模型代码混用行为。Yong等人(2025)和Zhao等人(2026)都试图使用提示工程和测试时干预来控制推理语言。他们的方法包括通过提示指示模型以不同语言进行推理,以及在模型生成中追加目标语言的token,然后以这些token为条件来指导后续文本生成的语言。或者,Li等人(2025a)训练一个探针来指导解码过程中的语言选择。类似地,Wang等人(2025a)通过在解码过程中屏蔽非目标推理语言脚本的logits来指导解码过程。然而,这些先前方法在控制模型行为的程度上存在根本局限性,因为它们不修改底层模型权重。我们的工作通过直接应用监督微调来修改多语言推理期间的推理模型行为,克服了这一局限性。我们的SFT方法部分受到Muennighoff等人(2025a;b)的启发,他们证明了推理能力可以通过在小但精心策划的训练语料库上进行SFT来开发。

## 3 理解代码混用推理行为

为了回答**RQ 1**关于LLM如何进行代码混用的问题,我们创建了一个新语料库CoRe,包含来自15个模型的7000条推理轨迹,如下所述。

### 3.1 方法

自上而下和自下而上的推理行为表征方法(参见第2部分)都存在局限性。理论基础的、自上而下的方法在模型推理中寻找预定义的、人类对齐的行为(例如,Gandhi等人,2025),可能会错过与人类不对齐的新颖推理行为。另一方面,数据驱动的、自下而上的方法从模型推理的观察中推导行为类别(例如,Lee等人,2025),可能无法表现出与人类行为类别的不一致。特别是,这些数据驱动的、自下而上的方法可能无法观察到仅出现在人类中而不出现在模型中的行为。

为了解决这些局限性,我们在框架中融合自上而下的理论驱动和自下而上的数据驱动方法。

**数据和模型。** 为了创建我们的CoRe语料库,我们从不同的模型、语言、任务和领域生成推理示例,以实现通用性。我们从15个具有不同大小、推理能力和多语言能力的模型生成推理示例(参见附录A.2和A.4获取完整列表)。我们从7个数据集中为生成推理示例的提示进行选择,从s1K(涵盖STEM、法律、逻辑、谜题和人文科学)到UniMoral(涵盖道德推理;参见附录A.4获取完整列表)。提示涵盖18种语言(阿拉伯语、孟加拉语、缅甸语、英语、法语、德语、印地语、印度尼西亚语、意大利语、日语、韩语、普通话汉语、葡萄牙语、俄语、西班牙语、斯瓦希里语、泰语和约鲁巴语)、10种文字和8个语言系(Hammarström等人,2025;Unicode, 2025)。我们从每个模型/语言/数据集组合中包括约50个实例,总共约7000个实例。(参见附录A.5了解用于生成推理示例的提示配置。)

**代码混用推理行为分类法。** 接下来,我们通过融合自上而下的理论驱动和自下而上的数据驱动方法来开发代码混用推理行为的分类法。我们依赖上述推理示例作为输入上下文到Gemini 2.5 Flash,用于头脑风暴区分代码混用策略的标准(Google, 2025a;Gemini Team等人,2025)。在这个阶段,我们通过向Gemini 2.5 Flash提供代码混用的最小和广泛定义("使用多种文字或语言")来引入有帮助的归纳偏见来指导分类法开发。我们使用BERTopic管道对Gemini的头脑风暴标准应用主题建模(Grootendorst, 2022)。最后,我们以自上而下的方式引入进一步的有帮助的结构。特别是,我们手动合并冗余主题,删除那些不太可能推广的主题(例如,"约鲁巴术语的解释"),并将主题分组为维度、类别和子类别。主题手动策划到最终层级由作者对代码混用和推理在人类和LLM中的相关文献的了解指导。参见附录A.6和A.7了解详情。

我们的代码混用推理行为分类法具有三个维度,既基于先前文献中的理论,也基于我们的数据集:

1. **功能** 描述特定代码混用在推理期间服务的目的。推理期间代码混用的常见功能包括将一种语言**翻译**为另一种语言和**引用**来自初始用户提示的材料及其原始语言,可能同时主要以不同语言进行推理。人类也进行代码混用以用原始语言引用材料、以另一种语言提供背景信息,以及在另一种语言中重复短语以强调和澄清

相似文章

使用Layer Swap重新思考多语言推理差距

arXiv cs.CL

本文重新审视了LLM中的多语言推理差距,发现在可比较的监督条件下,该差距比先前报告的要小。本文引入了Layer Swap,它将来自英语推理专家的中间层权重转移到母语专家,几乎消除了这一差距,同时保留了母语链式思维。

让语言模型学会用代码思考

arXiv cs.CL

本文介绍了 ThinC(Thinking in Code,用代码思考)框架。在该框架中,语言模型在简短的自然语言规划步骤后,仅使用代码块进行推理,在数学基准测试中优于现有的工具集成推理基线。

x1:跨语言与文化自适应推理学习

arXiv cs.CL

研究人员推出了 x1,这是一类推理模型家族,能够针对每个具体实例自适应地选择最优语言进行推理,证实了在多语言及文化相关任务中,语言选择会对推理质量产生影响。

大规模推理模型(尚)不是多语言潜在推理器

arXiv cs.CL

本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。