大规模推理模型(尚)不是多语言潜在推理器

arXiv cs.CL 论文

摘要

本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。

arXiv:2601.02996v2 公告类型:替换 摘要:大规模推理模型(LRMs)在数学推理任务上取得强劲性能,通常归功于其生成显式思维链(CoT)解释的能力。然而,最近的研究表明,LRMs往往在完成这些文本推理步骤之前就得到了正确答案,这表明存在潜在推理——编码在隐藏状态中的内部非语言计算。虽然这一现象已在英语中得到探索,但其多语言表现仍然鲜为人知。在本文中,我们对LRMs在11种语言上的多语言潜在推理进行了系统研究。使用基于截断的策略,我们通过仅给模型提供部分推理轨迹,来检查正确答案如何逐步出现,从而逐步测量潜在预测的形成。我们的结果揭示了多语言潜在推理的明确证据,但分布不均:在资源丰富的语言中较强,在低资源语言中较弱,在较难的基准测试中基本上不明显。为了理解这些差异是否反映了不同的内部机制,我们进一步进行了表征分析。尽管存在表面差异,我们发现预测的内部演变在各语言中高度一致,并基本符合英语——这一模式提示了一个英语中心的潜在推理路径。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:31

# 大规模推理模型(尚未)成为多语言隐性推理器
来源:https://arxiv.org/html/2601.02996

赵若元\*\{\}^\{\\text\{\*\}\}Hinrich Schütze†Michael A\. Hedderich†

###### 摘要

大规模推理模型(LRM)在数学推理任务上表现出色,通常归因于其生成显式思维链(CoT)解释的能力。然而,最近的研究表明,LRM 通常在完成这些文本推理步骤之前就到达了正确答案,这表明存在*隐性推理*——编码在隐层状态中的内部非言语计算。虽然这一现象已在英语中被探索,但其多语言行为在很大程度上仍不为人知。在本论文中,我们对11种语言中的LRM进行了系统的多语言隐性推理研究。采用截断策略,我们检验当模型仅获得部分推理踪迹时正确答案是如何出现的,从而能够逐步测量隐性预测的形成。我们的结果揭示了多语言隐性推理的明确证据,尽管分布不均:在资源丰富的语言中强,在低资源语言中较弱,在更难的基准上广泛可观察性较弱。为了理解这些差异是否反映不同的内部机制,我们进一步进行了表示分析。尽管表面存在差异,我们发现预测的内部演化在语言间高度一致,并广泛与英语相符——这一模式表明存在一条英语中心的隐性推理路径。¹¹¹我们在以下网址公开提供代码:https://github.com/cisnlp/multilingual-latent-reasoner

大规模推理模型(尚未)成为多语言隐性推理器

\*\*脚注:平等贡献。\.$\{\\dagger\}$$\{\\dagger\}$脚注:平等指导。

## 1 引言

最近的大规模推理模型(LRM)(OpenAI等,2024;Yang等,2025;DeepSeek-AI等,2025)在许多具有挑战性的任务上迅速推进了技术水平,如编码、数学推理和逻辑推理。这很大程度上被认为是由于它们生成显式CoT解释的能力,这些解释为多步问题解决提供了支撑,特别是通过测试时缩放,其中给予足够的计算预算以允许模型生成更长的推理踪迹。

尽管依赖于显式CoT解释,但新兴证据表明模型经常进行*隐性推理*——在隐层状态中计算中间或最终答案。这种隐性行为已在多跳事实知识回顾和在CoT背景下被观察到,其中模型在明确表述答案前在内部形成解决方案。这一现象与最近的发现相符:LLM可以通过直接从中间隐层状态预测未来令牌来"提前思考"。总体而言,这些观察表明显式CoT生成不是LRM解决问题的唯一机制,推理可能发生在模型的隐层空间中。

然而,现有的隐性推理研究几乎完全集中在英语上,这留下了这些隐性推理过程在语言间如何表现的开放问题。在显式推理层面,多语言性能已知是不均匀的:在英语中心语料库上训练的模型通常在代表性不足的语言上表现欠佳,原因是多语言推理训练数据有限、语言理解能力较弱,以及推理踪迹生成质量较低。这些发现提出了一个自然问题:如果显式推理在语言间变化,隐性推理是否表现出类似的差异,还是遵循语言独立的机制?

这促使我们的两个研究问题:(RQ1) *LRM在语言间是否表现出隐性推理,其强度如何变化?* 和 (RQ2) *语言是否遵循不同的内部隐性推理路径,还是共享一种通用机制?*

为了回答这些问题,我们使用两个不同难度的数学推理基准,对11种语言中的LRM进行了系统的多语言隐性推理研究。为了解决RQ1,我们通过在截断踪迹中引发和评估其逐步早期预测来量化LRM对显式推理踪迹的依赖程度,并提出了捕捉隐性推理不同维度的新颖聚合指标(参见§4)。为了解决RQ2,我们使用logit透镜方法分析答案形成的内部演化,检查在每种语言中正确答案在各层变得概率高时的时刻,并比较语言间隐层状态相似性轨迹(参见§5)。我们进一步区分隐性推理与潜在的记忆化效应(参见§7)。

我们的主要发现如下:

(i) 隐性推理存在于各种语言中。然而,资源丰富的语言显示出强的早期出现正确性,而低资源语言则显示出较弱的隐性推理信号。

(ii) 隐性推理在任务难度增加时不太明显。在更难的基准上,早期答案形成在所有语言和模型大小上基本消失。

(iii) 内部隐性推理动态在语言间共享。这些动态汇聚为英语中心路径,特别是对于高资源语言和正确求解的实例。

(iv) 虽然模型显示出部分记忆化,隐性推理对高资源语言仍然明显,这种能力随模型大小而扩展。

## 2 相关工作

**多语言推理** 由于大多数模型具有强烈的语言偏差,多语言推理仍然具有挑战性。由于模型通常依赖英语作为枢纽,翻译后求解策略对于资源不足的语言频繁有效。最近的工作表明,对多语言推理数据的后训练可以实质性改善跨语言性能。在推理时,模型行为对推理过程中使用的语言高度敏感。这些性能差距已被归因于语言特定推理踪迹质量的差异和低资源输入基本理解的失败。然而,现有研究几乎完全集中在*显式*多语言推理行为上。我们的工作旨在系统地研究*隐性*推理在语言间的表现。

**隐性隐层推理** 与模型产生逐步文本解释的*显式*推理不同,隐性或*隐性*推理指的是发生在模型隐层表示中的内部计算。先前工作表明LLM可能并行追求多条隐性推理路径,随着显式推理展开,逐渐增加对特定解决方案的信心。然而,即使模型在内部形成了正确答案,它也可能继续生成不必要的推理步骤,称为"过度思考"。受这些观察启发,出现了旨在训练模型在隐层空间中直接推理而不产生完整文本踪迹的新方法。然而,这条工作线几乎完全集中在英语上,留下隐性推理行为是否在语言间出现的开放问题。我们的工作通过系统地评估和比较多语言设置中的隐性推理动态来解决这一差距。

## 3 实验设置

### 3.1 模型

我们使用DeepSeek-R1的三个蒸馏变体,即DeepSeek-R1-Distill-Qwen-{7B, 14B, 32B},其主干模型基于Qwen2.5家族。选择这些模型是因为它们表现出强大的推理性能,同时提供多个大小,使我们能够分析多语言隐性推理如何随模型容量变化。

### 3.2 数据集和语言

**MGSM** 多语言小学数学数据集包含250个小学数学问题,来源于GSM8K,最初用英语编写,手动翻译成10种额外的语言:法语(FR)、德语(DE)、中文(ZH)、日语(JA)、俄语(RU)、西班牙语(ES)、斯瓦希里语(SW)、孟加拉语(BN)、泰卢固语(TE)和泰语(TH)。由于底层数学问题在语言间相同,它非常适合研究多语言(隐性)推理动态。

**多语言AIME** 多语言美国邀请数学考试(AIME)数据集是AIME2024和AIME2025的翻译版本,涵盖与MGSM相同的11种语言。这些数据集包含实质上更具挑战性的竞赛级数学问题,使我们能够检查增加的问题难度如何影响多语言隐性推理动态。

我们将本研究中考虑的语言分类为**高资源**(EN、ES、DE、FR、RU、ZH)、**中等资源**(BN、JA、TH)和**低资源**(SW、TE)组。此分类基于相对可用的大规模训练资源和当代多语言LLM中语言覆盖的程度。

### 3.3 语言控制

LLM可能以与提示不同的语言生成显式推理踪迹,这对于隐性推理的跨语言分析是不理想的。为了确保显式推理以与输入相同的语言生成,我们采用*提示黑客策略*,在think令牌后立即插入语言特定前缀,可靠地将推理踪迹引导至目标语言(详见§F.1)。

## 4 隐性推理识别

为了解决RQ1:*LRM在语言间是否表现出隐性推理,其强度如何变化?*,我们分析了推理踪迹截断下的模型早期预测。该协议连接了*显式*推理过程与模型的*内部*答案构造:如果模型在踪迹早期已经知道答案,那么即使只有推理的一小部分可见,它也应该经常正确回答。此方法类似于早期停止和逐步答案预测的并发工作,但我们利用这样的截断来识别隐性推理,并用量化语言间隐性推理能力的新颖指标来补充。

### 4.1 截断推理踪迹

设x表示数学问题,设模型在目标语言中产生完整推理踪迹c=(t₁,t₂,...,t_T),之后是最终答案,其中t_i表示第i个推理步骤。²²²推理踪迹被视为特殊思考标记之间的令牌,例如<think>和</think>。我们将每个单个句子视为一个推理步骤。

然后我们考虑截断比率集合ℛ={r₁,r₂,...,r_M}⊂[0,1],其中每个r∈ℛ指定保留的推理踪迹比例(例如10%)。对于比率r,我们将截断指数定义为m(r)=⌊r·T⌋,截断推理踪迹定义为c_{≤r}=(t₁,t₂,...,t_{m(r)})。然后我们要求模型基于原始数学问题x和截断推理踪迹c_{≤r}直接产生数值预测。³³³这是通过在截断推理踪迹之后添加</think>,然后追加简短前缀来引发数值答案预测来实现的(详见§F.1)。

### 4.2 评估指标

我们使用以下指标对截断比率r∈ℛ上的性能进行评估。⁴⁴⁴

相似文章

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。

潜在推理模型是否易于解释?

Lobsters Hottest

该论文研究了潜在推理模型的可解释性,发现推理令牌通常不是必要的,但在需要时可以被解码以显示可解释的痕迹,表明这些模型实现了预期的解决方案。