更少语言、更少Token:高效统一逻辑跨语言链式思维推理框架

arXiv cs.CL 论文

摘要

UL-XCoT在统一逻辑空间中剪枝低质量多语言推理路径,削减>50% token开销,同时提升低资源语言的准确率与鲁棒性。

arXiv:2604.20090v1 Announce Type: new 摘要:跨语言链式思维(XCoT)配合自一致性显著提升多语言推理能力,但现有方法因在各语言上大量采样完整轨迹而成本高昂。此外,多语言LLM表示随语言差异显著,阻碍直接特征比较与有效剪枝。受此启发,我们提出UL-XCoT,首个高效统一逻辑跨语言推理框架,在推理阶段有限采样预算下最大限度减少token与延迟冗余。具体而言,UL-XCoT(1)通过“每查询在语言无关统一逻辑空间中精选少量候选语言”实现更少语言,(2)在解码过程中监控逻辑空间轨迹动态以剪枝低质量推理路径,实现更少token,(3)对剩余高质量轨迹投票聚合。在覆盖18种语言的PolyMath与覆盖29种语言的MMLU-ProX-Lite上,使用DeepSeek-R1-DistillQwen-7B的实验表明,UL-XCoT在保持竞争力的准确率同时,较以往采样基线锐减超50%解码token成本。UL-XCoT在低资源语言上带来更稳定提升,凸显其在标准XCoT自一致性方法失效场景下的持续卓越鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/04/23 10:03

# 更少语言,更少 Token:一种高效的统一逻辑跨语言思维链推理框架  
来源:https://arxiv.org/html/2604.20090  
张晨远¹,⁶ 陈启光²¹ 陈谢⁵,⁶ 田卓涛¹ 邢博文⁴ 张美珊¹ 秦立波¹,²,³ 胡宝田¹ 张民¹  
¹ 哈尔滨工业大学(深圳) ² 中南大学 ³ 贵州大学 文本计算与认知智能教育部工程研究中心 ⁴ 北京科技大学 ⁵ 上海交通大学 ⁶ 上海创智学院  
[email protected][email protected][email protected]  

###### 摘要  
跨语言思维链(XCoT)结合自洽性可显著提升多语言推理,但现有方法因在全语种上完整采样轨迹而开销巨大。此外,多语言 LLM 的表示随语言差异剧烈,难以直接比较特征并剪枝。为此,我们提出 UL-XCoT——首个高效统一逻辑跨语言推理框架,在推理采样预算受限时极大压缩 token 与延迟。具体地,UL-XCoT(1)在统一逻辑空间中为每查询动态精选少量候选语言,实现“更少语言”;(2)在解码过程中监控逻辑轨迹动态,提前剪枝低质量路径,实现“更少 token”;(3)对剩余高质量轨迹投票聚合。在 18 种语言的 PolyMath 与 29 种语言的 MMLU-ProX-Lite 上,基于 DeepSeek-R1-Distill-Qwen-7B 的实验表明,UL-XCoT 在保持竞争力的准确率同时,解码 token 成本较以往采样基线降低 50% 以上;在低资源语言上增益更稳定,凸显其鲁棒性。

---

## 1 引言  
图 1:传统 XCoT 采样(a)需生成所有语种完整轨迹;统一逻辑 XCoT(UL-XCoT)高效采样(b)通过统一逻辑机制精选语言并选择性生成轨迹。  

多语言大模型(MLLM)已展现强大推理与泛化能力,而跨语言思维链(XCoT)可进一步激发其潜能。XCoT 让输入与中间步骤使用不同语言,有效激活核心推理能力。随着研究深入,XCoT 借自洽性通过测试时扩展采样多条轨迹并投票,获得越来越高的关注。然而,如图 1(a) 所示,现有方法存在两大痛点:  
1. 全语种采样:必须生成全部候选语言;  
2. 全轨迹推理:必须生成每条完整推理路径。  

冗余计算随语种数线性增长,产生大量无效 token。  

为此,我们提出统一逻辑跨语言思维链自洽框架 UL-XCoT,通过“候选语言选择(CLS)”与“动态思维链剪枝(DCP)”两大模块提升效率。如图 1(b),UL-XCoT 首先构建统一逻辑空间,使跨语言推理状态可比较;随后 CLS 在该空间内评估并精选与查询最相关的少量语种(更少语言);解码时 DCP 实时追踪各语种 CoT 演变,动态剪枝逻辑不一致路径(更少 token);最后对剩余高质量轨迹投票,兼顾成本与质量。  

在 PolyMath(18 语种)与 MMLU-ProX-Lite(29 语种)上的实验表明,UL-XCoT 在 DeepSeek-R1-Distill-Qwen-7B 上实现显著的精度-效率权衡:PolyMath 上难度加权准确率有竞争力的同时,平均生成 token 较 AUTOCAP 减少 50% 以上,较 SC 减少 65% 以上;在 MMLU-ProX-Lite 上同样保持效率优势。低资源语言子集上增益更稳定,凸显鲁棒性。  

贡献总结:  
- 指出以往跨语言集成推理“全语种枚举”假设带来的冗余计算本质缺陷;  
- 提出 UL-XCoT,从“更少语言”与“更少 token”两维度提升 XCoT 自洽效率;  
- 实验验证 UL-XCoT 在大幅降低推理成本的同时保持精度,尤其在低资源语言上效果显著。

---

## 2 方法  
图 2:UL-XCoT 总体框架,包括(i)统一逻辑机制,(ii)候选语言选择,(iii)动态思维链剪枝。  

给定查询 xx 以语言 ℓ 书写,UL-XCoT 引入统一逻辑机制,使不同语言的推理状态可比较、可度量。

### 2.1 总体流程  
形式化地,设 L={ℓ₁,…,ℓ_M} 为所有语言集合,f_θ 为 MLLM,A 为答案空间。整体推理输出  
â = UL-XCoT_θ(x|f_θ) ∈ A  
分四阶段:  
1. 构建统一逻辑机制:通过共享投影算子 P^(m)_shared 在层 m 建立跨语言可比逻辑空间;  
2. 候选语言选择:在该空间内计算理解相似度,精选 top-k 语种 L_par(x),实现更少语言;  
3. 并行 XCoT 解码:对每 ℓ∈L_par(x) 逐 token 生成轨迹 x_ℓ,并用时变置信信号动态剪枝低质量路径,保留语言子集 S(x)⊆L_par(x),对应轨迹 S*(x)={x_ℓ:ℓ∈S(x)},实现更少 token;  
4. 投票聚合:从每条幸存轨迹提取答案 a_ℓ,经投票算子 V 得最终 â=V({a_ℓ:ℓ∈S(x)})。

下文详述:  
1. 统一逻辑机制(ULM)  
2. 候选语言选择(CLS)  
3. 动态思维链剪枝(DCP)

### 2.2 统一逻辑机制  
为公平比较跨语言推理行为,需抑制语言表层差异,保留任务相关结构。我们构建统一逻辑空间,其信号作为 CLS(§2.3)与 DCP(§2.4)的决策依据。  

令 H_m(x_ℓ)∈ℝ^d 为语言 ℓ 样本在 Transformer 层 m 的隐状态。用固定验证集 X_val={x^i_{ℓ_i}} 获得各语言同义样本,定义语言中心  
μ^(m)_ℓ = 1/|X_val| ∑ H_m(x^i_ℓ)  
堆叠所有中心得 multilingual shift 矩阵  
M^(m) = [μ^(m)_ℓ₁, …, μ^(m)_ℓ_|L|] ∈ ℝ^{d×|L|}  
对其 SVD:M^(m)=U^(m)Σ^(m)V^(m)⊤,取前 r 左奇异向量作为语言变化子空间基  
B^(m)_lang = U^(m)_:,1:r  
其正交补定义跨语言共享子空间,投影算子  
P^(m)_shared = I − λ B^(m)_lang B^(m)⊤_lang  
任意输入经投影得统一逻辑表示  
H̃_m(x_ℓ) = P^(m)_shared H^(m)(x_ℓ)

### 2.3 候选语言选择  
CLS 在统一逻辑空间内预筛语种,无需生成,仅利用隐状态衡量理解一致性。  

##### 理解相似度分数(USS)  
对查询 x_ℓ 与候选语言 ℓ′,构造语义等价输入 x_ℓ′,在分析层 a 取最后 token 投影表示 H̃_a(x_ℓ)、H̃_a(x_ℓ′),定义  
USS(x_ℓ,x_ℓ′) = ⟨H̃_a(x_ℓ), H̃_a(x_ℓ′)⟩ / (‖H̃_a(x_ℓ)‖₂‖H̃_a(x_ℓ′)‖₂)  

##### 候选集选择  
按 USS 得分取 top-k:  
L_par(x_ℓ) = Top-k_{ℓ′∈L} USS(x_ℓ,x_ℓ′)  
仅在该集合上做并行 XCoT 采样,实现查询自适应的“更少语言”。

相似文章

MUX:基于多路复用令牌的连续推理

arXiv cs.AI

MUX 提出了一种无损连续推理的方法,通过将离散推理步骤蒸馏到多路复用的潜在令牌中,这些令牌编码了子词的叠加,实现了更高的带宽,并在语言模型推理任务中支持并行探索。

面向多语言推理的跨语言在线策略自蒸馏

Hugging Face Daily Papers

本文提出了跨语言在线策略自蒸馏(COPSD)方法,该方法通过共享的学生-教师架构,将高资源语言的推理能力迁移到低资源语言中。在17种非洲语言上的实验表明,该方法的数学推理能力和答案格式遵循度均得到显著提升,性能优于组相对策略优化(GRPO)。

SuperThoughts:叠加态中的推理令牌

arXiv cs.LG

SuperThoughts 将连续的思维链令牌压缩为潜在表示,并每步解码两个令牌,在数学推理基准上实现了约20-30%的思维链长度缩减,准确率损失极小,同时将推理吞吐量提高了一倍。