更少语言、更少Token:高效统一逻辑跨语言链式思维推理框架
摘要
UL-XCoT在统一逻辑空间中剪枝低质量多语言推理路径,削减>50% token开销,同时提升低资源语言的准确率与鲁棒性。
arXiv:2604.20090v1 Announce Type: new
摘要:跨语言链式思维(XCoT)配合自一致性显著提升多语言推理能力,但现有方法因在各语言上大量采样完整轨迹而成本高昂。此外,多语言LLM表示随语言差异显著,阻碍直接特征比较与有效剪枝。受此启发,我们提出UL-XCoT,首个高效统一逻辑跨语言推理框架,在推理阶段有限采样预算下最大限度减少token与延迟冗余。具体而言,UL-XCoT(1)通过“每查询在语言无关统一逻辑空间中精选少量候选语言”实现更少语言,(2)在解码过程中监控逻辑空间轨迹动态以剪枝低质量推理路径,实现更少token,(3)对剩余高质量轨迹投票聚合。在覆盖18种语言的PolyMath与覆盖29种语言的MMLU-ProX-Lite上,使用DeepSeek-R1-DistillQwen-7B的实验表明,UL-XCoT在保持竞争力的准确率同时,较以往采样基线锐减超50%解码token成本。UL-XCoT在低资源语言上带来更稳定提升,凸显其在标准XCoT自一致性方法失效场景下的持续卓越鲁棒性。
查看缓存全文
缓存时间: 2026/04/23 10:03
# 更少语言,更少 Token:一种高效的统一逻辑跨语言思维链推理框架 来源:https://arxiv.org/html/2604.20090 张晨远¹,⁶ 陈启光²¹ 陈谢⁵,⁶ 田卓涛¹ 邢博文⁴ 张美珊¹ 秦立波¹,²,³ 胡宝田¹ 张民¹ ¹ 哈尔滨工业大学(深圳) ² 中南大学 ³ 贵州大学 文本计算与认知智能教育部工程研究中心 ⁴ 北京科技大学 ⁵ 上海交通大学 ⁶ 上海创智学院 [email protected] [email protected] [email protected] ###### 摘要 跨语言思维链(XCoT)结合自洽性可显著提升多语言推理,但现有方法因在全语种上完整采样轨迹而开销巨大。此外,多语言 LLM 的表示随语言差异剧烈,难以直接比较特征并剪枝。为此,我们提出 UL-XCoT——首个高效统一逻辑跨语言推理框架,在推理采样预算受限时极大压缩 token 与延迟。具体地,UL-XCoT(1)在统一逻辑空间中为每查询动态精选少量候选语言,实现“更少语言”;(2)在解码过程中监控逻辑轨迹动态,提前剪枝低质量路径,实现“更少 token”;(3)对剩余高质量轨迹投票聚合。在 18 种语言的 PolyMath 与 29 种语言的 MMLU-ProX-Lite 上,基于 DeepSeek-R1-Distill-Qwen-7B 的实验表明,UL-XCoT 在保持竞争力的准确率同时,解码 token 成本较以往采样基线降低 50% 以上;在低资源语言上增益更稳定,凸显其鲁棒性。 --- ## 1 引言 图 1:传统 XCoT 采样(a)需生成所有语种完整轨迹;统一逻辑 XCoT(UL-XCoT)高效采样(b)通过统一逻辑机制精选语言并选择性生成轨迹。 多语言大模型(MLLM)已展现强大推理与泛化能力,而跨语言思维链(XCoT)可进一步激发其潜能。XCoT 让输入与中间步骤使用不同语言,有效激活核心推理能力。随着研究深入,XCoT 借自洽性通过测试时扩展采样多条轨迹并投票,获得越来越高的关注。然而,如图 1(a) 所示,现有方法存在两大痛点: 1. 全语种采样:必须生成全部候选语言; 2. 全轨迹推理:必须生成每条完整推理路径。 冗余计算随语种数线性增长,产生大量无效 token。 为此,我们提出统一逻辑跨语言思维链自洽框架 UL-XCoT,通过“候选语言选择(CLS)”与“动态思维链剪枝(DCP)”两大模块提升效率。如图 1(b),UL-XCoT 首先构建统一逻辑空间,使跨语言推理状态可比较;随后 CLS 在该空间内评估并精选与查询最相关的少量语种(更少语言);解码时 DCP 实时追踪各语种 CoT 演变,动态剪枝逻辑不一致路径(更少 token);最后对剩余高质量轨迹投票,兼顾成本与质量。 在 PolyMath(18 语种)与 MMLU-ProX-Lite(29 语种)上的实验表明,UL-XCoT 在 DeepSeek-R1-Distill-Qwen-7B 上实现显著的精度-效率权衡:PolyMath 上难度加权准确率有竞争力的同时,平均生成 token 较 AUTOCAP 减少 50% 以上,较 SC 减少 65% 以上;在 MMLU-ProX-Lite 上同样保持效率优势。低资源语言子集上增益更稳定,凸显鲁棒性。 贡献总结: - 指出以往跨语言集成推理“全语种枚举”假设带来的冗余计算本质缺陷; - 提出 UL-XCoT,从“更少语言”与“更少 token”两维度提升 XCoT 自洽效率; - 实验验证 UL-XCoT 在大幅降低推理成本的同时保持精度,尤其在低资源语言上效果显著。 --- ## 2 方法 图 2:UL-XCoT 总体框架,包括(i)统一逻辑机制,(ii)候选语言选择,(iii)动态思维链剪枝。 给定查询 xx 以语言 ℓ 书写,UL-XCoT 引入统一逻辑机制,使不同语言的推理状态可比较、可度量。 ### 2.1 总体流程 形式化地,设 L={ℓ₁,…,ℓ_M} 为所有语言集合,f_θ 为 MLLM,A 为答案空间。整体推理输出 â = UL-XCoT_θ(x|f_θ) ∈ A 分四阶段: 1. 构建统一逻辑机制:通过共享投影算子 P^(m)_shared 在层 m 建立跨语言可比逻辑空间; 2. 候选语言选择:在该空间内计算理解相似度,精选 top-k 语种 L_par(x),实现更少语言; 3. 并行 XCoT 解码:对每 ℓ∈L_par(x) 逐 token 生成轨迹 x_ℓ,并用时变置信信号动态剪枝低质量路径,保留语言子集 S(x)⊆L_par(x),对应轨迹 S*(x)={x_ℓ:ℓ∈S(x)},实现更少 token; 4. 投票聚合:从每条幸存轨迹提取答案 a_ℓ,经投票算子 V 得最终 â=V({a_ℓ:ℓ∈S(x)})。 下文详述: 1. 统一逻辑机制(ULM) 2. 候选语言选择(CLS) 3. 动态思维链剪枝(DCP) ### 2.2 统一逻辑机制 为公平比较跨语言推理行为,需抑制语言表层差异,保留任务相关结构。我们构建统一逻辑空间,其信号作为 CLS(§2.3)与 DCP(§2.4)的决策依据。 令 H_m(x_ℓ)∈ℝ^d 为语言 ℓ 样本在 Transformer 层 m 的隐状态。用固定验证集 X_val={x^i_{ℓ_i}} 获得各语言同义样本,定义语言中心 μ^(m)_ℓ = 1/|X_val| ∑ H_m(x^i_ℓ) 堆叠所有中心得 multilingual shift 矩阵 M^(m) = [μ^(m)_ℓ₁, …, μ^(m)_ℓ_|L|] ∈ ℝ^{d×|L|} 对其 SVD:M^(m)=U^(m)Σ^(m)V^(m)⊤,取前 r 左奇异向量作为语言变化子空间基 B^(m)_lang = U^(m)_:,1:r 其正交补定义跨语言共享子空间,投影算子 P^(m)_shared = I − λ B^(m)_lang B^(m)⊤_lang 任意输入经投影得统一逻辑表示 H̃_m(x_ℓ) = P^(m)_shared H^(m)(x_ℓ) ### 2.3 候选语言选择 CLS 在统一逻辑空间内预筛语种,无需生成,仅利用隐状态衡量理解一致性。 ##### 理解相似度分数(USS) 对查询 x_ℓ 与候选语言 ℓ′,构造语义等价输入 x_ℓ′,在分析层 a 取最后 token 投影表示 H̃_a(x_ℓ)、H̃_a(x_ℓ′),定义 USS(x_ℓ,x_ℓ′) = ⟨H̃_a(x_ℓ), H̃_a(x_ℓ′)⟩ / (‖H̃_a(x_ℓ)‖₂‖H̃_a(x_ℓ′)‖₂) ##### 候选集选择 按 USS 得分取 top-k: L_par(x_ℓ) = Top-k_{ℓ′∈L} USS(x_ℓ,x_ℓ′) 仅在该集合上做并行 XCoT 采样,实现查询自适应的“更少语言”。
相似文章
MUX:基于多路复用令牌的连续推理
MUX 提出了一种无损连续推理的方法,通过将离散推理步骤蒸馏到多路复用的潜在令牌中,这些令牌编码了子词的叠加,实现了更高的带宽,并在语言模型推理任务中支持并行探索。
面向多语言推理的跨语言在线策略自蒸馏
本文提出了跨语言在线策略自蒸馏(COPSD)方法,该方法通过共享的学生-教师架构,将高资源语言的推理能力迁移到低资源语言中。在17种非洲语言上的实验表明,该方法的数学推理能力和答案格式遵循度均得到显著提升,性能优于组相对策略优化(GRPO)。
SuperThoughts:叠加态中的推理令牌
SuperThoughts 将连续的思维链令牌压缩为潜在表示,并每步解码两个令牌,在数学推理基准上实现了约20-30%的思维链长度缩减,准确率损失极小,同时将推理吞吐量提高了一倍。
当大型语言模型发展语言:用于高效多智能体推理的符号通信
本文提出通信语言符号路由(CLSR),多个LLM智能体自主发明并演化紧凑的符号语言进行推理,相比思维链(CoT)实现3-6倍的令牌减少,同时保持准确性。
低资源东南亚语言中的原生多语言思维链推理
介绍了OSCD,一种后训练算法,用于改进低资源东南亚语言中的原生多语言思维链推理,在数学基准上实现了高达3.2倍的提升。