构建多语言桥梁:数据混合作为语言内推理泛化的支柱
摘要
本文提出通过优化监督微调中的数据混合,使推理模型能够在60种语言中实现语言内推理的泛化,模型在多个基准测试中L2推理率超过93%。
查看缓存全文
缓存时间: 2026/09/11 18:18
论文页面 - 构建多语言桥梁:数据混合成为语言内推理泛化的支柱
来源:https://huggingface.co/papers/2609.10445
摘要
经过优化的监督微调数据组合使推理模型能够在无需为目标语言提供推理监督的情况下,一致地处理和回应多种非英语语言。
推理语言模型(https://huggingface.co/papers?q=Reasoning%20language%20models)在各种复杂任务上取得了重大进展,但其能力仍然严重偏向英语:无论提示语言是什么,模型主要用英语进行推理。这对非英语用户来说难以使用,存在丢失原始问题意图的风险,并且无法充分利用目标语言中更易表达的知识。在这项工作中,我们推进了 L2 推理(https://huggingface.co/papers?q=L2%20reasoning),即模型用用户提示的语言一致进行推理的能力,从而在提示和答案之间构建一座语言内的桥梁。我们从数据角度出发,研究如何在 SFT(https://huggingface.co/papers?q=SFT)中优化数据组合(https://huggingface.co/papers?q=data%20composition)和调度以实现推理泛化(https://huggingface.co/papers?q=reasoning%20generalization)。构建规模为 3.35B 的 Tiny Aya L2-Thinker,我们在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的 6 个基准测试中,在 60 种语言上实现了超过 93% 的 L2 推理(https://huggingface.co/papers?q=L2%20reasoning)率,同时保持了强大的性能。我们表明,将 L2 推理(https://huggingface.co/papers?q=L2%20reasoning)泛化到未包含语言的路径,在于更广泛的语言覆盖、 readily available 的多语言非推理数据以及充分的英语推理基础。这些发现表明,推理是一种与语言无关的行为,可以通过精心的数据混合转移到类型多样的语言中,而无需在每种目标语言中提供推理监督。我们发布了模型权重和多语言推理(https://huggingface.co/papers?q=multilingual%20reasoning)数据,以支持关于可访问、语言内推理的进一步研究。
查看 arXiv 页面(https://arxiv.org/abs/2609.10445)查看 PDF(https://arxiv.org/pdf/2609.10445)项目页面(https://cohere.com/research/papers/building-multilingual-bridges-2026-09-10)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.10445)
将此论文添加到你的智能体:
hf papers read 2609.10445
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 2
CohereLabs/tiny-aya-l2-thinker 文本生成 • 3B • 约 9 小时前更新 • 48 • 7(https://huggingface.co/CohereLabs/tiny-aya-l2-thinker)
CohereLabs/tiny-aya-en-thinker 文本生成 • 3B • 约 9 小时前更新 • 22 • 6(https://huggingface.co/CohereLabs/tiny-aya-en-thinker)
引用本文的数据集 1
CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning 查看器 • 约 9 小时前更新 • 286k • 119 • 1(https://huggingface.co/datasets/CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning)
引用本文的空间 0
无链接到本文的空间
在空间的 README.md 中引用 arxiv.org/abs/2609.10445 以从本页面链接。
包含本文的收藏夹 0
无包含本文的收藏夹
将本文添加到收藏夹(https://huggingface.co/new-collection)以从本页面链接。
相似文章
多语言思维,而非更难的思维:教授推理模型代码切换的数据高效框架
本文介绍了一个数据高效的微调框架,用于教授推理模型有效地进行代码切换(混合使用多种语言),证明了战略性的代码切换可以提升低资源语言的推理能力。该工作分析了大型语言模型在不同语言、任务和领域中的代码切换行为,并开发了促进有益代码切换模式的干预措施。
通过可操控模型合并增强多语言推理
本文提出ST-Merge,一种可操控的模型合并框架,利用门控交叉注意力机制自适应地调节多语言模型和推理模型的贡献,在涵盖21种语言的多语言推理基准测试中优于固定合并方法。
使用Layer Swap重新思考多语言推理差距
本文重新审视了LLM中的多语言推理差距,发现在可比较的监督条件下,该差距比先前报告的要小。本文引入了Layer Swap,它将来自英语推理专家的中间层权重转移到母语专家,几乎消除了这一差距,同时保留了母语链式思维。
大规模推理模型(尚)不是多语言潜在推理器
本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。
大语言模型预训练的数据混合:综述与展望
# 大语言模型预训练的数据混合:综述与展望 来源:[https://arxiv.org/abs/2604.16380](https://arxiv.org/abs/2604.16380) [查看 PDF](https://arxiv.org/pdf/2604.16380) > 摘要:大型语言模型(LLMs)依赖于在海量且异构的语料上进行预训练,在现实中的计算和数据预算限制下,训练数据的构成对训练效率和下游泛化能力有着决定性的影响。与样本级的数据选择不同,数据混