技能差异:LLM中的技能是否具有语言不变性?

Hugging Face Daily Papers 论文

摘要

本文通过基于文本游戏的多语言自我对弈,量化了大语言模型在跨语言技能上的不一致性,揭示了不同语言间显著的性能差异,且这种差异可通过改变中间推理语言得到部分缓解。

大语言模型在不同语言间获取知识的能力存在不一致性,但在与不同语言交互时,其技能集的差异程度如何?本研究从知识与常规基准性能之外,正交地量化了跨语言技能的不一致性。我们通过多语言自我对弈实现这一目标:同一模型的两个实例在文本游戏中竞争,各自通过不同的语言接口进行交互。由于模型、对手、规则、状态空间和可用动作保持不变,该设定隔离了语言对模型实际行为的影响。我们构建了 TextArena 的多语言扩展版本,并在八种语言和六种游戏中评估了三个开源权重模型,这些游戏涵盖空间推理、不完全信息、资源分配和重复互动。研究发现,同一模型在不同语言下可能表现出显著不同的游戏强度,在胜负差距、无效动作和策略倾向上存在系统性差异。详细分析揭示了在空间推理、基于条件的决策及最优动作选择中出现的特定语言失效。在某些设置下,仅改变中间推理语言就能恢复大部分损失的性能,这表明语言可能影响决策过程的不同阶段。这些结果表明,技能差异是发展真正多语言模型过程中一个可量化的主要障碍。更好地理解这些差异有助于我们设计在不同语言间表现更为均衡的模型。
查看原文
查看缓存全文

缓存时间: 2026/08/27 15:20

论文页面 - 技能问题:LLM中的技能是否与语言无关?

来源:https://huggingface.co/papers/2608.25832

摘要

多语言自对弈研究发现,大型语言模型在推理和策略方面表现出显著的跨语言技能不一致性,其中部分不一致性可通过改变中间推理语言来恢复。

大型语言模型在不同语言间获取知识存在不一致性,但其在不同语言交互时技能集的差异程度如何?本研究从知识和通用基准性能之外的维度,量化了跨语言技能不一致性的程度。我们通过多语言自对弈实现这一目标:同一模型的两个实例在一个文本游戏中对战,各自使用不同的语言接口进行交互。由于模型、对手、规则、状态空间及可用操作均保持不变,该实验设置隔离了语言对模型实际行为的影响。我们为TextArena构建了多语言扩展版本,并评估了三个开放权重模型在八种语言和六种游戏中的表现,这些游戏涵盖空间推理、不完全信息、资源分配和重复交互。研究发现同一模型在不同语言中可能表现出显著不同的对战胜率,且胜负差距、无效动作及策略倾向存在系统性差异。详细分析揭示了空间推理、特定手牌决策和最优操作选择中存在语言特异性失败。在某些设置中,仅改变中间推理语言就能恢复大部分性能损失,表明语言可能影响决策过程的不同阶段。这些结果表明技能差异是开发真正多语言模型道路上一个可测量的主要障碍。更好地理解这些差异有助于我们设计在不同语言间表现更均衡的模型。

查看arXiv页面 (https://arxiv.org/abs/2608.25832)查看PDF (https://arxiv.org/pdf/2608.25832)GitHub421 (https://github.com/TextArena/TextArena)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.25832)

在您的代理中获取此论文:

hf papers read 2608\.25832

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2608.25832以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2608.25832以从此页面链接。

引用此论文的空间0

没有空间关联此论文

在空间README.md中引用arxiv.org/abs/2608.25832以从此页面链接。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。

跨模态技能注入研究:场景、方法与超参数

arXiv cs.CL

本文系统研究了跨模态技能注入,将领域专家大语言模型融入视觉语言模型以激发新兴多模态能力。评估了不同场景(指令遵循、跨语言、数学推理)、融合方法(TA、DARE等)及超参数,发现TA和DARE在除数学推理外表现良好。