技能差异:LLM中的技能是否具有语言不变性?
摘要
本文通过基于文本游戏的多语言自我对弈,量化了大语言模型在跨语言技能上的不一致性,揭示了不同语言间显著的性能差异,且这种差异可通过改变中间推理语言得到部分缓解。
查看缓存全文
缓存时间: 2026/08/27 15:20
论文页面 - 技能问题:LLM中的技能是否与语言无关?
来源:https://huggingface.co/papers/2608.25832
摘要
多语言自对弈研究发现,大型语言模型在推理和策略方面表现出显著的跨语言技能不一致性,其中部分不一致性可通过改变中间推理语言来恢复。
大型语言模型在不同语言间获取知识存在不一致性,但其在不同语言交互时技能集的差异程度如何?本研究从知识和通用基准性能之外的维度,量化了跨语言技能不一致性的程度。我们通过多语言自对弈实现这一目标:同一模型的两个实例在一个文本游戏中对战,各自使用不同的语言接口进行交互。由于模型、对手、规则、状态空间及可用操作均保持不变,该实验设置隔离了语言对模型实际行为的影响。我们为TextArena构建了多语言扩展版本,并评估了三个开放权重模型在八种语言和六种游戏中的表现,这些游戏涵盖空间推理、不完全信息、资源分配和重复交互。研究发现同一模型在不同语言中可能表现出显著不同的对战胜率,且胜负差距、无效动作及策略倾向存在系统性差异。详细分析揭示了空间推理、特定手牌决策和最优操作选择中存在语言特异性失败。在某些设置中,仅改变中间推理语言就能恢复大部分性能损失,表明语言可能影响决策过程的不同阶段。这些结果表明技能差异是开发真正多语言模型道路上一个可测量的主要障碍。更好地理解这些差异有助于我们设计在不同语言间表现更均衡的模型。
查看arXiv页面 (https://arxiv.org/abs/2608.25832)查看PDF (https://arxiv.org/pdf/2608.25832)GitHub421 (https://github.com/TextArena/TextArena)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.25832)
在您的代理中获取此论文:
hf papers read 2608\.25832
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2608.25832以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2608.25832以从此页面链接。
引用此论文的空间0
没有空间关联此论文
在空间README.md中引用arxiv.org/abs/2608.25832以从此页面链接。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
推理大语言模型中的隐藏语言一致性现象
本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。
跨模态技能注入研究:场景、方法与超参数
本文系统研究了跨模态技能注入,将领域专家大语言模型融入视觉语言模型以激发新兴多模态能力。评估了不同场景(指令遵循、跨语言、数学推理)、融合方法(TA、DARE等)及超参数,发现TA和DARE在除数学推理外表现良好。
技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
XLGoBench: 通过算法任务检测跨语言技能差距
XLGoBench 引入了一个合成算法任务基准,用于检测大语言模型中的跨语言技能差距,并在多个先进模型中展示了持续的差距。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。