XLGoBench: 通过算法任务检测跨语言技能差距
摘要
XLGoBench 引入了一个合成算法任务基准,用于检测大语言模型中的跨语言技能差距,并在多个先进模型中展示了持续的差距。
arXiv:2605.30788v1 公告类型: 新
摘要: 我们引入了一组合成算法任务,用于检测大语言模型在能力上的跨语言差距。我们的基准在不同语言之间具有可比性,因为它要求模型用不同语言执行相同的底层任务;具有可扩展性,因为每个任务可以在不同复杂度级别上生成,从而适应不同能力的模型;具有可量化性,因为每个任务都有客观的正确性概念;并且具有透明性,因为任务是从简单的模板生成的,可以轻松审计翻译错误。由于我们的基准聚焦于算法任务,性能差异是跨语言差距的充分但不必要的指标。尽管如此,我们通过大量实验表明,我们的基准揭示了多个最先进模型中的持续跨语言差距。
查看缓存全文
缓存时间: 2026/06/01 09:28
# XLGoBench:通过算法任务检测跨语言技能差距 来源:https://arxiv.org/abs/2605.30788 查看PDF (https://arxiv.org/pdf/2605.30788) > 摘要:我们引入了一组合成算法任务,用于检测大型语言模型在跨语言能力上的差距。我们的基准在语言间具有统一尺度,因为它要求模型使用不同语言执行相同的基础任务;具有可扩展性,因为每个任务可在不同复杂度级别上生成,从而适用于不同能力的模型;具有可量化性,因为每个任务都提供客观的正确性衡量标准;且具有透明性,因为任务由简单模板生成,可方便地审计翻译错误。由于我们的基准聚焦于算法任务,性能差异是跨语言差距的充分——而非必要——指标。尽管如此,通过大量实验,我们表明该基准揭示了多个最先进模型中持续存在的跨语言差距。 ## 提交历史 来自:Suvrat Raju [查看电子邮件 (https://arxiv.org/show-email/2ee2678e/2605.30788)] **[v1]** 2026年5月29日星期五 03:25:32 UTC (1,537 KB)
相似文章
MultiGhostBench:面向分布偏移的多语言长文本LLM生成文本归因基准
MultiGhostBench是一个多语言基准,用于评估分布偏移下长文本LLM生成文本的归因。它包含六种语言的928本书籍,并突出了性能下降以及没有单一方法在所有设置中始终最佳的现象。
衡量跨语言理解差距:证据语言如何影响语言模型的理解
本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。
GaoYao基准:全面评估大模型多语言与多文化能力的新框架
GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。
技能差异:LLM中的技能是否具有语言不变性?
本文通过基于文本游戏的多语言自我对弈,量化了大语言模型在跨语言技能上的不一致性,揭示了不同语言间显著的性能差异,且这种差异可通过改变中间推理语言得到部分缓解。
PolyWorkBench: 多语言长周期LLM智能体基准测试
介绍PolyWorkBench,一个用于评估LLM智能体在多语言长周期职场工作流中的表现的基准测试,涵盖五个领域,并展示了与单语言设置相比显著的性能下降。