PluraMath:将数学推理评估扩展到高资源语言之外

arXiv cs.CL 论文

摘要

PluraMath 将 PolyMath 数据集扩展到 18 种未被充分代表的语言,提供了一个经过人工验证的基准,用于评估 LLM 中的多语言数学推理。该论文揭示了在 27 个模型中,高资源和低资源语言之间持续存在的性能差距。

arXiv:2607.05992v1 Announce Type: new 摘要:数学推理已成为评估和微调推理型大语言模型(LLM)的核心任务,但现有基准仍严重偏向高资源语言,英语和中文主导了预训练语料库和评估套件。最近发布的 PolyMath(Wang et al., 2025)数据集向前迈出了重要一步,但其覆盖范围仍仅限于 18 种高资源语言。为解决这一差距,我们引入了 PluraMath,将 PolyMath 扩展到额外的 18 种{未被充分代表的语言,涵盖 6 个语系——从中资源到极低资源设置。我们通过人工策划的流程构建数据集,由母语者彻底验证预计算的翻译。使用 PluraMath,我们对 27 个推理型 LLM 在四个模型规模(小型、中型、大型和闭源集成模型)上进行了基准测试,探究了最先进模型在不同语言条件下的多语言数学推理能力。我们的细粒度分析证实,高资源和未被充分代表语言之间的数学推理性能存在持续差距,且更强的结果通常与更好的指令遵循能力相关。我们完全开源了数据集、数据获取流程和评估框架,旨在降低为未被充分代表社区开发多语言基准的门槛。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:42

# PluraMath: 将数学推理评估扩展至低资源语言
来源: https://arxiv.org/abs/2607.05992
作者: Daryna Dementieva (https://arxiv.org/search/cs?searchtype=author&query=Dementieva,+D), Nikolay Babakov (https://arxiv.org/search/cs?searchtype=author&query=Babakov,+N), Kathy Hämmerl (https://arxiv.org/search/cs?searchtype=author&query=H%C3%A4mmerl,+K), Ilseyar Alimova (https://arxiv.org/search/cs?searchtype=author&query=Alimova,+I), Jindřich Libovický (https://arxiv.org/search/cs?searchtype=author&query=Libovick%C3%BD,+J), Shu Okabe (https://arxiv.org/search/cs?searchtype=author&query=Okabe,+S), Miras Baisbay (https://arxiv.org/search/cs?searchtype=author&query=Baisbay,+M), Lukas Edman (https://arxiv.org/search/cs?searchtype=author&query=Edman,+L), Abrorkhon Inomkhujaev (https://arxiv.org/search/cs?searchtype=author&query=Inomkhujaev,+A), Antonia Karamolegkou (https://arxiv.org/search/cs?searchtype=author&query=Karamolegkou,+A), Mateusz Lango (https://arxiv.org/search/cs?searchtype=author&query=Lango,+M), Volkan Özer (https://arxiv.org/search/cs?searchtype=author&query=%C3%96zer,+V), Nikola Selic (https://arxiv.org/search/cs?searchtype=author&query=Selic,+N), Subhankar Swain (https://arxiv.org/search/cs?searchtype=author&query=Swain,+S), Tsedeniya Kinfe Temesgen (https://arxiv.org/search/cs?searchtype=author&query=Temesgen,+T+K), Galit Bary Weisberg (https://arxiv.org/search/cs?searchtype=author&query=Weisberg,+G+B), Alexander Fraser (https://arxiv.org/search/cs?searchtype=author&query=Fraser,+A)

查看 PDF (https://arxiv.org/pdf/2607.05992)

> 摘要: 数学推理已成为评估和调优推理型大语言模型(LLMs)的核心任务,但现有基准仍然严重偏向高资源语言,英语和中文在预训练语料和评估套件中占据主导地位。最近发布的 PolyMath (Wang et al., 2025) 数据集迈出了重要一步,但其覆盖范围仍仅限于 18 种高资源语言。为弥补这一不足,我们引入了 PluraMath,将 PolyMath 扩展至另外 18 种代表性不足的语言,涵盖 6 个语系——从中等资源到极低资源领域。我们通过人工策划的流水线构建数据集,由母语者彻底验证预计算翻译。利用 PluraMath,我们随后对 27 个推理型 LLM 进行了基准测试,覆盖四个模型规模——小型、中型、大型以及闭源集成模型——探究最先进模型在不同语言条件下的多语言数学推理能力。我们的细粒度分析证实,高资源语言与代表性不足语言之间的数学推理性能差距持续存在,更强的结果大多与更好的指令遵循能力相关。我们完全开源了数据集、数据采集流水线和评估框架,旨在降低代表性不足社区开发多语言基准的门槛。

## 提交历史

来自: Daryna Dementieva [查看邮件 (https://arxiv.org/show-email/4966295c/2607.05992)] **[v1]** 2026年7月7日星期二 08:25:29 UTC (6,751 KB)

相似文章

低资源语言数学教育中的大语言模型:僧伽罗语和泰米尔语研究

arXiv cs.CL

本文评估了大语言模型在僧伽罗语和泰米尔语(两种资源匮乏的南亚语言)中的数学推理能力,采用独立编写问题的平行数据集进行评估。研究表明,虽然基础算术在跨语言间转移良好,但复杂推理任务在非英语语言中表现出显著性能下降,这对在多语言教育环境中部署AI辅导工具具有重要启示。

多语言中数学推理的LLM参数:共享还是独立?

arXiv cs.CL

本文提出了一种跨语言的LLM数学推理机制分析,发现数学相关参数在不同语言之间存在部分重叠,主要集中于中间层。英语拥有最大规模的数学相关参数集,而低资源语言则拥有较小的参数集。

MathNet:一个面向数学推理与检索的全球多模态基准

Hugging Face Daily Papers

# 论文页面 - MathNet:一个面向数学推理与检索的全球多模态基准 来源:[https://huggingface.co/papers/2604.18584](https://huggingface.co/papers/2604.18584) ## 摘要 MathNet 是一个大规模、多语言、多模态的奥赛级数学问题数据集,旨在评估生成式模型和基于嵌入的系统中的数学推理与检索能力。数学问题解决对于大型语言和多模态模型而言仍是一项极具挑战性的推理测试。