PatiGonit22K:用于解决复杂孟加拉语数学应用题的综合数据集

arXiv cs.CL 论文

摘要

介绍了PatiGonit22K,这是一个扩展后的孟加拉语数学应用题数据集,包含22,441个问题,包括复杂的多步运算问题,旨在推动低资源语言数学推理研究的发展。

arXiv:2607.22859v1 公告类型: 新论文 摘要: 数学应用题(MWP)是评估自然语言理解和定量推理的重要基准。尽管在高资源语言方面最近取得了进展,但由于缺乏大规模标注数据集,孟加拉语仍然研究不足。在这项工作中,我们引入了PatiGonit22K,这是一个扩展后的孟加拉语MWP数据集,包含22,441个问题,通过在原PatiGonit数据集基础上扩展大量复杂数学问题而开发。该数据集包括简单和多步运算方程,为评估不同难度级别的数学推理提供了平衡的基准。每个问题都经过仔细翻译、标注、文化适配和验证,以确保语言一致性和数学正确性。通过增加孟加拉语MWP的规模和复杂性,PatiGonit22K为低资源语言中数学推理和教育NLP应用的未来研究提供了更全面的资源。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:27

# PatiGonit22K:一个用于解决复杂孟加拉语数学文字题的综合数据集
来源:https://arxiv.org/html/2607.22859
Swastika Kundu 孟加拉国达卡,阿赫桑努拉科技大学计算机科学与工程系 swastikakundu123@gmail\.com
Azizul Hakim Fayaz 孟加拉国达卡,东南大学计算机科学与工程系 azizulhakimfayaz@gmail\.com
Tashreef Muhammad 孟加拉国达卡,东南大学计算机科学与工程系 tashreef\.muhammad@seu\.edu\.bd

###### 摘要

数学文字题(MWPs)是评估自然语言理解和定量推理的重要基准。尽管资源丰富的语言近期取得了进展,但由于大规模标注数据集的匮乏,孟加拉语的研究仍然不足。本文中,我们介绍了 PatiGonit22K,这是一个扩展的孟加拉语 MWP 数据集,包含 22,441 个问题,通过在原有 PatiGonit 数据集的基础上扩充大量复杂数学问题而构建。该数据集包含简单方程和多操作方程,为不同难度级别的数学推理评估提供了一个均衡的基准。每个问题都经过仔细翻译、标注、文化适应和验证,以确保语言一致性和数学正确性。通过提升孟加拉语 MWP 的规模和复杂性,PatiGonit22K 为未来低资源语言的数学推理和教育 NLP 应用研究提供了更全面的资源。

## 1 引言

尽管数学文字题(MWP)研究取得了显著进展,但大多数公开可用的数据集和基准系统都是为英语和中文等资源丰富的语言开发的。孟加拉语全球有超过 2.3 亿使用者 [5] (https://arxiv.org/html/2607.22859#bib.bib3),是全球使用人数第七多的语言,但由于缺乏大规模标注数据集和领域特定资源,它在 MWP 研究中仍然是一种低资源语言。

PatiGonit 数据集的引入通过提供 10,000 个翻译后的数学文字题,标志着孟加拉语 MWP 的第一个基准。然而,该数据集包含的复杂多操作问题相对较少,限制了其在评估高级数学推理方面的有效性。为解决这一限制,我们引入了 PatiGonit22K,这是一个包含 22,441 个孟加拉语数学文字题的扩展数据集,其中复杂问题的比例大幅增加。该数据集经过仔细翻译、标注和验证,为未来的孟加拉语 MWP 研究提供了一个更全面的基准。

参见图注
图 1:简单方程和复杂方程示例
## 2 相关工作

PatiGonit 数据集的引入标志着孟加拉语数学文字题(MWP)的第一个基准,包含 10,000 个从 MAWPS 数据集改编的翻译算术问题 [2] (https://arxiv.org/html/2607.22859#bib.bib1)。作者评估了多个基于 Transformer 的模型,包括 Basic Transformer、mT5、BanglaT5 和 mBART50,用于从孟加拉语文本生成数学方程。其中,mT5 实现了 97.30% 的最高准确率,展示了 Transformer 架构在孟加拉语 MWP 求解中的有效性,并为未来研究建立了强有力的基线。

为了提高复杂孟加拉语 MWP 的推理能力,Paul 等人引入了 SOMADHAN 数据集,包含 8,792 个人工标注的数学文字题及逐步解答 [6] (https://arxiv.org/html/2607.22859#bib.bib2)。该研究调查了多个大语言模型,包括 GPT-4o、GPT-3.5 Turbo、Llama、DeepSeek 和 Qwen,使用了思维链(CoT)提示和 LoRA 微调。实验表明,CoT 推理一致地提升了数学推理性能,其中 Llama-3.3 70B 在少样本设置下达到了 88% 的最高准确率。

GSM-Plus-BN 基准被提出,作为首个基于扰动的孟加拉语数学推理数据集,用于评估大语言模型的鲁棒性 [7] (https://arxiv.org/html/2607.22859#bib.bib4)。该基准使用标准提示和思维链提示评估了包括 Qwen3、Llama 和 GPT-OSS 在内的模型。实验结果表明,GPT-OSS-20B 实现了 96.08% 的最高总体准确率,而 Llama-3.3-70B 和 GPT-OSS-120B 对语言扰动表现出更强的鲁棒性。

Mondal 等人引入了 BMWP,这是首个用于算术运算预测和问题求解的孟加拉语数学文字题数据集,包含 8,653 个标注问题 [4] (https://arxiv.org/html/2607.22859#bib.bib5)。该研究比较了多种深度学习架构,包括 LSTM、Bi-LSTM、GRU、BGRU、SimpleRNN、Stacked LSTM 和 GPT-2。其中,LSTM 取得了 90.42% 的最佳验证准确率,展示了循环神经网络在孟加拉语 MWP 求解中的有效性。

Aurpa 等人提出了 Shomikoron,这是首个用于数学方程识别的孟加拉语数据集,包含 3,430 条数学语句及其对应的方程 [1] (https://arxiv.org/html/2607.22859#bib.bib6)。作者评估了多个基于 Transformer 的模型,包括 mBERT、ELECTRA、XLNet、RoBERTa 和 DistilBERT,用于方程预测。实验结果显示,mBERT 以 99.8% 的准确率取得了最佳性能,凸显了 Transformer 模型从孟加拉语文本中提取数学方程的有效性。

## 3 数据集

### 3.1 数据收集

为了解决孟加拉语数学文字题(MWP)数据集的稀缺性,我们将现有的 PatiGonit 数据集从 10,000 个问题扩展到 22,441 个问题。新增的问题旨在提高复杂问题的比例和总样本量,从而增强数据集的多样性和代表性。该数据集从多个来源收集,以确保问题类型和难度级别的多样性。来自 MAWPS 数据集 (mawps-single) [3] (https://arxiv.org/html/2607.22859#bib.bib7) 的英文 MWP 被翻译成孟加拉语,并仔细注意语言保真度和数学正确性。算术问题也从 MATH23K 数据集 [8] (https://arxiv.org/html/2607.22859#bib.bib8) 改编而来,确保数值和运算符在孟加拉语中的准确表示。此外,来自 MAWPS 数据集 [3] (https://arxiv.org/html/2607.22859#bib.bib7) 的单运算问题也被纳入,以增加对较简单问题类型的覆盖。从这些来源中,收集了简单(单运算)和复杂(多运算)问题,创建了一个非常适合评估不同难度级别数学推理的数据集。

### 3.2 数据集统计

扩展后的数据集称为 PatiGonit22K,总共包含 22,441 个问题,包括简单方程和复杂方程。基于方程类型的问题分布总结在表 1 中。

表 1:PatiGonit22K 数据集的统计
在 22,441 个问题中,5,412 个是涉及单运算(加、减、乘或除)的简单方程,而 17,029 个是组合了多个运算的复杂方程。这种分布确保了基本和高级数学推理任务的充分覆盖,使 PatiGonit22K 成为孟加拉语 MWP 的一个稳健基准。

### 3.3 数据集标注

PatiGonit22K 中的每个问题都经过仔细翻译,以确保高质量的训练和评估。标注过程遵循以下规则:

1. 1. 翻译与文化适应:问题(包括问题文本和相应方程)从英语翻译成孟加拉语,同时保持语言保真度。通过适当调整数字、单位和符号以适应孟加拉语学生,保留了文化相关性。
2. 2. 答案列:在数据集中添加了一个单独的列,包含每个方程的解,从而可以直接评估模型预测。
3. 3. 质量验证与一致性检查:所有标注由精通孟加拉语和英语数学术语的双语标注员团队进行验证。检查了数据集中的重复问题、不一致的方程表示和模糊措辞。未通过这些检查的问题被纠正或删除。

参见图注
图 2:PatiGonit22K 数据集示例
这种严格的标注确保了 PatiGonit22K 为评估基于 Transformer 的模型在简单和复杂孟加拉语 MWP 上的表现提供了一个可靠的基准,支持低资源数学 NLP 任务的稳健研究。图 2 展示了我们提出的数据集的概览。

## 声明

- • 数据可用性:PatiGonit22K 数据集包含复杂的孟加拉语小学数学文字题,可供研究和学术目的公开使用。有兴趣使用该数据集的研究人员可通过以下链接访问:PatiGonit22K 数据集(原始数据)(Mendeley Data)(https://data.mendeley.com/datasets/pgxv75scs7/1)。

## 参考文献

- [1] (2024) Shomikoron: dataset to discover equations from bangla mathematical text. Data in Brief, 55, pp. 110742. 由 §2 (https://arxiv.org/html/2607.22859#S2.p5.1) 引用.
- [2] J. J. Era, B. Paul, T. S. Aothoi, M. R. Zim, and F. M. Shah (2024) Empowering bengali education with ai: solving bengali math word problems through transformer models. In 2024 27th International Conference on Computer and Information Technology (ICCIT), pp. 909–914. 由 §2 (https://arxiv.org/html/2607.22859#S2.p1.1) 引用.
- [3] R. Koncel-Kedziorski, S. Roy, A. Amini, N. Kushman, and H. Hajishirzi (2016) MAWPS: a math word problem repository. In Proceedings of the 2016 conference of the north american chapter of the association for computational linguistics: human language technologies, pp. 1152–1157. 由 §3.1 (https://arxiv.org/html/2607.22859#S3.SS1.p1.1) 引用.
- [4] S. Mondal, D. Khatua, S. Mandal, D. K. Prasad, and A. A. Sekh (2025) BMWP: the first bengali math word problems dataset for operation prediction and solving. Discover Artificial Intelligence, 5(1), pp. 25. 由 §2 (https://arxiv.org/html/2607.22859#S2.p4.1) 引用.
- [5] B. Paul, F. T. Chowdhury, D. Biswas, and M. Sultana (2025) Geospatial and temporal trends in urban transportation: a study of nyc taxis and pathao food deliveries. arXiv preprint arXiv:2505.03816. 由 §1 (https://arxiv.org/html/2607.22859#S1.p1.1) 引用.
- [6] B. Paul, J. J. Era, M. R. Zim, T. S. Aothoi, and F. M. Shah (2025) Leveraging large language models for bengali math word problem solving with chain of thought reasoning. arXiv preprint arXiv:2505.21354. 由 §2 (https://arxiv.org/html/2607.22859#S2.p2.1) 引用.
- [7] B. Paul, N. J. Mayouree, M. A. Karim, S. C. Nath, and S. Kundu (2026) GSM-plus-bn: a perturbation-based benchmark for bangla mathematical reasoning in large language models. arXiv preprint arXiv:2607.13248. 由 §2 (https://arxiv.org/html/2607.22859#S2.p3.1) 引用.
- [8] Q. Wu, Q. Zhang, Z. Wei, and X. Huang (2021) Math word problem solving with explicit numerical values. In Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 5859–5869. 由 §3.1 (https://arxiv.org/html/2607.22859#S3.SS1.p1.1) 引用.

相似文章

MathNet:一个面向数学推理与检索的全球多模态基准

Hugging Face Daily Papers

# 论文页面 - MathNet:一个面向数学推理与检索的全球多模态基准 来源:[https://huggingface.co/papers/2604.18584](https://huggingface.co/papers/2604.18584) ## 摘要 MathNet 是一个大规模、多语言、多模态的奥赛级数学问题数据集,旨在评估生成式模型和基于嵌入的系统中的数学推理与检索能力。数学问题解决对于大型语言和多模态模型而言仍是一项极具挑战性的推理测试。

VAMPS:视觉辅助数学问题求解基准

arXiv cs.AI

VAMPS 是一个包含 1,168 道多模态双语数学题的新基准,旨在评估 LLM 能否通过构建图形/可视化并对其进行推理来提升解题能力。核心发现:即便在绘图本是自然解题策略的问题上,直接分析求解的表现也出人意料地优于借助工具进行可视化求解。

CrowdMath: 一个众包数学研究讨论数据集

arXiv cs.AI

介绍了CrowdMath,一个包含164条专家标注的进展链条的数据集,来自MIT PRIMES–AoPS CrowdMath项目,捕捉了协作数学问题解决过程。对六个前沿模型进行基准测试,发现它们在下一帖子预测上达到83-88%的准确率,但在帖子角色分类上仅有0.42的macro-F1,突显了在理解协作进展方面的差距。