大型语言模型中的数学推理:基准、架构、评估与开放挑战
摘要
本综述综合了大型语言模型在数学推理方面的最新进展,涵盖了基准、架构、训练策略和评估协议。它指出了推理忠实性和基准偏差等关键挑战。
arXiv:2605.19723v1 公告类型:新
摘要:数学推理对于教育、科学和工业中的问题解决至关重要,是评估人工智能系统的重要基准。随着大型语言模型(LLM)推理能力的提升,理解其数学推理表现变得愈发重要。本综述通过结构化的数据集、架构、训练策略和评估协议分析,综合了LLM在数学推理方面的最新进展。我们的系统综述涵盖约120篇同行评审研究和预印本,审视了这一研究领域的演变,并提供了一个统一的分析框架以理解当前进展与局限性。本研究特别引入了一个统一的数学数据集分类法,区分了预训练语料库、监督微调资源以及不同推理复杂度级别的评估基准。系统分析了推理架构与训练策略,包括工具集成、验证器引导推理和参数高效适配,以评估其对推理鲁棒性和泛化能力的影响。此外,对现有指标的对比评估凸显了最终答案准确性与过程级推理验证之间的差距。通过综合这些领域的见解,我们的分析识别了反复出现的失败模式,如推理忠实性问题、基准偏差和泛化局限性,并指出了改进符号基础、评估可靠性以及开发更稳健可信的基于LLM的推理系统的关键研究方向。
查看缓存全文
缓存时间: 2026/05/20 08:26
# 大语言模型中的数学推理:基准测试、架构、评估与开放挑战 来源:https://arxiv.org/html/2605.19723 ###### 摘要 数学推理对于教育、科学和工业中的问题解决至关重要,是评估人工智能系统的关键基准。随着大语言模型(LLM)推理能力的提升,理解其数学推理的表现变得愈发重要。本综述通过对数据集、架构、训练策略和评估协议的结构化分析,综合了近年来LLM数学推理的进展。我们的系统综述涵盖了约120篇同行评审的研究和预印本,考察了该研究领域的演变,并提供了一个统一的分析框架来理解当前的进展与局限性。本研究特别引入了一种统一的数学数据集分类法,区分了预训练语料库、监督微调资源以及不同推理复杂度级别的评估基准。我们系统分析了推理架构和训练策略,包括工具集成、验证器引导推理和参数高效适配,以评估其对推理鲁棒性和泛化能力的影响。此外,对现有指标的比较评估突出了最终答案准确性与过程级推理验证之间的差距。通过综合这些领域的见解,我们的分析识别了反复出现的失败模式,如推理忠实性问题、基准偏差和泛化局限性,并概述了改进符号基础、评估可靠性以及开发更鲁棒和值得信赖的基于LLM的推理系统的关键研究方向。 ###### 关键词:大语言模型,人工智能,自然语言,数学应用题,推理 ††期刊:Intelligent Systems with Applications \affiliation[NUST]组织=国立科技大学电气工程与计算机科学学院,伊斯兰堡,巴基斯坦 \affiliation[West]组织=西悉尼大学计算、数据与数学科学学院,印度尼西亚 \affiliation[MIUN]组织=中瑞典大学通信、质量管理与信息系统系,厄斯特松德校区,瑞典 ## 1 引言 数学通过精确的符号系统形式化了对数、结构、空间和变化的推理(Devlin and Gray,1998 (https://arxiv.org/html/2605.19723#bib.bib17); Kline,1990 (https://arxiv.org/html/2605.19723#bib.bib50))。除了算术计算,它还需要组合抽象、多步演绎、变量绑定以及对跨互连概念的形式约束进行操作(Huang and Chang,2023 (https://arxiv.org/html/2605.19723#bib.bib42))。因此,数学推理从根本上不同于表面层的数值模式识别;它要求结构化推理、证明构造和长程依赖追踪(Yuanet al.,2023 (https://arxiv.org/html/2605.19723#bib.bib110))。这些特征使数学成为评估LLM推理能力的严格基准。 最近的LLM通过大规模预训练在多种自然语言任务中展现出强大性能(Weiet al.,2022 (https://arxiv.org/html/2605.19723#bib.bib104); Matzakoset al.,2023 (https://arxiv.org/html/2605.19723#bib.bib69))。诸如思维链(CoT)(Weiet al.,2022 (https://arxiv.org/html/2605.19723#bib.bib104))和工具集成推理(TIR)(Li,2024 (https://arxiv.org/html/2605.19723#bib.bib58))等提示策略改进了多步问题解决,并在代数操作、定理证明和结构化应用题方面取得了进展(Imaniet al.,2023 (https://arxiv.org/html/2605.19723#bib.bib45))。尽管如此,解决数学问题仍然是人工智能中一个长期存在的挑战(Feigenbaum and Feldman,1963 (https://arxiv.org/html/2605.19723#bib.bib23); Hosseiniet al.,2014 (https://arxiv.org/html/2605.19723#bib.bib40))。尽管规模不断扩大,LLM仍然表现出脆弱的泛化能力、算术不一致性(见图1 (https://arxiv.org/html/2605.19723#S1.F1))、符号推理失败以及长推理链中的错误传播(Raeet al.,2022 (https://arxiv.org/html/2605.19723#bib.bib81); Lewkowyczet al.,2022 (https://arxiv.org/html/2605.19723#bib.bib55))。如图1 (https://arxiv.org/html/2605.19723#S1.F1)所示,模型生成了一个大致连贯的思维链解决方案,正确制定了中间步骤(例如,推导出x+10=20并求解x=10),却产生了错误的最终答案。这种差异突出了一个关键局限性:尽管中间推理步骤看起来在逻辑上一致,但最终输出仍可能因算术错误或答案验证薄弱而偏离。这种行为反映了LLM推理缺乏全局一致性,局部的逐步合理性并不能保证最终结果的正确性。因此,在需要抽象、形式严谨性和非标准解决策略的竞赛级和大学级问题上,性能大幅下降。 这些局限性源于多种因素。现有基准通常强调最终答案准确性,并且可能包含分布偏差或预训练污染,限制了它们衡量真正推理泛化能力的能力(Mishraet al.,2022 (https://arxiv.org/html/2605.19723#bib.bib73); Huanget al.,2025 (https://arxiv.org/html/2605.19723#bib.bib43); Guanet al.,2025 (https://arxiv.org/html/2605.19723#bib.bib31))。此外,下一个词预测目标优化的是局部连贯性而非全局有效的推导,这可能会鼓励捷径学习(Ahnet al.,2024 (https://arxiv.org/html/2605.19723#bib.bib3))。尽管元认知提示和自反思技术提高了解决方案质量(Wang and Zhao,2023 (https://arxiv.org/html/2605.19723#bib.bib103)),但生成的推理轨迹的忠实性仍不确定(Didolkaret al.,2024 (https://arxiv.org/html/2605.19723#bib.bib18))。 尽管进展迅速,但关于LLM中数学推理的研究在数据集、架构、训练策略和评估方法方面仍然分散。现有综述通常侧重于单个方面,如推理提示、基准数据集或评估协议。相比之下,本综述提供了一个跨数据集、模型架构、训练策略和评估框架的统一分析,强调了这些组件如何共同影响数学推理性能。最近的综述探讨了大语言模型中推理的相关方面,包括提示策略、基准数据集和推理评估协议。然而,大多数现有综述只关注问题的单一维度,例如提示技术、基准比较或推理评估。相比之下,本综述提供了一个统一的分析,共同考察了数据集、架构调整、训练策略和评估方法。通过将这些组件整合在一个框架内,本综述强调了整个模型开发生命周期中的设计选择如何共同影响数学推理性能。 **图1:顶部:数学应用题。底部:逐步错误的解决方案。输入问题:** Dane的两个女儿每人需要种一定数量的花来建一个花园。随着日子过去,花朵增加了20朵,但其中10朵死了。Dane的女儿们收获了这些花,并将它们分到5个不同的篮子里,每个篮子有4朵花。每个女儿最初种了多少朵花?**答案:** 逐步解决方案:计算收获的花总数:Dane的女儿们将花分到5个篮子里,每个篮子有4朵花。收获的花总数为:5×4=20朵花。考虑到花朵增加和死亡的情况:问题说增加了20朵花,但10朵死了。设两个女儿最初种的花数为x。考虑生长和死亡后,花的总数变为:x+20-10=x+10。建立收获花总数的等式:收获的花总数等于生长和死亡后的花总数:x+10=20。求解x:两边减去10:x=10。确定每个女儿种了多少朵花:两个女儿一起种了x=10朵花。由于花在两个女儿之间平均分配,每个女儿种了:10/2=5朵花。**最终答案:6** 本综述提供了跨整个模型开发生命周期的LLM数学推理的结构化综合。研究格局可以组织为三个主要组件:数据集、模型架构和训练策略,以及评估方法。我们首先分析基准数据集,涵盖基础语料库、中小学和竞赛级问题(Heet al.,2024 (https://arxiv.org/html/2605.19723#bib.bib34); Gaoet al.,2024 (https://arxiv.org/html/2605.19723#bib.bib28); Fanget al.,2025 (https://arxiv.org/html/2605.19723#bib.bib22); Huanget al.,2025 (https://arxiv.org/html/2605.19723#bib.bib43))以及形式证明语料库(Zhenget al.,2022 (https://arxiv.org/html/2605.19723#bib.bib118); Luet al.,2021 (https://arxiv.org/html/2605.19723#bib.bib67); Azerbayevet al.,2023 (https://arxiv.org/html/2605.19723#bib.bib7); Zhanget al.,2024b (https://arxiv.org/html/2605.19723#bib.bib114))(第4节 (https://arxiv.org/html/2605.19723#S4))。然后,我们考察架构调整(第5节 (https://arxiv.org/html/2605.19723#S5))和训练策略——包括预训练(Devlinet al.,2019 (https://arxiv.org/html/2605.19723#bib.bib16))、监督微调(Liet al.,2023 (https://arxiv.org/html/2605.19723#bib.bib59))和强化学习(Stoneet al.,2022 (https://arxiv.org/html/2605.19723#bib.bib94))——这些旨在提高推理鲁棒性和忠实性(第6节 (https://arxiv.org/html/2605.19723#S6))。最后,我们回顾评估方法和指标,强调答案级正确性与步骤级推理验证之间的差距(第7节 (https://arxiv.org/html/2605.19723#S7))。 ## 研究问题 为了结构化分析LLM中的数学推理,本综述由以下研究问题引导: - • **RQ1:** 当前使用哪些数据集和基准来评估LLM的数学推理,特别是针对竞赛级和奥赛风格的问题? - • **RQ2:** 哪些架构设计和训练策略最有效地提高了LLM的数学推理能力? - • **RQ3:** LLM如何执行多步推理?其生成的推理轨迹在多大程度上是忠实且可验证的? - • **RQ4:** 使用哪些评估方法和指标来评估数学推理性能?当前评估协议存在哪些局限性? - • **RQ5:** 推进LLM中鲁棒性数学推理仍面临哪些关键挑战和开放研究方向? ## 贡献 本综述对大语言模型中数学推理的研究进行了全面综合。主要贡献总结如下: - • **统一的数据集分类法。** 我们根据现有数学数据集在LLM开发中的功能角色对其进行组织,区分了预训练语料库、监督微调数据集以及不同推理难度级别的评估基准。 - • **推理架构和训练策略的系统分析。** 我们回顾了架构调整、推理增强机制和训练管道——包括工具集成、验证器引导推理和参数高效微调——并分析了这些方法如何影响推理鲁棒性和泛化能力。 - • **推理指标的比较评估。** 我们考察了现有的评估方法,并突出了答案级正确性与过程级推理验证之间的差距。 - • **失败模式和局限性的横截面综合。** 通过整合来自数据集、架构、训练策略和评估框架的见解,我们识别了限制LLM可靠数学推理的反复出现的失败模式。 - • **未来研究方向。** 我们概述了在未来的LLM系统中改进推理忠实性、符号基础和评估可靠性的关键开放挑战和有前景的研究方向。 ## 论文组织 本文的其余部分组织如下。第2节 (https://arxiv.org/html/2605.19723#S2)介绍了用于收集和分析相关研究的结构化文献综述方法。第3节 (https://arxiv.org/html/2605.19723#S3)介绍了LLM数学推理的背景。第4节 (https://arxiv.org/html/2605.19723#S4)考察了基准数据集,第5节 (https://arxiv.org/html/2605.19723#S5)讨论了模型架构和训练适配,第6节 (https://arxiv.org/html/2605.19723#S6)回顾了评估方法,第7节 (https://arxiv.org/html/2605.19723#S7)综合了开放挑战和未来研究方向,第8节 (https://arxiv.org/html/2605.19723#S8)总结了本综述。为清晰起见,图2 (https://arxiv.org/html/2605.19723#Sx3.F2)总结了本综述考察的整体研究格局,突出了数据集、模型架构和评估方法之间的关系。 **图2:大语言模型中数学推理研究的概念格局。** 该领域涵盖数据集设计、模型架构和评估方法,每个方面都针对推理能力的不同方面。 ## 2 文献收集方法 鉴于人工智能领域快速的发表周期和预印本驱动的传播,严格的穷尽性是不切实际的。因此,我们采用一种结构化和可重复的范围综述方法,通过系统过滤最大限度地提高主题覆盖范围,同时保持方法透明度。 **表1:结构化文献筛选过程中应用的资格和纳入标准。** ### 2.1 搜索策略和关键词制定 搜索协议与本综述引导的五个研究问题保持一致。一个多层次的布尔查询矩阵捕捉了LLM、数学推理、基准数据集、架构优化策略、推理忠实性和评估协议之间的交集。十个重叠的关键词配置涵盖了研究空间的多个语义投影,范围从广泛查询(例如,*LLMs AND mathematical reasoning AND benchmarks*)到针对性的方法论交集(例如,*formal verification*,*tool integration*,或*reasoning faithfulness*)。这种冗余通过确保在一个查询中弱呈现的研究可以通过替代公式检索到,从而减轻了查询敏感性和排序偏差。所有查询字符串、执行日期和检索计数均已记录,以确保可追溯性。表2 (https://arxiv.org/html/2605.19723#S2.T2)总结了搜索矩阵。 **表2:结构化搜索矩阵**
相似文章
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。
大语言模型数学问题求解中可执行推理约束下的表示鲁棒性
本文通过系统性地变化等价问题的表面表示,研究了大语言模型在数学问题求解中的表示鲁棒性,发现存在显著的敏感性,并表明代码增强推理并不能统一消除脆弱性。
From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models
This paper introduces MPAR-Bench, a bilingual benchmark for evaluating multi-point associative reasoning in large language models, along with a perturbation suite and coarse-to-fine evaluation protocol. Results show that deeper reasoning does not automatically confer robust reasoning breadth.
揭示大语言模型中的数学推理:内部机制的方法学研究
本文通过早期解码分析大语言模型的内部机制,研究其如何执行算术运算。研究发现,能力强的模型在推理任务中,注意力模块和 MLP 模块之间呈现明确的分工。