AdvancedMathBench: 面向高级数学证明生成与验证的基准套件
摘要
AdvancedMathBench是一个新的基准套件,用于评估大语言模型在高级数学证明生成与验证方面的性能。它包含用于生成的ProverBench和用于验证的VerifierBench,表明当前模型如GPT-5.5-xhigh仅取得了有限的性能。
查看缓存全文
缓存时间: 2026/07/14 04:13
论文页面 - AdvancedMathBench:面向高级数学证明生成与验证的基准套件
来源:https://huggingface.co/papers/2607.11849 作者: , , , , , , , , , , ,
摘要
大型语言模型(LLMs)在高中和奥林匹克风格的数学任务上取得了显著表现,但其在高等数学方面的能力仍未被充分理解。然而,现有基准在覆盖范围和评估粒度上存在不足:其学科覆盖有限,且往往仅依赖最终答案的正误或粗略判断,导致推理过程的有效性未得到充分评估。为填补这一空白,我们推出了 AdvancedMathBench,一个用于评估高等数学推理能力的基准套件。其核心证明生成基准 ProverBench 包含 296 道题目,涵盖本科与博士资格考试水平。为提供可靠的证明评估,我们开发了专用的自动验证流水线,该流水线在大规模专家标注数据上训练,既能给出正确性判定,也能对证明错误进行细粒度评估,并在保留的证明轨迹上与人类专家表现出高度一致性。我们还引入了 VerifierBench,包含 888 条模型生成的证明轨迹及其对应的专家真值,用于评估模型是否能正确判断证明有效性并提供合理的验证理由。实验表明,AdvancedMathBench 对前沿模型仍具有挑战性。在证明生成任务中,表现最佳的模型 GPT-5.5-xhigh 在 UGD 和 QE 子项上仅分别达到 75.8 和 66.1,说明高级数学证明构造仍有很大改进空间。在证明验证任务中,最佳模型的 Balanced F1 仅达 65.1,且模型普遍呈现低真负率,表明关键错误检测仍是主要瓶颈。
查看arXiv页面 (https://arxiv.org/abs/2607.11849)查看PDF (https://arxiv.org/pdf/2607.11849)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11849)
引用本文的模型0
无模型链接本论文
请在模型 README.md 中引用 arxiv.org/abs/2607.11849,以便从本页面链接。
引用本文的数据集0
无数据集链接本论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.11849,以便从本页面链接。
引用本文的 Space0
无 Space 链接本论文
请在 Space README.md 中引用 arxiv.org/abs/2607.11849,以便从本页面链接。
包含本论文的收藏0
无收藏包含本论文
请将本论文添加至收藏 (https://huggingface.co/new-collection),以便从本页面链接。
相似文章
MA-ProofBench:一种用于数学分析中定理证明的LLMs两级评估
MA-ProofBench是一个新的形式化基准,用于评估LLMs在数学分析中的定理证明能力,包含200个问题,分为两个难度级别。最佳模型GPT-5.5在Level I上仅达到16%,在Level II上为5%,突显了非形式化推理与形式化推理之间的显著差距。
GTBench:一个基于课程体系的图论数学研究助手大语言模型评估基准
论文介绍了GTBench,这是一个基于课程体系的基准,用于评估大语言模型在图论中作为数学研究助手的能力,包含63个问题,分为三个难度级别。它评估了五个前沿模型,发现性能随难度增加而下降,其中GPT-5在基础问题上近乎完美,但在研究生级别的证明上仅达到82%。
ComBench:一个用于奥林匹克级组合数学严谨证明推理与构造实现的基准
ComBench 是一个奥林匹克级组合数学基准测试,包含100道题目,旨在评估大语言模型的严谨证明推理与构造实现能力。结果表明,像GPT-5.5这样的前沿模型仅达到65.4%的总体平均分,并且这两种能力是截然不同的。
RePro:基于证明验证的基准重写,用于可靠评估LLM的数学问题求解能力
RePro将面向Lean的神经自动化定理证明器集成到基准重写中,以确保问题有效性和答案正确性,从而可靠评估LLMs在数学问题求解中的表现。
MathAdv:定理证明器的知识、推理、形式化与泛化
MathAdv 是一个用于数学形式定理证明的诊断基准,覆盖13个领域,并提供辅助任务以评估知识、推理和鲁棒性。该研究揭示了形式化瓶颈以及模型间的性能差异。