AdvancedMathBench: 面向高级数学证明生成与验证的基准套件

Hugging Face Daily Papers 论文

摘要

AdvancedMathBench是一个新的基准套件,用于评估大语言模型在高级数学证明生成与验证方面的性能。它包含用于生成的ProverBench和用于验证的VerifierBench,表明当前模型如GPT-5.5-xhigh仅取得了有限的性能。

大型语言模型(LLMs)在高中和奥林匹克竞赛风格的数学问题上取得了显著成绩,但它们在高等数学方面的能力仍未被充分理解。然而,现有基准在范围和评估粒度上均存在不足:它们覆盖的学科领域有限,且通常依赖最终答案的正确性或粗略判断,导致对推理过程有效性的评估不足。为弥补这一差距,我们引入了AdvancedMathBench,这是一个专为评估高级数学推理能力而设计的基准套件。其核心的证明生成基准ProverBench包含296个问题,涵盖本科和博士资格考试水平。为了对证明进行可靠评估,我们开发了一个专用的自动验证流程,该流程基于大规模专家标注进行训练,能够生成正确性判定以及对证明错误的细粒度评估,并且在保留的证明轨迹上与人类专家表现出高度一致性。我们还进一步引入了VerifierBench,它包含888条模型生成的证明轨迹,并配有专家标注的真实结果,用于评估模型是否能正确判断证明有效性并提供合理的验证理由。实验表明,AdvancedMathBench对前沿模型仍然具有挑战性。在证明生成方面,最佳模型GPT-5.5-xhigh在UGD和QE子集上分别仅达到75.8和66.1,表明在高级数学证明构建方面仍有很大的改进空间。在证明验证方面,最佳模型仅达到65.1的平衡F1值,且模型普遍表现出较低的真负率,这表明关键错误检测仍是一个主要瓶颈。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:13

论文页面 - AdvancedMathBench:面向高级数学证明生成与验证的基准套件

来源:https://huggingface.co/papers/2607.11849 作者: , , , , , , , , , , ,

摘要

大型语言模型(LLMs)在高中和奥林匹克风格的数学任务上取得了显著表现,但其在高等数学方面的能力仍未被充分理解。然而,现有基准在覆盖范围和评估粒度上存在不足:其学科覆盖有限,且往往仅依赖最终答案的正误或粗略判断,导致推理过程的有效性未得到充分评估。为填补这一空白,我们推出了 AdvancedMathBench,一个用于评估高等数学推理能力的基准套件。其核心证明生成基准 ProverBench 包含 296 道题目,涵盖本科与博士资格考试水平。为提供可靠的证明评估,我们开发了专用的自动验证流水线,该流水线在大规模专家标注数据上训练,既能给出正确性判定,也能对证明错误进行细粒度评估,并在保留的证明轨迹上与人类专家表现出高度一致性。我们还引入了 VerifierBench,包含 888 条模型生成的证明轨迹及其对应的专家真值,用于评估模型是否能正确判断证明有效性并提供合理的验证理由。实验表明,AdvancedMathBench 对前沿模型仍具有挑战性。在证明生成任务中,表现最佳的模型 GPT-5.5-xhigh 在 UGD 和 QE 子项上仅分别达到 75.8 和 66.1,说明高级数学证明构造仍有很大改进空间。在证明验证任务中,最佳模型的 Balanced F1 仅达 65.1,且模型普遍呈现低真负率,表明关键错误检测仍是主要瓶颈。

查看arXiv页面 (https://arxiv.org/abs/2607.11849)查看PDF (https://arxiv.org/pdf/2607.11849)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11849)

引用本文的模型0

无模型链接本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.11849,以便从本页面链接。

引用本文的数据集0

无数据集链接本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.11849,以便从本页面链接。

引用本文的 Space0

无 Space 链接本论文

请在 Space README.md 中引用 arxiv.org/abs/2607.11849,以便从本页面链接。

包含本论文的收藏0

无收藏包含本论文

请将本论文添加至收藏 (https://huggingface.co/new-collection),以便从本页面链接。

相似文章

MA-ProofBench:一种用于数学分析中定理证明的LLMs两级评估

arXiv cs.AI

MA-ProofBench是一个新的形式化基准,用于评估LLMs在数学分析中的定理证明能力,包含200个问题,分为两个难度级别。最佳模型GPT-5.5在Level I上仅达到16%,在Level II上为5%,突显了非形式化推理与形式化推理之间的显著差距。

GTBench:一个基于课程体系的图论数学研究助手大语言模型评估基准

arXiv cs.AI

论文介绍了GTBench,这是一个基于课程体系的基准,用于评估大语言模型在图论中作为数学研究助手的能力,包含63个问题,分为三个难度级别。它评估了五个前沿模型,发现性能随难度增加而下降,其中GPT-5在基础问题上近乎完美,但在研究生级别的证明上仅达到82%。