CrowdMath: 一个众包数学研究讨论数据集
摘要
介绍了CrowdMath,一个包含164条专家标注的进展链条的数据集,来自MIT PRIMES–AoPS CrowdMath项目,捕捉了协作数学问题解决过程。对六个前沿模型进行基准测试,发现它们在下一帖子预测上达到83-88%的准确率,但在帖子角色分类上仅有0.42的macro-F1,突显了在理解协作进展方面的差距。
查看缓存全文
缓存时间: 2026/06/08 09:13
# 众包数学研究讨论数据集 来源:https://arxiv.org/html/2606.06526 **第一作者** 所属机构 / 地址第一行 所属机构 / 地址第二行 所属机构 / 地址第三行 email@domain **第二作者** 所属机构 / 地址第一行 所属机构 / 地址第二行 所属机构 / 地址第三行 email@domain Sherin Muckatira¹,†,\* Jesse Geneson²,† Slava Gerovitch³ Pavel Etingof³ Mikhail Gronas⁴ Anna Rumshisky¹,⁵,⋄ ¹麻省大学洛厄尔分校 ²圣何塞州立大学 ³麻省理工学院 ⁴达特茅斯学院 ⁵亚马逊AGI ###### 摘要 大型语言模型在数学推理方面取得了显著进展,但现有基准通常评估那些有最终答案、逐步求解过程或完整证明的明确问题。它们未能捕捉协作式开放问题求解的过程:在这种场景中,参与者提出部分论证、识别先前步骤中的漏洞或错误、修复有缺陷的推理,并逐步将零散贡献综合成一个证明。我们提出了**CrowdMath**,这是一个包含164条由专家标注的进展链的数据集,来自MIT PRIMES–AoPS(Art of Problem Solving)CrowdMath项目(2016–2025年),这是一个协作研究计划,其讨论已产出经过同行评审的出版物。每条链追踪了从开放问题陈述到完成证明的多参与者论坛讨论过程。帖子根据其在演进求解过程中的功能角色进行标注,包括部分进展、证明完成、错误推理和错误识别。我们定义了评估任务,并对六种前沿模型进行了基准测试。模型在下一帖预测任务上达到了83–88%的准确率,表明它们能够跟上数学讨论的局部流程。然而,在识别个别贡献的功能重要性方面,模型表现不佳,最佳模型在帖子角色分类上的宏F1分数仅为0.42。**CrowdMath**暴露了解决明确数学问题与理解协作数学进展过程之间的差距。 # CrowdMath:众包数学研究讨论数据集 Sherin Muckatira¹,†,\* Jesse Geneson²,† Slava Gerovitch³ Pavel Etingof³ Mikhail Gronas⁴ Anna Rumshisky¹,⁵,⋄ ¹麻省大学洛厄尔分校 ²圣何塞州立大学 ³麻省理工学院 ⁴达特茅斯学院 ⁵亚马逊AGI †††共同第一作者。 ††\*通讯作者:[email protected] ††⋄工作完成于麻省大学洛厄尔分校。 ## 1 引言  大型语言模型(LLM)在数学能力方面表现出色,在小学应用题、竞赛式问题求解和形式化定理证明上均有强劲表现(Cobbe等,2021;Hendrycks等,2021;Yang等,2023)。这些数据集和基准对于衡量模型能否通过给出正确的最终答案、推导过程或机器可验证的证明来解决明确定义的问题,具有重要价值。即使以往的工作揭示了中间推理步骤,它们通常也只研究单个求解尝试中的推理。这就留下了一个互补的场景:协作式开放问题求解,其中数学进展分布在多个帖子和参与者之间。在协作式开放问题求解中,个别贡献单独看可能不完整,但对最终解决方案却至关重要。参与者可能提出部分想法、测试一个例子、识别错误、完善猜想、提出或回答澄清性问题,或将早期观察连接成一条证明路径。因此,理解这类讨论需要的不仅仅是检查最终答案是否正确。模型必须跟踪讨论当前所处阶段,某个贡献如何与之前贡献相关联,所提出的步骤是否有效或有用,以及哪种类型的贡献能推进论证。 我们提出了**CrowdMath**,这是一个包含由专家标注的协作数学研究讨论的数据集,源自MIT PRIMES–AoPS CrowdMath项目¹¹¹https://artofproblemsolving.com/polymath。CrowdMath包含164条进展链,追踪了多参与者论坛讨论串中从开放问题陈述到完成证明的完整发展过程。每个帖子根据其在演进求解过程中的功能角色被标注,包括**Progress**(进展)、**Proof**(证明)、**Erroneous**(错误)、**FindError**(发现错误)、**Question**(问题)和**Answer**(答案),并附带指向相关先前帖子及结果的链接。CrowdMath与先前资源有三个关键区别。第一,它捕捉的是真实世界的研究轨迹,而非教科书习题或合成问题。第二,它标注了数学进展的过程,包括部分想法、错误、纠正、问题、答案以及完成证明的步骤。第三,它保留了这些开放问题讨论的协作结构,使得能够评估模型是否能够跨越参与者追踪依赖关系,并推理个别帖子如何为共享的数学结果做出贡献。 ††代码和数据集将在https://github.com/text-machine-lab/crowdmath发布 我们在由这些标注衍生出的任务上对前沿模型进行了评估,包括帖子角色分类和下一帖预测。我们的结果表明,模型通常能够跟上数学话语的表面流程,但在识别个别贡献的功能重要性方面表现不佳,尤其是在区分完成证明的帖子与部分进展时。这些发现表明,当前模型在理解作为演进协作过程的数学进展方面仍然能力有限。我们的主要贡献如下: 1. 一个数据集**CrowdMath**,包含来自MIT PRIMES CrowdMath项目的自然发生的、多参与者的开放数学问题求解讨论,并带有帖子级别的标注,捕捉每个贡献在演进求解过程中的作用。 2. 评估任务,用于测试前沿模型能否分类证明步骤并预测下一个贡献。 3. 基线结果,显示前沿模型难以区分证明完成与部分进展,暴露了过程级数学理解方面的差距。 ## 2 相关工作 表1:CrowdMath用于协作开放问题求解的标注模式。帖子级标签捕捉功能角色,例如提出问题、取得进展、完成证明、错误和识别错误。元数据字段记录出版链接、定理编号以及依赖的先前帖子。 ##### 中小学与竞赛类基准 已有多个数学数据集使用封闭式答案来评估语言模型中的数学推理。诸如(Ling等,2017;Amini等,2019;Cobbe等,2021;Miao等,2020)的数据集专注于中小学和大学水平的数学问题,其中大多数提供自然语言推理过程和封闭式答案。诸如(Hendrycks等,2021;Gao等,2025;He等,2024;Sun等,2026;Yue等,2024;Mao等,2024;Gulati等,2025)的数据集则难度更高,包括高中竞赛、奥林匹克风格问题以及大学竞赛题。动态和合成的竞赛风格基准通过添加新获取或生成的问题进一步扩展了覆盖范围(Balunovic等,2026;Manem等)。虽然这些数据集和基准非常适合有已知解的问题,但它们对于数学中复杂的开放问题代表性不足。CrowdMath试图捕捉解决开放问题所涉及的步骤。 ##### 研究级数学推理数据集 最近的数据集超越了学校和竞赛数学,转向研究级推理。Glazer等人(2024)引入了由专家精心设计的、对前沿模型具有难度的问题,而Zhang等人(2026)则从研究论文和数学论坛中提取问题。其他工作则专注于特定数学领域中的开放问题,例如代数组合学以及计算或应用数学(Chau等,2025;Wang等,2026)。这些基准衡量的是模型能否得出正确的最终答案,而非涉及数学进展的过程。CrowdMath捕捉了数学家如何在开放问题上集体取得进展。 ##### 过程监督与面向证明的数据集 另一类数据集通过过程监督来研究数学推理,其中监督在中间推理步骤层面提供,而不仅仅在最终答案层面。这些数据集(Lightman等,2024;Wang等,2024)使用正确性标签标注解决方案中的单个步骤,这些标签来自人工标注或自动生成的监督。过程监督数据集通常侧重于评估单个求解轨迹中步骤的正确性。相比之下,我们的数据集将开放数学问题求解捕捉为一个更广泛的协作过程,其中进展可能来自部分想法、失败尝试以及多个贡献者之间的纠正。形式化和自然语言定理证明基准评估模型能否证明数学陈述、填补缺失的证明步骤、或将非形式化数学转化为形式化系统(Welleck等,2021;Zheng等,2022;Liu等,2023;Azerbayev等,2023;Li等,2021;Yang等,2023)。虽然形式化定理证明数据集为机器可检查的推理提供了严格的基准,但它们没有捕捉到通常表征开放数学问题进展的非形式化、探索性和协作性过程。  ##### 协作数学话语 有一小部分工作将数学作为对话进行研究。Macina等人(2023)引入了人类教师与LLM学生之间的师生对话数据集,重点关注常见的学生错误。Suresh等人(2022)通过视频记录中标注的K-12课堂记录,研究了课堂数学讨论。与这些在教育环境中研究数学对话的数据集不同,CrowdMath针对的是协作式开放问题求解,捕捉围绕困难数学问题的非形式化、多贡献者讨论,其中进展常常是部分、非线性且分布于不同参与者之间的。 ##### 创造性与开放式数学问题求解 近期工作也开始评估数学推理中的创造性。Ye等人(2025)研究模型在看过已知解后是否能提出创新解,而Chen等人(2025)评估模型在代数、几何、分析等领域的新问题上的表现。这些工作侧重于评估模型生成解的创造性。CrowdMath提供了一个数据集,用于研究开放问题求解的协作过程,其中进展可能通过多个贡献者的部分想法、错误、纠正和反例而浮现。 ## 3 CrowdMath项目 CrowdMath是一个大型协作数学研究项目,于2016年由MIT PRIMES和AoPS发起,灵感来自Timothy Gowers和Terence Tao的Polymath项目。该项目开放注册,全球可访问,允许高中和本科生参与者无需经过正式选拔过程即可贡献。每年周期专注于一小批原创的未解决问题,通常涉及组合学、图论及相关离散领域,这些问题的选择既具可接近性又达到研究水平。参与者在导师指导下,通过AoPS上持续开放的公共论坛讨论串进行工作。多个项目已在《Electronic Journal of Combinatorics》和《Discrete Applied Mathematics》等期刊上发表了经同行评审的论文。从数据角度来看,CrowdMath提供了一个异常丰富的数学发现记录。与精心策划的问题集或竞赛档案不同,论坛日志捕捉了推理的完整时间演变过程:探索性计算、部分证明、反例、错误和纠正——所有这些都嵌入在多参与者话语中,并与可验证的已发表成果相关联。这种真实开放问题研究、协作互动以及明确的中间状态的结合,使得CrowdMath特别适合构建针对细粒度推理、错误检测和过程级监督(而非仅最终答案准确性)的数据集。 (B) 每条结果的帖子数 | 帖子数 | 结果数 | 百分比 | |--------|--------|--------| | 1 | 8 | 9.4 | | 2 | 21 | 3.4 | | 3 | 51 | 5.2 | | 4 | 9 | 5.5 | | 5 | 8 | 4.9 | | 6–10 | 15 | 9.1 | | ≥11 | 4 | 2.4 | | 均值 | 2.7 | | | 中位数 | 2 | | | 最大值 | 25 | | 表2:CrowdMath数据集统计。(A) 2016-2025年按年度划分的已标注进展链数量。(B) 链长分布,以每条已完成结果关联的帖子数衡量。(C) 包含每种标签类型的链数量。 ## 4 数据集 ### 4.1 标注过程 每个帖子\(S_i\)被赋予表1(https://arxiv.org/html/2606.06526#S2.T1)模式中的一个或多个标签。由于大多数标签是以结果为中心的(以结果标识符\(y\)为参数,有时还有帖子标识符\(j\)),在帖子所引用的结果被识别之前,无法对帖子进行完整标注。因此,我们分两轮对每个CrowdMath讨论串进行标注。 **第一轮:结果识别。** 我们阅读讨论串,以识别其讨论中建立的每个结果,其中结果定义为表1(https://arxiv.org/html/2606.06526#S2.T1)中所指的新数学发现。每个结果被赋予一个基于其完成帖子的唯一标识符:在讨论串\(X\)的帖子\(k\)中完成的结果,被标记为\(X\)-\(k\),当单个帖子完成多个结果时,则在末尾附加一个字母。
相似文章
麻省理工学院科学家构建了全球最大规模的奥数级数学问题集,并向所有人开放
麻省理工学院(MIT)研究人员与沙特阿卜杜拉国王科技大学(KAUST)及 HUMAIN 公司合作,发布了 MathNet。这是目前最大的开源奥数级数学问题数据集,包含来自 47 个国家的超过 30,000 道由专家编写的问题。
MIT 与 IMO 发布 MathNet:全球最大国际数学奥林匹克题库与解答数据集,规模达以往 5 倍,覆盖 40 余国、40 年历程
MIT 与 IMO 联合推出 MathNet,汇集 40 多国、40 年国际数学奥林匹克赛题与详解,数据量较现有数据集扩大 5 倍。
MathNet:一个面向数学推理与检索的全球多模态基准
# 论文页面 - MathNet:一个面向数学推理与检索的全球多模态基准 来源:[https://huggingface.co/papers/2604.18584](https://huggingface.co/papers/2604.18584) ## 摘要 MathNet 是一个大规模、多语言、多模态的奥赛级数学问题数据集,旨在评估生成式模型和基于嵌入的系统中的数学推理与检索能力。数学问题解决对于大型语言和多模态模型而言仍是一项极具挑战性的推理测试。
AI 随时间推移解决的数学问题
一个数据链接,追踪 AI 系统随时间解决数学问题的情况,突出 AI 数学推理的进步。
面向协作问题求解与AI推理数据集生成的数学论坛平台
本文介绍了一个数学论坛平台,该平台将图像到LaTeX的转换流程直接集成到发帖界面中,减少了用户的操作障碍。系统旨在生成一个经过社区验证的数学问题与解答数据集,用于训练AI推理系统。