解决数学应用题
摘要
OpenAI 训练了一个使用验证器的系统来解决小学数学应用题,准确率达到儿童水平的 90%,性能几乎是微调后的 GPT-3 的两倍。该方法通过训练验证器来评估候选解决方案并选择最佳方案,解决了语言模型在多步推理中的弱点。
我们训练了一个系统来解决小学数学问题,准确率几乎是微调后的 GPT-3 模型的两倍。它解决问题的能力接近真实儿童的水平:我们对 9-12 岁儿童进行的小样本测试中,他们在我们的数据集测试中得分为 60%,而我们的系统在相同问题上得分为 55%。
查看缓存全文
缓存时间:
2026/04/20 14:55
# 解决数学应用题
来源: https://openai.com/index/solving-math-word-problems/
OpenAI
我们训练了一个系统,可以解决小学数学应用题,准确率是微调 GPT-3 模型的近两倍。它解决了大约 90% 与真实儿童相同的问题:我们从数据集中抽取的 9-12 岁儿童样本在测试中获得 60% 的成绩,而我们的系统在相同问题上获得 55% 的成绩。
## 为什么这很重要
这很重要,因为当今的 AI 在常识性多步推理方面仍然相当薄弱,即使对小学生来说也很容易。我们通过训练模型识别自己的错误来取得这些成果,这样它可以反复尝试直到找到一个有效的解决方案。
GPT-3 这样的大型语言模型具有许多令人印象深刻的技能,包括模仿多种写作风格的能力和广泛的事实知识。但是,它们在执行需要准确多步推理的任务方面表现不佳,比如解决小学数学应用题。虽然该模型可以模仿正确解决方案的节奏,但它经常产生逻辑上的关键错误。
为了在复杂逻辑领域中达到人类的表现水平,我们的模型必须学会识别自己的错误并谨慎选择步骤。为此,我们训练验证器来评估提议的解决方案是否正确。为了解决新问题,我们使用验证器从许多提议的解决方案中选择最佳的一个。我们收集了新的 GSM8K 数据集来评估我们的方法,并且我们正在发布这个数据集以促进研究。
在下面的十个例子中,我们展示了由我们的新方法生成的解决方案、验证过程以及基准方法(微调)的对比。
GSM8K 包含 8.5K 个高质量小学数学应用题。每个问题需要 2 到 8 个步骤来解决,解决方案主要涉及使用基本算术运算(+ − × ÷)执行一系列基础计算来达到最终答案。微调后的最先进的语言模型在这个数据集上表现不佳,主要是由于问题的高度多样性。同时,GSM8K 的解决方案仅依赖于基础概念,因此达到高测试性能是一个可以实现的目标。
GSM8K 中的解决方案以自然语言而不是纯数学表达式的形式编写。通过坚持自然语言,模型生成的解决方案更容易被人类理解,我们的方法在领域上仍然相对不可知。
数学推理中的一个重要挑战是对单个错误的高度敏感性。自回归模型逐个词元生成每个解决方案,没有机制来纠正自己的错误。偏离轨道的解决方案会迅速变得无法恢复,正如所提供的例子中所看到的那样。
我们通过训练验证器来评估模型生成的解决方案的正确性来解决这个问题。验证器收到许多可能的解决方案,这些都是由模型本身编写的,它们被训练来决定哪些(如果有的话)是正确的。
在测试时解决新问题时,我们生成 100 个候选解决方案,然后选择验证器排名最高的解决方案。验证器从这种固有的可选性以及验证通常是比生成更简单的任务这一事实中受益。
我们发现,只要数据集足够大,验证就能为性能带来强劲提升。对于太小的数据集,我们认为验证器会通过记忆训练集中的最终答案而过度拟合,而不是学习任何更有用的数学推理属性。
在完整训练集上,6B 参数的验证略微优于微调的 175B 参数模型,性能提升大约相当于 30 倍的模型大小增加。此外,如果根据当前结果推断,验证似乎能更有效地随着额外数据而扩展。
产生正确的论证和识别错误的论证是开发更通用 AI 的关键挑战。小学数学是测试这些能力的理想试床。GSM8K 中的问题在概念上很简单,但一个细微的错误就足以使整个解决方案脱轨。识别和避免此类错误是我们的模型需要开发的关键技能。通过训练验证器,我们教会我们的模型区分好的解决方案和不太奏效的解决方案。随着我们尝试将模型应用于更复杂的逻辑领域,我们期望这些技能变得越来越相关。
相似文章
OpenAI Blog
# 解决(部分)形式化数学奥林匹克问题 来源:[https://openai.com/index/formal-math/](https://openai.com/index/formal-math/) 我们在 [miniF2F](https://arxiv.org/abs/2109.00110) 基准测试上实现了新的最先进成果(41.2% vs 29.3%),这是一个具有挑战性的高中奥林匹克问题集合。我们的方法称为*语句课程学习*,包括手动收集一组难度级别不同的陈述(不含证明)
X AI KOLs Timeline
一项研究分析了ALEKS数学学习系统中的320万条记录,发现ChatGPT出现后,学生完成AI友好的应用题速度更快,但学到的知识却更少,记忆保持率下降了25%。该研究强调,使用AI绕过脑力付出会削弱知识构建。
Reddit r/LocalLLaMA
一位研究人员让小型语言模型在自己生成的编程错误和修正上进行训练,在HumanEval上达到80%,并在数学上超越GPT-3.5,展示了在极少资源下的有效自我改进。
OpenAI Blog
# 对抗游戏提高语言模型输出的可读性 来源: [https://openai.com/index/prover-verifier-games-improve-legibility/](https://openai.com/index/prover-verifier-games-improve-legibility/) 确保语言模型生成可理解的文本对于提高其实用性至关重要,尤其是在处理复杂任务(如解决数学问题)时。我们发现,当我们仅针对获得正确答案来优化强大模型的问题求解过程时
X AI KOLs
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。