GPT-5 与数学发现的未来

OpenAI Blog 新闻

摘要

GPT-5 帮助数学家 Ernest Ryu 解决了一个困扰优化理论40年的开放问题,涉及 Nesterov 加速梯度法的稳定性性质。这一突破展示了大型语言模型通过从数学文献中提取相关技术和思想来辅助重大数学发现的能力。

UCLA 教授 Ernest Ryu 与 GPT-5 共同解决了优化理论中的一个关键问题,展示了人工智能在加速数学发现中的作用。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:49

# GPT-5 如何帮助数学家 Ernest Ryu 解决了一个 40 年的开放问题 来源:https://openai.com/index/gpt-5-mathematical-discovery/ 每一个重要的数学问题都有一段故事——有人提出问题,有人试图解决它,有人失败了,最终,也许,有人成功了。围绕解答一个令人沮丧的简单优化理论问题的故事并无不同,只是这位研究人员使用的工具能够快速从广泛的数学论文中挖掘想法和技术。 加州大学洛杉矶分校 (UCLA) 的 Ernest Ryu 教授在应用数学和优化理论领域有 15 年的经验,他对每个人都在谈论的大型语言模型 (LLM) 充满好奇。2023 年,他决定测试 ChatGPT-3.5 解决简单数学和逻辑问题的能力,比如在多个时区安排多人会议。他注意到它能理解隐含的约束条件(比如没人想在上午 12 点至早上 6 点之间开会),但产生准确结果的能力差异很大。它有很多优势,但在他看来,仍有很长的路要走。 Ernest Ryu 的照片 当 OpenAI 两年后推出 GPT-5 时,Ryu 开始听说该模型在数学方面快速发展的能力。他决定再次尝试,现在模型已经更加成熟,看看它是否能处理更复杂的问题。他没有预料到这将对解决他所在领域的一个长期悬而未决的问题做出有意义的贡献。 Ryu 决定解决一个"开放"问题,即未解决且被学界公认为有趣的问题。他的数学直觉告诉他,这个问题可能承认一个简单的解决方案;只是人类还没找到而已。 问题是:当算法使用一种称为 Nesterov 加速梯度 (NAG) 的现象时,它变得快得多——但从 NAG 添加的额外动量不会影响算法的稳定性吗? 与可能在受到过度推动时失效的汽车引擎不同,NAG 似乎能够提供"加速"而不会引入不稳定。几十年来,研究人员观察到这种行为,但他们无法完全解释为什么该方法始终保持快速*和*稳定的潜在原因。 NAG 于 1983 年由数学家 Yurii Nesterov 首次引入,是一种使用预测形式(通常被称为"向前看")的优化方法,用来加快算法收敛的速度。与传统算法不同,传统算法采取增量步骤并计算梯度(或函数在给定点的斜率的方向和陡峭程度),NAG 在向前看点计算梯度,使算法能够做出更明智的最终更新。通过预测参数将在何处,而不是计算时的当前状态,NAG 帮助更有效地引导算法的步骤、更快地收敛,并在接近函数最小值时管理其固有的振荡,从而更快地向解决方案迈进。 更简单地说,优化理论家想知道为什么算法动量的增加不会显著影响其稳定性。在训练机器学习模型或解决工程问题时,效率对于避免浪费计算资源和产生较慢的结果至关重要。 "通过扩展优化理论中现有的理论工具,我们共同设计为效率、稳定性和安全性优化的算法,"Ryu 说。他和其他几人多年前曾试图解决这个谜题,但未能提出能够揭示解决方案的数学证明。 当 Ryu 继续提示 GPT-5 时,经常在孩子睡着后深夜进行,他对该模型在尝试解决这个基本问题时的创意和非常规方法印象深刻。但是,当他重新检查模型的工作时,他会注意到其推理中的错误。问题仍然未解决。 "它有一个我从未想过的有趣方法,"他说——就像他在数学头脑风暴中重视的人类思维一样。"所以,这就是为什么我决定,好吧,让我进一步推进这件事。" 在整个过程中,GPT-5 并没有发明新的数学工具和原理。它非常善于使用现有的工具,从稍微超出给定专业领域的论文中找到方程、解决方案和想法,这些可能是 Ryu 否则不会遇到的。"它用它尝试的奇怪事物让我感到惊讶。它从这种大规模阅读和学习中提取的能力就是使它真正强大的原因。" Ryu 继续提示,同时将 GPT-5 视为他可以交换想法的合作者。他注意到它会继续产生创意想法,以新的和意想不到的方向推动他。当他提出一个问题时,它会提供一个方向——正确或错误——而 Ryu 会快速评估它。如果这个想法感觉像是一个死胡同,他会立即转向;如果它显示出前景,他会追求它看看它会导向哪里。这个过程的纯粹速度将通常需要数天的工作压缩到数小时。 "GPT-5 是一个非常不寻常的合作者,"他说,"因为它会提出完全出乎意料的东西。" > "数学研究的方式是你有想法,每当你或你的同事想出一个粗略的想法时,你就能感受到它是否会奏效。这是人工智能和人类之间的伙伴关系能够特别有效的地方。" GPT-5 使 Ryu 能够考虑解决证明的新潜在路径,这些路径他本来不会想到,无论是因为他没有看到联系,还是因为它们来自他不太熟悉的相邻数学领域。当 Ryu 继续与 GPT-5 一起探索想法时,一件事变得越来越明显:当与主题专业知识和仔细验证配对时,这些系统可以成为强大的探索工具。 "数学研究的方式是你有想法,每当你或你的同事想出一个粗略的想法时,你就能感受到它是否会奏效,就像一种数学直觉,"Ryu 说。"这是人工智能和人类之间的伙伴关系能够特别有效的地方。" 他继续这种提示 LLM 获取新想法、排除他认为是死胡同的想法以及追求他认为有潜力的想法的方法。 此外,他和 GPT-5 生成、评估、探索和穷尽想法的速度明显快于他单独工作的速度。经过大约三天内大约 12 小时与 GPT-5 的协作,以及近十几种方法之后,他正在研究的其中一种方法最终奏效了。 这个转折点出现在模型建议了一种重新构造支配 NAG 方法的方程的方式时。该建议按其所述并不正确,但 Ryu 认识到似乎有意义的结构特性,自己更严格地发展了它,并开始向模型提出有针对性的问题以测试潜在证明的可行性。这条探究线最终成为了他自己写出的最终证明的骨架。 "那是一种超现实的感觉,"他说,将这种经验比作与一个能够想出想法、提出问题和进行头脑风暴的能干学生合作。"与 GPT-5 合作真的在智力上令人兴奋,"Ryu 说。"我必须保持警惕以检查计算步骤,但仍然比自己进行计算快得多。" 虽然这个过程明显更快,但它也需要仔细验证。GPT-5 经常产生看起来似是而非但经不起仔细检查的论证。Ryu 审查了每项建议,丢弃了失败的建议,并发展了包含数学上有意义的想法的建议。工作流程取决于他的判断——既要识别有前景的方向,也要认识到何时一条推理已经被充分探索。 Ryu 像使用工具一样使用 GPT-5,他非常小心地了解它在做什么,这样他就能辨别出它擅长什么和不擅长什么。当要求 GPT-5 检查工作时,Ryu 发现如果他开始一个新的聊天而不是要求模型在同一聊天中检查其工作,会取得更大的成功。他将结果输入新对话的过程有助于最小化累积错误。然后,他说,"你可以坐下来仔细检查所有细节本身,"就像在研究过程中通常会做的那样。 每个会话中,Ryu 都会制定一个问题,提示 GPT-5 获取一个方向或技术,并收到一个数学论证——有时正确,有时有缺陷,有时完全出乎意料。虽然 GPT-5 生成的几个论证是不正确的,但它在做人类通常会觉得认知上令人筋疲力尽的事情方面表现出色:快速提出和丢弃同一想法的变体,搜索可能论证的空间,以及从相邻子领域借用数学工具来详尽地搜索答案。根据 Ryu 的说法,"最终重要的几个关键步骤是由 GPT-5 建议的,"尽管它无法自己将它们组装成完整的证明。 这种动态类似于与一个能够立即显示新路径的伙伴探索一个巨大的迷宫。大多数路径通向无处,但探索的速度意味着死胡同被更快地发现。在经典研究工作流程中,排除一个想法可能需要大量时间。 在这种探索中使用 GPT-5 的主要好处是模型在整个过程中提供的加速。它能够从庞大的文献数据库中提取的速度使 Ryu 能够快速排除死胡同方法并追求有前景的方法。大约 12 小时内,Ryu 解决了他估计如果他以这种速度决定追求可能需要数周专注工作的问题。 "但那永远不会发生,"他说。"因为在三天的艰苦尝试后,我就会放弃。作为数学家,你必须决定是否放弃问题并转向下一个问题。" 但有了 GPT-5,他有了迅速取得进展的感觉,这使他继续前进。在他看来,这创造了一个心理转变:源源不断的新想法使问题在比可能更长的时间内感觉在达到范围内。 作为教授,Ryu 认真对待人工智能和学习之间的关系。这是一个必须被理解和利用以获得价值的工具。任何使用人工智能的人都必须足够精通他们正在探索的科目,以了解模型何时想出好想法,何时想出不正确的想法,以及何时犯了错误。 Ryu 解决 NAG 问题的工作的预印本论文已公开发布,正在进行同行评审,这通常需要 12-18 个月。为了吸引更广泛的数学社区,Ryu 以传统风格撰写了他的论文。GPT-5 想出了几个塑造最终证明的关键想法,但对于该论文,Ryu 清理了它并自己写了,连同相关的叙述。GPT-5 在标题和摘要中被提及,其贡献在全文中得到解释。经过深思熟虑如何信任 GPT-5 对帮助解决这个证明的协作,他最终决定它被用作工具,这就是为什么 GPT-5 没有列为合著者。 "我希望这是一个案例研究,向经典数学家说明使用 GPT-5 的潜在价值。为了做到这一点,我觉得我可能应该遵循经典出版期刊论文和这种学术方式的风格,"Ryu 说。 Ryu 的经历只是 GPT-5 如何能帮助世界上最聪慧的人找到解决人类最复杂和最有趣问题的解决方案的一个例子。他的成功在很大程度上依赖于他在数学领域的专业知识,以及他愿意逐步、三重和四重检查 LLM 推理和每一步断言的意愿。 最终,Ryu 认为当研究人员以生产和积极的方式使用人工智能时,这将是一件好事。他期望来自相邻领域的想法的多样性变得更容易获取,他认为这是一个积极的发展。 "要有耐心,"Ryu 说。"如果你想让模型失败,它就会失败。但如果你的心态是你想与模型合作来提取价值,那么你更有可能这样做。" "这次经历对我产生了深刻的影响。我计划今后在我的数学研究中一直使用人工智能,"Ryu 说。"没有理由我不会。"

相似文章

用GPT-5.2推进科学与数学

OpenAI Blog

OpenAI发布了GPT-5.2,包括专门针对科学和数学工作优化的GPT-5.2 Pro与GPT-5.2 Thinking变体。该模型在GPQA Diamond(93.2%)和FrontierMath(40.3%)等基准测试中达到了最先进的性能,展现出更强的推理能力,旨在加速物理、化学、生物和数学等领域的科学研究。

我最近使用 ChatGPT 5.5 Pro 的一次体验

Hacker News Top

数学家 Timothy Gowers 讲述了 ChatGPT 5.5 Pro 如何在约一小时内、几乎不需要人工干预的情况下,产出了博士级别的数学研究成果——解决了一篇组合数学/加法数论论文中的若干开放问题。这一经历促使他大幅修正了对大语言模型数学能力的评估。