如果AI+人类能够覆盖弱点来解决复杂数学问题,那么我们就能解决AI问题
摘要
本文探讨了在假设驱动研究中,人机协作如何推动数学问题解决和人工智能发展,并以黎曼猜想的进展以及用于架构搜索的AIRA-Compose系统为例。
其中一部分内容是在AI协助下撰写的,但提出的观点是有依据的。请稍加信任,继续读下去。这不是什么天马行空的新想法,而是大型实验室已经在做的事情,我们现在也可以尝试。让我们看看今年发生了什么。一个模型将黎曼猜想的进展从41.6%推进到67.2%,并在Lean证明助手中得到验证,还经过了外部数学家的审查,而不仅仅是宣布。另一个模型以大约2000美元的计算成本,解决了群论中一个存在了27年的开放问题。这些都不是因为AI自己决定去研究数学而发生的。是人类选择了目标。AI则完成了严谨、详尽、可验证的追踪工作。这就是我认为人们一直忽略的部分。我们实际上并不是在等待AI产生想法。我们是在等待有人提出正确的问题。值得回顾一下Transformer本身是如何诞生的,因为我认为其模式是相同的。《Attention Is All You Need》(Vaswani等人,2017)中的核心举措并非某种黑箱式的飞跃,而是一个具体、可陈述的假设:循环对于序列建模并非必要。这篇论文是构建并测试该假设直至其结论的工作。一个猜测,足以用一句话清晰地表述,交给一个被设计用来推导其结果的过程。那么,为什么我们总是将‘Transformer之后会是什么’视为需要某种神秘火花的东西呢?实际上已经存在一个真实的、正在运行的版本,正是这个过程。一个名为AIRA-Compose(Pepe等人,2026,arxiv.org/abs/2605.15871)的多智能体系统搜索注意力、MLP和Mamba组件的组合,先以低成本小规模测试候选架构,然后只对那些经得起考验的进行扩展。它已经找到了架构——AIRAformer-D和AIRAhybrid-D——在下游任务上比Llama 3.2高出2.4-3.8%,并且具有比基线更好的计算扩展曲线。这是一个小型、真实的成果,而非预测。我想坦诚地说明局限,因为我认为这才是真正有趣的部分。这些成功是在代理规模上确认的,尚未在前沿规模上验证,并且运行这些流程的同一研究团队报告称,大多数被测试的假设最终结果都是噪声,而非突破。这不是方法的失败。而是一个诚实的过滤器在正常工作时的样子。如果你想实际尝试,这里大致是目前有效的模式:像数学成果那样开始。选择一个具体、狭窄、定义明确的目标,不是‘改进AI’,而是像‘移除X是否会改变性能’这样可证伪的目标。将其表述为一个清晰的假设,就像‘循环不必要’那样陈述,而不是开放式地‘想出点新东西’。模糊的提示是这些流程中大多数噪声的来源;具体的假设才是实际成功的来源。让模型做它擅长的部分:针对那个特定假设,组装和重组已知组件,并严格检查结果是否真实。不要轻信单一的自我报告;黎曼和Astra的成果之所以重要,是因为它们经过了外部证明助手和独立评审员的核查,而不是因为模型声称有效。然后,在大规模测试之前先进行低成本测试。在标准架构上训练一个小型、快速的基线模型,用你提出的修改训练另一个相同的小型模型,相同的数据、相同的规模、没有其他差异,然后进行比较。AIRA-Compose和类似系统正是通过这种方式保持低成本,在任何人投入真实计算资源进行扩展之前运行代理规模的比较。如果小规模下没有真实信号,那通常就是你的答案。如果有,那你就有了进一步扩展的理由,同时要记住,小规模的成功并不能保证在前沿规模上成立,因此将其视为值得追寻的有力线索,而非最终结果。值得注意的是,这不仅限于架构。相同的人类假设、AI执行、小模型验证循环也适用于此领域的其他开放问题。长期可靠性、持续学习、自我改进的训练循环,所有这些都具有相同的模式:一个具体的、可陈述的‘如果我们尝试X而不是Y会怎样?’,低成本测试,只有在验证有效时才进行扩展。如果你对这些问题中的任何一个有精确、可测试的‘假设X不是必需的’,那就是目前真正的瓶颈所在。我鼓励你们都启动你们最好的模型,开始测试针对当前AI最大障碍的每一种方法。我们提出问题并进行测试的人越多,我们获得解决方案的速度就越快。请记住,AI现在不需要自己思考。你只需要引导它,并在其长期规划、外推、逻辑跳跃和提出正确问题方面的弱点上为其提供支持。我们不需要等待大公司创新,我们只需要提出正确的问题,并集中我们的发现共同努力,我们就能更快地取得进展。
相似文章
人工智能与数学的未来(2分钟阅读)
Grant Sanderson 与 Dwarkesh Patel 探讨了人工智能在数学领域的快速进展、概念突破的本质,以及随着AI的进步这对其他领域意味着什么。
AI超越数学家
AI已经进步到能够为原创数学研究做出贡献的程度,超越了人类数学家,并可能减少对该职业的需求,尽管人类与AI的团队合作可能最终表现出色。
没有数学家的数学
一篇关于OpenAI的人工智能解决十个开放数学问题的反思性文章,认为人工智能最终将超越人类数学家,并重塑数学与科学。
"AI解决了数学最重大的挑战之一,但无法可靠地计算两个数的相加?!" [D]
讨论了AI系统能解决复杂数学问题却难以完成基本算术(如两数相加)这一明显矛盾。
AI解决数学问题是否正在经历指数级增长?
本文讨论了AI解决数学问题的能力是否在呈指数级增长,并可能分析了近期的趋势和研究。