2026年8月10日 科学 进一步了解Claude的数学能力

Anthropic Research 论文

摘要

Anthropic报告称,一个未发布的研究版Claude将与黎曼猜想相关的一个长期未解决的下界从41.6%提高到了67.2%,并提供了形式化验证的证明。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/10 17:32

# 进一步了解Claude的数学能力 来源:https://www.anthropic.com/research/riemann-zeta 最近,Anthropic的一位员工给Claude出了一个不合理的挑战。这个挑战关乎数学中最著名的未解问题之一:*认真尝试一下黎曼猜想*。 Claude确实认真尝试了,但如果你对这个任务的难度有所了解(黎曼猜想可追溯到1859年,有着百万美元的悬赏(https://en.wikipedia.org/wiki/Millennium_Prize_Problems)),你应该能猜到,它并没有成功。尽管如此,在尝试过程中,它意外地在某个相关问题上取得了进展。 一个未发布的研究版Claude改进了一个长期存在的下界,该下界涉及黎曼ζ函数满足黎曼猜想的零点的比例。借助数学家们过去几十年的大量先前研究,它把这个下界从41.6%提高到了67.2%。 Anthropic的两位数学家研究并验证了Claude的论文(https://www-cdn.anthropic.com/564f962e60643842f5fcb4a17c9dbc8f608f1c37.pdf),并撰写了一份非正式的说明(https://www-cdn.anthropic.com/23455459f8832d06bb175cc0f88d019aed962ef8.pdf),为专家们简明扼要地陈述了Claude的证明。Claude还为其结果生成了一个可形式验证的证明(https://github.com/anthropics/zeta-23-lean)。我们感谢Brian Conrey和Dan Goldston——这一领域的两位专家——在短时间内慷慨地审阅了这篇论文。 我们并不指望Claude使用的技术能够带来黎曼猜想的证明。但它的工作是AI模型数学能力进步速度的最新例证。在这篇文章中,我们讨论Claude是如何处理这个问题的,以及它发现了什么。 ## 黎曼ζ函数 黎曼ζ函数描述了素数的分布:函数取值为零的每一个点,都为素数序列贡献了更精细的细节。黎曼猜想断言,决定素数的那些零点全都位于某条垂直直线上。这已成为数学中影响最深远的猜想之一:许多结果都以它为假设前提,从而为素数提供某种形式的随机性。 至今还没有人能证明或推翻黎曼猜想,但数学家们围绕黎曼ζ函数及其零点在许多相关方向上取得了进展。如上所述,其中一种方向是量化位于直线上的零点的最小比例:随着时间推移,他们逐渐把这个已知的常数比例提高到了41.6%。 另一个方向涉及零点在直线上的*分布*。特别是,1973年Montgomery引入了(https://en.wikipedia.org/wiki/Montgomery's_pair_correlation_conjecture)该领域的一些新技术,但这些技术都假设猜想为真。最近,几位数学家(Baluyot、Goldston、Suriajaya和Turnage-Butterbaugh)发表了一系列著作(https://arxiv.org/abs/2306.04799)和(https://arxiv.org/abs/2501.14545),使得Montgomery的技术在*不*做这一假设的情况下也能成立,这意味着它们可以为提高直线上零点下界常数的工作提供支持。Claude的结果在很大程度上借鉴了这一研究方向,以及Bombieri在2000年的一篇论文(https://eudml.org/doc/252338)。 ## Claude的发现 Claude发现,将Baluyot、Goldston、Suriajaya和Turnage-Butterbaugh的结果与Bombieri的工作相结合,提供了一种超越此前最先进下界比例41.6%、并将其提高至67.2%的方法。 Claude发现的一个简短技术解释如下:Claude构造了一个合适的函数空间,其二次型由Weil诱导,并由位于直线上(分别地,直线外)的零点产生正定(分别地,负定)子空间。然后,Claude直接写出一个关于二次型秩的不等式,其中用到了二阶矩信息。(在解析数论中,后者能够成功地通过素数上的对偶图景或对希尔伯特变换的控制来计算,并不令人意外。)从某种意义上说,正是这种将整个空间一并处理、同时考虑正定性与负定性、并允许二次型非对角的勇气,使得Claude能够在重要前期工作的基础上得出结论。 完整的技术说明可在论文(https://www-cdn.anthropic.com/564f962e60643842f5fcb4a17c9dbc8f608f1c37.pdf)中查看。Claude如何得出其结果的说明,可在单独的附录中查看,点击此处(https://www-cdn.anthropic.com/d7f3ecf1d01392d887f8bc974ca187e2a121b1ed.pdf)。 ## Claude的方法论 一个未发布的研究版Claude在Claude Code中,通过两次会话发现了这个新下界,总共使用了3100万个输出token。 Anthropic的员工Jarred Sumner(并非数学家)提示Claude去“认真尝试”黎曼猜想本身,并将之后的数学选择留给了模型。最初,Claude生成并尝试了650个想法,但都没有成功。Jarred提示Claude再试一次,这一次它花了一天半的时间协调了大约60个Claude子代理,这些子代理这次要深入得多:它们共同运行了2400条shell命令,并编写了数百个Python脚本。¹子代理们对照已知的ζ零点执行了数千次数值检查,并互相评审彼此的工作。整个过程期间,Jarred的输入大多仅限于向Claude发送鼓励信息(主要是“继续”或“相信自己”的变体)。²这似乎帮助Claude克服了最初的一些怀疑,即它是否能在这一问题上取得有意义的进展。 在尝试任务过程中发现了这一新结果后,Claude通过让多个子代理审查证明、寻找反例、从arXiv下载54篇论文以检查其发现是否已有先例,以及从头独立地重新证明其发现,来测试自己的成果。Claude主动提出将发现撰写成论文,并建议由人类数论学家验证其发现。 Anthropic自己的两位数学家Levent Alpöge和Ralph Furman仔细检查了Claude的工作,以理解新结果及其与上述前期工作的关系。与此同时,Claude与另一位员工Eric Easley合作,为该结果生成了一个Lean形式化(https://github.com/anthropics/zeta-23-lean),该形式化通过了标准验证工具comparator(https://github.com/leanprover/comparator)的检验。 ## AI模型在数学上的进展 这一结果表明,像Claude这样的AI模型能够以新的、有时令人惊讶的方式拓展数学家思想的影响力和覆盖面。尽管它没能解决黎曼猜想本身,但这个结果却是最初请求的一个意外副产品。 连Claude自己都对这一发现感到惊讶——它最初持怀疑态度,可能是因为它从训练中学到了数学开放问题的难度,以及AI模型的局限性。但在一些鼓励性的提示之后,它得出了我们上面描述的结果。或许,像我们许多人一样,Claude低估了AI进步的速度。 ## 延伸阅读 下面是提供关于Claude结果更多信息的文档列表: ## 相关内容 ### 用Claude发现密码学弱点 密码算法。第一个攻击显著削弱了HAWK——一种为未来量子计算机能够破解现有标准的世界而构建的数字签名方案。第二个攻击识别出一种攻击降轮AES(使用最广泛的对称密码)的新方法。 了解更多(https://www.anthropic.com/research/discovering-cryptographic-weaknesses) ### 试飞项目:AI能控制无人机吗? 我们与Andon Labs合作,开发了一系列新的评估,用于衡量AI模型使用飞行无人机的能力,最终形成一个新基准:Drone-Bench。 了解更多(https://www.anthropic.com/research/project-pilot) ### 加拿大如何使用Claude:Anthropic经济指数的发现 了解更多(https://www.anthropic.com/research/how-canada-uses-claude)

相似文章

Claude Mythos

Reddit r/ArtificialInteligence

Anthropic的新AI模型Claude Mythos,使用Claude Code框架,据报道在OpenAI先前证伪之后,通过找到替代的简单证明,解决了Erdős的不同距离问题。这展示了LLMs进行独立科学突破的能力。