2026年9月25日 ScienceYes:Claude能够完成九圈计算
摘要
物理学家Matt von Hippel向AI公司发起挑战,要求解决理论物理学中的一个计算问题,来自Anthropic的Claude在一个月内成功计算了N=4超杨-米尔斯理论中的九圈振幅。
暂无内容
查看缓存全文
缓存时间: 2026/09/25 19:16
# Claude计算出N=4超杨-米尔斯理论中的九圈振幅
来源:https://www.anthropic.com/research/yes-claude-can-do-nine-loops
*在这篇客座文章中,物理学家兼科学作家马特·冯·希佩尔分享了当他向人工智能公司发起挑战,针对其曾研究的理论物理子领域中的某个问题时所发生的故事。*
九环振幅示意图
发起挑战后竟在一个月内被攻克,这种事并不常见。但我们正身处一个非凡的时代。
请允许我自我介绍:我是马特·冯·希佩尔。我曾是一名理论物理学家,如今是一名科学作家。长期以来,我一直在博客上以4gravitons.com (https://4gravitons.com/) 为阵地,每周撰写关于物理学及其研究者的文章。
随着博客中关于物理学的内容越来越多,不可避免地开始涉及人工智能话题。这让我有些困扰,因为我绝非AI专家。当然,我曾浅尝辄止地涉足过这个领域(https://arxiv.org/abs/2502.05121),见识可能比您的祖母要多些,但终究需要退后一步,信赖专家们的意见。令人沮丧的是,专家们众说纷纭:我遇到过一些聪明、见多识广的人,他们坚信AI距通用人工智能仅剩数年光阴,而这种智能将带来真正可怕的事物;我也遇到过同样聪明、见闻广博的人,他们同样确信基于大语言模型的AI已接近其能力上限,像Claude这样的模型甚至无法在物理学领域做出令人瞩目的成果,更遑论征服世界。
我一直不太愿意做出自己的预测。在形成观点之前,我希望看到大语言模型能在某个熟悉的领域取得进展——一个我深知其难度的领域,因为我曾尝试解决过类似的问题。
此外,我还希望看到大语言模型完成一项我预计**计算上**极其困难的任务。大语言模型在数学领域已取得惊人进展,这一点毋庸置疑,仅本月发生的事件 (https://www.quantamagazine.org/ai-has-solved-one-of-maths-1-million-millennium-prize-problems-20260908/) 很可能已改变了许多人的看法。然而,数学进步往往源于新思想的诞生,而思想本身充满神秘感:在发现之前,人们永远难以确切知道其寻找难度。相比之下,计算过程显得更为“实在”。我渴望看到大语言模型应对一项挑战——这项挑战之所以看似遥不可及,并非因为研究者们在原理上不知如何解决,而是因为实施它似乎需要超出研究者合理可用范围的更多算力和时间。我想验证这些研究者是否错了:一个更智能的“人工研究者”是否能利用相同的计算机资源来攻克此难题。
于是,我发起了挑战 (https://4gravitons.com/2026/08/07/it-only-counts-when-ai-gets-to-my-field/):
> “如果AI公司想打动我这类人(或者说震慑我们),那么他们需要攻克我曾经的领域。证明AI能够利用学术界可及的计算机资源,解决散射振幅领域某个悬而未决的重大问题。证明那个被所有人认为是障碍的计算瓶颈实际上无关紧要。为我们实现七圈的N=8超引力理论,或者九圈的N=4超杨-米尔斯理论。”
简而言之:AI能否解决我曾经从事的理论粒子物理子领域的前沿问题?而且是在预算有限的情况下?
## **挑战详情**
我曾经从事的领域是理论粒子物理的一个分支,称为“振幅学”。当其他粒子物理学家预测新粒子时,他们必须确保能通过计算来验证这些预测。他们计算一种称为“散射振幅”的公式,使物理学家能够利用亚原子粒子的动量和能量来计算它们发生特定反应的概率。如果物理学家能对这些反应做出更精确的预测,他们就能检验大型强子对撞机等实验的结果是否与预测相符。任何不符都可能成为新理论的证据,这种理论有望解释物理学中一些悬而未决的重大谜团,例如暗物质的本质,或是宇宙中物质与反物质的平衡之谜。
这些散射振幅公式极难计算,物理学家几乎总是采用近似方法。他们进行部分计算,将计算限制在特定数量的“圈”内。“圈”是衡量粒子间相互作用复杂度的指标。计算中包含的“圈”数越多,结果就越接近真实答案,但计算的难度也随之指数级增加。
实际上,大多数散射振幅公式仅计算到两圈。少数达到了三圈。您可能听闻的粒子物理学中最精确的预测使用了五圈 (https://en.wikipedia.org/wiki/Anomalous_magnetic_dipole_moment#Electron)。
振幅学家们渴望取得更大突破。他们开发创新的实验性技术,并在特殊的“玩具模型”理论中进行测试。通过在计算更简单的玩具模型上试验技术,而非直接挑战现实世界中更复杂的粒子,振幅学家们可以对新方法进行压力测试,并观察其潜力极限。
我针对其中两个玩具模型发布了挑战。Anthropic团队选择攻克的是将特定玩具模型理论——N=4超杨-米尔斯理论——计算推进到九圈。
“杨-米尔斯”是一类技术性理论的名称,它解释了我们周围世界的大部分现象。自然界四种基本力中的三种:电磁力、将原子核束缚在一起的强核力,以及导致香蕉等物质发生放射性衰变的弱核力,均属于杨-米尔斯理论。
“N=4超”部分源于超对称理论。物理学家推测每种粒子都有一个“超对称伙伴”,即电荷相同但类型不同的粒子,例如将物质粒子(如电子)与力粒子(如光子)配对。他们曾乐观地认为,通过未发现的更常见粒子的伙伴,这些粒子可能解释暗物质。这些推测使用了“N=1”超对称。而在“N=4”中,每种粒子拥有*四个*超对称伙伴,而非仅仅一个。
这种粒子过剩使得该理论极不现实。N=4超杨-米尔斯理论并非用于解释暗物质,或现实世界中的任何事物 (https://arstechnica.com/science/2013/05/earning-a-phd-by-studying-a-fine-incorrect/)。相反,振幅学家们用它来锤炼技术,因为N=4在计算上反而更为容易。不同粒子间精妙的平衡意味着只需特定的变量组合,从而简化了计算过程。
这些计算采用了一种名为“自举法”的实验性技术,该技术竟意外地非常适合AI应用。进行自举法计算振幅时,无需考虑所有可能的粒子相互作用。你只需大致知道答案应有的形式,用专门的符号体系在计算机文件中记录每种可能性。然后,你开始核查所有已知信息:来自其他计算技术的预测、答案必须遵循的规则、与答案更容易求解的关联问题的联系。这有点像数独游戏:从一个包含所有可能数字的网格开始,边做边排除。最终,你希望发现只有一种可能性能满足所有检查条件,同时保留足够的检查步骤以确保自己未犯错误。
这意味着,兰斯已经为验证别人提交的九圈振幅公式做好了充分准备。这将是一个有趣的答案,不仅是对自举法技术的验证,也是罕见的复杂度达如此之高的振幅实例,其本身就值得深入研究。
但他尚未计算出该结果,该领域内也无人计算出来。他找到八圈答案的过程本身就有些间接,是通过一种令人惊讶的联系 (https://www.quantamagazine.org/particle-physicists-puzzle-over-a-new-duality-20220801/)(关联到一个不同但相关的公式——形式因子)实现的,这是一种涉及不同粒子的部分类振幅,结果表明更易计算。他预期找到下一圈的结果会更加间接,可能需要借助不同类型的AI方法。如果人们认为只需将常规自举法多运行一圈就能完成,早就有人做了。
## **然后,他们做到了**
显然,Anthropic有同事在读我的博客。
八月底,Anthropic的两位物理学家利亚姆·菲茨帕特里克和悉达多·米什拉-沙尔马联系我,表示他们攻克了我文章中的一项挑战。在与兰斯验证结果后,他们向我讲解了他们的方法。
秉承挑战的精神,他们并未动用数百万美元的算力。他们使用的是Fable 5.1,基于Claude Science (https://claude.com/product/claude-science) 平台进行工作,这是一个供科学家付费使用的平台。Claude Science在业内被称为“工具集”,它利用Claude大语言模型,结合结构化规则和提示,以获得更稳健、更具科学实用性的行为。
据称,在询问Claude它最有可能解决哪个问题后,他们给出了一个简单的提示:
“问题是在平面N=4超杨-米尔斯理论中计算六粒子(六边形)振幅至九圈。”
从那以后,他们只需不断指示它继续工作,比如:
“我要去睡觉了,接下来几个小时都不在线。请持续工作,直到我通知你停止。每4-6小时给我一次更新。”
Claude最终用两种不同方法完成了计算:原始自举法和间接的形式因子法。任何一种方法大约会花费最终用户一两千美元,主要是由于长时间运行Claude的成本。自举法计算使用Python编程语言及SymPy包,耗资约100美元,相当于96个CPU运行一周的成本。
九年前我做这类工作时,96个CPU运行一周感觉很多,但如果理由充分,现在这成本相当低廉。
事实证明,人类完成这项任务也指日可待。在我收到Anthropic消息几天后,我们收到了来自北京中国科学院的振幅学家何颂的消息。何颂的团队已获得大部分结果。他们也借助了一些基于GPT-6的AI辅助,但并非Anthropic那种近乎无人工干预的一次性完成方式。
目前各方关系友好,这让人松了口气。人类研究者——兰斯、何颂及其合作者——将发表成果,花时间解释并分析结果,以造福未来研究者。Claude的任务,目前已告一段落。
## **那么,问题解决了吗?**
我发起挑战是希望更好地了解当前AI的能力及其未来潜力。我学到了什么?
我本以为这可能是见证AI以惊人方式突破计算壁垒的机会。结果发现,它完成的是人类也能做到的事。Claude使用了已知的方法,只是比之前人们尝试过的多用了一些算力。它可能因为使用Python而非Maple(兰斯最爱的数学软件)或Mathematica(我的最爱)而获得了优势,也可能采用了比我们优秀得多的软件工程实践,但并非超级智能般的碾压。
我最大的收获是:垂手可得的成果比预期更多。即使目标明确且简单,有时在专家眼中实现难度远低于实际。一些有计算机背景的人多年来一直告诉我,振幅学家只需雇佣几位程序员就能取得更大进展。他们现在应该感到 vindicated(被证实是正确的)。
同样值得注意的是,Claude Science在一次尝试中完成了这项任务,除了“继续”之外,没有任何更复杂的科学监督。这些都是精细而繁杂的计算。如果我使用96个CPU一周的时间来做这类计算,几乎肯定会耗时两周:几乎可以肯定我第一次尝试时会搞砸。我不知道Claude在过程中犯了多少错误,但这个工具集让它在没有外部合作者输入的情况下完成了任务。在这一点上,我并不感到惊讶。但如果你之前仍认为AI错得离谱、无法使用,那么这应该是你的核心收获:它现在可以可靠地完成这类事情。
进展无疑非常迅速。三月份 (https://www.anthropic.com/research/vibe-physics),AI完成物理项目的方式还像个学生:处理小规模任务,需要大量指导且常犯错误。相比之下,这次计算是真正的前沿挑战,通常由振幅学领域的顶尖专家来解决。尽管这可能只是一个对AI更友好的问题,但我认为不仅如此:我认为技术确实取得了实质性进步。
我能将此结论推广到多远?我不确定。
这类玩具模型理论往往局限于小众子领域。现实世界的振幅计算领域更广泛,许多团队竞相冲击前沿。那里垂手可得的成果可能更少。但我不会轻下断论。我知道从事这些计算的人越来越多地使用AI进行编程。如果人们尚未检验AI科学工具集能否一次性完成那里的前沿计算,他们应该去验证(并且应该制定结果验证计划)。如果有人能以合理预算再推进一圈,我丝毫不会感到惊讶。
那么,这将成为学界讨论的问题:新的前沿在哪里?接下来需要解决什么?与许多数学问题不同,振幅学不仅仅是新方法的训练场。它有一个目标:使预测足够精确,以与即将进行的实验结果相比较。该领域距离这一目标又近了多少?
不过,更广泛地说,我并未真正得到答案。
我最初的好奇不仅在于AI当今在研究中能做什么,更关乎未来。当你阅读大语言模型出现之前关于通用人工智能的预测时,它们常常提出看似奇幻的风险。人们想象AI能模拟人类以预测并操纵他们的行为,或是从第一性原理出发设计出终结物种的病毒或吞噬世界的纳米技术。对这些风险的常见反驳是,它们混淆了智能(模糊而神秘的新思想源泉)与计算能力。批评者认为,即使新建一批数据中心,其计算能力也不足以完成任何这些任务,那些不过是科幻小说中尚未到来的噩梦。
我觉得自己并未给这些批评者提供更好的答案。我了解到一些关于AI现状的信息:它可以在合理预算内完成我曾经研究领域的重要工作,而且几乎是自主完成的。但我曾希望看到更奇特的现象——计算本身出现具有意外能力的新方法。我曾希望窥见未来,为关于通用人工智能的辩论提供有见地的观点。我想知道AI能将计算极限推向多远……而我在这里学到的,似乎只是我对极限所在之处过于天真了。
## **附录:被机器抢先发表是何感受?**
*——兰斯·迪克森,SLAC国家加速器实验室粒子物理与天体物理学教授*
相似文章
@AnthropicAI: 科学博客最新动态:是的,Claude 能进行九圈计算。理论物理学家使用公式预测粒子行为……
Claude AI 解决了理论物理中的九圈散射振幅问题,创下新纪录,并展示了人工智能在复杂科学计算中的潜力。
2026年8月10日 科学 进一步了解Claude的数学能力
Anthropic报告称,一个未发布的研究版Claude将与黎曼猜想相关的一个长期未解决的下界从41.6%提高到了67.2%,并提供了形式化验证的证明。
2026年8月18日科学:Claude如何加速蛋白质设计与分析化学
Claude AI模型,包含Mythos和Opus变体,成功为15个目标中的14个设计了蛋白质结合剂,成功率高于一般水平,并快速准确地执行了化学分析任务,展示了科学研究的加速进展。
Claude Mythos
Anthropic的新AI模型Claude Mythos,使用Claude Code框架,据报道在OpenAI先前证伪之后,通过找到替代的简单证明,解决了Erdős的不同距离问题。这展示了LLMs进行独立科学突破的能力。
2026年6月5日 - 科学: 让Claude成为化学家
Anthropic正在与化学家合作,提升Claude的化学能力,首先发布了一份白皮书,比较Claude在核磁共振波谱分析中的表现与ChemDraw的差异。