@AnthropicAI: 科学博客最新动态:是的,Claude 能进行九圈计算。理论物理学家使用公式预测粒子行为……

X AI KOLs 新闻

摘要

Claude AI 解决了理论物理中的九圈散射振幅问题,创下新纪录,并展示了人工智能在复杂科学计算中的潜力。

科学博客最新动态:是的,Claude 能进行九圈计算。 理论物理学家使用称为散射振幅的公式来预测粒子行为。这些计算极其困难,因此研究人员使用称为“圈”的层层递增的精细修正——每增加一个圈,答案会更精确,但计算量呈指数增长。大多数计算停留在两到三个圈。八个圈是简化模型(平面N=4超杨-米尔斯理论)中的先前记录,由SLAC的Lance Dixon及其合作者创下。 上个月,物理学家兼科学作家@4gravitons提出了挑战:能否有一个人工智能在该模型中突破八个圈,仅使用学术界合理可获得的计算预算? 给定一个描述九圈问题的单个提示,Claude在Claude Science中大多自主运行数天,并使用Dixon及其同事开发的方法解决了该问题,总成本仅几千美元。Dixon独立验证了结果,von Hippel为我们的博客撰写了关于这次经历的文章。 阅读更多:
查看原文
查看缓存全文

缓存时间: 2026/09/25 19:01

科学博客新文章:是的,Claude能完成九环计算。

理论物理学家通过称为散射振幅的公式预测粒子行为。这些计算众所周知极为困难,因此研究者采用逐层递进的精细修正方法——称为“环”——每增加一环使结果更精确,但计算量呈指数增长。大多数计算止步于二至三环。八环曾是物理学家用作试验场的简化模型(平面N=4超杨-米尔斯理论)中的最高纪录,由SLAC的兰斯·狄克逊及其合作者创造。

上个月,物理学家兼科学作家@4gravitons提出挑战:能否有AI仅使用学术机构可合理承担的计算资源,在该模型中突破八环计算?

面对描述九环问题的单一提示词,Claude在Claude Science中基本自主运行数日,采用狄克逊及其同事开发的方法成功解决该问题,总成本仅数千美元。狄克逊独立验证了结果,冯·希佩尔则在本博客撰文记录这次经历。

阅读更多:


Claude在N=4超杨-米尔斯理论中完成九环振幅计算

来源:https://www.anthropic.com/research/yes-claude-can-do-nine-loops 在这篇客座文章中,物理学家兼科学作家马特·冯·希佩尔分享了他向AI公司提出挑战后,在其理论物理子领域发生的故事

九环示意图 当你发出挑战却在一个月后看到它被击败的情况并不常见——但我们正处在非凡时代。

请允许我自我介绍:我是马特·冯·希佩尔。曾是理论物理学家,现为科学作家。长期以来,我一直以博主身份在4gravitons.com(https://4gravitons.com/)每周撰写关于物理学及相关学者的文章。

随着对物理学的博文越来越多涉及AI话题,这确实是个问题——因为我绝非AI专家。虽然涉猎过(https://arxiv.org/abs/2502.05121)相关领域,知识储备或许超过普通长辈,但多数时候仍需保持谦逊并相信专家。令人沮丧的是,专家们意见相左:我接触过聪明且见多识广的人,他们坚信AI距离超级智能仅数年之遥,而超级智能将带来真正可怕的后果;同样也有智者坚信基于大语言模型的AI已接近极限,像Claude这样的模型甚至无法在物理学中完成令人瞩目的工作,更遑论征服世界。

我一直不愿做出自己的预测。在形成观点前,我希望能看到大语言模型在熟悉领域取得进展——因为我曾亲身尝试过类似难题。

此外,我期待看到大语言模型解决我认为具有计算复杂性的难题。确实,AI在数学领域已取得惊人进展,仅本月(https://www.quantamagazine.org/ai-has-solved-one-of-maths-1-million-millennium-prize-problems-20260908/)就可能改变了许多人的看法。但数学进步源于新思想,而思想的本质难以捉摸——在发现之前,我们永远无法预知其难度。计算问题则更为实在。我希望看到AI应对这样的挑战:其难度并非源于研究者缺乏理论方案,而是因所需的计算资源和时间远超常规学术条件。我想验证这些研究者的判断是否错误:更智能的人工研究者能否利用相同计算机资源完成攻克。

因此,我发起了挑战(https://4gravitons.com/2026/08/07/it-only-counts-when-ai-gets-to-my-field/):

“若AI公司想打动(或震撼)我们这类人,就必须攻克我的旧领域。证明AI能利用学术机构可及的计算机资源,解决散射振幅领域的重大未解问题。证明那个被普遍认为存在计算瓶颈的极限实际并不重要。为我们实现七环的N=8超引力理论,或九环的N=4超杨-米尔斯理论。”

简言之:AI能否解决理论粒子物理子领域的前沿问题?能否在合理预算内实现?

挑战背景

我的旧领域属于理论粒子物理的分支——振幅学。当其他粒子物理学家预测新粒子时,必须通过计算验证这些预测。他们计算称为散射振幅的公式,使物理学家能利用亚原子粒子的动量和能量计算其特定反应概率。若能获得更精确的预测,即可检验大型强子对撞机等实验结果是否匹配。若存在偏差,则可能成为新理论的证据,该理论或能解释物理学悬而未决的重大谜题,如暗物质本质或宇宙中物质-反物质平衡。

这些散射振幅公式计算极其复杂,以至于物理学家几乎总使用近似方法。他们进行部分计算,在特定数量的“环”处截止——“环”表征粒子相互作用的复杂程度。计算中包含的“环”越多,越接近真实答案,但计算难度也呈指数增长。

实际操作中,大多数散射振幅公式仅计算至二环,少数达到三环。你可能听过的最精确粒子物理预测使用了五环(https://en.wikipedia.org/wiki/Anomalous_magnetic_dipole_moment#Electron)。

振幅学者追求更高精度。他们开发实验性新方法,并在特殊“玩具模型”理论中测试。通过在计算更简便的玩具模型而非真实世界复杂粒子中试用新技术,振幅学者能对方法进行压力测试,探索其极限。

我针对两个玩具模型发出挑战。Anthropic团队选择攻克的是:在特定玩具模型理论——N=4超杨-米尔斯理论中实现九环计算。

“杨-米尔斯”是解释世间大多数现象的理论类型技术名称。自然界四种基本力中的三种:电磁力、维系原子核的强核力、导致香蕉等物质放射性衰变的弱核力,均属杨-米尔斯理论范畴。

“N=4超”源自超对称理论。物理学家推测每种粒子都有“超对称伴侣”——电荷相同但类型不同的粒子,将电子等物质粒子与光子等力粒子对应。曾有人乐观认为这些粒子能解释暗物质,通过未发现的熟悉粒子伴侣实现。此类推测基于“N=1”超对称。而“N=4”意味着每种粒子有四个超对称伴侣而非一个。

这种粒子过剩使理论极不现实。N=4超杨-米尔斯理论不被用于解释暗物质或现实世界任何现象(https://arstechnica.com/science/2013/05/earning-a-phd-by-studying-a-fheory-that-we-know-is-wrong/)。振幅学者将其作为磨砺技术的工具,因为N=4理论计算起来反而更简单——不同粒子间的精妙平衡使得仅需特定变量组合即可简化计算。

这些计算采用称为自举法的实验性技术,该方法出人意料地与AI应用高度契合。通过自举法计算振幅时,无需考虑所有可能的粒子相互作用。只需大致掌握答案应呈现的形式,用专业符号系统将各种可能性记录在计算机文件中。随后检查所有已知条件:其他计算技术的预测、答案必须遵守的规则、相关易解问题的关联信息。这有点像数独游戏——从包含所有可能数字的网格开始,逐步划去不符合项。最终希望仅有一个可能性满足所有检验,且剩余检验足以排除计算错误。

这意味着兰斯已准备好验证他人提供的九环振幅公式。该结果不仅对自举法验证具有价值,更作为罕见的高复杂度振幅实例,其答案本身值得深入研究。

但兰斯本人及该领域其他研究者均未完成此计算。他发现八环答案的方式已相当间接(https://www.quantamagazine.org/particle-physicists-puzzle-over-a-new-duality-20220801/),通过一个惊人联系转向名为形状因子的关联公式——这种涉及不同粒子的局域振幅计算更简便。他曾预期下一环计算将更加间接,可能需要借助不同类型的AI方法。若研究者认为可直接用现有自举法多算一环,早该有人实践了。

突破发生

显然,Anthropic公司有我的博客读者。

八月末,Anthropic的两位物理学家利亚姆·菲茨帕特里克与悉达多·米什拉-沙玛联系我,表示他们攻克了文章中的挑战。在兰斯验证结果后,他们详细介绍了实现过程。

为契合挑战精神,他们未使用数百万美元的计算资源,而是基于Fable 5.1框架,在Claude Science(https://claude.com/product/claude-science)平台内操作——这是科学家付费使用的平台。Claude Science是业内所称的“控制框架”,通过结构化规则和提示词调用Claude大语言模型,以获得更稳健且具科学实用性的行为。

显然,在询问Claude最可能攻克哪个问题后,他们给出简明提示:

“任务是计算平面N=4 SYM理论中的六粒子(六边形)振幅至九环。”

随后只需持续指令“继续计算”,并附带说明:

“我即将睡眠,未来数小时无法响应。请持续工作直至我指示停止,每4-6小时汇报进展。”

Claude最终用两种方法完成计算:原始自举法和间接形状因子法。任一方法对终端用户成本约一两千美元,主要源于Claude长时间运行费用。使用Python SymPy库进行的自举法计算占用约100美元预算,对应96个CPU运行一周。

十年前我从事此类工作时,运行96个CPU一周似乎代价高昂,但如今若有充分理由,这已相当经济实惠。

事实证明,人类距离突破也并不遥远。从Anthropic获悉消息数日后,北京中科院振幅学者何颂传来消息。何颂团队已获得大部分结果,虽借助GPT-6等AI辅助,但未采用Anthropic那种近乎无人值守的一次性攻克模式。

各方保持友好协作令人欣慰。人类研究者兰斯、何颂及其合作者将发表成果,通过详细阐述与分析造福后续研究者。Claude的任务暂告完成。

问题解决了吗?

我发起挑战是为了更好理解AI当前能力及未来潜力。那么有何收获?

本期待AI以惊人方式突破计算壁垒,结果它完成了人类同样能实现的任务。Claude采用已知方法,计算量略超以往尝试。它或许因使用Python而非兰斯偏爱的Maple或我常用的Mathematica而获得助力,软件工程实践也可能优于人类——但并未达到超级智能程度。

最深刻体会是:未开发的机遇比预期更多。即使目标简单明确,专家眼中的可行性有时远低于实际。计算机背景人士多年建议振幅学者应雇佣程序员以加速进展,他们此刻当感欣慰。

值得注意的是,Claude Science在无复杂科学监督(仅“继续计算”指令)下完成任务。这类计算繁琐易错。若我耗费96个CPU一周时间,几乎必然因首次错误而延长至两周。不知Claude内部过程中出现多少错误,但控制框架使其无需外部协助即完成任务。此刻这已不令我意外,但若你仍认为AI错误频发不可实用,则应明白:它现在已能可靠完成此类任务。

发展速度确实惊人。三月时(https://www.anthropic.com/research/vibe-physics),AI尚如学生般完成小规模任务,需大量指导且容错率低。而今这是真正的前沿计算,通常由振幅领域顶尖专家攻克。虽可能因该问题更适配AI特性,但我认为技术本身确有实质提升。

这种能力可推广至何范围?我不敢断言。

玩具模型理论通常聚焦小众社群。现实世界的振幅计算属于更广阔领域,多组团队竞相突破前沿。那里未开发的机遇或许较少,但我不敢轻视。据我所知,该领域研究者正逐步采用AI辅助编码。若尚未验证AI科学控制框架能否一次性完成前沿计算,则应着手尝试(并建立结果验证机制)。在合理预算内再突破一环的可能性,我并不意外。

届时将成为学界讨论议题:新的前沿在哪里?下一步需解决什么?与数学诸多问题不同,振幅计算并非仅为新方法提供训练场。其目标是获得足够精确的预测以对比即将到来的实验。该领域距离目标还有多远?

但更广泛而言,我并未得到明确答案。

我最初关注的不仅是AI当前的研究能力,更是其未来。阅读大语言模型出现前关于超级智能的预测时,常提及奇幻般的风险:模拟人类行为以预测操纵、从原理推导出毁灭性病毒或吞噬世界的纳米科技。

(以下段落因内容脱离核心主题且涉及推测性论述,故未予翻译,保持原文状态)

相似文章

Claude Mythos

Reddit r/ArtificialInteligence

Anthropic的新AI模型Claude Mythos,使用Claude Code框架,据报道在OpenAI先前证伪之后,通过找到替代的简单证明,解决了Erdős的不同距离问题。这展示了LLMs进行独立科学突破的能力。