前沿模型在物理学上的表现如何?专家重新评分揭示评估缺陷与主流基准测试接近饱和(1分钟阅读)

TLDR AI 论文

摘要

专家对物理学基准测试的重新评分表明,前沿AI模型的表现优于此前评估,这揭示了评估系统的缺陷以及封闭式任务的接近饱和,从而强调了进行更严格评估的必要性。

那些令人担忧的物理学分数往往是测试本身的问题。专家重新检查了六个流行的基准测试,发现大多数模型“失败”的背后是错误的答案键、模糊的问题和评分器漏洞。清理这些问题后,前沿模型的表现突然显得接近满分,因此下一个挑战必须是更难的人工设计的考试,而不是另一个基于有缺陷测验的排行榜。
查看原文
查看缓存全文

缓存时间: 2026/09/14 14:19

# 前沿模型在物理领域的能力如何?专家复核揭示评估体系缺陷与主要基准测试趋近饱和现象
来源:https://arxiv.org/html/2609.13009  
Ali Ansari、Haoran Sun、Andy Zeyi Liu、Mark Jabbour、Yongshan Ding、Steven Girvin、Yu He、Sohrab Ismail-Beigi、Aleksander Kubica、Owen D. Miller、Corey O’Hern、Vidvuds Ozolins、David Poland、A. Douglas Stone、Frank C. van den Bosch、Logan Wright、Navid Akbari、Santanu Antu、Kangle Cai、Andrew Calabrese-Day、Mateo Cárdenes Wuttig、Meng Cheng、Barry T. Chiang、Ali Ghorashi、Shouzhen Gu、Haoyang Huang、Zhibo Kang、Lukas Kienesberger、Hantian Liu、Charles Lomba、Zhongling Lu、Wenchao Ma、Rohin E. McIntosh、Evan McKinney、Ivan Rojkov、Xulei Sun、Yarone Meir Tokayer、Naveen Balaji Umasankar、Mira Varma、Leda Wang、Qimin Wang、Tyler Wang、Haoyu Wei、Jinming Yang、Jinchen Zhao、Sherlock Tingrui Zhao、Qinyuan Zheng、Jay S. Zou、Lucas Baker、Arman Cohan、John Sous  
耶鲁大学、Jump Trading集团、剑桥大学、南加州大学  
†\\dagger核心贡献者。α\\alpha物理学顾问。β\\beta数据审计员。详见作者贡献声明(https://arxiv.org/html/2609.13009#A7)。通信作者:[email protected]  

###### 摘要  
包括《人工智能分析智能指数(2026)》在内的主要物理基准测试报告的低分数表明,前沿语言模型在高级物理问题上仍然表现欠佳,这对它们的科学推理和量化问题解决能力提出了严苛考验。然而,这一印象与领域专家在实际工作中使用这些模型的经验并不总能吻合。我们通过在六个广泛使用的物理基准测试上评估前沿模型,并由专家进行审计,重新审视了这些报告结果,重点关注具有可验证最终答案的纯文本问题。针对物理学的每个子领域,具有相关专业知识的教师和研究生研究人员仔细审阅问题陈述、参考答案和模型响应,以区分模型的真实错误、评分者错误、错误的参考答案以及模糊或不明确的问题。大多数最初被评估为错误的审计案例反映的是基准测试本身的问题,而非模型的物理推理错误。随后,我们请专家通过纠正错误的参考答案、修复或排除有问题的问题来解决这些基准测试问题。我们发现,GPT-5.6-Sol在HLE-Physics上的平均@4(mean@4)测量值从47.3%上升至78.7%,在CMT-Benchmark上从61.0%上升至87.2%,同时其修正后的pass@4在54个保留的CritPt挑战题中达到94.4%。修正后的分数是在专家复核后,针对保留的评估子集计算得出的。UGPhysics、PRISM-Physics和PHYBench的审计子集分数在修正后也显著提升。这些发现表明,当前基准测试严重低估了前沿模型解决设定明确的物理问题的能力。在这些封闭式任务上趋近饱和的表现凸显了对更严苛、经专家验证的评估方法的需求。  

图1:GPT-5.6-Sol、Fable 5和Gemini 3.1 Pro在六个物理基准测试上的审计前与验证/修复后表现。所有分数使用mean@4,审计前的CritPt分数除外,该分数使用人工智能分析的mean@5。浅色和深色条形分别代表审计前和验证/修复后的表现。验证/修复后的表现在评估错误修正以及有问题的问题修复或排除后测量。  

## 1 引言  
大语言模型(LLM)在数学推理方面取得了快速进展。大量工作集中于通过数学基准测试来评估这些推理能力。随着模型在这些基准测试上的表现提升,评估工作的重点已转向物理学——这是检验LLM科学推理和问题解决能力的基础领域。过去两年中,出现了众多物理基准测试,涵盖从本科习题到专家策划的挑战(Xu等,2025 (https://arxiv.org/html/2609.13009#bib.bib1);Qiu等,2025 (https://arxiv.org/html/2609.13009#bib.bib2);Feng等,2025 (https://arxiv.org/html/2609.13009#bib.bib8);AI安全中心等,2026 (https://arxiv.org/html/2609.13009#bib.bib10);Pan等,2026 (https://arxiv.org/html/2609.13009#bib.bib4);Zhu等,2026 (https://arxiv.org/html/2609.13009#bib.bib5))。这些基准测试通常报告,即使是前沿模型,其表现也远逊于物理学家专家。例如,GPT-5.6-Sol在CritPt(Zhu等,2026 (https://arxiv.org/html/2609.13009#bib.bib5))最高推理强度下的mean@5得分为32.3%,在《人类终极考试》(HLE)(AI安全中心等,2026 (https://arxiv.org/html/2609.13009#bib.bib10))物理部分(以下简称HLE-Physics)的高推理强度下mean@4得分为47.3%。由于物理学结合了建模、数学和计算,这些分数表明其局限性可能延伸到金融和技术领域的其他量化应用。  
然而,鉴于AI辅助数学研究在开放问题上最近的进展,这些结论值得仔细审视。前沿模型及其构建的智能体为新的证明和解决开放研究问题做出了贡献(Bubeck等,2025 (https://arxiv.org/html/2609.13009#bib.bib13);Sothanaphan,2026 (https://arxiv.org/html/2609.13009#bib.bib14);Feng等,2026 (https://arxiv.org/html/2609.13009#bib.bib15)),包括解决长期存在的猜想和显著改进既定界限(Alon等,2026 (https://arxiv.org/html/2609.13009#bib.bib16);Tao,2026 (https://arxiv.org/html/2609.13009#bib.bib17);OpenAI,2026c (https://arxiv.org/html/2609.13009#bib.bib18);Alpöge和Furman,2026 (https://arxiv.org/html/2609.13009#bib.bib19);OpenAI,2026a (https://arxiv.org/html/2609.13009#bib.bib20))。这些成就本身并不能排除数学推理与物理推理之间存在真实差距,因为物理学需要数学之外的技能,如建模、抽象和确定合适的假设。然而,物理基准测试上的糟糕分数似乎与物理学家的经验相矛盾,他们报告模型在实际应用中表现出强大的能力(Schwartz,2026b (https://arxiv.org/html/2609.13009#bib.bib21);Guevara等,2026 (https://arxiv.org/html/2609.13009#bib.bib23))。这种明显的差异促使我们的核心问题:前沿模型*真的*在物理学习上存在困难吗?  
为了研究这个问题,我们对几个领先的物理基准测试进行了专家审计。我们发现,前沿模型现在能够以近乎完美的准确率解决广泛的定义明确、习题式的物理问题,这与人工智能分析报告的低分(人工智能分析,2026 (https://arxiv.org/html/2609.13009#bib.bib6))相反。我们招募了一个由物理专家组成的团队,包括教师及其研究生研究员,在各自子领域内对纯文本、封闭式的物理问题进行审计。审查员检查问题陈述、参考答案和模型响应,将测试模型的真实错误与评分者错误和基准测试材料中的缺陷区分开来。当问题出在材料本身时,审查员会识别定义不清的问题和缺失的假设,在可能的情况下纠正有问题的问题陈述和参考答案,并独立推导缺失的解。在纠正评估错误和修复或排除有问题的问题后,分数显著提高(图1 (https://arxiv.org/html/2609.13009#S0.F1))。在HLE-Physics上,GPT-5.6-Sol的mean@4从47.3%提升至78.7%。在CMT-Benchmark(Pan等,2026 (https://arxiv.org/html/2609.13009#bib.bib4))上,它从61.0%提升至87.2%。在CritPt上,审计前70个评估挑战题的mean@5为32.3%,审计后54个保留挑战题的mean@4为87.5%,pass@4达到94.4%。因此,这些基准测试上接近完美表现的明显差距是有问题的基准测试材料和评估程序的产物,而非前沿模型物理推理能力存在真实局限的证据。  

## 2 方法论:物理评估中的错误诊断  
我们的方法结合了基准测试评估和专家审计,以将测试模型的真实错误与评分者错误和基准测试材料中的缺陷区分开来。我们首先使用原始基准测试和可用的评估程序测量表现,然后审查问题陈述、参考答案和模型响应,以识别报告错误的来源。利用这些发现,我们纠正评估程序和参考答案,修复或排除有问题的问题,并重新评估模型表现。  

### 2.1 基准测试与评估套件  
#### 2.1.1 基准测试  
我们评估了六个广泛使用的物理基准测试,涵盖广泛的学科和难度水平,主要根据问题来源分为两组。第一组包括问题来自或改编自现有物理练习和考试的基准测试:UGPhysics(Xu等,2025 (https://arxiv.org/html/2609.13009#bib.bib1))专注于本科物理,PHYBench(Qiu等,2025 (https://arxiv.org/html/2609.13009#bib.bib2))包含难度延伸至物理奥赛水平的问题¹,PRISM-Physics(Zhao等,2025 (https://arxiv.org/html/2609.13009#bib.bib3))包含具有最终答案和过程级评估的高级物理问题(我们仅使用前者)。这些基准测试基于公开可用的来源材料,这造成了训练数据污染的潜在途径。第二组包括由*领域专家*贡献的原始问题构建的基准测试。HLE-Physics是《人类终极考试》(HLE)(AI安全中心等,2026 (https://arxiv.org/html/2609.13009#bib.bib10))的物理子集,CMT-Benchmark(Pan等,2026 (https://arxiv.org/html/2609.13009#bib.bib4))专注于高级凝聚态理论,CritPt(Zhu等,2026 (https://arxiv.org/html/2609.13009#bib.bib5))包含由专家策划的涵盖物理学大多数前沿领域的高级问题。所有六个都是封闭式基准测试。每个问题都旨在有一个模型必须获得的确定最终答案,基准测试提供该答案作为参考答案。一些基准测试还提供分步解答,即该答案的推导过程。只要最终答案(以任何等效数学形式)正确,响应无需遵循规定的推导过程。  

#### 2.1.2 审计前评估  
我们在纯文本物理问题上评估了三个前沿模型:GPT-5.6-Sol、Claude Fable 5和Gemini 3.1 Pro。附录A (https://arxiv.org/html/2609.13009#A1)总结了工具访问权限和推理设置。在纠正任何问题之前,我们首先使用原始基准测试材料和(如果可用)基准测试自身的评估器对每个模型的响应进行评分。我们将这些称为审计前分数。CMT-Benchmark没有公开的评估器,因此我们调整了HLE评估流程,包括其系统提示和LLM-裁判提示,以根据提供的参考答案评估响应。我们报告审计前准确率为mean@4,即四次尝试的平均准确率,CritPt除外,其审计前分数是人工智能分析报告的mean@5值²。图1 (https://arxiv.org/html/2609.13009#S0.F1)和表1 (https://arxiv.org/html/2609.13009#S3.T1)报告了这三个模型的审计前准确率。相应的错误率将真实的模型错误、评分者错误和基准测试材料中的缺陷混在一起。因此,我们进行了以下描述的专家审计,以识别每个错误的来源,然后报告修正后的准确率。  

### 2.2 错误归因  
我们审计的主要目标是识别每个表观模型错误的来源。我们将每个审计案例分配到以下三个类别之一。  
**模型错误**。问题设定明确且参考答案正确,但测试模型给出错误答案。只有这些才算作真实的模型错误。  
**评分者错误**。问题设定明确,参考答案正确,且测试模型给出正确答案,但评估器标记为错误。这主要发生在基于规则的评估器中,因为它们可能无法识别以等效数学形式或不同惯例书写的正确答案。  
**基准测试错误**。问题陈述或参考答案存在缺陷。这包括错误的参考答案、不一致的条件、歧义或缺失的假设。当缺失的假设对于确定预期答案是必要的,且无法从问题陈述中明确推断时,我们将其归类为基准测试错误。  

**错误在各基准测试中的分布**  
图2:基准测试缺陷很常见,且评分者错误在基于规则的评估器中尤为普遍。评分者错误在使用基于规则评估器的PHYBench和PRISM-Physics的审计案例中占主导地位。条形图显示每个基准测试审计集的比例:前四个基准测试的拒绝答案(总计250个),以及CMT-Benchmark和CritPt的所有审计问题。评分者错误无法针对CMT-Benchmark或CritPt确定,因为其原始评估器的逐题判断不可用。  

### 2.3 审计数据收集  
为了减轻专家对HLE-Physics、PHYBench、PRISM-Physics和UGPhysics的审查负担,我们将审计限制在GPT-5.6-Sol高推理强度的所有尝试均被评估为错误的问题上。用于审计的运行与获取表1 (https://arxiv.org/html/2609.13009#S3.T1)中报告的审计前评估结果所使用的运行是分开的。附录B.3 (https://arxiv.org/html/2609.13009#A2.SS3)提供了这些运行的详细信息。  

### 2.4 专家审计  
我们由一个主要来自耶鲁大学的物理学家团队进行审计。我们将每个问题匹配给在其子领域具有专业知识的审计员。任务分配遵循附录F (https://arxiv.org/html/2609.13009#A6)中描述的协议。审计员首先评估问题陈述是否设定明确且参考答案正确。如果不是,则该案例被归类为基准测试错误。我们将此类问题从HLE-Physics、PHYBench、PRISM-Physics和UGPhysics中排除。对于CritPt和CMT-Benchmark,审计员则尽可能修复问题陈述或参考答案,例如添加缺失的边界条件或澄清确定预期答案所需的惯例(图6 (https://arxiv.org/html/2609.13009#A6.F6))。我们保留修复后的问题,并排除那些无法找到合理修复的问题。我们将由此产生的评估标记为“验证/修复”,并在本文其他地方称为“修正后”评估。对于剩余案例,审计员评估测试模型是否给出正确答案(允许等效的数学表达式和符合问题陈述的替代惯例),并将案例归类为模型错误或评分者错误。每个审计案例获得一个标签。  

## 3 结果  
**基于规则的评分者错误的典型例子**

相似文章

评估AI执行科研任务的能力

OpenAI Blog

OpenAI推出FrontierScience,这是一个新的基准测试,用于衡量人工智能在物理、化学和生物学领域的专家级科学能力。GPT-5.2在奥林匹克式任务中达到77%,在研究型任务中达到25%。该论文提供了早期证据,表明GPT-5能显著加速真实的科学工作流程,将工作周期从数周缩短至数小时,同时建立了度量标准,以追踪朝着AI加速科学研究的进展。