rohanpaul_ai:耶鲁大学及其他顶尖实验室的新论文显示,前沿模型已接近突破当今封闭式物理...
摘要
一项耶鲁大学主导的论文发现,前沿AI模型在物理基准测试中表现不佳,主要是由于基准测试的缺陷,而非模型本身的局限性,这表明基准测试质量是准确评估的关键瓶颈。
查看缓存全文
缓存时间: 2026/09/17 06:15
耶鲁大学等顶尖实验室的最新论文显示,前沿模型在当前各类封闭式物理基准测试中已接近上限。
许多表面的模型失误,实际上源于题目设计缺陷、错误答案和评分系统漏洞——经过审计的物理测试中,大部分失败案例都可归因于此,这使基准测试质量成为衡量前沿模型的新瓶颈。
研究人员并未直接采用原始评分,而是邀请物理学家对六项主流物理基准测试中的模型失败案例进行复核。
在四个被审计测试集的250个被判定错误的案例中,仅有12例属于真正的模型失误。
其余238例均因题目质量不佳、参考答案错误或评分系统错误否定正确答案所致。
经专家复核后,GPT-5.6-Sol的HLE-Physics测试分数从47.3%提升至78.7%。
可见,仅凭物理基准测试得分可能严重低估前沿模型的实际解题能力。
但这并不意味着这些模型能可靠地进行物理研究——作者团队的智能体仍未能完全解决其尝试的任何开放理论物理难题。
重要的是,我们必须认识到:不能再将基准测试分数视为衡量AI物理能力的绝对真实标准。
相似文章
前沿模型在物理学上的表现如何?专家重新评分揭示评估缺陷与主流基准测试接近饱和(1分钟阅读)
专家对物理学基准测试的重新评分表明,前沿AI模型的表现优于此前评估,这揭示了评估系统的缺陷以及封闭式任务的接近饱和,从而强调了进行更严格评估的必要性。
@andrewchen: “不要赌AI模型不会随时间大幅进步”曾经是你在支持前沿实验室时说的话…
Andrew Chen 认为,开放权重AI模型正在快速进步,并将覆盖大多数消费者/专业消费者用例,而前沿模型则只能竞争剩余高价值的10%应用领域,例如编程、科学和数学。
@rohanpaul_ai: 这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈…
一篇论文评估了八个领先的AI模型在长期任务上的表现,发现即使表现最好的模型也只达到了人类表现的27.3%,突显了可靠长期AI执行的重大局限性。
@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…
本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。
前沿模型并不像Navier-Stokes解决方案所暗示的那么好
本文批评了围绕Navier-Stokes证明公告的炒作,指出前沿AI模型并非如宣称的那样有能力,并强调了大规模计算和并行处理的作用,而非模型智能。