rohanpaul_ai:耶鲁大学及其他顶尖实验室的新论文显示,前沿模型已接近突破当今封闭式物理...

X AI KOLs Following 论文

摘要

一项耶鲁大学主导的论文发现,前沿AI模型在物理基准测试中表现不佳,主要是由于基准测试的缺陷,而非模型本身的局限性,这表明基准测试质量是准确评估的关键瓶颈。

耶鲁大学及其他顶尖实验室的新论文表明,前沿模型已接近突破当今封闭式物理基准测试的上限。 此外,许多表面上的失败源于问题设计不当、参考答案错误以及严格的评分标准,这些因素解释了大多数经审核的物理失败案例,使得基准测试质量成为衡量前沿模型的新瓶颈。 研究人员让物理学家重新检查了6个流行物理基准测试中的模型失败案例,而不是依赖原始分数。 在4个经审核的基准测试子集的250个被拒绝案例中,仅有12个是模型的实际错误。 其余238个案例源于问题设计不当、参考答案错误,或评分标准拒绝了正确答案。 经专家评审后,GPT-5.6-Sol在HLE-Physics上的测量分数从47.3%上升至78.7%。 因此,低物理基准分数可能会严重低估前沿模型的实际解题能力。 但这并不意味着这些模型能可靠地进行物理研究:作者们的代理模型在尝试解决任何开放理论物理问题时仍未能完全成功。 但这确实意味着,不应再将基准分数视为AI物理能力的纯净基准事实。
查看原文
查看缓存全文

缓存时间: 2026/09/17 06:15

耶鲁大学等顶尖实验室的最新论文显示,前沿模型在当前各类封闭式物理基准测试中已接近上限。

许多表面的模型失误,实际上源于题目设计缺陷、错误答案和评分系统漏洞——经过审计的物理测试中,大部分失败案例都可归因于此,这使基准测试质量成为衡量前沿模型的新瓶颈。

研究人员并未直接采用原始评分,而是邀请物理学家对六项主流物理基准测试中的模型失败案例进行复核。

在四个被审计测试集的250个被判定错误的案例中,仅有12例属于真正的模型失误。

其余238例均因题目质量不佳、参考答案错误或评分系统错误否定正确答案所致。

经专家复核后,GPT-5.6-Sol的HLE-Physics测试分数从47.3%提升至78.7%。

可见,仅凭物理基准测试得分可能严重低估前沿模型的实际解题能力。

但这并不意味着这些模型能可靠地进行物理研究——作者团队的智能体仍未能完全解决其尝试的任何开放理论物理难题。

重要的是,我们必须认识到:不能再将基准测试分数视为衡量AI物理能力的绝对真实标准。

相似文章

@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…

X AI KOLs Following

本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。