标签
一项耶鲁大学主导的论文发现,前沿AI模型在物理基准测试中表现不佳,主要是由于基准测试的缺陷,而非模型本身的局限性,这表明基准测试质量是准确评估的关键瓶颈。
本文讨论了一篇研究论文,揭示了许多基于科学的LLM基准测试存在错误答案,纠正后LLM性能分数显著提升,这表明当前的评估可能低估了AI在物理学中的能力。
专家对物理学基准测试的重新评分表明,前沿AI模型的表现优于此前评估,这揭示了评估系统的缺陷以及封闭式任务的接近饱和,从而强调了进行更严格评估的必要性。