physics-benchmarks

标签

Cards List
#physics-benchmarks

rohanpaul_ai:耶鲁大学及其他顶尖实验室的新论文显示,前沿模型已接近突破当今封闭式物理...

X AI KOLs Following · 昨天 缓存

一项耶鲁大学主导的论文发现,前沿AI模型在物理基准测试中表现不佳,主要是由于基准测试的缺陷,而非模型本身的局限性,这表明基准测试质量是准确评估的关键瓶颈。

0 人收藏 0 人点赞
#physics-benchmarks

事实证明,当前许多基于科学的LLM基准测试在答案上存在缺陷。纠正后,LLM基准测试分数显著上升。

Reddit r/singularity · 2天前 缓存

本文讨论了一篇研究论文,揭示了许多基于科学的LLM基准测试存在错误答案,纠正后LLM性能分数显著提升,这表明当前的评估可能低估了AI在物理学中的能力。

0 人收藏 0 人点赞
#physics-benchmarks

前沿模型在物理学上的表现如何?专家重新评分揭示评估缺陷与主流基准测试接近饱和(1分钟阅读)

TLDR AI · 4天前 缓存

专家对物理学基准测试的重新评分表明,前沿AI模型的表现优于此前评估,这揭示了评估系统的缺陷以及封闭式任务的接近饱和,从而强调了进行更严格评估的必要性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈